Generation Navigator: A State-Aware Agentic Framework for Image Generation

TL;DR

Generation Navigator通过PRE-GRPO优化图像生成,WISE得分0.90。

cs.CV 🔴 高级 2026-05-18 28 次浏览
Jinming Liu Ruoyu Feng Yuqi Wang Wenjun Zeng Xin Jin
图像生成 强化学习 多轮交互 状态感知 算法优化

核心发现

方法论

本文提出了Generation Navigator框架,将图像生成重新定义为状态条件下的动作决策问题。通过引入PRE-GRPO算法,该框架能够在多轮生成过程中动态调整生成轨迹。PRE-GRPO通过奖励高质量图像发现、避免质量退化和减少不必要的轮次来优化生成过程。

关键结果

  • 在T2I-ReasonBench上,Generation Navigator达到了79.06%的推理准确率,显著优于现有方法。
  • 在WISE基准测试中,该方法获得了0.90的整体得分,超越了许多专有模型。
  • 在消融实验中,PRE-GRPO相较于传统GRPO算法表现出更显著的性能提升。

研究意义

Generation Navigator通过引入状态感知的动作决策,解决了传统图像生成方法中用户意图难以实现的问题。这一框架不仅提高了生成图像的质量,还减少了用户的交互次数,具有重要的学术和工业应用价值。

技术贡献

技术上,本文通过PRE-GRPO算法实现了对多轮生成轨迹的优化,克服了传统强化学习中信用分配的难题。该方法在图像生成领域引入了新的理论保障和工程可能性。

新颖性

这是首次将图像生成问题重新定义为状态条件下的动作决策问题,并通过PRE-GRPO算法实现了对生成轨迹的优化,与现有的固定工作流方法形成鲜明对比。

局限性

  • 该方法在处理极复杂的用户意图时可能仍需多次交互以达到满意结果。
  • 在某些特定场景下,生成质量可能受限于初始提示的准确性。

未来方向

未来的研究可以探索如何进一步减少交互次数,提升生成质量。此外,扩展该框架以支持更多类型的多模态输入也是一个值得探索的方向。

AI 总览摘要

尽管文本到图像生成技术取得了快速进展,但准确实现用户意图仍然具有挑战性。现有方法通常依赖于简单的提示重写或基于手工规则的闭环代理,无法适应生成过程的动态变化。

本文提出了Generation Navigator框架,将图像生成重新定义为状态条件下的动作决策问题。通过引入PRE-GRPO算法,该框架能够在多轮生成过程中动态调整生成轨迹,显著提高了生成图像的质量和效率。

实验结果表明,Generation Navigator在多个基准测试中表现优异,尤其是在T2I-ReasonBench和WISE上取得了显著的性能提升。这一框架不仅在学术界具有重要意义,还为工业应用提供了新的可能性。

深度分析

研究背景

近年来,文本到图像生成技术取得了显著进展,特别是在扩散模型和自回归多模态生成方面。然而,单次生成往往难以满足复杂的用户意图,尤其是在涉及空间布局、常识推理和细粒度风格时。

核心问题

现有方法通常依赖于固定的工作流或提示重写,无法动态适应生成过程的变化。这导致生成结果往往不尽如人意,用户需要多次尝试才能达到满意效果。

核心创新

Generation Navigator通过将图像生成重新定义为状态条件下的动作决策问题,实现了生成过程的动态调整。PRE-GRPO算法通过奖励高质量图像发现、避免质量退化和减少不必要的轮次来优化生成轨迹。

方法详解

  • �� Generation Navigator框架由导航器、生成器和审阅器组成。• 导航器是唯一的学习组件,负责输出结构化动作。• PRE-GRPO算法通过奖励高质量图像发现、避免质量退化和减少不必要的轮次来优化生成轨迹。

实验设计

实验在T2I-ReasonBench和WISE等基准测试上进行,采用Qwen3-VL-8B-Instruct作为导航器,Doubao-Seed1.5作为审阅器,FLUX.2-Klein-9B作为生成器。实验结果表明,Generation Navigator在多个基准测试中表现优异。

结果分析

在T2I-ReasonBench上,Generation Navigator达到了79.06%的推理准确率,显著优于现有方法。在WISE基准测试中,该方法获得了0.90的整体得分,超越了许多专有模型。

应用场景

该框架可用于需要高质量图像生成的场景,如广告创意、影视制作等。其状态感知的动作决策机制能够显著提高生成效率,减少用户交互次数。

局限与展望

尽管该方法在多个基准测试中表现优异,但在处理极复杂的用户意图时可能仍需多次交互。此外,生成质量可能受限于初始提示的准确性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱(用户提示),但每次做出来的菜(生成的图像)都不太对味。于是你开始调整食材和步骤(状态条件下的动作决策),直到做出满意的菜肴。Generation Navigator就像一个聪明的厨师助手,它能根据每次尝试的结果调整做菜的步骤,最终帮你做出完美的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次你都要画一幅画。你有一个主题,但每次画出来的结果都不太对。于是你开始调整画法,比如换个颜色或者重新开始。Generation Navigator就像一个聪明的游戏助手,它能根据每次画的结果给你建议,最终帮你画出完美的作品。是不是很酷?

术语表

Generation Navigator (生成导航器)

一个多轮文本到图像生成框架,能够动态调整生成轨迹。

用于优化图像生成过程。

PRE-GRPO (峰值保留效率组相对策略优化)

一种轨迹级别的强化学习目标,奖励高质量图像发现和减少不必要轮次。

用于优化生成轨迹。

T2I-ReasonBench

一个用于评估文本到图像生成模型推理能力的基准测试。

用于验证模型的推理准确性。

WISE

一个知识密集型生成基准测试,评估模型在多个领域的生成能力。

用于验证模型的知识生成能力。

Qwen3-VL-8B-Instruct

用于导航器的多模态语言模型。

作为Generation Navigator的核心组件。

开放问题 这项研究留下的未解疑问

  • 1 如何在极复杂的用户意图下减少交互次数仍是一个开放问题。
  • 2 如何进一步提高生成质量,特别是在初始提示不准确的情况下。

应用场景

近期应用

广告创意

广告公司可以使用该框架生成高质量的广告图像,减少创意过程中的反复尝试。

远期愿景

影视制作

该框架可以用于影视制作中的场景设计,显著提高制作效率和图像质量。

原文摘要

Despite rapid advances in text-to-image generation, faithfully realizing user intent remains challenging, often requiring manual multi-turn trial and error. To automate this process, existing systems rely on either simple prompt rewriting or closed-loop agents driven by hand-crafted rules, rather than learning to adapt actions to the evolving generation process. In this paper, we reformulate image generation as a state-conditioned action-making problem and propose Generation Navigator, a multi-turn T2I agent that learns to dynamically steer the generation trajectory and output the next action. However, training this agent via reinforcement learning introduces a critical credit assignment challenge: naively rewarding a trajectory based solely on a single state assigns equal credit to all actions in the rollout, ignores the quality dynamics across turns, and fails to distinguish actions that improve the trajectory from those that degrade it or waste turns without progress. We resolve this with PRE-GRPO (Peak-Retention-Efficiency Group Relative Policy Optimization), a trajectory-level reinforcement learning objective that explicitly rewards discovering a high-quality image (Peak), avoiding subsequent quality degradation across turns (Retention), and minimizing unnecessary turns (Efficiency). Experiments show substantial improvements across benchmarks, reaching a WISE score of 0.90 and 79.06% reasoning accuracy on T2I-ReasonBench.

cs.CV