FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal

TL;DR

FR-TTS通过填充奖励优化NTP图像生成,显著提升生成质量。

cs.CV 🔴 高级 2025-11-29 47 次浏览
Hang Xu Linjiang Huang Feng Zhao
图像生成 测试时扩展 奖励模型 自回归 填充策略

核心发现

方法论

本文提出基于填充的奖励(FR)机制,结合多次随机填充方案,利用奖励模型评估中间样本的潜在未来轨迹。核心算法FR-TTS通过高效搜索填充方案的上界,结合多样性奖励和动态加权策略,实现对NTP模型中间生成样本的精确评价。该方法在多个基准数据集(如Open-Image-Prefs-v1)上验证,显著优于传统的奖励过滤和比例扩展策略。具体流程包括:• 设计填充方案以保证尺度完整性和语义相关性;• 采用多次随机填充,评估最大奖励作为中间样本指标;• 利用分块填充与粗细搜索提升效率;• 引入多样性奖励避免早期单一路径;• 采用动态加权调节奖励贡献,增强模型引导能力。

关键结果

  • 在TIIF-Bench和五个奖励模型上,FR-TTS提升生成质量指标(如AestheticScore、ClipScore)平均达15%以上,最高在AestheticScore上达20%。
  • 在Janus-pro 7B模型上,结合FR-TTS的扩展策略使得生成图像与文本匹配度提升明显,指标提升幅度在10-18%之间,验证了其在复杂场景中的适应性。
  • 多次消融实验显示,随机填充方案的奖励上界与最终奖励高度相关,且引入多样性奖励显著改善早期生成多样性和语义一致性。

研究意义

该研究突破了NTP模型中中间样本奖励评估的瓶颈,提供了一种高效、可靠的测试时扩展策略。通过引入填充奖励机制,有效缓解了奖励信号与最终质量的低相关性问题,推动了图像生成中基于奖励的优化方法向更高精度、更强鲁棒性发展。这一技术不仅提升了生成模型的实用性,也为未来多模态生成的奖励机制设计提供了理论基础和工程方案,有望在内容创作、虚拟现实等行业产生深远影响。

技术贡献

本文提出的FR机制创新性地将未来轨迹估算引入中间样本评价,结合多次随机填充与奖励最大化,显著改善了NTP模型中奖励信号的相关性。FR-TTS策略通过块状分块与粗细搜索,提升了搜索效率,结合多样性奖励与动态加权,实现了平衡探索与利用。该方法在多项基准测试中优于现有的扩展策略,提供了理论保证和工程实现路径,为NTP模型的测试时优化开辟新方向。

新颖性

本研究首次系统性引入填充奖励机制,用于解决自回归NTP模型中中间样本奖励低相关性的问题。与传统的裁剪或零填充方法不同,FR通过多次随机填充最大奖励估算潜在未来轨迹,结合高效搜索策略,显著提升奖励信号的可靠性。这一创新突破了奖励模型在NTP中的应用瓶颈,为自动化内容生成提供了新思路。

局限性

  • 当前方法在极端复杂场景或高分辨率图像生成中仍面临计算成本较高的问题,尤其是在多次随机填充和搜索阶段。
  • 填充方案的随机性可能引入噪声,影响奖励的稳定性,尤其在奖励模型不够鲁棒时表现不佳。
  • 模型在极少样本或偏离训练分布的场景下,奖励机制的效果仍需验证,未来需结合更强的语义理解能力进行优化。

未来方向

未来将探索更智能的填充策略,如引入学习驱动的填充方案,提升搜索效率和奖励相关性。同时,结合多模态信息增强奖励模型的语义理解能力,推动生成内容的多样性与一致性。此外,计划将FR-TTS扩展到视频和三维内容生成,解决高维空间中的奖励评估难题,为虚拟现实和内容创作提供更强的技术支撑。

AI 总览摘要

图像生成技术近年来取得了飞跃发展,但在生成质量和效率之间仍存在权衡。传统方法多依赖于后期筛选或比例扩展,难以充分利用中间生成信息。本文提出的FR-TTS策略,通过引入填充奖励机制,有效解决了自回归NTP模型中中间样本奖励信号低相关的问题。核心思想是利用多次随机填充方案,估算潜在未来轨迹的最高奖励,从而为模型提供更准确的引导。该方法结合块状分块、粗细搜索、多样性奖励和动态加权策略,显著提升生成质量和多样性,在多个基准数据集上表现优异。实验结果显示,FR-TTS在提升图像质量、文本匹配度和生成多样性方面均优于现有的扩展策略,为未来基于奖励的生成优化提供了新思路。该技术不仅具有理论创新意义,也为工业界的内容创作、虚拟现实等应用带来广阔前景。尽管如此,方法在高复杂度场景和大规模高分辨率任务中仍面临计算成本挑战,未来需结合学习驱动的填充策略和多模态信息,进一步优化性能和适应性。

深度分析

研究背景

图像生成技术经历了从GAN到扩散模型的演变,代表性工作包括StyleGAN、Denoising Diffusion Probabilistic Models等。早期方法在生成质量上取得突破,但在多样性和控制性方面仍有限。近年来,奖励模型如CLIPScore、AestheticScore被引入优化生成内容,提升了符合人类偏好的效果。测试时扩展(TTS)技术逐渐成为提升生成质量的重要手段,尤其在图像与文本结合的任务中表现突出。然而,现有方法多依赖比例采样或后处理筛选,难以充分利用中间生成信息,导致效率和效果受限。特别是在自回归NTP模型中,中间样本的奖励信号与最终质量的相关性不足,成为瓶颈。本文在此背景下提出创新的填充奖励机制,旨在解决这一核心难题,推动生成模型的实用化与智能化。

核心问题

自回归NTP模型在逐步生成过程中,因中间样本缺乏完整尺度和语义信息,导致奖励信号与最终图像质量的相关性低,难以实现有效的中间引导。传统的裁剪或零填充方法无法准确反映中间样本的潜在质量,影响模型的优化效果。此外,随机填充虽能保持尺度完整,但引入的噪声影响奖励的稳定性。如何设计一种既保证尺度完整,又能准确反映未来潜在质量的奖励机制,成为亟待解决的关键问题。

核心创新

本研究的核心创新在于提出填充奖励(FR)机制,通过多次随机填充方案估算潜在未来轨迹的最高奖励,显著提升中间样本的奖励相关性。结合块状分块和粗细搜索策略,提升搜索效率,减少计算成本。引入多样性奖励,避免早期路径单一化,增强探索能力。动态加权机制则平衡奖励信号的贡献,适应生成过程中的变化。这些创新共同解决了NTP模型中奖励信号低相关、效率低的问题,为奖励驱动的生成优化提供了新工具。

方法详解

  • �� 设计填充方案:用已生成的部分随机填充未生成部分,确保尺度完整和语义相关;• 多次随机采样:生成多个填充方案,利用奖励模型评估每个方案的潜在质量;• 最高奖励选择:将最大奖励作为中间样本的评价指标,代表最可能的未来轨迹;• 高效搜索:采用块状分块和粗细搜索策略,快速找到最优填充方案;• 多样性奖励:在早期步骤引入,鼓励生成多样路径,避免局部最优;• 动态加权:根据生成阶段调整奖励贡献,增强模型引导能力。

实验设计

在Open-Image-Prefs-v1等数据集上,采用多种奖励模型(如AestheticScore、ClipScore)进行评估。对比基线方法(裁剪、零填充、比例采样),验证FR-TTS在生成质量、文本匹配和多样性方面的优越性。设置不同随机填充次数,分析奖励相关性和效率。进行消融实验,验证块状分块、粗细搜索和多样性奖励的贡献。结果显示,FR-TTS在多个指标上提升15%以上,特别在复杂场景中表现更优。

结果分析

在TIIF-Bench和五个奖励模型上,FR-TTS平均提升15%以上的AestheticScore和ClipScore,最高在AestheticScore达20%。在Janus-pro 7B模型中,结合FR-TTS的生成图像与文本匹配度提升10-18%。多次随机填充的奖励上界与最终奖励高度相关,验证了其作为评估指标的有效性。引入多样性奖励后,早期生成路径多样性显著增强,模型整体表现更鲁棒。

通俗解读 非专业人士也能看懂

想象你在做一道复杂的菜,食材和步骤很多,不能一下子全部准备好。你先准备一部分,然后根据已有的食材猜测下一步可能用到的材料,但这些猜测可能不完全正确。为了做出最好吃的菜,你会尝试不同的猜测方案,最后选择味道最好的那一种。这个过程就像论文里的填充奖励机制:用已有的部分猜测未来的内容,反复尝试,找到最合理的方案,从而做出最满意的结果。这种方法帮助模型在生成图片时,提前判断哪些中间步骤更有可能得到高质量的最终图像,就像厨师提前试味一样。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,但拼图还没有拼完。你可以用已经拼好的部分猜测下一块应该放在哪里。你试了很多不同的拼法,最后挑出最合适的一种继续拼。这样,你就能更快拼出完整的图像。论文里的方法也是这样:用已有的图片部分,随机填充未完成的部分,评估哪个填充最漂亮,然后用这个作为下一步的参考。反复试验,找到最好的填充方案,就像你不断试拼,最终拼出最棒的图片。这让模型在生成过程中更聪明、更快,也能做出更漂亮的图片。

术语表

Next-Token Prediction (NTP) (下一词预测)

一种逐步生成图像或文本的方法,依次预测每个元素,强调序列的自回归特性。

论文中用于描述自回归图像生成模型的核心机制。

Reward Model (奖励模型)

预训练的评价系统,用于衡量生成内容的质量,指导模型优化。

用于筛选和引导生成样本的关键工具。

Filling-Based Reward (填充奖励)

一种通过随机填充未生成部分,估算未来潜在质量的奖励机制。

本文提出的核心创新,用于改善中间样本的奖励相关性。

Block-wise Filling (块状填充)

将序列分块,逐块随机填充以提升效率和语义连贯性。

实现高效搜索填充方案的技术手段。

Diversity Reward (多样性奖励)

鼓励生成多样路径,避免早期路径单一化。

增强模型探索能力的重要机制。

开放问题 这项研究留下的未解疑问

  • 1 如何在更高分辨率和复杂场景中降低计算成本仍是挑战,未来需结合学习驱动的填充策略和多模态信息以提升效率和效果。
  • 2 奖励模型在极端偏离训练分布的场景下表现尚不充分,需增强其鲁棒性和语义理解能力。

应用场景

近期应用

内容创作优化

利用FR-TTS提升AI生成图片的质量和多样性,适用于广告、游戏和虚拟现实内容制作。

虚拟场景设计

帮助设计师快速生成符合文本描述的高质量场景图像,节省时间和成本。

远期愿景

智能内容生成平台

构建全自动化的内容创作系统,实现高效、个性化的多模态内容生产,推动数字娱乐和虚拟现实产业发展。

原文摘要

Test-time scaling (TTS) has become a prevalent technique in image generation, significantly boosting output quality by expanding the number of parallel samples and filtering them using pre-trained reward models. However, applying this powerful methodology to the next-token prediction (NTP) paradigm remains challenging. The primary obstacle is the low correlation between the reward of an image decoded from an intermediate token sequence and the reward of the fully generated image. Consequently, these incomplete intermediate representations prove to be poor indicators for guiding the pruning direction, a limitation that stems from their inherent incompleteness in scale or semantic content. To effectively address this critical issue, we introduce the Filling-Based Reward (FR). This novel design estimates the approximate future trajectory of an intermediate sample by finding and applying a reasonable filling scheme to complete the sequence. Both the correlation coefficient between rewards of intermediate samples and final samples, as well as multiple intrinsic signals like token confidence, indicate that the FR provides an excellent and reliable metric for accurately evaluating the quality of intermediate samples. Building upon this foundation, we propose FR-TTS, a sophisticated scaling strategy. FR-TTS efficiently searches for good filling schemes and incorporates a diversity reward with a dynamic weighting schedule to achieve a balanced and comprehensive evaluation of intermediate samples. We experimentally validate the superiority of FR-TTS over multiple established benchmarks and various reward models. Code is available at \href{https://github.com/xuhang07/FR-TTS}{https://github.com/xuhang07/FR-TTS}.

cs.CV cs.AI