TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TL;DR

TAGRPO通过直接轨迹对齐提升GRPO在图像到视频生成中的表现,显著提高奖励。

cs.CV 🔴 高级 2026-01-09 5 次浏览
Jin Wang Jianxiang Lu Guangzheng Xu Comi Chen Haoyu Yang Linqing Wang Peng Chen Mingtao Chen Zhichao Hu Longhuang Wu Shuai Shao Qinglin Lu Ping Luo
图像到视频 轨迹对齐 奖励优化 对比学习 生成模型

核心发现

方法论

TAGRPO是一种后训练框架,通过直接轨迹对齐提升图像到视频生成的奖励。利用对比学习的思想,TAGRPO在中间潜变量上应用新的GRPO损失,鼓励与高奖励轨迹对齐,同时最大化与低奖励轨迹的距离。

关键结果

  • TAGRPO在Wan 2.2和HunyuanVideo-1.5上实现了比DanceGRPO更快的收敛和更高的奖励增益,320p和720p分辨率下的Q-Save和HPSv3指标均显著提升。
  • 实验表明TAGRPO在视觉质量和运动稳定性方面优于基线模型,减少了视觉失真和运动伪影。
  • 消融实验验证了轨迹对齐损失和记忆库机制对奖励提升的必要性。

研究意义

TAGRPO通过直接轨迹对齐和记忆库机制,显著提升了图像到视频生成的质量和效率,为生成模型的后训练优化提供了新的思路。该方法不仅提高了生成视频的视觉质量,还减少了计算开销,具有广泛的应用潜力。

技术贡献

TAGRPO通过引入轨迹对齐损失和记忆库机制,突破了现有GRPO方法在图像到视频生成中的局限性,提供了新的理论保证和工程可能性。与现有方法相比,TAGRPO在奖励优化和计算效率方面实现了显著提升。

新颖性

TAGRPO首次在图像到视频生成中应用直接轨迹对齐,区别于现有的基于奖励信号的优化方法,提供了更丰富的优化指导。与DanceGRPO相比,TAGRPO显著提高了生成质量和效率。

局限性

  • TAGRPO在高分辨率视频生成中的效果仍需进一步验证,尤其是在复杂场景下。
  • 记忆库机制的更新策略可能导致样本多样性不足,影响优化效果。
  • 对比学习的应用可能需要额外的计算资源。

未来方向

未来研究可以探索TAGRPO在其他生成任务中的应用,如文本到视频生成,并优化记忆库机制以提高样本多样性和优化效率。

AI 总览摘要

近年来,图像到视频生成技术取得了显著进展,但现有方法在奖励优化方面仍存在挑战。TAGRPO通过引入直接轨迹对齐和记忆库机制,显著提升了生成视频的质量和效率。

TAGRPO利用对比学习的思想,在中间潜变量上应用新的GRPO损失,鼓励与高奖励轨迹对齐,同时最大化与低奖励轨迹的距离。实验结果表明,TAGRPO在Wan 2.2和HunyuanVideo-1.5上实现了比DanceGRPO更快的收敛和更高的奖励增益。

尽管TAGRPO在视觉质量和运动稳定性方面表现优异,但在高分辨率视频生成中的效果仍需进一步验证。未来研究可以探索TAGRPO在其他生成任务中的应用,并优化记忆库机制以提高样本多样性和优化效率。

深度分析

研究背景

图像到视频生成技术在动画、内容创作和视觉特效等领域具有广泛应用潜力。近年来,扩散模型在文本到图像和文本到视频生成中取得了成功,但图像到视频生成仍然是一个未充分探索的领域。现有方法在奖励优化方面存在局限性,直接应用GRPO技术未能实现一致的奖励提升。

核心问题

图像到视频生成面临的核心问题是如何有效优化生成视频的奖励。现有方法通常依赖奖励信号来调节样本的生成概率,忽略了样本之间的关系指导。由于视频生成需要保持时间和结构的一致性,现有方法在奖励优化方面未能充分利用这些关系。

核心创新

TAGRPO通过直接轨迹对齐和记忆库机制,显著提升了图像到视频生成的质量和效率。轨迹对齐损失鼓励与高奖励轨迹对齐,同时最大化与低奖励轨迹的距离。记忆库机制存储历史样本及其奖励信号,减少计算开销。

方法详解

  • �� TAGRPO在中间潜变量上应用新的GRPO损失,鼓励与高奖励轨迹对齐。
  • �� 引入记忆库机制,存储历史样本及其奖励信号,减少计算开销。
  • �� 通过对比学习的思想,优化样本之间的关系,提升生成质量。

实验设计

实验在Wan 2.2和HunyuanVideo-1.5上进行,使用Q-Save和HPSv3作为奖励模型。设置320p和720p分辨率,评估TAGRPO在视觉质量和运动稳定性方面的表现。消融实验验证了轨迹对齐损失和记忆库机制对奖励提升的必要性。

结果分析

TAGRPO在Wan 2.2和HunyuanVideo-1.5上实现了比DanceGRPO更快的收敛和更高的奖励增益。视觉质量和运动稳定性显著提升,减少了视觉失真和运动伪影。消融实验验证了轨迹对齐损失和记忆库机制对奖励提升的必要性。

应用场景

TAGRPO可应用于动画制作、内容创作和视觉特效等领域,提升生成视频的质量和效率。通过优化样本之间的关系,TAGRPO在奖励优化方面具有广泛的应用潜力。

局限与展望

TAGRPO在高分辨率视频生成中的效果仍需进一步验证,尤其是在复杂场景下。记忆库机制的更新策略可能导致样本多样性不足,影响优化效果。对比学习的应用可能需要额外的计算资源。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,TAGRPO就像一个聪明的厨师助手。它不仅能帮你选择最好的食材,还能告诉你如何避免使用不好的食材。通过这种方式,TAGRPO帮助你做出更美味的菜肴。在视频生成中,TAGRPO通过选择和优化样本之间的关系,使生成的视频更流畅、更真实。它就像一个经验丰富的厨师,知道如何调整每个步骤,以确保最终的菜肴完美无瑕。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超级酷的游戏,TAGRPO就像是你的游戏助手。它能帮你选择最好的装备,还能告诉你如何避免使用不好的装备。通过这种方式,TAGRPO帮助你在游戏中取得更好的成绩。在视频生成中,TAGRPO通过选择和优化样本之间的关系,使生成的视频更流畅、更真实。就像一个经验丰富的玩家,知道如何调整每个步骤,以确保最终的游戏体验完美无瑕。

术语表

TAGRPO (轨迹对齐奖励优化)

一种后训练框架,通过直接轨迹对齐提升图像到视频生成的奖励。

在论文中用于优化生成视频的质量和效率。

GRPO (群体相对策略优化)

一种奖励优化技术,通过群体样本的相对排名来优化生成模型。

在论文中用于提升生成视频的奖励。

记忆库机制

一种存储历史样本及其奖励信号的机制,减少计算开销。

在论文中用于优化样本之间的关系。

对比学习

一种机器学习技术,通过比较样本之间的关系来优化模型。

在论文中用于提升生成视频的质量。

消融实验

一种实验方法,通过移除某些组件来验证其对整体性能的影响。

在论文中用于验证轨迹对齐损失和记忆库机制的必要性。

开放问题 这项研究留下的未解疑问

  • 1 如何在高分辨率视频生成中验证TAGRPO的效果,尤其是在复杂场景下。
  • 2 记忆库机制的更新策略如何优化以提高样本多样性和优化效率。

应用场景

近期应用

动画制作

TAGRPO可用于提升动画制作的质量和效率,减少视觉失真和运动伪影。

远期愿景

内容创作

TAGRPO在内容创作中具有广泛应用潜力,优化样本之间的关系,提升生成质量。

原文摘要

Recent studies have demonstrated the efficacy of integrating Group Relative Policy Optimization (GRPO) into flow matching models, particularly for text-to-image and text-to-video generation. However, we find that directly applying these techniques to image-to-video (I2V) models often fails to yield consistent reward improvements. To address this limitation, we present TAGRPO, a robust post-training framework for I2V models inspired by contrastive learning. Our approach is grounded in the observation that rollout videos generated from identical initial noise provide superior guidance for optimization. Leveraging this insight, we propose a novel GRPO loss applied to intermediate latents, encouraging direct alignment with high-reward trajectories while maximizing distance from low-reward counterparts. Furthermore, we introduce a memory bank for rollout videos to enhance diversity and reduce computational overhead. Despite its simplicity, TAGRPO achieves significant improvements over DanceGRPO in I2V generation. The deliverables will be updated at https://tagrpo.github.io/ .

cs.CV