SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

TL;DR

SoliReward通过单项二元注释和层次渐进查询注意机制,提升视频生成奖励模型的鲁棒性。

cs.LG 🔴 高级 2025-12-17 5 次浏览
Jiesong Lian Ruizhe Zhong Zixiang Zhou Xiaoyue Mi Long Hu Yuan Zhou Qinglin Lu Yixue Hao Junchi Yan
视频生成 奖励模型 注释噪声 奖励黑客 机器学习

核心发现

方法论

SoliReward采用单项二元注释和跨提示配对策略,结合层次渐进查询注意机制,提升特征聚合能力。引入改进的BT损失,考虑胜平场景,正则化正样本的得分分布。

关键结果

  • 在物理合理性、主体变形和语义对齐的基准测试中,SoliReward在直接RM评估指标上表现出色,提升了视频生成模型的后训练效果。
  • 与现有基线相比,SoliReward在物理合理性任务中实现了78.48%的准确率,显著优于VideoAlign的71.60%。
  • 通过引入胜平对,BT-WT损失有效减少了奖励黑客问题,提升了模型的泛化能力。

研究意义

该研究通过构建更鲁棒的视频奖励模型,解决了注释噪声和奖励黑客问题,提升了视频生成模型的性能。其方法为视频生成领域的后训练对齐提供了新的思路,具有重要的学术和工业价值。

技术贡献

SoliReward在数据注释、训练策略和模型架构上均有创新。提出的BT-WT损失和HPQA架构在理论上提供了新的保证,并为工程实现开辟了新的可能性。

新颖性

SoliReward首次将单项二元注释与跨提示配对策略结合,显著降低了注释噪声。同时,HPQA架构在特征聚合上具有独特优势。

局限性

  • 在某些复杂场景下,单项二元注释可能无法捕捉所有细微差别,影响模型的精确性。
  • 跨提示配对策略可能在特定数据集上表现不佳。

未来方向

未来的研究方向包括探索更复杂的注释机制和进一步优化HPQA架构,以提升模型在不同场景下的适应性和鲁棒性。

AI 总览摘要

视频生成模型的后训练对齐是提升模型性能的关键。然而,现有方法在数据注释噪声和奖励黑客问题上面临挑战。SoliReward通过单项二元注释和跨提示配对策略,结合层次渐进查询注意机制,提升了视频生成奖励模型的鲁棒性。实验结果显示,SoliReward在物理合理性、主体变形和语义对齐的基准测试中表现出色,显著提升了视频生成模型的后训练效果。尽管如此,该方法在某些复杂场景下仍存在局限,未来研究将继续优化注释机制和模型架构,以进一步提升模型的适应性和鲁棒性。

深度分析

研究背景

视频生成模型近年来取得了显著进展,如Sora 2、Veo 3和Seedance等。然而,这些模型在生成高保真、时间一致的视觉内容时,仍需通过后训练对齐技术来提升性能。现有方法如DanceGRPO和LongChat-Video虽有所突破,但其核心的奖励模型在数据注释噪声和奖励黑客问题上面临挑战。

核心问题

构建能够准确捕捉复杂视频质量的奖励模型面临数据注释噪声和奖励黑客问题。现有的成对偏好学习方法在注释模糊性上存在显著噪声,影响了奖励模型的准确性。此外,奖励模型在后训练中容易受到奖励黑客的影响,导致生成模型偏离人类偏好。

核心创新

SoliReward通过单项二元注释和跨提示配对策略,显著降低了注释噪声。引入的BT-WT损失通过胜平对的方式,有效减少了奖励黑客问题。层次渐进查询注意机制在特征聚合上具有独特优势,提升了奖励信号的鲁棒性。

方法详解

  • �� 采用单项二元注释,降低注释噪声。
  • �� 使用跨提示配对策略,生成大规模偏好数据集。
  • �� 引入BT-WT损失,正则化正样本得分分布。
  • �� 提出HPQA架构,增强特征聚合能力。

实验设计

实验在物理合理性、主体变形和语义对齐的基准测试上进行,使用了多个SOTA模型生成的视频数据集。通过对比现有基线,验证了SoliReward在直接RM评估指标和视频生成模型后训练效果上的提升。

结果分析

SoliReward在物理合理性任务中实现了78.48%的准确率,显著优于VideoAlign的71.60%。BT-WT损失有效减少了奖励黑客问题,提升了模型的泛化能力。实验结果显示,SoliReward在多个基准测试中均表现出色。

应用场景

SoliReward可用于提升视频生成模型的后训练对齐性能,适用于需要高保真、时间一致的视觉内容生成的场景,如影视制作、虚拟现实等。

局限与展望

尽管SoliReward在多个基准测试中表现出色,但在某些复杂场景下,单项二元注释可能无法捕捉所有细微差别。此外,跨提示配对策略在特定数据集上可能表现不佳。未来研究将继续优化注释机制和模型架构。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。SoliReward就像一个聪明的厨师助手,它通过简单的“好/坏”标签来帮助你选择最好的食材。然后,它会将这些食材组合成美味的菜肴。这个助手还会确保每道菜的味道都很均衡,不会因为某个食材特别好而过度使用。通过这种方式,它帮助你做出更美味、更健康的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,SoliReward就像你的游戏助手。它会帮你挑选最好的装备,并确保你在游戏中不会因为某个装备太强而失去平衡。这样,你就能在游戏中更好地发挥,获得更高的分数!是不是很酷?

术语表

奖励模型 (Reward Model)

用于量化人类偏好的模型,帮助生成模型对齐人类期望。

在视频生成模型的后训练对齐中使用。

注释噪声 (Annotation Noise)

由于注释者的主观性和模糊性导致的数据不准确。

影响奖励模型准确性的关键因素。

奖励黑客 (Reward Hacking)

生成模型利用奖励模型的漏洞,偏离人类真实偏好的现象。

在后训练中需要解决的问题。

层次渐进查询注意机制 (Hierarchical Progressive Query Attention)

一种增强特征聚合能力的架构,融合多层特征。

用于提升奖励信号的鲁棒性。

BT-WT损失 (BT-WT Loss)

改进的损失函数,考虑胜平场景,正则化正样本得分分布。

用于减少奖励黑客问题。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂场景中进一步降低注释噪声?现有方法在某些情况下可能不够精确。
  • 2 跨提示配对策略在不同数据集上的适用性如何?需要更多实验验证。

应用场景

近期应用

视频生成优化

SoliReward可用于优化视频生成模型的后训练对齐,提升生成内容的质量和一致性。

远期愿景

智能影视制作

通过提升视频生成模型的性能,SoliReward可推动智能影视制作的发展,减少人工干预,实现自动化生产。

原文摘要

Post-training alignment of video generation models with human preferences is a critical goal. Developing effective Reward Models (RMs) for this process faces significant methodological hurdles. Current data collection paradigms, reliant on in-prompt pairwise annotations, suffer from labeling noise. Concurrently, the architectural design of VLM-based RMs, particularly their output mechanisms, remains underexplored. Furthermore, RM is susceptible to reward hacking in post-training. To mitigate these limitations, we propose SoliReward, a systematic framework for video RM training. Our framework first sources high-quality, cost-efficient data via single-item binary annotations, then constructs preference pairs using a cross-prompt pairing strategy. Architecturally, we employ a Hierarchical Progressive Query Attention mechanism to enhance feature aggregation. Finally, we introduce a modified BT loss that explicitly accommodates win-tie scenarios. This approach regularizes the RM's score distribution for positive samples, providing more nuanced preference signals to alleviate over-focus on a small number of top-scoring samples. Our approach is validated on benchmarks evaluating physical plausibility, subject deformity, and semantic alignment, demonstrating improvements in direct RM evaluation metrics and in the efficacy of post-training on video generation models. Code and benchmark are available at https://github.com/lian700/SoliReward.

cs.LG cs.CV