WorldReward: Reward Modeling for Camera-Conditioned World Models

TL;DR

提出WorldReward,基于VLM的配对偏好奖励模型,融合动作一致性与视觉质量评估。

cs.CV 🔴 高级 2026-09-03 92 次浏览
Yibin Wang Zehan Wang Junshu Tang Zhimin Li Yujie Zhou Jiazi Bu Pengyang Ling Feng Han Zhixiong Zhang Long Xing Shengyuan Ding Ziang Li Cheng Jin Yuhang Zang Jiaqi Wang Tianyu Pang
视觉-语言模型 奖励建模 世界模型 视频生成 强化学习

核心发现

方法论

本文提出WorldReward,通过将长视频拆分为动作对齐的片段,利用结构化视觉证据进行逐段评判。模型基于视觉-语言模型(VLM)进行逐片段偏好推理,结合投票机制形成全视频偏好。训练数据由前沿VLM生成的结构化判断、多轮工具审查和人工校准组成,确保偏好标注的多样性与准确性。引入WorldReward-Bench,建立了涵盖动作一致性、外观质量和运动质量的人工标注基准,验证模型在所有维度上均优于GPT-5.5。该模型在HY-WorldPlay 1.5的强化学习后训练中,显著提升了动作执行与视觉质量。

关键结果

  • 在WorldReward-Bench上,WorldReward在动作一致性、外观和运动质量三项指标上分别超越GPT-5.5 3.42、1.45和3.56个百分点,表现优异。
  • 结合强化学习,模型在短期和长期生成任务中,持续改善动作准确性与视觉效果,验证其作为奖励信号的有效性。
  • 通过消融实验验证,片段级结构化推理、源图像和动作面板等关键设计元素对性能提升至关重要。

研究意义

该研究突破了现有视频奖励模型的局限,将动作一致性与视觉质量统一在一个基于VLM的偏好框架中,显著提升了摄像机条件下世界模型的生成质量。其创新的片段级推理机制和大规模偏好数据构建策略,为未来多模态视频理解与生成提供了新思路,有望推动自动化内容创作、虚拟现实等行业的发展。同时,该模型在强化学习中的应用,展示了其在复杂场景中的潜力,有助于实现更自然、更真实的虚拟环境交互。

技术贡献

本文首次提出基于VLM的配对偏好奖励模型,融合动作一致性与视觉质量评估,采用片段级结构化推理机制,有效应对长视频中的噪声干扰。通过大规模偏好数据的结构化构建,结合多轮工具审查和人工校准,显著提升模型的偏好判断准确性。模型在多项公开基准上优于现有方法,验证其在摄像机条件下世界模型优化中的有效性。该方法为多模态视频奖励提供了新范式,拓展了VLM在生成质量评估中的应用边界。

新颖性

本研究首次将VLM应用于摄像机条件下的长视频偏好奖励,通过片段级推理机制,有效解决了全视频长距离、多模态干扰的问题。与传统几何或图像基础奖励不同,WorldReward融合动作与视觉信息,提供更全面的评估指标。这种结构化、多尺度的偏好推理框架,代表了视频奖励建模的创新方向,显著优于现有的单一尺度或非结构化方法。

局限性

  • 模型依赖大规模偏好数据的质量与多样性,偏差可能影响评估准确性,且训练成本较高。
  • 在极端复杂场景或极端视觉风格下,模型的偏好判断仍存在一定误差,需进一步优化多模态融合机制。
  • 当前方法主要针对摄像机条件的生成场景,泛化到其他类型视频仍需验证。

未来方向

未来将探索多模态偏好数据的自动生成与扩展,提升模型在多样化场景中的适应性。还计划结合强化学习优化策略,增强模型对长序列中的局部错误的敏感性。此外,结合更先进的VLM架构,提升偏好判断的细粒度与鲁棒性,推动视频内容自动评估与生成的深度融合。

AI 总览摘要

随着虚拟环境和内容生成技术的快速发展,如何有效评估摄像机条件下的长视频生成质量成为关键难题。现有奖励模型多偏重几何轨迹或单帧质量,难以全面反映动作执行的准确性与视觉效果的自然流畅。本文提出WorldReward,一种基于视觉-语言模型(VLM)的配对偏好奖励框架,创新性地将长视频拆解为动作对齐的片段,利用结构化视觉证据进行逐段评判。模型通过投票机制整合片段偏好,形成全视频的动作一致性与视觉质量指标。训练过程中,作者构建了大规模偏好数据集,结合前沿VLM生成的结构化判断、多轮工具审查和人工校准,确保偏好标注的多样性和准确性。引入的WorldReward-Bench基准,涵盖动作、外观和运动三个维度,验证模型在所有指标上均优于GPT-5.5,显示出强大的偏好一致性。实验还表明,将该奖励模型用于强化学习后训练的HY-WorldPlay 1.5,显著提升了动作执行的准确性和视觉效果,验证了其在长短期生成任务中的应用潜力。这一研究不仅推动了多模态视频奖励的理论发展,也为虚拟环境、自动内容创作等行业提供了新的技术工具。未来,作者计划扩展偏好数据的自动化生成,结合更先进的VLM架构,进一步提升模型的鲁棒性和泛化能力,推动虚拟世界的智能化演化。

深度分析

研究背景

视频基础的世界模型近年来取得显著发展,从未来观察预测到交互式场景生成,代表作包括VideoGPT、DreamFusion等。尽管如此,如何评估生成视频的质量仍是难点,尤其是在保持动作准确性与视觉自然性方面。几何轨迹模型、图像质量评分和偏好学习方法各有优势,但都存在局限:几何模型忽略视觉细节,图像评分忽略动作一致性,偏好模型难以同时兼顾两者。现有奖励多为单一指标,难以满足复杂场景的多维需求,亟需融合多模态信息的统一评估体系。

核心问题

核心问题在于如何设计一个既能评估动作执行的准确性,又能反映视觉质量的统一奖励模型。现有方法多偏重单一维度,导致生成视频在动作或视觉上表现不佳。长视频中的短暂错误难以被捕捉,整体评价容易被良好片段掩盖,缺乏细粒度的局部反馈。此外,长序列中的多模态信息交织,增加了偏好判断的复杂性。解决这些问题对于提升虚拟环境的真实性和交互体验具有重要意义。

核心创新

创新点包括:1)提出基于VLM的配对偏好奖励模型,融合动作一致性与视觉质量评估;2)采用片段级结构化推理机制,将长视频拆解为动作对齐的短片段,逐段分析;3)引入多轮工具审查和人工校准,确保偏好数据的高质量;4)建立涵盖多样场景的偏好基准,验证模型的全面优越性。这些创新解决了长视频偏好评估中的噪声干扰和信息稀疏问题,显著提升了奖励的准确性和鲁棒性。

方法详解

  • �� 片段构建:将长视频拆分为动作对齐的短片段,每段包含4个连续动作和对应的帧块。• 输入设计:每段包括源图像、帧网格概览和动作细节面板,便于模型判断动作方向和视觉变化。• 逐段偏好推理:模型对每个片段进行动作一致性和视觉质量的偏好判断,考虑时间稳定性、动态合理性和结构完整性。• 投票整合:将所有片段偏好结果通过投票机制汇总,形成全视频的偏好指标。• 数据构建:利用前沿VLM进行结构化判断,结合多轮工具审查和人工校准,生成大规模偏好数据集。• 训练过程:在偏好数据上训练模型,优化其偏好判断能力。• 评估方法:在WorldReward-Bench基准上测试,比较不同模型和指标的偏好一致性。• 应用:将模型作为奖励信号,用于强化学习后训练,提升生成质量。

实验设计

采用公开视频生成模型(如HY-WorldPlay 1.5)生成多场景、多风格的视频样本,构建偏好数据集并进行偏好标注。基准包括GPT-5.5、Gemini 3.1 Pro等VLM判别器,采用偏好一致性指标评估模型表现。通过消融实验验证片段级推理、结构化视觉输入等关键设计的贡献。模型在动作一致性、外观和运动质量指标上均优于对比方法,特别是在长序列中表现出更强的鲁棒性。实验还涵盖多样场景、风格和控制策略,验证模型的泛化能力。

结果分析

在WorldReward-Bench上,模型在动作偏好评分中超越GPT-5.5 3.42个百分点,外观质量超越1.45点,运动质量超越3.56点。结合强化学习,模型在长短期生成任务中持续提升动作准确性和视觉效果,表现出优异的适应性。消融分析显示,片段结构化推理和多轮校准是性能提升的关键因素。整体而言,模型在多模态偏好评估中实现了突破,为虚拟环境的自动优化提供了新工具。

应用场景

该模型可广泛应用于虚拟现实、游戏内容生成、自动视频编辑等场景,提供更自然的交互体验和高质量内容。其作为奖励信号,能显著提升生成模型的动作准确性和视觉自然性,降低人工调优成本。未来还可结合自主学习和多模态感知,推动智能虚拟环境的自动化构建,满足工业、娱乐等多行业需求。

局限与展望

模型依赖大量偏好数据,偏差可能影响评估准确性;在极端复杂或风格化场景中表现仍有限;训练成本较高,难以实时应用。未来需优化偏好数据采集与模型推理效率,增强泛化能力,解决复杂场景下的表现不足。

通俗解读 非专业人士也能看懂

想象你在看一部电影,导演希望每个场景都符合剧情,又要画面漂亮。传统的方法就像用单一的镜头或评分标准,难以同时兼顾剧情和画面。本文提出的办法像是有一个聪明的评委,他能同时判断每个场景是否符合剧情(动作是否正确)和画面是否好看(视觉质量),还会把每个场景的评判结果投票,最后得出整个电影的评价。这个评委会用一种特殊的“眼睛”和“思考方式”来看每一段,确保每个动作都符合预期,画面也没有瑕疵。通过不断学习和校准,这个评委变得越来越聪明,能帮助自动生成更自然、更真实的视频内容。这就像是让机器变成了一个既懂剧情又懂画面的大导演,能自动帮我们筛选出最棒的作品。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你可以让虚拟世界里的角色做任何事情,但你希望他们做的事情既符合你的指令,又画面漂亮。以前的方法就像是只看动作是否对,或者只看画面是否漂亮,但不能同时判断两者。现在,这个新方法就像有个聪明的朋友,他能一边看每个动作是不是按你的意思做,一边看画面是不是很棒,然后投票决定哪个更好。这个朋友会把长长的视频拆成很多小片段,逐个判断,然后把所有判断合起来,给出一个整体的评价。这样一来,虚拟世界变得更真实、更漂亮,也更符合你的想法。这就像有个超级评委,让你的视频更酷、更自然!

原文摘要

Camera-conditioned world models generate interactive videos in which commanded actions should induce the expected scene changes while appearance, geometry, and temporal dynamics remain coherent. Existing rewards assess these requirements separately: geometry-based rewards estimate trajectory execution but cannot judge the visual quality of the executed motion, whereas image-based rewards measure frame quality without capturing action execution or temporal dynamics. We posit that a vision-language model (VLM) offers a shared reasoning space for relating actions to their visual outcomes. However, judging a complete long video against its full action sequence creates a lengthy, noisy context in which short-lived local action evidence can be missed or diluted. We present WorldReward, a VLM-based pairwise preference reward model that unifies action-consistency and visual-quality evaluation for camera-conditioned world models. WorldReward decomposes paired videos into action-aligned chunks, organizes each chunk into structured visual evidence, and aggregates chunk-level decisions by voting into separate video-level action and visual-quality preferences. To train it, we construct a large-scale reasoning-augmented preference dataset using structured judgments generated by a frontier VLM and refined through tool-based agent auditing and targeted human review. We further introduce WorldReward-Bench, a human-annotated benchmark measuring reward-model agreement with human preferences across action consistency, appearance quality, and motion quality. WorldReward achieves the highest agreement on all three dimensions, exceeding GPT-5.5 by 3.42, 1.45, and 3.56 percentage points, respectively. When used for RL post-training of HY-WorldPlay 1.5, it consistently improves both action execution and visual quality across short- to long-term horizons.

cs.CV