Inference-time Physics Alignment of Video Generative Models with Latent World Models

TL;DR

使用WMReward和VJEPA-2模型提高视频生成物理合理性,ICCV 2025挑战赛得分62.64%。

cs.CV 🔴 高级 2026-01-16 31 次浏览
Jianhao Yuan Xiaofeng Zhang Felix Friedrich Nicolas Beltran-Velez Melissa Hall Reyhane Askari-Hemmat Xiaochuang Han Nicolas Ballas Michal Drozdzal Adriana Romero-Soriano
视频生成 物理对齐 潜在世界模型 推理时间 机器学习

核心发现

方法论

该研究提出了一种名为WMReward的方法,通过在推理时利用潜在世界模型VJEPA-2的物理先验作为奖励信号,来提高视频生成的物理合理性。该方法通过搜索和引导多个候选去噪轨迹,优化生成性能。

关键结果

  • 在ICCV 2025 Perception Test PhysicsIQ Challenge中,WMReward方法获得了62.64%的最终得分,超越之前的最先进方法7.42%。
  • 在图像条件、多个帧条件和文本条件生成设置中,物理合理性显著提高。
  • 人类偏好研究验证了该方法的有效性,物理合理性提升了11.4%。

研究意义

该研究展示了使用潜在世界模型提高视频生成物理合理性的可行性,解决了现有视频生成模型在物理合理性方面的不足。这一进展对学术界和工业界具有重要意义,特别是在机器人和自动驾驶等应用中。

技术贡献

该研究的技术贡献在于将潜在世界模型用于视频生成的推理时间对齐,提供了一种新的奖励模型来指导生成过程。这种方法与现有的基于视觉语言模型的方法相比,表现出更好的物理理解能力。

新颖性

该研究首次将潜在世界模型的物理先验用于视频生成的推理时间对齐,提出了WMReward奖励模型,与现有方法相比,提供了更有效的物理合理性提升。

局限性

  • 该方法依赖于潜在世界模型的准确性,如果模型对物理现象的理解不够准确,可能影响结果。
  • 在计算资源有限的情况下,搜索和引导多个候选轨迹可能导致计算开销较大。

未来方向

未来的研究可以探索更高效的搜索策略,降低计算开销,并将该方法应用于更广泛的生成任务,如三维场景生成。

AI 总览摘要

当前的视频生成模型在生成视觉内容方面取得了显著进展,但在物理合理性上仍存在不足。许多模型在预训练阶段缺乏对物理规律的理解,导致生成的视频不符合物理常识。为了解决这一问题,研究人员提出了一种名为WMReward的新方法,通过在推理时利用潜在世界模型VJEPA-2的物理先验作为奖励信号,来提高视频生成的物理合理性。

WMReward方法通过搜索和引导多个候选去噪轨迹,优化生成性能。在ICCV 2025 Perception Test PhysicsIQ Challenge中,该方法获得了62.64%的最终得分,超越之前的最先进方法7.42%。实验结果表明,该方法在图像条件、多个帧条件和文本条件生成设置中,物理合理性显著提高。

这种方法的意义在于展示了使用潜在世界模型提高视频生成物理合理性的可行性,解决了现有视频生成模型在物理合理性方面的不足。这一进展对学术界和工业界具有重要意义,特别是在机器人和自动驾驶等应用中。未来的研究可以探索更高效的搜索策略,降低计算开销,并将该方法应用于更广泛的生成任务,如三维场景生成。

深度分析

研究背景

视频生成技术近年来取得了显著进展,尤其是在生成视觉内容方面。然而,这些模型在物理合理性上仍存在不足,生成的视频往往不符合基本的物理规律。这一问题不仅影响用户体验,还限制了这些模型在机器人和自动驾驶等领域的应用。现有研究主要集中在通过改进预训练阶段来提高物理合理性,但推理时间的对齐问题仍未得到充分探索。

核心问题

现有的视频生成模型在生成物理合理的视频方面存在挑战。尽管视觉效果显著提高,但生成的视频常常违反基本物理规律。这一问题的核心在于模型在推理阶段缺乏对物理现象的深刻理解,导致生成结果不符合现实世界的物理常识。

核心创新

该研究的核心创新在于提出了一种名为WMReward的方法,通过在推理时利用潜在世界模型VJEPA-2的物理先验作为奖励信号,来提高视频生成的物理合理性。这种方法与现有的基于视觉语言模型的方法相比,表现出更好的物理理解能力。

方法详解

  • �� 利用VJEPA-2模型的物理先验作为奖励信号
  • �� 在推理阶段搜索和引导多个候选去噪轨迹
  • �� 通过WMReward模型优化生成性能
  • �� 在ICCV 2025挑战赛中验证方法有效性

实验设计

实验在多个生成设置下进行,包括图像条件、多个帧条件和文本条件。使用的模型包括MAGI-1、Sora2和vLDM。评估指标包括物理合理性得分和人类偏好研究。实验结果表明,WMReward方法在所有设置下均显著提高了物理合理性。

结果分析

实验结果显示,WMReward方法在ICCV 2025挑战赛中取得了62.64%的得分,超越之前的最先进方法7.42%。此外,在人类偏好研究中,物理合理性提升了11.4%。这些结果表明,WMReward方法在提高视频生成物理合理性方面具有显著优势。

应用场景

该方法可直接应用于需要高物理合理性的视频生成任务,如机器人导航和自动驾驶。通过提高生成视频的物理合理性,这些应用可以获得更可靠的环境建模和决策支持。

局限与展望

尽管WMReward方法在提高物理合理性方面表现出色,但其计算开销较大,尤其是在资源有限的情况下。此外,该方法依赖于潜在世界模型的准确性,如果模型对物理现象的理解不够准确,可能影响结果。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。现有的视频生成模型就像一个只关注食材外观的厨师,虽然食物看起来不错,但味道可能不对。WMReward方法就像一个经验丰富的厨师,他不仅关注食材的外观,还考虑它们的味道和营养。通过利用潜在世界模型的物理先验,WMReward方法就像是给厨师提供了一本关于食材搭配的指南,确保每道菜不仅看起来好看,还符合健康标准。

简单解释 像给14岁少年讲一样

想象你在玩一个虚拟现实游戏,游戏中的物体看起来很真实,但当你试图与它们互动时,它们却不遵循物理规律,比如球不会滚动,水不会流动。WMReward方法就像是游戏中的一个新补丁,修复了这些不合理的物理现象。通过使用一种叫做VJEPA-2的模型,这个补丁确保游戏中的每个物体都按照真实世界的物理规律运动,让游戏体验更加真实和有趣!

术语表

潜在世界模型 (Latent World Model)

一种预测模型,将高维观测数据编码为紧凑的潜在表示,并学习潜在空间的转换函数以预测未来状态。

在论文中用于提供物理先验以提高视频生成的物理合理性。

VJEPA-2

一种潜在世界模型,通过自监督学习训练,能够在物理理解基准上达到最先进的性能。

用作WMReward方法中的奖励模型。

WMReward

一种奖励模型,通过利用潜在世界模型的物理先验来提高视频生成的物理合理性。

在推理阶段用于引导视频生成模型。

去噪轨迹 (Denoising Trajectories)

在生成过程中,通过去噪步骤逐步生成目标数据的过程。

用于WMReward方法中的候选轨迹搜索。

ICCV 2025 Perception Test PhysicsIQ Challenge

一个评估视频生成模型物理合理性的挑战赛。

WMReward方法在该挑战赛中取得了优异成绩。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算开销的情况下提高WMReward方法的效率?
  • 2 潜在世界模型在不同生成任务中的适用性如何?
  • 3 如何进一步提高WMReward方法的语义一致性?

应用场景

近期应用

机器人导航

通过提高视频生成的物理合理性,机器人可以更准确地感知和理解环境,从而提高导航和决策能力。

远期愿景

自动驾驶

在自动驾驶中应用该方法,可以提高车辆对环境的理解和预测能力,增强安全性和可靠性。

原文摘要

State-of-the-art video generative models produce promising visual content yet often violate basic physics principles, limiting their utility. While some attribute this deficiency to insufficient physics understanding from pre-training, we find that the shortfall in physics plausibility also stems from suboptimal inference strategies. We therefore introduce WMReward and treat improving physics plausibility of video generation as an inference-time alignment problem. In particular, we leverage the strong physics prior of a latent world model (here, VJEPA-2) as a reward to search and steer multiple candidate denoising trajectories, enabling scaling test-time compute for better generation performance. Empirically, our approach substantially improves physics plausibility across image-conditioned, multiframe-conditioned, and text-conditioned generation settings, with validation from human preference study. Notably, in the ICCV 2025 Perception Test PhysicsIQ Challenge, we achieve a final score of 62.64%, winning first place and outperforming the previous state of the art by 7.42%. Our work demonstrates the viability of using latent world models to improve physics plausibility of video generation, beyond this specific instantiation or parameterization.

cs.CV