PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

TL;DR

PlayWorld通过多模态代理玩家评估171个场景中的长远目标,揭示现有世界模型在空间一致性和状态持续性方面的不足。

cs.CV 🔴 高级 2026-08-14 101 次浏览
Kaixin Ding Xi Chen Minghong Cai Zhiyuan Xu Yiyang Wang Yuxiang Lu Junyi Li Shuyang Chen Yuan Gao Xin Tao Pengfei Wan Hengshuang Zhao
视频世界模型 长远目标评估 多模态代理 交互一致性 基准测试

核心发现

方法论

本文提出一种基于多模态代理玩家的评估框架,利用171个场景中的长远目标,结合动态调整的交互策略,系统评估九个先进世界模型在几何一致性、交互保真度、视线外演化和洞察演变等方面的表现。代理玩家通过观察生成的帧和历史行为,采用Keep、Stop、Extend、Correct等决策,动态调节行动时长和内容,确保评估的公平性和多样性。引入VQA问答验证机制,结合场景特定的问答指标,量化模型在空间结构保持、交互合理性、视线外状态连续性和场景内动态演变的能力。整个流程在10-60秒的连续滚动中进行,兼顾视频质量和可控性指标,确保多维度评估的全面性。

关键结果

  • 实验结果显示,当前九个世界模型在长远交互目标下表现不稳定,几何一致性平均得分为2.74(Genie 3)和2.54(HappyOyster),空间和时间连续性存在明显缺陷。交互保真度得分最低为1.01(HY-World2),表现出对复杂交互的响应不足。视线外演化和洞察演变指标也显示模型在持续状态保持和场景理解方面存在较大差距,尤其是在长时间动态变化和复杂场景中的表现不佳。通过对模型响应的动态调节,代理玩家成功模拟人类交互行为,提升了评估的公平性和适应性。
  • 结果表明,虽然部分模型在短期视频生成方面表现优异,但在空间一致性、状态持续性和复杂交互方面仍存在显著不足。特别是在长时间连续交互中,模型容易出现场景漂移、对象消失或不合理的物理反应。这揭示了当前视频世界模型在长远目标追踪和复杂场景理解上的瓶颈,为未来模型的空间一致性和状态连续性优化提供了明确方向。

研究意义

本研究通过引入多模态代理玩家和长远目标评估机制,为视频世界模型的系统性评估提供了新的思路。相比传统基于预定义轨迹的评估方法,PlayWorld能够模拟人类真实交互行为,反映模型在复杂场景中的实际表现。这不仅有助于推动模型在空间一致性、物理合理性和动态理解方面的提升,也为未来智能交互系统的开发奠定基础。其多维度评价体系涵盖几何、交互、视线外状态和洞察演变,全面反映模型的实际应用潜力,有望引导行业标准的制定和技术突破。

技术贡献

本文提出了基于多模态Agent Player的长远目标交互评估框架,创新性地结合了动态调节策略和场景特定VQA问答验证机制,突破了传统基于固定轨迹的评估限制。引入171个多样化场景和50种行动模式,丰富了评估样本空间。通过动态调整行动策略,有效缓解了模型响应差异带来的不公平问题。实验验证了该方法在九个世界模型上的适用性,揭示了模型在空间一致性和状态持续性方面的不足,为模型优化提供了具体指标和方向。

新颖性

本研究首次提出利用多模态Agent Player进行长远目标的动态交互评估,突破了传统基于预定义轨迹的限制,实现了模型响应的自适应调节和多维度评价。引入171个场景和多样化的VQA验证机制,系统性地评估模型在复杂交互中的表现,填补了长远目标评估缺乏标准化和自动化的空白。这一方法为未来视频世界模型的公平比较和持续优化提供了新的技术路径。

局限性

  • 当前评估主要依赖模拟的交互场景,可能无法完全反映真实用户的复杂行为和偏好,存在一定的模拟偏差。
  • 模型在空间一致性和状态连续性方面仍表现不足,尤其在长时间复杂交互中容易出现场景漂移和对象误差,未来需要引入更强的物理和语义理解机制。
  • 评估过程对计算资源要求较高,尤其是在多场景、多指标的情况下,存在一定的效率瓶颈,需优化算法和硬件支持。

未来方向

未来将结合强化学习和自监督机制,提升模型在长远交互中的稳定性和一致性。计划引入更丰富的场景和动态物理引擎,增强模型对复杂环境的理解能力。同时,推动评估框架的自动化和标准化,结合真实用户交互数据,逐步实现从模拟到真实应用的迁移,推动视频世界模型在虚拟现实、游戏设计和智能机器人等领域的广泛应用。

AI 总览摘要

视频世界模型作为人工智能研究的前沿方向,旨在模拟未来场景的动态演变,支持交互式应用。近年来,随着深度学习和生成模型的发展,诸如OpenAI的VideoGen、Google DeepMind的DreamWorld等系统在视频生成质量和交互控制方面取得了显著突破。然而,现有评估方法多依赖于预定义轨迹或静态指标,难以全面反映模型在复杂长远交互中的表现。这一局限性阻碍了模型的持续优化和行业标准的建立。

为解决这一问题,本文提出了PlayWorld评估框架,创新性地引入多模态Agent Player,模拟人类交互行为,动态调节行动策略,以实现对长远目标的自适应追踪。该方法结合了171个多样化场景和50种行动模式,构建了丰富的评估样本库,涵盖几何一致性、交互保真度、视线外状态演化和洞察演变四个核心维度。通过场景特定的VQA问答验证机制,量化模型在空间结构保持、物理合理性和动态理解方面的能力。

在九个最先进的世界模型上的实验结果显示,尽管部分模型在短期视频生成方面表现优异,但在长时间连续交互中,空间一致性和状态持续性仍存在明显不足。模型容易出现场景漂移、对象消失或不合理的物理反应,揭示了当前技术在复杂场景理解和长远目标追踪上的瓶颈。这些发现为未来模型的空间一致性和状态连续性优化提供了明确方向。

总体而言,PlayWorld为视频世界模型的系统性评估提供了新思路,推动了行业标准的制定。未来,结合强化学习和物理引擎的引入,有望进一步提升模型的稳定性和真实性,推动虚拟现实、智能机器人等应用的快速发展。尽管如此,评估过程的计算成本和模拟偏差仍需优化,未来工作将聚焦于提升效率和真实性,推动模型从实验室走向实际应用。

深度解读

原文摘要

Video world models simulate future states conditioned on current observations and user actions. Recent systems have demonstrated impressive video consistency and action controllability over long sequences. However, fairly comparing these interactive models remains challenging. In practice, a human player typically evaluates a world model by pursuing long-horizon objectives through interaction. For example, a user may turn around 360 degrees to see whether the environment remains consistent, or walk into the water and inspect whether realistic water ripples are generated. The action sequence required to achieve the same objective may vary substantially between models, making fixed action-conditioned evaluation unsuitable for cross-model comparison. To address this, we employ multi-modal Agent Players to interact with world models toward specified long-horizon objectives. Building on this paradigm, we introduce PlayWorld, a benchmark providing 171 scenarios, each with a specified objective. To evaluate performance thoroughly, we assess models along four core dimensions: geometry consistency, interaction fidelity, out-of-sight evolution, and insight evolution. In addition, we incorporate basic ability metrics for video quality and controllability. Experiments across nine state-of-the-art world models reveal that current models remain unreliable on long-horizon interactive objectives, particularly in maintaining spatial consistency and persistent state evolution. Code and data are available at https://github.com/kxding/PlayWorld.

cs.CV

参考文献 (20)

Advancing Open-source World Models

R. Gao, Qiuyu Wang, Yanhong Zeng 等

2026 93 引用 ⭐ 高影响力 查看解读 →

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

Wenqiang Sun, Haiyu Zhang, Haoyuan Wang 等

2025 105 引用 ⭐ 高影响力 查看解读 →

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

Haoyu Chen, Kaichen Zhou, Hang Hua 等

2026 4 引用 ⭐ 高影响力 查看解读 →

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

Xiaojie Xu, Zhe Lin, Kang He 等

2026 11 引用 ⭐ 高影响力 查看解读 →

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

Haoyi Zhu, Haozhe Liu, Yuyang Zhao 等

2026 19 引用 ⭐ 高影响力 查看解读 →

Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model

Xianglong He, Chunli Peng, Zexiang Liu 等

2025 135 引用 ⭐ 高影响力 查看解读 →

WorldScore: A Unified Evaluation Benchmark for World Generation

Haoyi Duan, Hong-Xing Yu, Sirui Chen 等

2025 121 引用 ⭐ 高影响力 查看解读 →

Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models

Meiqi Wu, Zhixi Cai, Fufangchen Zhao 等

2026 6 引用 ⭐ 高影响力 查看解读 →

VBench: Comprehensive Benchmark Suite for Video Generative Models

Ziqi Huang, Yinan He, Jiashuo Yu 等

2023 1788 引用 ⭐ 高影响力 查看解读 →

Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model

Junshu Tang, Jiacheng Liu, Jiaqi Li 等

2025 42 引用 ⭐ 高影响力 查看解读 →

GAIA-1: A Generative World Model for Autonomous Driving

Anthony Hu, Lloyd Russell, Hudson Yeo 等

2023 639 引用 查看解读 →

Large Video Planner Enables Generalizable Robot Control

Boyuan Chen, Tianyuan Zhang, Haoran Geng 等

2025 58 引用 查看解读 →

T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation

Kaiyue Sun, Kaiyi Huang, Xian Liu 等

2024 169 引用 查看解读 →

Cosmos World Foundation Model Platform for Physical AI

N. Agarwal, Arslan Ali, M. Bala 等

2025 792 引用 查看解读 →

WorldSimBench: Towards Video Generation Models as World Simulators

Yiran Qin, Zhelun Shi, Jiwen Yu 等

2024 1246 引用 查看解读 →

Yume-1.5: A Text-Controlled Interactive World Generation Model

Xiaofeng Mao, Zhen Li, Chuanhao Li 等

2025 56 引用 查看解读 →

February 2024

A. Moffitt

2024 87 引用

Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability

Shenyuan Gao, Jiazhi Yang, Li Chen 等

2024 361 引用 查看解读 →

Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models

Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari

2026 6 引用 查看解读 →

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

Kaining Ying, Hengrui Hu, Siyu Ren 等

2026 12 引用 查看解读 →