WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models
提出WorldRoamBench,基于逐帧动作、视觉漂移、物理交互和记忆的长时程稳定性评估,涵盖600+场景。
核心发现
方法论
该方法结合逐帧动作准确性、轨迹误差、视觉漂移、物理交互和场景记忆多维度评估。采用基于动作的逐帧指标,绕过语义尺度差异,揭示隐藏的动作失败;引入基于片段的视觉漂移指标,捕捉中途非单调崩溃;设计可控性门控的物理评估,检测碰撞、光学和3D一致性;采用场景迁移的记忆协议,通过点云重建和追踪+VLM推理,评估模型的长时记忆能力。测试涵盖600+多场景、多视角、多时间长度的案例,评估多模型性能。
关键结果
- 在10+开源和闭源模型中,最高模型在所有维度的平均得分仅为0.65,显示大部分模型在长时互动中存在明显不足。
- 动作逐帧准确率平均仅达60%,轨迹误差(TrajScore)在0.75左右,视觉漂移指标显示模型在数百帧后出现明显的视觉崩溃。
- 物理交互方面,模型常出现穿越障碍或违反物理定律的情况,记忆评估显示模型在回访时场景重建偏差明显,反映出记忆能力的局限。
研究意义
该基准系统突破了现有短时片段评估的限制,系统性地评估长时互动中的多维性能,为未来稳定、物理真实、记忆可靠的交互世界模型提供了重要参考。它推动模型在复杂开放环境中的应用,从而促进虚拟现实、机器人导航等行业的发展。
技术贡献
引入逐帧动作指标,突破语义尺度差异的限制;设计片段级视觉漂移检测,捕获中途崩溃;提出可控性门控的物理评估,确保交互的物理合理性;采用场景迁移的记忆协议,提升长时记忆能力。整体架构实现了多维度、长时程的系统性评估,填补了现有基准的空白。
新颖性
首次提出面向开放世界的长时互动稳定性基准,结合动作、视觉、物理和记忆四个维度,采用多场景、多视角、多时间长度的真实案例,全面评估模型性能,具有较强创新性。
局限性
- 评估依赖于预训练的动作识别和点云重建,可能受限于模型的基础能力,导致部分指标偏低。
- 对复杂场景中的动态交互和多目标追踪支持不足,未来需扩展多目标、多动作的评估能力。
- 长时间交互中,模型仍存在累积误差和场景一致性不足的问题,需进一步优化算法和训练策略。
未来方向
未来将引入多模态融合评估,增强对动态场景和多目标交互的支持;开发更高效的长时记忆机制;探索自适应评估指标以适应不同应用场景,推动交互模型向更真实、更稳定方向发展。
AI 总览摘要
随着交互式世界模型(IWMs)逐步逼近现实应用,长时程的稳定性成为核心挑战。现有评估多集中于短片段,忽视了模型在持续交互中的表现。为此,本文提出了WorldRoamBench,一套面向开放世界、多场景、多视角的长时互动基准,涵盖动作追踪、视觉一致性、物理交互和记忆能力四大维度。
该基准通过600余个真实案例,模拟连续10至60秒的WASD/IJKL操作,系统评估模型在长时间互动中的表现。创新点在于引入逐帧动作指标,避免语义尺度差异带来的偏差;设计片段级视觉漂移检测,捕捉中途崩溃;提出可控性门控的物理评估,确保交互的合理性;采用场景迁移的记忆协议,提升长时记忆能力。
实验结果显示,当前主流模型在所有维度的平均得分仅为0.65,存在明显不足。动作准确率约60%,视觉质量在数百帧后出现崩溃,物理交互常违反基本定律,记忆能力在回访时偏差显著。这表明模型在长时互动中仍面临巨大挑战。
该工作为未来交互世界模型的研发提供了系统性评估工具,有助于推动模型在真实环境中的应用。未来,将结合多模态信息、优化长时记忆机制,进一步提升模型的稳定性和真实感,推动虚拟现实、机器人等行业的变革。
深度分析
研究背景
交互式世界模型(IWMs)近年来快速发展,代表性工作包括Genie、Matrix-Game、HY-World等。这些模型通过学习潜在动作空间,实现实时生成环境,支持用户用键盘等输入进行交互。早期评估主要关注短时片段(5-10秒),侧重视觉质量和动作一致性,缺乏对长时稳定性、物理交互和记忆的系统性考察。随着模型复杂度提升,长时互动的稳定性成为关键瓶颈。现有的评估体系无法全面反映模型在持续交互中的表现,限制了其实际应用潜力。
核心问题
核心问题在于模型在长时间连续操作中,是否能保持场景的真实性、一致性和记忆的连续性。短时评估无法揭示模型在累积误差、场景崩溃和物理违规方面的潜在缺陷。长时互动中,模型容易出现视觉退化、物理碰撞穿越、记忆偏差等问题,严重制约其在虚拟现实、机器人导航等场景中的应用。解决这一问题需要系统性、多维度的评估方法,确保模型在复杂环境中的稳定性。
核心创新
本研究的创新点包括:1)提出逐帧动作指标,绕过语义尺度差异,揭示隐藏的动作失败;2)引入片段级视觉漂移指标,捕获中途崩溃;3)设计可控性门控的物理评估,确保交互的物理合理性;4)采用场景迁移的记忆协议,评估模型的长时记忆能力。这些创新共同构建了一个多维度、长时程的全面评估体系,弥补了现有方法在长互动稳定性方面的不足。
方法详解
- �� 采用基于动作的逐帧指标,利用相机轨迹估计(如ViPE)对每帧动作进行分类,检测动作偏差;
- �� 设计片段级漂移指标,通过对连续帧的图像质量和色彩变化进行检测,捕获中途崩溃;
- �� 构建可控性门控的物理测试,包括碰撞、遮挡、反射等,确保模型生成的场景符合物理规律;
- �� 采用场景迁移协议,利用点云重建和追踪+VLM推理,评估模型在回访中的记忆一致性;
- �� 设计长时(10-60秒)连续交互测试,涵盖多场景、多视角,确保评估的全面性。
实验设计
- �� 采用600+真实案例,涵盖自然、城市、室内场景,模拟连续WASD操作;
- �� 测试对象包括10+开源和闭源模型,比较其在动作追踪、视觉质量、物理交互和记忆方面的表现;
- �� 评估指标包括逐帧动作准确率、轨迹误差(TrajScore)、视觉漂移、物理违规检测和场景重建偏差;
- �� 通过不同时间长度和场景复杂度的测试,分析模型在多样环境下的稳定性和鲁棒性。
结果分析
- �� 最高模型在所有维度的平均得分为0.65,显示模型在长时互动中存在明显不足;
- �� 动作逐帧准确率平均为60%,轨迹误差(TrajScore)约为0.75,视觉漂移在数百帧后明显加剧;
- �� 物理交互中,模型常出现穿越障碍或违反物理定律的情况;记忆评估显示模型在回访时场景偏差明显,反映出长时记忆的局限性;
- �� 结果揭示,模型在连续长时间交互中难以兼顾动作、视觉、物理和记忆的平衡,存在显著改进空间。
应用场景
- �� 该基准可用于虚拟现实、增强现实、机器人导航等领域的模型评估,帮助开发更稳定、真实的交互系统;
- �� 未来可结合多模态信息,提升模型在复杂环境中的表现,推动智能交互技术的商业化应用。
局限与展望
- �� 评估依赖预训练模型,可能受限于基础模型的性能;
- �� 对动态多目标场景支持不足,未来需扩展多目标、多动作的评估能力;
- �� 长时间交互中,模型仍存在累积误差和场景不一致的问题,需优化算法和训练策略。
通俗解读 非专业人士也能看懂
想象你在一个巨大的玩具城里玩耍,这个城由很多不同的房子、道路和人物组成。你可以用遥控器控制一个小车,沿着道路开动,看看房子里的玩偶,甚至和他们互动。这个城很复杂,有很多细节,比如灯光、声音和运动。模型就像这个玩具城的智能导游,它能根据你的指令,带你在城里自由探索,告诉你每个房间的情况,甚至记住你之前看过的地方。
但问题是,这个导游有时候会迷路,或者忘记你之前告诉它的事情。它可能会走错路,或者忘记你喜欢的玩偶在哪里。为了让这个导游变得更聪明、更可靠,科学家们设计了各种测试,看看它在长时间玩耍后还能不能记得住东西,走得稳不稳,能不能正确反应你的指令。这就像是给导游安排了一个“长跑比赛”,让它在城里跑上好几圈,观察它的表现。这个研究就是在设计这样一套“长跑测试”,帮助科学家们打造更聪明、更真实的虚拟世界导游。
原文摘要
Despite rapid progress in interactive world models (IWMs), existing benchmarks evaluate action following only at trajectory level and ignore memory and interaction physics. We introduce WorldRoamBench, an open-world benchmark for long-horizon stability across four dimensions, each with tailored innovations: (i) Action: per-frame action metric bypassing cross-model semantic scale disparity and exposing failures hidden by trajectory; (ii) Vision: segment-based drift metric capturing non-monotonic mid-sequence collapse missed by start-vs-end comparisons; (iii) Physics: controllability-gated evaluation over mechanics, optics, and 3D consistency, scoring plausibility under faithful action execution; (iv) Memory: action-decoupled protocol evaluating scene memory via transition-localized 3D point-cloud reconstruction and subject memory via tracking-plus-VLM reasoning. The benchmark comprises 600+ test cases across Nature, Urban, and Indoor scenes in first/third-person views with WASD 10-60s continuous interaction. Evaluating 10+ open/closed-source models reveals none reliably satisfies all dimensions; even the best achieves only moderate scores. Advances on WorldRoamBench are steps toward IWMs that are stable, physically grounded, memory-faithful, and deployable in real-world applications.