WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

TL;DR

提出WorldRoamBench,基于逐帧动作、视觉漂移、物理交互和记忆的长时程稳定性评估,涵盖600+场景。

cs.CV 🔴 高级 2026-06-30 35 次浏览
Ting-Bing Xu Jiacheng Sui Zhe Gao Kewei Shi Wenjin Yang Zhicheng Liu Zhaoxu Sun Mingchao Sun Hongyu Pan Fan Jiang Mu Xu Qi Fan Yang Gao Yong Li Baoquan Chen
交互世界模型 长时程稳定性 基准测试 物理交互 记忆评估

核心发现

方法论

该方法结合逐帧动作准确性、轨迹误差、视觉漂移、物理交互和场景记忆多维度评估。采用基于动作的逐帧指标,绕过语义尺度差异,揭示隐藏的动作失败;引入基于片段的视觉漂移指标,捕捉中途非单调崩溃;设计可控性门控的物理评估,检测碰撞、光学和3D一致性;采用场景迁移的记忆协议,通过点云重建和追踪+VLM推理,评估模型的长时记忆能力。测试涵盖600+多场景、多视角、多时间长度的案例,评估多模型性能。

关键结果

  • 在10+开源和闭源模型中,最高模型在所有维度的平均得分仅为0.65,显示大部分模型在长时互动中存在明显不足。
  • 动作逐帧准确率平均仅达60%,轨迹误差(TrajScore)在0.75左右,视觉漂移指标显示模型在数百帧后出现明显的视觉崩溃。
  • 物理交互方面,模型常出现穿越障碍或违反物理定律的情况,记忆评估显示模型在回访时场景重建偏差明显,反映出记忆能力的局限。

研究意义

该基准系统突破了现有短时片段评估的限制,系统性地评估长时互动中的多维性能,为未来稳定、物理真实、记忆可靠的交互世界模型提供了重要参考。它推动模型在复杂开放环境中的应用,从而促进虚拟现实、机器人导航等行业的发展。

技术贡献

引入逐帧动作指标,突破语义尺度差异的限制;设计片段级视觉漂移检测,捕获中途崩溃;提出可控性门控的物理评估,确保交互的物理合理性;采用场景迁移的记忆协议,提升长时记忆能力。整体架构实现了多维度、长时程的系统性评估,填补了现有基准的空白。

新颖性

首次提出面向开放世界的长时互动稳定性基准,结合动作、视觉、物理和记忆四个维度,采用多场景、多视角、多时间长度的真实案例,全面评估模型性能,具有较强创新性。

局限性

  • 评估依赖于预训练的动作识别和点云重建,可能受限于模型的基础能力,导致部分指标偏低。
  • 对复杂场景中的动态交互和多目标追踪支持不足,未来需扩展多目标、多动作的评估能力。
  • 长时间交互中,模型仍存在累积误差和场景一致性不足的问题,需进一步优化算法和训练策略。

未来方向

未来将引入多模态融合评估,增强对动态场景和多目标交互的支持;开发更高效的长时记忆机制;探索自适应评估指标以适应不同应用场景,推动交互模型向更真实、更稳定方向发展。

AI 总览摘要

随着交互式世界模型(IWMs)逐步逼近现实应用,长时程的稳定性成为核心挑战。现有评估多集中于短片段,忽视了模型在持续交互中的表现。为此,本文提出了WorldRoamBench,一套面向开放世界、多场景、多视角的长时互动基准,涵盖动作追踪、视觉一致性、物理交互和记忆能力四大维度。

该基准通过600余个真实案例,模拟连续10至60秒的WASD/IJKL操作,系统评估模型在长时间互动中的表现。创新点在于引入逐帧动作指标,避免语义尺度差异带来的偏差;设计片段级视觉漂移检测,捕捉中途崩溃;提出可控性门控的物理评估,确保交互的合理性;采用场景迁移的记忆协议,提升长时记忆能力。

实验结果显示,当前主流模型在所有维度的平均得分仅为0.65,存在明显不足。动作准确率约60%,视觉质量在数百帧后出现崩溃,物理交互常违反基本定律,记忆能力在回访时偏差显著。这表明模型在长时互动中仍面临巨大挑战。

该工作为未来交互世界模型的研发提供了系统性评估工具,有助于推动模型在真实环境中的应用。未来,将结合多模态信息、优化长时记忆机制,进一步提升模型的稳定性和真实感,推动虚拟现实、机器人等行业的变革。

深度分析

研究背景

交互式世界模型(IWMs)近年来快速发展,代表性工作包括Genie、Matrix-Game、HY-World等。这些模型通过学习潜在动作空间,实现实时生成环境,支持用户用键盘等输入进行交互。早期评估主要关注短时片段(5-10秒),侧重视觉质量和动作一致性,缺乏对长时稳定性、物理交互和记忆的系统性考察。随着模型复杂度提升,长时互动的稳定性成为关键瓶颈。现有的评估体系无法全面反映模型在持续交互中的表现,限制了其实际应用潜力。

核心问题

核心问题在于模型在长时间连续操作中,是否能保持场景的真实性、一致性和记忆的连续性。短时评估无法揭示模型在累积误差、场景崩溃和物理违规方面的潜在缺陷。长时互动中,模型容易出现视觉退化、物理碰撞穿越、记忆偏差等问题,严重制约其在虚拟现实、机器人导航等场景中的应用。解决这一问题需要系统性、多维度的评估方法,确保模型在复杂环境中的稳定性。

核心创新

本研究的创新点包括:1)提出逐帧动作指标,绕过语义尺度差异,揭示隐藏的动作失败;2)引入片段级视觉漂移指标,捕获中途崩溃;3)设计可控性门控的物理评估,确保交互的物理合理性;4)采用场景迁移的记忆协议,评估模型的长时记忆能力。这些创新共同构建了一个多维度、长时程的全面评估体系,弥补了现有方法在长互动稳定性方面的不足。

方法详解

  • �� 采用基于动作的逐帧指标,利用相机轨迹估计(如ViPE)对每帧动作进行分类,检测动作偏差;
  • �� 设计片段级漂移指标,通过对连续帧的图像质量和色彩变化进行检测,捕获中途崩溃;
  • �� 构建可控性门控的物理测试,包括碰撞、遮挡、反射等,确保模型生成的场景符合物理规律;
  • �� 采用场景迁移协议,利用点云重建和追踪+VLM推理,评估模型在回访中的记忆一致性;
  • �� 设计长时(10-60秒)连续交互测试,涵盖多场景、多视角,确保评估的全面性。

实验设计

  • �� 采用600+真实案例,涵盖自然、城市、室内场景,模拟连续WASD操作;
  • �� 测试对象包括10+开源和闭源模型,比较其在动作追踪、视觉质量、物理交互和记忆方面的表现;
  • �� 评估指标包括逐帧动作准确率、轨迹误差(TrajScore)、视觉漂移、物理违规检测和场景重建偏差;
  • �� 通过不同时间长度和场景复杂度的测试,分析模型在多样环境下的稳定性和鲁棒性。

结果分析

  • �� 最高模型在所有维度的平均得分为0.65,显示模型在长时互动中存在明显不足;
  • �� 动作逐帧准确率平均为60%,轨迹误差(TrajScore)约为0.75,视觉漂移在数百帧后明显加剧;
  • �� 物理交互中,模型常出现穿越障碍或违反物理定律的情况;记忆评估显示模型在回访时场景偏差明显,反映出长时记忆的局限性;
  • �� 结果揭示,模型在连续长时间交互中难以兼顾动作、视觉、物理和记忆的平衡,存在显著改进空间。

应用场景

  • �� 该基准可用于虚拟现实、增强现实、机器人导航等领域的模型评估,帮助开发更稳定、真实的交互系统;
  • �� 未来可结合多模态信息,提升模型在复杂环境中的表现,推动智能交互技术的商业化应用。

局限与展望

  • �� 评估依赖预训练模型,可能受限于基础模型的性能;
  • �� 对动态多目标场景支持不足,未来需扩展多目标、多动作的评估能力;
  • �� 长时间交互中,模型仍存在累积误差和场景不一致的问题,需优化算法和训练策略。

通俗解读 非专业人士也能看懂

想象你在一个巨大的玩具城里玩耍,这个城由很多不同的房子、道路和人物组成。你可以用遥控器控制一个小车,沿着道路开动,看看房子里的玩偶,甚至和他们互动。这个城很复杂,有很多细节,比如灯光、声音和运动。模型就像这个玩具城的智能导游,它能根据你的指令,带你在城里自由探索,告诉你每个房间的情况,甚至记住你之前看过的地方。

但问题是,这个导游有时候会迷路,或者忘记你之前告诉它的事情。它可能会走错路,或者忘记你喜欢的玩偶在哪里。为了让这个导游变得更聪明、更可靠,科学家们设计了各种测试,看看它在长时间玩耍后还能不能记得住东西,走得稳不稳,能不能正确反应你的指令。这就像是给导游安排了一个“长跑比赛”,让它在城里跑上好几圈,观察它的表现。这个研究就是在设计这样一套“长跑测试”,帮助科学家们打造更聪明、更真实的虚拟世界导游。

原文摘要

Despite rapid progress in interactive world models (IWMs), existing benchmarks evaluate action following only at trajectory level and ignore memory and interaction physics. We introduce WorldRoamBench, an open-world benchmark for long-horizon stability across four dimensions, each with tailored innovations: (i) Action: per-frame action metric bypassing cross-model semantic scale disparity and exposing failures hidden by trajectory; (ii) Vision: segment-based drift metric capturing non-monotonic mid-sequence collapse missed by start-vs-end comparisons; (iii) Physics: controllability-gated evaluation over mechanics, optics, and 3D consistency, scoring plausibility under faithful action execution; (iv) Memory: action-decoupled protocol evaluating scene memory via transition-localized 3D point-cloud reconstruction and subject memory via tracking-plus-VLM reasoning. The benchmark comprises 600+ test cases across Nature, Urban, and Indoor scenes in first/third-person views with WASD 10-60s continuous interaction. Evaluating 10+ open/closed-source models reveals none reliably satisfies all dimensions; even the best achieves only moderate scores. Advances on WorldRoamBench are steps toward IWMs that are stable, physically grounded, memory-faithful, and deployable in real-world applications.

cs.CV cs.AI