ActWorld: From Explorable to Interactive World Model via Action-Aware Memory

TL;DR

ActWorld用100K互动视频与动作感知记忆,让世界模型同时会走、会看、会交互。

cs.CV 🔴 高级 2026-06-16 37 次浏览
Zhexiao Xiong Yizhi Song Hao Kang Qing Yan Liming Jiang Jenson Yang Zhoujie Fu Stathi Fotiadis Angtian Wang Zichuan Liu Bo Liu Yiding Yang Xin Lu Nathan Jacobs
世界模型 人机交互 记忆机制 视频生成 具身智能

核心发现

方法论

作者将问题拆成数据与记忆两条线:先构建100K人-物交互视频,并用chain-of-thought式推理为每个chunk生成细粒度caption;再在chunk-autoregressive世界模型中加入hierarchical action-aware memory,按交互重要性路由历史压缩,并用persistent memory bank长期保留event-update与object-identity tokens,缓解动作遗忘。

关键结果

  • ActWorld在单一模型内同时支持导航与中途物体交互,解决了以往只能走不能碰的局面;论文报告其在交互保真度上显著优于navigation-only baselines,同时不牺牲视角控制。
  • 数据侧贡献明确:作者自建100K interaction video dataset,并为每个chunk配套密集caption,这为密集人-物状态变化建模提供了此前缺乏的监督信号。
  • 消融显示,若去掉动作感知记忆或持久记忆库,模型更易出现action-forgetting,即把前面发生过的开门、拾取、触发等事件遗忘,后续对象状态预测明显变差。

研究意义

这项工作把world model从“可浏览”推进到“可交互”,对虚拟现实、机器人仿真、游戏代理和交互式内容生成都很关键。它直击两大长期瓶颈:一是缺少可学习的人-物交互数据,二是长时序压缩会抹掉决定后续状态的关键事件帧。ActWorld证明,只靠导航动作词表无法支撑真实环境理解;必须让模型记住“发生了什么动作、作用在谁身上、结果是什么”。

技术贡献

技术上,ActWorld不是简单扩展动作类别,而是把“交互重要性”显式写入记忆管理:重要事件帧优先保留,普通历史可压缩;同时把对象身份与状态更新拆成可持续追踪的token,适配长滚 rollout。相较只依赖最近帧或固定长度上下文的生成式世界模型,它更接近因果记忆系统:先保留会改变世界状态的证据,再据此继续生成。

新颖性

其新颖性在于把中途物体交互纳入chunk-autoregressive世界模型,而非停留在prompt-to-full-video或游戏化场景。与以往偏导航的world model不同,它把动作遗忘问题明确归因于记忆压缩,并提出按交互重要性路由的分层记忆与持久记忆库,形成从数据、编码到长程生成的一体化方案。

局限性

  • 论文摘要未给出统一的定量指标与全部基准细节,因此外部读者难以直接比较其提升幅度;同时,100K数据虽大,但仍可能覆盖有限的交互种类与物理后果,面对复杂工具使用或多主体协作时泛化未知。
  • 分层记忆与持久记忆库会增加系统复杂度与推理开销,长rollout时如何在显存、速度与记忆保真之间平衡,仍是落地难点。
  • 当前能力主要围绕可见对象交互展开,对力学细节、隐状态、遮挡后的持续因果关系建模仍可能不足。

未来方向

下一步可扩展到更多交互类型,如工具使用、多物体联动与多智能体协作;也可引入更强的因果监督,把动作、对象属性变化与物理响应显式对齐。社区还需要统一评测协议,量化交互保真、长时一致性与视角控制之间的权衡。

AI 总览摘要

ActWorld试图回答一个看似简单却长期未解的问题:世界模型能否不仅“看起来像真的”,还真的“能被用户改写”?过去的互动世界模型大多围绕导航展开,动作词表几乎只包含走、转、看,物体交互则常被排除在外,或只在游戏场景、整段视频提示生成中零散出现。结果是,模型生成的世界可浏览,却难以真正操作。

为打通这道鸿沟,作者提出两项互补设计。数据上,他们构建了一个10万条的interaction video dataset,并用chain-of-thought式推理为每个chunk标注caption,让模型学习“动作—事件—状态变化”的细粒度对应关系。模型上,ActWorld采用chunk-autoregressive框架,并引入hierarchical action-aware memory:把历史压缩按交互重要性路由,关键的事件更新帧和对象身份token则写入persistent memory bank,跨长rollout持续保留。

这套设计的核心直觉很像做笔记:普通路程可以快速省略,但真正改变结果的关键步骤必须记住。若模型忘了“打开门”这一事件,后面门是否仍开着就会预测错;若记住了事件与对象身份,后续生成就能延续因果链,而不是只追逐最近一两帧的视觉表象。论文据此指出,传统recency-biased compression会引发action-forgetting,而ActWorld正是为纠正这一病灶而生。

实验表明,ActWorld在同一模型中兼顾灵活导航与丰富物体交互,交互保真度显著优于navigation-only baselines,同时不牺牲视角控制。换言之,它不再只是一个会“走动”的视频生成器,而更像一个能够记住发生过什么、并据此继续演化场景的动态世界引擎。

更广泛地看,这项工作为具身智能、机器人仿真、游戏代理和交互式内容创作提供了新的底座:模型不只是预测下一帧,而是维持一段可操作的世界历史。它也提醒研究界,真正的互动世界模型不应只扩大动作词表,更要重建记忆结构,让关键事件在长时序中不被抹去。

当然,ActWorld仍处在起点:摘要未给出完整的定量指标与跨数据集泛化结果,复杂工具使用、多主体协作以及更精细物理规律仍待突破。但它已经把研究方向从“能看”推进到“能改”,这是互动世界模型迈向真实应用的重要一步。

深度分析

研究背景

世界模型研究经历了从静态视频预测到可控生成的演进。早期方法多关注next-frame prediction、imagination rollout和navigation control,能让模型沿着用户视角前进,但通常只处理低维动作,如前进、转向、观察。近期的VideoGPT、Make-A-Video类工作强化了视觉质量,却大多把交互简化为文本提示。ActWorld针对的是更难的一类任务:在生成过程中,用户突然对场景中的具体物体施加动作,并要求模型维持后续状态一致性。

核心问题

核心问题有两个。第一,数据不足:真实人-物交互视频稀缺,且缺少能对齐动作、事件、对象状态变化的密集标注。第二,记忆失真:许多world model依赖最近帧或固定长度上下文压缩,容易把真正决定后续状态的关键事件丢掉,导致action-forgetting。这个问题之所以重要,是因为物体状态往往不是由当前视角决定,而是由此前发生过的交互决定。

核心创新

ActWorld的创新可概括为三点。其一,数据创新:构建100K interaction video dataset,并对每个chunk生成caption,提供密集监督。其二,记忆创新:提出hierarchical action-aware memory,按交互重要性决定哪些历史片段应被保留。其三,持续性创新:加入persistent memory bank,长期保存event-update和object-identity tokens,使对象状态在长rollout中可追踪。与只做视角控制的模型相比,它真正把交互写进了时序记忆。

方法详解

  • �� 输入:包含导航与交互动作的视频序列,以及每个chunk的语义caption。模型在chunk-autoregressive范式下逐段生成未来内容。

  • �� 数据层:作者先从交互视频中筛选人-物作用明显的片段,再用chain-of-thought reasoning生成chunk级描述,帮助模型学习动作触发的状态转移。

  • �� 记忆路由:历史信息不再一视同仁,而是根据交互重要性分层压缩。会改变对象状态的事件帧优先进入保留通道,普通上下文则可被摘要。

  • �� 持久记忆库:把事件更新token与对象身份token长期存放,供后续rollout查询,避免对象在长序列中“失名”“失态”。

  • �� 生成输出:模型在既定视角控制下继续生成新chunk,同时保持被交互对象的外观、位置与状态连续一致。

实验设计

实验围绕两类能力展开:一是灵活导航,即模型能否维持正常视角控制;二是中途交互,即在rollout过程中插入物体操作后,后续帧能否正确反映状态变化。作者使用自建的100K interaction video dataset进行训练与评估,并与navigation-only baselines比较。文中重点关注交互保真、视角控制和长时一致性,同时通过消融验证动作感知记忆与persistent memory bank的作用。

结果分析

主要结果是:ActWorld在一个模型内同时实现导航与对象交互,说明交互不是导航模型的附属能力,而可以被统一建模。其次,论文明确指出其在交互保真度上优于navigation-only baselines,并且没有牺牲 viewpoint control,这是关键平衡点。再次,消融表明若缺少分层动作感知记忆,模型更容易出现action-forgetting,后续对象状态预测明显退化,证明记忆路由是核心贡献而非附加模块。

应用场景

短期内,它可用于可交互仿真环境、游戏NPC世界状态生成、虚拟训练场景以及机器人策略预演。对开发者来说,前提是有动作标注或可自动获得的交互视频,以及能支持长序列rollout的算力。长期看,它可能成为通用环境模拟底座,让用户像在沙盒里一样真实地改变世界,而不是只沿着既定轨迹观看。

局限与展望

当前版本的能力仍受数据覆盖面和标注质量约束。100K视频虽可观,但复杂工具链、稀有物理交互、多主体博弈与遮挡后因果关系未必充分覆盖。其次,分层记忆与持久记忆库会增加系统复杂度,长序列推理成本和显存压力不可忽视。未来需要更统一的评测协议与更强的物理/因果监督。

通俗解读 非专业人士也能看懂

可以把ActWorld想成一个会记事的厨房。以前的模型像只会照着眼前画面做菜的学徒:你让它往前走,它能走;你让它转身,它能转,但如果你说“把锅盖打开,再把盘子拿走”,它就容易忘记刚才发生了什么。因为它只盯着最近几秒的画面,像一个记忆很短的人。

ActWorld做的事,是给这个学徒配了一本会自动整理的笔记本。普通路上走了几步不重要,可以简单记;但一旦你打开了锅盖、拿起了盘子、或者改变了桌上的东西,这些关键步骤就会被重点记下来。这样下一秒厨房会继续按真实逻辑变化,而不是像失忆一样乱跳。

它还不是只记“发生过什么”,而是记“这个东西是谁”。比如那只盘子、那扇门、那把杯子,它们各自经历了什么变化,都会被持续追踪。于是模型不只是拍漂亮画面,而是真的懂得:刚才那一下动作,会不会影响接下来整个厨房的样子。

简单解释 像给14岁少年讲一样

想象你在玩一个超自由的游戏。以前的世界模型像那种只会带你散步的NPC:你往左,它跟着往左;你转头,它也转头,但你要是突然捡起地上的钥匙、打开门、把箱子挪开,它就开始发懵,像忘了你刚刚干了啥。

ActWorld就厉害多了。它不光会记住你往哪儿走,还会记住你对东西做了什么。比如你把杯子拿走了,桌子上就不该还摆着杯子;你把门打开了,后面那一瞬间门就得保持打开状态。听起来很正常对吧?但对模型来说,这其实一点都不简单,因为它得把前面发生过的关键动作牢牢记住。

它怎么做到的呢?可以把它想成“重点内容自动高亮”的笔记本。普通路过的画面,随便记一下;真正会改变结果的动作,重点标出来,专门留着以后看。这样模型就不会一边生成一边失忆。

术语表

Chunk-autoregressive (分块自回归)

把长视频或长时序分成一个个chunk,按顺序逐块预测未来。它能降低长序列生成的难度,同时保留时序连贯性。

ActWorld用它来在生成过程中插入导航和物体交互。

Action-aware memory (动作感知记忆)

一种按动作重要性决定保留哪些历史信息的记忆机制。与只保留最近帧不同,它优先保存会改变对象状态的关键事件。

用于缓解action-forgetting和历史压缩失真。

Persistent memory bank (持久记忆库)

长期保存关键token的外部记忆模块。它让模型在长rollout中仍能访问早先的事件更新和对象身份信息。

用于跨多个chunk维持对象连续性。

Event-update token (事件更新token)

表示某次交互后对象状态发生变化的压缩表示。它帮助模型记住门是否被打开、物体是否被拿起等状态转移。

被写入persistent memory bank以支持后续预测。

Object-identity token (对象身份token)

用于标识同一物体在不同时间步中的身份线索。它让模型不至于把不同物体或同一物体的不同状态混淆。

与事件更新token一起维持长时对象一致性。

Chain-of-thought reasoning (链式推理)

先分解再描述的标注方式,通过逐步推断生成更细的语义标签。它通常能把复杂动作拆成可学习的中间语义。

用于为每个chunk生成caption。

开放问题 这项研究留下的未解疑问

  • 1 ActWorld对复杂物理交互的上限仍不清楚,例如多次受力、遮挡后的对象状态、以及多个物体之间的连锁反应是否都能稳定追踪,现有摘要没有给出足够细的量化证据。
  • 2 100K数据集虽然解决了稀缺性,但交互类型与场景分布是否足够均衡仍是问题;若训练集中某类动作过多,模型可能学会模式化生成,而非真正理解交互因果。

应用场景

近期应用

交互式仿真训练

可用于机器人和具身智能的虚拟训练环境,研究者能在生成场景中插入开门、拾取、推拉等动作,观察后续状态变化,用于策略预演与失败分析。

游戏与虚拟内容生成

游戏开发者和内容创作者可用它生成既能移动视角、又能响应玩家操作的动态场景,减少手工脚本编写,并提升沉浸感与可玩性。

远期愿景

通用可操作世界底座

长期目标是让模型像一个会记忆的虚拟环境引擎,用户不只是在看世界,而是在改写世界。若与更强物理引擎和多主体规划结合,可支持更接近真实环境的数字孪生。

原文摘要

Interactive world models aim to simulate environment dynamics under real-time user actions. However, their action vocabulary is largely confined to navigation: most actions correspond to motion (e.g., walk, turn, look around), while interaction with objects in the scene (e.g., pick up plates, open doors, or trigger physical responses) is either absent, restricted to game domains, or relegated to prompt-to-full-video scenarios. The resulting worlds are visually explorable but not truly actionable. In this work, we present ActWorld, an interactive world model that extends prior navigation-centric generators to support mid-rollout object interaction within a chunk-autoregressive framework. We argue that the navigation-interaction gap stems from two bottlenecks. First, a data bottleneck: the lack of human-object interaction data with accurate, dense labels. Second, a memory bottleneck: recency-biased history compression in existing world models discards the event-transition frames that causally determine subsequent object states, leading to an action-forgetting pathology. On the data side, we construct a 100K interaction video dataset, each annotated with per-chunk captions via chain-of-thought reasoning. On the model side, we introduce a hierarchical action-aware memory design that routes history compression by interaction importance, complemented by a persistent memory bank that maintains event-update and object-identity tokens across long rollouts. Experiments show that ActWorld supports both flexible navigation and rich object interaction within a single model, substantially improving interaction fidelity over navigation-only baselines without sacrificing viewpoint control. Project page is available at https://interactwm.github.io/ActWorld.

cs.CV