核心发现
方法论
MemoryVAM引入基于Perceiver的Recap Compressor,将每帧CLIP嵌入映射为紧凑的记忆标记,并通过Recap-Cue模块估算任务完成状态。该记忆模块在视频预测、辅助重建和episode边界监督下训练,无需逐帧标签。该机制可适配UNet和Diffusion Transformer骨架,通过不同的交叉注意力注入接口实现。模型在LIBERO-Mem数据集成功将成功率从5%提升至42.5%,在真实机器人任务中,计数任务成功率达78.3%,空间回忆80.0%,序列追踪75.0%。
关键结果
- 在LIBERO-Mem上,模型成功率从5%提升至42.5%,显著改善长时域操控表现。
- 在真实机器人中,模型在计数、空间回忆和序列追踪任务中表现优异,成功率分别达78.3%、80.0%、75.0%。
- 通过消融实验验证,记忆在未来预测和动作解码中共同作用,缺一不可,提升整体性能。
研究意义
该研究突破了视频世界模型在长时域任务中的瓶颈,将episodic memory系统融入预测与控制,极大增强机器人在复杂、多阶段任务中的自主能力。其无监督训练机制降低了标注成本,为未来大规模视频驱动机器人学习提供了新思路。该方法不仅提升了任务成功率,也推动了视频预测、记忆机制与机器人控制的深度融合,具有广泛的理论和应用价值。
技术贡献
提出双路径记忆注入机制,将Recap-Cue模块引入UNet和Diffusion Transformer骨架,实现episode级记忆的高效编码与利用。模型结合视频预测和辅助重建目标,训练过程中无需逐帧标签,增强了记忆的自主学习能力。创新在于将episodic memory作为视频世界模型的核心组成部分,统一优化未来预测和动作控制,突破了传统只依赖短期观察窗口的限制,为长时域机器人操控提供新范式。
新颖性
首次将episodic memory系统系统性融入视频世界模型,通过Recap-Cue模块实现episode级记忆的高效编码与利用,显著提升长时域操控性能。不同于以往仅在动作策略中引入记忆的做法,本研究将记忆作为预测和控制的共同基础,形成整体优化框架,开创了视频驱动机器人学习的新方向。
局限性
- 模型在极长的任务中可能受到Recap Compressor的记忆容量限制,需引入在线递归或截断机制以应对超长序列。
- 训练依赖大量视频数据,计算成本较高,实际部署时需优化推理效率。
- 在极端复杂或动态环境中,记忆的鲁棒性和泛化能力仍需进一步验证。
未来方向
未来将探索引入在线递归机制以支持超长序列,结合强化学习优化记忆更新策略,提升模型在动态环境中的适应性。同时,考虑多模态信息融合,丰富记忆内容,增强任务泛化能力,推动机器人自主学习向更复杂场景拓展。
AI 总览摘要
随着机器人在复杂环境中执行多阶段任务的需求不断增长,传统视频世界模型因观察窗口有限而难以应对长时域的操控挑战。现有方法多依赖短期观察,导致在多次重复或隐藏状态变化的任务中表现不佳。为解决这一瓶颈,MemoryVAM引入了一套基于episodic memory的机制,将episode级别的历史信息融入视频预测和动作控制中。
该机制核心是Recap-Cue模块,通过Perceiver架构将每帧CLIP嵌入映射为紧凑的记忆标记,并利用辅助监督训练,避免了对逐帧标签的依赖。这些记忆标记通过双路径注入:一方面作为条件信息影响未来预测的视觉骨架,另一方面直接调节动作解码器的控制策略,从而实现历史信息的全局利用。
在LIBERO-Mem基准测试中,模型成功率从5%提升至42.5%,在真实机器人任务中,表现同样优异,计数任务成功率达78.3%,空间回忆80.0%,序列追踪75.0%。这些结果验证了episodic memory在长时域任务中的关键作用。该研究不仅推动了视频预测与机器人控制的深度融合,也为未来大规模无监督学习提供了新路径。尽管如此,模型在超长序列和极端复杂环境中仍面临挑战,未来将结合递归机制和多模态信息,进一步提升其鲁棒性与泛化能力。
深度分析
研究背景
近年来,视频世界模型在机器人学习中逐渐崭露头角,代表性工作包括VPP、Cosmos等,利用深度神经网络实现对未来场景的预测,从而指导机器人行为。早期方法多依赖短期观察窗口,假设任务满足马尔可夫性质,但在长时域、多阶段任务中表现有限。随着任务复杂度提升,如何利用长时记忆成为研究热点。已有研究尝试引入外部记忆或递归机制,但多依赖标签或有限的记忆容量,难以实现大规模无监督学习。
核心问题
现有视频世界模型在长时域任务中表现不足,主要源于缺乏有效的episodic memory机制,导致模型无法捕获隐藏的任务进展信息。短观察窗口限制了模型对历史信息的利用,尤其在多次重复、隐藏状态变化或复杂序列中表现不佳。这限制了机器人在复杂环境中的自主能力,亟需一种高效、可训练的记忆系统,融合到预测和控制中,以实现长时域的任务成功。
核心创新
MemoryVAM的核心创新在于引入Recap-Cue模块,通过Perceiver架构将episode级别的历史信息映射为紧凑的记忆标记。这些记忆标记通过双路径注入:一是作为条件影响未来视觉预测,增强模型的历史一致性;二是直接调节动作解码器,确保控制策略考虑历史信息。该机制无需逐帧标签,利用视频预测目标进行自监督训练,兼容UNet和Diffusion Transformer骨架,统一优化未来预测与动作控制,突破了传统短观察窗口的限制。
方法详解
- �� 维护episode历史:每帧通过CLIP视觉嵌入提取特征。
- �� Recap Compressor:利用Perceiver交叉注意力,将历史特征压缩为固定大小的记忆标记G。
- �� 双路径注入:
- 进入视频骨架:将G作为交叉注意力条件,影响未来预测和特征生成。
- 进入动作解码器:将G与视觉特征拼接,调节动作分布。
- �� 任务完成估计:Cue Gate结合骨架特征、记忆和语言指令,预测任务完成状态。
- �� 训练:采用视频预测、重建和episode边界监督,训练记忆模块,无需逐帧标签。
- �� 骨架适配:支持UNet和Diffusion Transformer,通过不同的交叉注意力接口实现记忆注入。
实验设计
- �� 评估在LIBERO-Mem基准,比较无记忆和记忆增强模型性能,指标包括成功率和视频预测质量。
- �� 真实机器人任务:计数、空间回忆和序列追踪,验证模型在实际环境中的效果。
- �� 消融实验:验证双路径记忆注入的重要性,分析重建损失和任务完成估计的影响。
- �� 训练细节:采用两阶段训练策略,第一阶段学习预测与记忆,第二阶段训练动作策略,确保模型稳定性。
结果分析
- �� 在LIBERO-Mem,成功率从5%提升至42.5%,在长序列预测中FVD指标显著下降。
- �� 在机器人任务中,模型在计数任务中达78.3%,空间回忆80.0%,序列追踪75.0%,优于无记忆模型。
- �� 消融分析显示,双路径记忆注入是性能提升的关键,单路径效果有限,模型能有效利用episode级历史信息进行长时域操控。
应用场景
- �� 机器人自主操作:适用于复杂、多阶段任务,如装配、检索、追踪等。
- �� 无监督学习:利用视频预测进行训练,减少对标注数据的依赖。
- �� 长时域任务:特别适合需要记忆隐藏状态或多次重复的场景,提升自主性和鲁棒性。
局限与展望
- �� 记忆容量受Recap Compressor限制,超长任务可能需引入递归或截断机制。
- �� 训练和推理成本较高,实际部署需优化效率。
- �� 在极端复杂或动态环境中,记忆的泛化能力仍需验证,未来需结合多模态信息增强鲁棒性。
通俗解读 非专业人士也能看懂
想象你在厨房做菜,食材、步骤和时间都很重要。每次做菜时,你会记住之前用过的调料、烹饪时间和步骤顺序。传统的厨师只看眼前的食材,难以记住之前的细节,容易做错菜。MemoryVAM就像给厨师装上了记忆宝盒,能记住整个烹饪过程中的每个细节。这样,无论菜做了多久,厨师都能根据记忆调整步骤,确保菜肴完美。这种记忆机制帮助机器人在复杂任务中记住隐藏信息、避免重复错误,就像厨师记住了每次的经验一样。它让机器人变得更聪明、更可靠,能应对更长、更复杂的任务。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,你需要记住每个拼图片的颜色、位置和你已经拼到哪一步。刚开始还挺简单,但当拼图变得很大、很多块都长得差不多时,就容易搞混。这时候,你会用一张小纸条记下重要的线索,比如哪个角落已经拼好,哪个颜色还缺少。MemoryVAM就像给机器人装上了这张“记忆纸条”,让它可以记住之前拼了多远、哪些地方已经完成。这样,无论拼图多大、多复杂,机器人都能根据记忆找到正确的下一步,不会重复或迷失方向。它让机器人在长时间、多步骤的任务中变得更聪明、更有条理,就像你在拼大拼图一样。
原文摘要
Video-world-model policies learn action-relevant representations by predicting future observations. However, they condition on only a short observation window, which renders long-horizon manipulation non-Markovian when the correct action depends on earlier events that are no longer visible. We present MemoryVAM, an episodic memory mechanism for video-world-model policies. We employ a Recap-Cue (RC) module, in which a Perceiver-based Recap Compressor maps per-frame CLIP embeddings into compact memory tokens, and a lightweight Cue Gate estimates task completion from memory and language. These tokens are injected into both the video backbone and the action decoder, aligning policy imagination with episode progress and conditioning actions on history. Our model trains the memory module with video prediction, a delta-reconstruction auxiliary loss, and episode-boundary supervision, requiring no per-frame progress labels. The same mechanism applies to UNet and Diffusion Transformer (DiT) backbones by changing only the cross-attention injection interface. On LIBERO-Mem, our model improves average success from 5% to 42.5%. On real robots, it achieves 78.3% success on counting tasks, 80.0% on spatial recall, and 75.0% on sequential tracking. Project page: https://MemoryVAM.github.io/