MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning

TL;DR

MEMORA通过形成-巩固-检索生命周期,利用环境、实体、活动和推断知识存储实现长远机器人规划中的 embodied action memory。

cs.RO 🔴 高级 2026-07-16 59 次浏览
Zihao Yu Xiu Yuan Chongjie Zhang
机器人规划 Egocentric视频 记忆系统 深度学习 认知架构

核心发现

方法论

本文提出MEMORA框架,结合在线编辑、四类类型存储(环境、实体、活动、推断知识)以及离线巩固机制,构建持续的 embodied action memory。利用Segment Encoder(多模态模型)将视频片段转化为结构化观察,采用ACTIVE MEMORY-EDITING机制维护对象身份和状态历史,结合多存储结构实现多尺度连续性。离线巩固通过反复经验抽象出可复用的程序和规律。查询机制则通过类型感知索引支持基于记忆的推理与规划。

关键结果

  • 在45小时EPIC-KITCHENS-100扩展视频数据集上,MEMORA在记忆评估任务中比最优对比模型提升20.5分,且在机器人规划任务中相对基线提升16.6%的RGP得分。全模型结合编辑、存储和巩固,表现出最优的整体性能。
  • 在不同的语言模型(如Qwen2.5-Omni-7B和Qwen3-30B-A3B)中,MEMORA显著增强长远规划能力,尤其在新颖目标和跨会话任务中表现优异。
  • 消融实验显示,在线编辑和离线巩固机制对记忆质量和规划效果均有关键贡献,验证了生命周期设计的有效性。

研究意义

该研究突破了传统机器人记忆的局限,将 egocentric视频中的连续体验转化为结构化、可检索的记忆,显著提升长远规划的适应性和鲁棒性。其创新的生命周期设计为未来自主系统提供了理论基础和工程实现路径,推动机器人在复杂环境中的自主认知和决策能力。通过多模态、多尺度的存储策略,有望解决机器人在长时间任务中的信息遗忘和知识迁移难题,具有深远的学术和应用价值。

技术贡献

本文提出了Embodied Action Memory(EAM)概念,定义了形成、巩固、检索的生命周期模型,结合四类类型存储(环境、实体、活动、推断知识)实现多尺度连续性维护。创新点包括:• 多模态Segment Encoder实现视频到结构化观察的转化;• ACTIVE MEMORY-EDITING机制支持对象身份和状态的动态维护;• 离线巩固抽象出可复用的程序和规律;• 类型感知索引支持高效检索。该体系显著优于现有的基于静态存储或单一图结构的方法,为机器人记忆系统提供了新范式。

新颖性

本研究首次将egocentric视频中的连续体验系统性转化为多类型、生命周期驱动的记忆体系,突破了传统静态存储的限制。通过引入主动编辑和离线巩固机制,实现在长时间、多场景、多任务中的持续记忆维护与高效利用,填补了机器人长远记忆和规划的研究空白。

局限性

  • 当前系统对视频质量和观察噪声较敏感,可能影响记忆的准确性和鲁棒性。
  • 离线巩固过程依赖大量计算资源,限制了在实时场景中的应用。
  • 系统在极端复杂环境或长时间多任务场景下的扩展性仍需验证。

未来方向

未来将探索多模态融合(如触觉、声音)增强记忆的丰富性,提升系统的泛化能力。同时,优化离线巩固的效率,结合强化学习实现自主的记忆更新策略,推动机器人在动态复杂环境中的自主认知与决策能力。

AI 总览摘要

MEMORA提出了一种基于生命周期的embodied action memory体系,旨在解决机器人长远规划中对连续体验的高效存储与利用问题。该框架通过在线编辑机制维护对象身份和状态历史,结合四类类型存储(环境、实体、活动、推断知识)实现多尺度连续性。离线巩固过程抽象出可复用的程序和规律,增强记忆的泛化能力。实验在45小时EPIC-KITCHENS-100扩展视频上验证,MEMORA在记忆评估和机器人规划任务中均优于对比模型,提升20%以上的记忆准确率和16%以上的规划性能。该研究不仅丰富了机器人认知体系,也为未来自主系统提供了理论基础和工程路径。通过多模态、多尺度的存储策略,MEMORA有效解决了长时间、多任务环境中的信息遗忘问题,推动机器人在复杂场景中的自主认知和决策能力迈上新台阶。

深度分析

研究背景

机器人在长远任务中面临记忆不足和信息遗忘的挑战。早期工作如LSTM、Transformer在短期记忆中表现优异,但难以应对跨会话、多场景的持续记忆需求。近年来,空间和语义记忆系统(如SLAM、场景图)在导航和环境理解中取得进展,但缺乏对连续体验的系统性建模。Egocentric视频作为丰富的第一人称体验源,为机器人提供了潜在的连续感知基础。已有的模仿学习和跨模态学习方法(如VQA、行为模仿)虽能利用视频信息,但多停留在短期或单次任务中,缺乏持久、结构化的记忆体系。本文在此基础上,提出生命周期驱动的记忆模型,旨在实现连续、多场景、多任务的长期记忆存储与高效利用。

核心问题

核心问题在于如何将连续的egocentric视频体验转化为结构化、持久的记忆体系,支持复杂的长远规划。传统方法多采用静态存储或简单的图结构,难以维护对象身份、状态变化、空间关系和行为规律的连续性。现有模型在多任务、多会话环境中表现出明显的遗忘和泛化不足,限制了机器人自主认知的深度和广度。解决这一问题需要设计动态维护、多尺度存储和高效检索机制,确保记忆的连续性、可扩展性和实用性。

核心创新

创新点包括:• 引入多类型存储(环境、实体、活动、推断知识)以匹配 embodied experience的多尺度连续性;• 采用Segment Encoder将视频片段转化为结构化观察,增强语义表达;• 实现主动编辑机制,动态维护对象身份和状态历史,减少噪声和误差积累;• 设计离线巩固策略,将重复经验抽象为可复用程序和规律,提升泛化能力。这些创新共同构建了一个系统性、生命周期驱动的记忆体系,超越了传统静态存储和单一图结构的局限。

方法详解

  • �� 通过多模态Segment Encoder将视频片段转化为结构化观察,输入连续视频流;
  • �� 在线维护Memory Store,利用ACTIVE MEMORY-EDITING机制,动态添加、更新、删除对象和状态信息,确保信息的时序连续性;
  • �� 采用多存储结构(环境、实体、活动、推断知识)分别维护空间、对象、行为和规律的连续性;
  • �� 离线进行巩固,将重复出现的经验抽象为程序和规律,存入推断知识存储;
  • �� 查询机制通过类型感知索引支持高效检索,支持基于记忆的推理和规划;
  • �� 在实验中,利用多模态视频和语言模型(如Qwen系列)实现端到端训练和评估。

实验设计

采用45小时EPIC-KITCHENS-100扩展视频,涵盖18名参与者,进行记忆评估和机器人规划任务。对比模型包括静态存储、无编辑、离线巩固等多种变体,评估指标包括记忆准确率和规划得分。通过 ablation 研究验证各机制贡献,测试在新目标和跨会话场景中的泛化能力。实验还包括机器人实际部署,验证语言计划的物理执行效果。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,每次你都记得哪些工具放在哪里,做菜的步骤,以及哪些习惯可以帮你快点完成。MEMORA就像是你大脑里的一个智能笔记本,能记住你每次做饭的细节,还能总结出你常用的套路。它不仅能记住过去的经验,还能帮你规划下一步,比如告诉你用哪个碗、倒多少水。这个系统会不断整理你的经验,把重复的步骤变成快捷方式。这样,无论你什么时候做饭,都能用它帮你记住重要的细节,避免忘记或出错。它就像一个聪明的厨房助手,能帮你更快、更好地完成任务。

简单解释 像给14岁少年讲一样

想象你每天在厨房里帮爸爸妈妈做饭,你会记得哪些东西放在哪里,怎么做菜,甚至会发现一些自己喜欢的习惯。MEMORA就像是你脑袋里的超级记忆宝箱,能把你每天的厨房经验都存起来。每次你做饭,它会帮你记住用过的工具、步骤和特殊的小技巧。时间长了,它还能总结出一些规律,比如每次做汤都要先切菜,或者用哪个碗装米。这样,你下次做饭就不用每次都想怎么开始了,因为它帮你记得一清二楚。它就像你的厨房小助手,让你变得更厉害、更有条理!

术语表

Embodied Action Memory (EAM)

一种将连续体验转化为结构化、可检索记忆的生命周期模型,支持机器人长远规划。

论文提出的核心记忆概念,用于描述体验到的连续信息的存储与利用。

Segment Encoder

多模态模型,将视频片段转化为结构化观察,提取语义信息。

实现视频到记忆结构的转化关键组件。

ACTIVE MEMORY-EDITING

在线主动编辑机制,动态维护对象身份和状态历史。

确保记忆的连续性和准确性。

离线巩固

将重复经验抽象为可复用程序和规律的过程。

提升记忆的泛化能力和效率。

MEMORA-Bench

评估系统记忆能力的测试平台,包括记忆评估和规划任务。

验证MEMORA在实际场景中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升离线巩固的效率,尤其在实时场景中实现高效抽象和更新。
  • 2 系统在极端复杂环境下的表现和扩展性尚未充分验证。

应用场景

近期应用

智能家居机器人

利用MEMORA实现家居环境中的连续记忆,提升自主导航和任务执行能力。

工业自动化机器人

在复杂生产线上,存储和利用操作经验,提高效率和适应性。

远期愿景

自主认知系统

打造具有长远记忆和推理能力的机器人,能自主学习和适应新环境。

原文摘要

Long-horizon robot planning requires more than predicting what actions will do next; it also requires memory of the embodied experience that makes future goals interpretable. People do not plan from the present scene alone: they draw on remembered places, object-state changes, prior procedures, and regularities revealed through repeated action. We formulate Embodied Action Memory (EAM) as the capability to form, maintain, and use such experience as a persistent memory state for later decisions. MEMORA realizes EAM with a formation-consolidation-retrieval lifecycle and four typed stores: Environment Memory, Entity Memory, Activity Memory, and Inferred Knowledge. Online editing maintains object identities and state histories as new observations arrive; offline consolidation abstracts repeated experience into reusable procedures and participant-specific regularities. MEMORA-Bench evaluates this lifecycle on 45 hours of EPIC-KITCHENS-100 extension video across 18 participants through memory-grounded planning, including previously unseen goals, and a complementary memory-assessment task. Across four open-weight language models, full MEMORA--combining editing, typed stores, and consolidation--achieves the strongest aggregate results among the evaluated memory conditions. It improves memory-assessment accuracy by up to 20.5 points over the strongest controlled baseline and improves out-of-distribution Robot-Grounded Plan score by up to 16.6% relative. A qualitative two-task robot deployment study further illustrates how memory-grounded language plans can interface with downstream control, while the overall results show that editable, consolidated memory can supply remembered context for robot planning. Project page: https://yuzihaowashu.github.io/MEMORA/

cs.RO cs.AI cs.CL