R+X: Retrieval and Execution from Everyday Human Videos

TL;DR

R+X利用视觉语言模型从未标注的人类日常视频中检索行为片段,并通过零样本模仿学习实现机器人技能,免训练。

cs.RO 🔴 高级 2024-07-18 55 引用 109 次浏览
Georgios Papagiannis Norman Di Palo Pietro Vitiello Edward Johns
机器人学习 视觉语言模型 视频检索 零样本模仿 人类行为理解

核心发现

方法论

R+X框架由两个核心阶段组成:检索(Retrieval)和执行(Execution)。在检索阶段,利用Gemini Pro 1.5 Flash等多模态视觉语言模型,从长时间未标注的人类第一人称视频中检索出与给定任务描述相关的短视频片段。通过DINO特征提取和K-means聚类,自动识别出场景中的关键点和手部动作轨迹。在执行阶段,采用Keypoint Action Tokens(KAT)模型,基于少样本的上下文学习能力,将检索到的示例行为映射到机器人动作轨迹,实现即时模仿。该流程无需任何微调或训练,充分利用预训练模型的知识迁移能力。

关键结果

  • 在12个日常家庭任务中,R+X成功实现了从长未标注视频中提取行为并执行,平均成功率达到85%,显著优于基线方法(如微调的R3M-DiffLang和Octo),提升幅度在10%-20%之间。实验中,R+X在对象变化、场景复杂度和语言指令多样性方面表现出优越的泛化能力,尤其在面对未见过的物体和复杂指令时,表现出较强的鲁棒性。
  • 在连续任务学习中,R+X展现出无灾难性遗忘能力,能在不断增加新任务的同时保持旧任务性能,平均性能下降不到5%,而传统微调方法性能下降超过20%。此外,R+X在不同场景中的空间和语言泛化测试中,表现出比单一策略模型更强的适应性,尤其在复杂环境和多样指令下,表现出更高的成功率。
  • 通过消融实验验证,检索阶段的视觉特征提取和手部动作轨迹的准确性对最终性能影响显著。使用DINO特征和手部动作提取模型HaMeR,显著优于传统的深度特征和手部估计方法,确保了行为模仿的准确性和鲁棒性。

研究意义

本研究突破了以往依赖手工标注和特定环境条件的机器人学习方法,提出利用未标注的自然视频数据实现任务学习的全新框架。该方法充分利用大规模预训练模型的知识迁移能力,极大降低了数据标注成本,提升了机器人在复杂、多变环境中的自主学习能力。未来,随着可穿戴设备普及,海量日常视频将成为机器人自主学习的重要资源,推动机器人向更智能、更灵活的方向发展。这一技术的实现,有望在家用机器人、服务机器人和智能制造等领域引发深远变革。

技术贡献

该论文提出了结合视觉语言模型(Gemini Pro 1.5 Flash)和少样本模仿学习(KAT)的创新框架,首次实现从长未标注人类视频中自动检索行为片段,并在无需微调的情况下,利用预训练模型的上下文理解能力,直接实现机器人技能的即时模仿。这种分阶段的检索-执行策略,突破了传统端到端训练的限制,显著提升了泛化能力和适应性。论文还引入了基于深度特征的3D关键点提取和手部动作估计,增强了行为表示的语义和几何一致性,为机器人自主学习提供了新的技术路径。

新颖性

本研究的创新点在于提出一种全新的从未标注视频中学习机器人技能的方法,结合了先进的视觉语言模型检索能力和少样本模仿学习技术,实现了无需任何微调的任务执行。这在机器人学习领域尚属首次,突破了传统依赖大量标注数据和端到端训练的局限,为机器人自主学习提供了全新解决方案。与以往方法不同,R+X强调利用自然场景中的丰富信息,通过检索和模仿实现泛化,极大降低了数据准备和训练成本。

局限性

  • 该方法依赖于高质量的预训练视觉语言模型,若模型在特定任务或场景中表现不足,可能影响检索效果和行为模仿的准确性。
  • 在极端复杂或动态环境中,关键点提取和手部动作估计可能出现误差,影响机器人行为的精确性和鲁棒性。
  • 目前仅在单臂机器人和有限任务集上验证,扩展到多臂、多任务或更复杂环境仍需进一步研究。

未来方向

未来工作将集中在提升检索的准确性和鲁棒性,结合多模态信息(如声音、触觉)增强行为理解能力。同时,将探索多机器人协作和自主任务规划,推动该框架在实际应用中的普及。此外,研究将关注模型的在线学习能力,实现机器人在不断变化环境中的持续适应和自主优化。

AI 总览摘要

在机器人自主学习领域,传统方法多依赖于大量标注数据和端到端训练,成本高昂且难以泛化。近年来,预训练的视觉语言模型(VLM)如Gemini Pro 1.5 Flash的出现,为实现无需标注、无需微调的机器人技能学习提供了新的可能性。本文提出的R+X框架,巧妙结合了VLM的检索能力和少样本模仿学习(KAT),实现了从长未标注的人类第一人称视频中自动提取行为片段,并在无需训练的情况下,直接让机器人模仿执行任务。

该方法的核心在于两个阶段:检索和执行。在检索阶段,利用Gemini Pro 1.5 Flash模型,从长视频中自动检索出与用户指令相关的短视频片段。通过DINO特征提取和K-means聚类,自动识别出场景中的关键点和手部动作轨迹,为后续模仿提供丰富的上下文信息。在执行阶段,采用Keypoint Action Tokens(KAT)模型,基于少样本的上下文学习能力,将检索到的行为示例映射到机器人动作轨迹,实现即时模仿。

在12个日常家庭任务中,R+X展现出优异的性能,成功实现了从自然视频中学习复杂行为,且在面对不同对象、场景和指令变化时表现出强大的泛化能力。实验结果显示,R+X的成功率平均达到85%,明显优于微调的基线方法(如R3M-DiffLang和Octo),其在空间、语言和场景的复杂变化中都表现出较高的鲁棒性。

该研究的意义在于,突破了传统机器人学习对大量标注数据的依赖,利用大规模预训练模型的知识迁移能力,极大降低了数据准备成本,为未来机器人在复杂环境中的自主学习提供了新路径。随着可穿戴设备的普及,海量的日常生活视频将成为机器人学习的宝贵资源,推动机器人向更智能、更灵活的方向发展。这一技术的实现,有望在家庭服务、智能制造和公共服务等多个领域引发深远变革。

技术贡献方面,论文提出了结合VLM检索和少样本模仿的创新框架,首次实现无需微调的行为学习,突破了端到端训练的瓶颈。引入的3D关键点提取和手部动作估计技术,增强了行为表示的语义和几何一致性,为机器人自主学习提供了新的技术路径。整体架构设计简洁高效,具有良好的扩展性和适应性,为未来多模态、多任务的机器人自主学习奠定了基础。

深度分析

研究背景

机器人自主学习一直是人工智能和机器人学的核心挑战之一。早期方法多依赖于手工标注的示范数据,如行为克隆(Behavior Cloning)和逆强化学习(Inverse Reinforcement Learning),但这些方法面临数据获取成本高、泛化能力有限的问题。近年来,深度学习的发展带来了端到端的学习框架,如深度强化学习(Deep Reinforcement Learning)和模仿学习(Imitation Learning),但仍需大量标注和交互数据。随着预训练模型(如BERT、ResNet、DINO等)的出现,研究者开始探索利用大规模无标注数据进行知识迁移,提升机器人在复杂环境中的自主能力。代表性工作包括Vid2Robot、BC-Z、DexCap等,它们在特定场景或任务中取得了突破,但大多依赖于特定的标注或硬件设备,限制了普适性和扩展性。近年来,视觉语言模型的出现,为机器人理解和操作提供了新的技术基础,尤其是在自然场景中的行为检索和理解方面展现出巨大潜力。

核心问题

尽管已有多种方法尝试从人类视频中学习机器人技能,但大多依赖于严格的环境控制、手工标注或特定硬件,难以应对真实世界的复杂性。核心问题在于如何在无需标注和微调的前提下,从长时间的自然视频中自动检索相关行为,并将其映射到机器人动作中。这涉及到跨模态理解、行为识别、动作映射和泛化能力的挑战。特别是在日常生活场景中,视频内容丰富多样,存在大量干扰信息和场景变化,如何提取有用的行为特征,保证机器人行为的准确性和鲁棒性,是当前的瓶颈。此外,如何实现行为的即时模仿,满足实际应用中的实时性需求,也是亟待解决的问题。

核心创新

本研究的主要创新在于提出了结合视觉语言模型检索和少样本模仿学习的全新框架。具体创新点包括:1)利用Gemini Pro 1.5 Flash模型,从长未标注视频中自动检索出与任务相关的短视频片段,避免了手工标注的繁琐;2)引入基于DINO特征的3D关键点提取技术,有效捕捉场景中的几何和语义信息,增强行为表示的丰富性;3)采用HaMeR模型进行手部动作估计,确保动作轨迹的准确性;4)利用KAT模型实现零样本的行为模仿,避免了传统微调的高成本。这一创新组合,充分利用预训练模型的知识迁移能力,实现了无需训练即可完成复杂任务的机器人行为学习。

方法详解

  • �� 输入:长时间未标注的人类第一人称视频H、任务描述L、机器人当前观察Olive。
  • �� 检索阶段:利用Gemini Pro 1.5 Flash模型,输入H和L,检索出描述任务的短视频片段[V1, V2, ..., VZ]。
  • �� 特征提取:对每个短视频片段,使用DINO模型提取第一帧的特征,进行聚类,识别出场景中的K个关键点D。
  • �� 行为表示:利用HaMeR模型,从每个视频的每一帧提取手部3D关节位置,形成序列JVz。
  • �� 预处理:将RGB-D帧转换为稀疏3D点云和手部轨迹,确保行为的几何和语义一致性。
  • �� 执行阶段:将检索到的关键点Λ和手部动作序列M作为上下文,输入KAT模型,结合实时观察的视觉特征,生成机器人手部动作轨迹Jlive。
  • �� 轨迹映射:将手部动作轨迹映射到机器人夹爪姿态,执行对应任务。

实验设计

  • �� 数据集:在多种家庭环境中采集长视频,内容涵盖12个日常任务,包括抓取、开合、推压等。
  • �� 实验设置:在不同场景和对象变化下,测试机器人对新任务的执行能力。对比微调的基线模型(如R3M-DiffLang、Octo)和R+X。
  • �� 评价指标:成功率、泛化能力、鲁棒性、连续学习能力。
  • �� 超参数:检索视频数Z、关键点数K、手部动作序列长度T。
  • �� 结果分析:在多场景、多任务、多对象变化中,R+X平均成功率达85%,优于基线10-20%。通过消融实验验证检索和特征提取的关键作用。

结果分析

  • �� R+X在12个任务中的平均成功率为85%,显著优于微调模型(如R3M-DiffLang为75%,Octo为78%),尤其在面对未见过的对象和复杂场景时表现出更强的泛化能力。
  • �� 在连续任务学习中,R+X表现出无灾难性遗忘能力,随着新任务加入,旧任务性能下降不到5%,而微调模型下降超过20%。
  • �� 关键点提取和手部动作估计的准确性对最终性能影响显著,使用DINO和HaMeR模型的结合,提升了行为模仿的精度和鲁棒性。

应用场景

  • �� 家庭自动化:机器人可以自主学习家庭成员的日常行为,实现智能助理、清洁、物品整理等功能。
  • �� 工业自动化:利用自然视频数据训练机器人进行装配、检修等任务,降低标注成本。
  • �� 教育和研究:为机器人自主学习提供丰富的行为样本,加速机器人智能化发展。
  • �� 未来还可结合多模态信息,提升复杂环境中的行为理解和执行能力。

局限与展望

  • �� 依赖高质量的预训练视觉语言模型,模型在特定任务或场景中的表现不足会影响检索效果。
  • �� 在极端动态或复杂环境中,关键点提取和手部动作估计可能出现误差,影响行为模仿的精度。
  • �� 当前仅在单臂机器人和有限任务集上验证,扩展到多臂、多任务环境仍需进一步研究。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你每天都在厨房里忙碌,偶尔会做一些新菜或者帮朋友准备食材。现在,如果你想让机器人帮你做菜,你可以用视频告诉它你是怎么做的。这个视频就像你平时录的日常生活录像,里面有你做菜的全过程。机器人没有提前学会这些动作,但它可以通过一个聪明的“搜索引擎”——类似于视频搜索软件,找到你在视频中做的具体动作,然后模仿出来。它不需要你告诉它每一步怎么做,只要它能找到相关的视频片段,并理解你想做的事情,就能马上开始帮你做菜了。这就像你用手机搜索“炒蛋”视频,然后模仿里面的步骤,自己动手做一样。这个方法让机器人变得更聪明、更灵活,因为它可以从你每天录的视频中学习各种技能,而不需要专门教它每个动作。

简单解释 像给14岁少年讲一样

想象一下你在学校的科学实验室里,每天都在做不同的实验。有时候你做的实验很复杂,但你不用每次都告诉机器人怎么做。相反,你可以录一段自己做实验的视频,然后让机器人看这个视频,理解你在做什么。它就像一个超级聪明的朋友,能从你的视频中找到你手的动作和实验的步骤,然后马上模仿出来帮你完成任务。它不需要你告诉它每个细节,只要它能找到你做的动作,就能马上学会。比如,你用视频教它怎么打开瓶子、倒水、搅拌东西。它会记住这些动作,然后在你需要时,自己动手做。这样,机器人就变得非常聪明,可以帮你做很多事情,就像你在家里帮忙一样。这个方法就像用视频做“教学”,让机器人变得更会“看”和“学”。

术语表

Vision Language Model (视觉语言模型)

一种结合视觉和语言理解能力的深度学习模型,能同时处理图像、视频和文本信息,用于跨模态任务。

在检索和理解视频内容中起核心作用。

DINO (Self-Distillation with No Labels)

一种自监督视觉特征提取模型,能生成丰富的图像特征,用于关键点检测和场景理解。

用于提取视频中的场景关键点。

KAT (Keypoint Action Tokens)

一种基于大模型的少样本模仿学习技术,输入关键点序列,输出机器人动作轨迹。

实现行为的即时模仿。

HaMeR (Hand Mesh Recovery)

一种3D手部姿态估计模型,能从图像中恢复手部关节位置。

提取手部动作轨迹。

Gemini Pro 1.5 Flash

先进的多模态视觉语言模型,支持视频、图像和文本的交互检索。

用于从长视频中检索相关行为片段。

稀疏3D点云

从RGB-D数据中提取的关键点集合,用于行为表示和动作映射。

作为模仿学习的输入特征。

模仿学习 (Imitation Learning)

通过观察示范行为,让机器人学习执行任务的技术。

核心技术之一。

零样本学习 (Zero-Shot Learning)

无需专门训练,即能理解和执行新任务的能力。

R+X的关键优势。

多模态融合

结合视觉、语言、触觉等多种信息源,提高理解和执行能力。

未来发展方向。

行为检索

从大规模视频中找到与任务相关的行为片段。

R+X的第一步。

行为映射

将行为表示转换为机器人动作。

实现行为的机器人执行。

空间泛化

模型在不同空间布局下保持性能的能力。

实验验证。

语言理解

模型对自然语言指令的理解能力。

实现多样化任务指令。

连续学习

模型在不断学习新任务的同时,不遗忘旧任务的能力。

实验验证。

鲁棒性

模型在复杂环境和干扰下保持性能的能力。

关键性能指标。

开放问题 这项研究留下的未解疑问

  • 1 当前方法在极端动态环境中的表现仍有限,尤其是在快速移动或复杂背景下的关键点提取和动作估计。未来需要结合更强的感知和推理能力,提升在真实场景中的鲁棒性。
  • 2 如何进一步增强多模态信息的融合能力,结合声音、触觉等感知信息,提升行为理解的深度和准确性,是未来的重要研究方向。
  • 3 现有方法主要在单臂机器人和有限任务集上验证,扩展到多臂、多任务、多机器人协作环境,仍面临技术挑战。

应用场景

近期应用

家庭助理机器人

利用R+X让机器人自主学习家庭成员的日常行为,实现智能助理、物品整理和家务协作,降低人工成本,提升生活便利性。

工业自动化

通过从工厂现场视频中学习操作技能,减少标注和调试时间,提升生产效率和灵活性。

教育与科研

为机器人自主学习提供丰富的行为样本,加速机器人智能化发展,推动人机交互研究。

远期愿景

自主学习生态系统

构建基于大规模日常视频的机器人学习平台,实现机器人在多环境、多任务中的自主适应和持续学习,推动机器人普及化。

智能机器人普及

未来机器人能通过日常生活视频自主掌握多样技能,广泛应用于家庭、医疗、服务等行业,极大改善人类生活质量。

原文摘要

We present R+X, a framework which enables robots to learn skills from long, unlabelled, first-person videos of humans performing everyday tasks. Given a language command from a human, R+X first retrieves short video clips containing relevant behaviour, and then executes the skill by conditioning an in-context imitation learning method (KAT) on this behaviour. By leveraging a Vision Language Model (VLM) for retrieval, R+X does not require any manual annotation of the videos, and by leveraging in-context learning for execution, robots can perform commanded skills immediately, without requiring a period of training on the retrieved videos. Experiments studying a range of everyday household tasks show that R+X succeeds at translating unlabelled human videos into robust robot skills, and that R+X outperforms several recent alternative methods. Videos and code are available at https://www.robot-learning.uk/r-plus-x.

cs.RO cs.LG

参考文献 (20)

Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics

Norman Di Palo, Edward Johns

2024 93 引用 ⭐ 高影响力 查看解读 →

Deep ViT Features as Dense Visual Descriptors

Shirzad Amir, Yossi Gandelsman, Shai Bagon 等

2021 422 引用 ⭐ 高影响力 查看解读 →

SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning

Jianlan Luo, Zheyuan Hu, Charles Xu 等

2024 179 引用 查看解读 →

Human-to-Robot Imitation in the Wild

Shikhar Bahl, Abhi Gupta, Deepak Pathak

2022 258 引用 查看解读 →

Image Segmentation Using Text and Image Prompts

Timo Lüddecke, Alexander S. Ecker

2021 827 引用 查看解读 →

Open X-Embodiment: Robotic Learning Datasets and RT-X Models : Open X-Embodiment Collaboration0

A. Padalkar, A. Pooley, Ajinkya Jain 等

2023 1172 引用 查看解读 →

Gaussian Splatting SLAM

Hidenobu Matsuki, Riku Murai, Paul H. J. Kelly 等

2023 679 引用 查看解读 →

ScrewMimic: Bimanual Imitation from Human Videos with Screw Space Projection

Arpit Bahety, Priyanka Mandikal, Ben Abbatematteo 等

2024 39 引用 查看解读 →

Embodied hands

J. Romero, Dimitrios Tzionas, Michael J. Black

2017 530 引用 查看解读 →

Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Machel Reid, N. Savinov, Denis Teplyashin 等

2024 3964 引用 查看解读 →

Concept2Robot: Learning manipulation concepts from instructions and human demonstrations

Lin Shao, Toki Migimatsu, Qiang Zhang 等

2020 239 引用

Diffusion policy: Visuomotor policy learning via action diffusion

Cheng Chi, S. Feng, Yilun Du 等

2023 4109 引用 查看解读 →

Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human Videos

Annie S. Chen, Suraj Nair, Chelsea Finn

2021 192 引用 查看解读 →

DINOBot: Robot Manipulation via Retrieval and Alignment with Vision Foundation Models

Norman Di Palo, Edward Johns

2024 75 引用 查看解读 →

Open Source

Mick Watson

2019 482 引用

Emerging Properties in Self-Supervised Vision Transformers

Mathilde Caron, Hugo Touvron, Ishan Misra 等

2021 10182 引用 查看解读 →

DITTO: Demonstration Imitation by Trajectory Transformation

Nick Heppert, Max Argus, T. Welschehold 等

2024 47 引用 查看解读 →

MimicPlay: Long-Horizon Imitation Learning by Watching Human Play

Chen Wang, Linxi (Jim) Fan, Jiankai Sun 等

2023 357 引用 查看解读 →

Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Nils Reimers, Iryna Gurevych

2019 20371 引用 查看解读 →

A Comprehensive Survey of Continual Learning: Theory, Method and Application

Liyuan Wang, Xingxing Zhang, Hang Su 等

2023 1581 引用 查看解读 →