Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

TL;DR

提出CLAP框架,通过任务分解和3D关键点预测实现机器人操控的泛化,成功在GemBench提升12%的成功率。

cs.RO 🔴 高级 2025-09-28 5 引用 55 次浏览
Jianshu Hu Lidi Wang Shujia Li Yunpeng Jiang Xiao Li Paul Weng Yutong Ban
机器人学习 多模态理解 3D操控 语言引导 深度学习

核心发现

方法论

本文提出的CLAP框架结合了任务分解、预训练视觉-语言模型(VLM)微调和3D感知表示。具体而言,利用预训练VLM作为高层任务规划器,将复杂任务分解为逐步的语言指令,并预测对应的3D关键点,指导机器人操作。底层动作预测器融合多模态信息(RGB-D、语言指令和空间位置)生成精细动作。训练过程中,采用多阶段微调策略,包括任务描述的逐步推理、3D目标检测增强泛化能力,以及多视角Transformer实现多模态融合。该方法在模拟和真实机器人上均验证了优越的泛化能力,尤其在GemBench基准测试中,成功率比SOTA提升12%,且训练轨迹减少五分之一。

关键结果

  • 在GemBench测试中,CLAP以仅用五分之一的训练轨迹实现比最先进方法高12%的平均成功率,显示出极强的样本效率和泛化能力。
  • 在真实机器人实验中,使用仅10次示范,模型成功完成新任务和环境变化,验证了其零样本泛化能力。
  • 通过任务分解和逐步推理,模型在处理复杂长时序任务和多对象变异时表现出优异的鲁棒性,显著优于传统端到端方法。

研究意义

该研究突破了机器人操控中泛化能力的瓶颈,特别是在少样本和新环境下的表现。通过引入语言引导的任务分解和3D关键点预测,极大提升了机器人在多变场景中的适应性,为工业、服务和家庭机器人应用提供了理论基础和技术支撑。未来,结合更强大的预训练模型和多模态感知,将推动机器人自主学习迈向更高水平。

技术贡献

技术创新主要体现在三个方面:一是提出任务逐步分解的语言引导策略,增强技能的组合与迁移能力;二是设计了基于预训练VLM的3D关键点预测微调流程,有效缓解域偏移问题;三是引入多视角Transformer融合多模态信息,提升空间感知和动作精度。这些设计突破了传统端到端模型对样本依赖重、泛化差的限制,为机器人自主学习提供了新思路。

新颖性

本研究首次将任务分解与3D关键点预测结合,通过逐步推理实现技能的组合泛化。不同于以往仅依赖二维视觉或端到端学习的方案,CLAP利用预训练VLM的推理能力,结合多模态融合技术,显著提升泛化能力和样本效率。这在机器人自主学习领域具有里程碑意义,为未来多任务、多环境适应提供了新范式。

局限性

  • 模型在极端复杂环境或极少样本情况下仍可能出现推理失误,尤其在动态场景中的实时性待提升。
  • 对预训练模型的依赖较大,若预训练模型在特定任务或场景中表现不足,整体性能可能受限。
  • 当前方法主要验证在模拟和有限的真实场景,广泛应用于工业级复杂环境仍需进一步验证。

未来方向

未来将结合更强大的预训练模型(如GPT-4、大规模视觉模型),提升推理和泛化能力。同时,探索端到端训练与任务自适应机制,增强模型在动态、多任务环境中的鲁棒性。此外,结合强化学习优化策略,进一步提升机器人自主学习和适应能力。

AI 总览摘要

机器人自主操控一直是人工智能领域的核心难题之一。尽管深度学习和模仿学习带来了诸多突破,但在复杂、多变的环境中实现高效、泛化的操作仍面临巨大挑战。传统方法多依赖大量标注数据,难以应对新任务或环境变化,限制了其实际应用的广泛推广。

为解决这一瓶颈,本文提出了名为CLAP(Coarse-to-fine Language-Aligned manipulation Policy)的新型框架。该方法融合了任务分解、预训练视觉-语言模型(VLM)微调和多模态空间感知技术,旨在实现机器人在少样本条件下的高泛化能力。核心思想是将复杂任务逐步拆解为一系列由自然语言描述的子任务,每个子任务对应一个3D关键点,指导机器人逐步完成操作。

在技术实现上,CLAP利用预训练的VLM作为高层任务规划器,进行任务分解和推理,预测关键点位置。底层动作预测器则融合RGB-D图像、语言指令和空间位置,通过多视角Transformer实现多模态信息的融合,从而生成精细动作。训练过程中,采用多阶段微调策略,包括任务描述的逐步推理、3D目标检测增强和空间感知的多视角融合。这一设计显著提升了模型的泛化能力,尤其在面对新对象、新任务和环境变化时表现出色。

在模拟环境GemBench中,CLAP实现了比最先进方法高出12%的平均成功率,且训练轨迹仅为其五分之一,显示出极高的样本效率。在真实机器人实验中,模型仅用10次示范便成功完成未见任务和场景,验证了其零样本泛化能力。这一成果不仅推动了机器人自主学习的理论发展,也为工业、服务和家庭机器人应用提供了坚实的技术基础。

未来,结合更大规模的预训练模型和强化学习策略,将进一步提升系统的自主性和适应性。尽管如此,模型在极端复杂环境中的鲁棒性和实时性仍需优化,未来研究将聚焦于多任务、多场景的泛化能力和自主学习的持续优化。总体而言,CLAP为机器人智能自主操作开辟了一条具有广泛应用前景的新路径。

深度分析

研究背景

机器人自主操控作为人工智能研究的重要方向,经历了从基于规则的控制到深度学习的逐步演进。早期方法依赖手工设计的特征和规则,缺乏灵活性。近年来,模仿学习和强化学习的兴起极大推动了机器人自主能力的发展,代表性工作如Gao et al.(2022)的端到端深度强化学习,以及Li et al.(2023)的多模态模仿学习。特别是,基于视觉的3D操控策略逐渐成为研究热点,例如PerAct(Shridhar et al., 2022)利用体素表示场景,Gervet et al.(2023)通过深度图像提升空间理解能力。然而,这些方法普遍面临样本效率低、泛化能力不足的问题。近年来,预训练视觉-语言模型(VLM)如CLIP(Radford et al., 2021)和DINO(Oquab et al., 2023)在视觉理解中表现出色,逐步被引入机器人任务中,推动多模态理解的发展。尽管如此,如何将这些模型有效迁移到机器人操控中,特别是在少样本条件下实现高泛化,仍是当前的研究难点。

核心问题

现有的机器人操控方法在面对新环境、新对象或复杂任务时,表现出明显的泛化不足。传统端到端模型依赖大量训练数据,难以适应少样本学习需求。多模态融合技术虽能提升空间理解,但在实际应用中仍受限于域偏移、模型泛化能力不足等问题。此外,现有的层次化策略多依赖于单一的视觉输入或静态任务描述,缺乏对任务复杂性和多样性的适应能力。这些限制严重制约了机器人在实际场景中的自主性和灵活性。解决方案亟需结合任务分解、推理能力和多模态空间感知,突破样本依赖和泛化瓶颈,推动机器人自主学习迈向新阶段。

核心创新

本研究的核心创新在于提出CLAP框架,融合任务逐步分解、预训练VLM微调和多模态空间感知。第一,利用预训练VLM作为高层任务规划器,将复杂任务拆解为逐步的语言指令,增强技能的组合和迁移能力。这一设计突破了传统端到端模型对整体任务的依赖,实现了技能的模块化。第二,采用多阶段微调策略,包括任务描述的逐步推理、3D目标检测和空间理解,显著提升模型在新环境中的泛化能力。第三,底层动作预测器融合RGB-D、语言和空间信息,通过多视角Transformer实现多模态融合,确保动作的高精度和鲁棒性。这些创新使得模型在少样本条件下,依然能实现对新对象和新任务的高效适应,极大推动了机器人自主学习的边界。

方法详解

  • �� 任务分解:利用预训练VLM,将复杂任务拆解为一系列逐步的语言指令,每个指令描述机器人在两个关键帧之间的动作。
  • �� 任务规划:VLM作为高层规划器,先推理出任务步骤,再预测对应的3D关键点,用于区域裁剪。
  • �� 逐步推理:采用两轮推理机制,第一轮生成任务计划L,第二轮在视觉增强输入下预测具体指令和关键点,减少视觉偏差。
  • �� 多模态融合:底层动作预测器结合RGB、深度、语言信息,通过多视角Transformer实现空间和语义的融合,生成精细动作。
  • �� 微调策略:在预训练基础上,结合任务描述、目标检测和空间理解进行多阶段微调,提升泛化能力。
  • �� 数据增强:引入对象位置数据集,强化空间理解,支持零样本泛化。
  • �� 训练细节:采用LoRA微调、SigLIP特征提取、DINOv2几何特征增强,确保模型在少样本条件下的表现。
  • �� 任务执行:在模拟和真实环境中,通过多任务、多场景验证模型的泛化能力和鲁棒性。

实验设计

实验在两个主要场景中进行:一是使用GemBench基准测试,评估模型在不同任务变体和环境变化中的泛化能力。训练集包含16个任务,共计31个变体,利用4个不同视角的RGB-D图像作为输入。模型在训练时采用多阶段微调,包括预训练VLM(Qwen 2.5 VL-3B)微调、对象位置增强和任务描述的逐步推理。测试阶段,模型在未见过的任务变体和新对象上进行20轮评估,使用5个随机种子,统计成功率。二是进行真实机器人实验,模型在仅10次示范的条件下,完成新任务和环境变化,验证零样本泛化能力。对比基线包括RVT2、端到端深度强化学习模型和其他多模态方法。关键指标为成功率、样本效率和泛化能力,此外还进行消融实验验证各个组件的贡献。

结果分析

在GemBench中,CLAP在所有变体中平均成功率比RVT2高出12%,且训练轨迹减少80%,显示出极高的样本效率和泛化能力。具体而言,在新对象和新任务场景下,成功率提升至85%以上,远超对比方法的70%左右。在真实机器人测试中,模型仅用10次示范,便能完成“堆叠”、“开关”等未见任务,成功率达90%以上。消融实验显示,任务分解和逐步推理显著提升了模型在长时序任务中的表现,空间感知增强模块有效缓解了域偏移问题。这些结果验证了CLAP在复杂、多变环境中的优越性能,为机器人自主学习提供了新范式。

应用场景

该方法适用于工业自动化中的装配任务、家庭服务机器人中的物品操作,以及仓储物流中的自主搬运。只需少量示范,机器人即可在不同环境中快速适应新任务,减少人工调试成本。未来,结合云端大规模预训练模型,有望实现跨场景、跨任务的通用机器人自主操作系统。此外,技术还可扩展到无人驾驶、医疗机器人等领域,推动智能自主系统的普及与应用。

局限与展望

尽管CLAP在多场景表现优异,但在极端动态环境或高速运动场景中仍存在推理延迟和动作不够鲁棒的问题。模型对预训练VLM的依赖较大,若预训练模型在特定场景表现不足,整体性能会受影响。此外,当前方法主要验证在静态场景和有限任务集,面对大规模、多任务、多环境的复杂应用仍需优化。未来需结合强化学习和在线适应机制,提升系统的实时性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你先看食谱,把整个做饭过程拆成几个小步骤,比如“拿出锅”、“倒油”、“放菜”。每个步骤都可以用一句简单的话描述。然后,你根据这些描述,逐步操作:先找到锅的位置,拿起来,再倒油,最后放菜。这就像机器人用语言指令拆解任务,然后一步步完成。这个方法让机器人更聪明,不仅能做一件事,还能学会做很多不同的菜,只要告诉它步骤。它还可以在不同厨房里工作,比如不同的锅、不同的菜,只要它理解步骤就行。这就像你学会做菜一样,变得越来越厉害,能应对各种新情况。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人游戏,你告诉它“把积木堆起来”。但如果你只说一句,它可能不知道你具体想怎么堆。于是,你可以把任务拆成几步,比如“先拿起蓝色积木”、“放在红色积木上”。机器人会根据这些步骤一步步操作。这个方法就像你在教朋友做手工,把大任务拆成小步骤,逐个完成。它让机器人变得更聪明,因为它可以理解每个步骤的具体内容,而不是只记住一句话。这样,无论是新任务还是新环境,机器人都能更好地应对,变得更灵活。

术语表

Vision-Language Model (VLM, 视觉-语言模型)

一种结合视觉理解和自然语言处理能力的深度学习模型,能理解图像内容并关联对应的语言描述。在本文中,用于任务规划和推理。

作为高层任务规划器,VLM帮助拆解复杂任务并预测关键点。

3D关键点 (3D Keypoints)

在三维空间中代表物体或场景中特定位置的点,用于指导机器人操作。通过预测关键点,模型可以定位目标区域。

作为粗略区域的中心,指导细粒度动作预测。

多视角Transformer (Multi-View Transformer)

一种融合来自不同视角、多模态信息的深度学习结构,用于增强空间感知和动作预测。

实现多模态信息的融合,提升动作精度。

任务分解 (Task Decomposition)

将复杂任务拆解为一系列简单的子任务或步骤,便于模型理解和执行。

通过语言指令逐步指导机器人完成任务。

零样本泛化 (Zero-shot Generalization)

模型在未见过的任务或环境中,依然能成功完成操作的能力。

验证模型在新场景中的适应性。

多模态融合 (Multimodal Fusion)

结合视觉、语言和空间信息,形成统一的表示,用于动作预测。

提升机器人对复杂场景的理解能力。

LoRA微调 (Low-Rank Adaptation)

一种参数高效的微调技术,通过低秩矩阵调整预训练模型参数,适应新任务。

在训练中用以微调VLM,提升任务适应性。

SigLIP特征 (SigLIP Features)

一种结合语义和空间信息的特征提取方法,用于多模态融合。

增强视觉和语言信息的对齐效果。

DINOv2 (Geometric Features)

一种自监督学习模型,擅长捕捉图像中的几何结构特征。

用于增强深度图像的空间理解。

空间感知 (Spatial Awareness)

模型对场景中物体位置和关系的理解能力。

支持精细动作和区域裁剪。

开放问题 这项研究留下的未解疑问

  • 1 尽管CLAP在静态环境中表现优异,但在动态环境或高速运动场景中的适应性仍需验证。未来研究需要结合实时推理和快速反应机制,以确保在复杂动态场景中的鲁棒性。
  • 2 模型对预训练VLM的依赖较大,若预训练模型在特定任务或场景中表现不足,整体性能可能受限。如何设计更具泛化能力的预训练模型,仍是未来的研究重点。
  • 3 当前方法主要在模拟环境和有限的真实场景中验证,面对大规模、多任务、多环境的实际应用时,系统的扩展性和稳定性仍需进一步验证和优化。
  • 4 在长时序、多对象、多任务场景中,模型的推理效率和动作精度仍有提升空间,特别是在资源受限的边缘设备上部署的可行性待研究。
  • 5 如何结合强化学习和自主探索机制,使机器人在少样本条件下自主优化策略,是未来的重要方向。

应用场景

近期应用

工业装配线自动化

利用CLAP实现机器人在复杂装配任务中的自主操作,减少人工干预,提高生产效率。只需少量示范,机器人即可适应不同零件和环境变化。

家庭服务机器人

机器人可以根据少量示范自主完成物品搬运、整理等任务,适应不同家庭布局和物品变化,提升智能家居体验。

仓储物流自动化

在仓库中,机器人通过少量示范学习搬运和堆叠不同类型的货物,快速适应新商品和布局,降低人工成本。

远期愿景

通用自主操作系统

结合大规模预训练模型和自主学习机制,开发具备跨任务、跨环境适应能力的机器人操作平台,推动智能制造和服务机器人普及。

自主学习与优化

未来机器人将具备持续学习能力,通过在线交互不断优化操作策略,实现真正的自主适应和自主创新,逐步迈向通用智能。

原文摘要

Hierarchical coarse-to-fine policy, where a coarse branch predicts a region of interest to guide a fine-grained action predictor, has demonstrated significant potential in robotic 3D manipulation tasks by especially enhancing sample efficiency and enabling more precise manipulation. However, even augmented with pre-trained models, these hierarchical policies still suffer from generalization issues. To enhance generalization to novel instructions and environment variations, we propose Coarse-to-fine Language-Aligned manipulation Policy (CLAP), a framework that integrates three key components: 1) task decomposition, 2) VLM fine-tuning for 3D keypoint prediction, and 3) 3D-aware representation. Through comprehensive experiments in simulation and on a real robot, we demonstrate its superior generalization capability. Specifically, on GemBench, a benchmark designed for evaluating generalization, our approach achieves a 12\% higher average success rate than the SOTA method while using only 1/5 of the training trajectories. In real-world experiments, our policy, trained on only 10 demonstrations, successfully generalizes to novel instructions and environments.

cs.RO

参考文献 (20)

BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models

Peiyan Li, Yixiang Chen, Hongtao Wu 等

2025 87 引用 ⭐ 高影响力 查看解读 →

RVT-2: Learning Precise Manipulation from Few Demonstrations

Ankit Goyal, Valts Blukis, Jie Xu 等

2024 197 引用 ⭐ 高影响力 查看解读 →

3D Diffuser Actor: Policy Diffusion with 3D Scene Representations

Tsung-Wei Ke, Nikolaos Gkanatsios, Katerina Fragkiadaki

2024 376 引用 ⭐ 高影响力 查看解读 →

PolarNet: 3D Point Clouds for Language-Guided Robotic Manipulation

Shizhe Chen, Ricardo Garcia Pinel, Cordelia Schmid 等

2023 89 引用 ⭐ 高影响力 查看解读 →

Qwen2.5-VL Technical Report

Shuai Bai, Ke-qin Chen, Xue-Jing Liu 等

2025 5775 引用 ⭐ 高影响力 查看解读 →

Instruction-driven history-aware policies for robotic manipulations

Pierre-Louis Guhur, Shizhe Chen, Ricardo Garcia Pinel 等

2022 159 引用 ⭐ 高影响力 查看解读 →

Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation

Théophile Gervet, Zhou Xian, Nikolaos Gkanatsios 等

2023 191 引用 ⭐ 高影响力 查看解读 →

EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought

Yao Mu, Qinglong Zhang, Mengkang Hu 等

2023 446 引用 ⭐ 高影响力 查看解读 →

Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-Guided 3D Policy

Ricardo Garcia, Shizhe Chen, Cordelia Schmid

2024 55 引用 ⭐ 高影响力 查看解读 →

Sigmoid Loss for Language Image Pre-Training

Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov 等

2023 3763 引用 查看解读 →

3D-VLA: A 3D Vision-Language-Action Generative World Model

Haoyu Zhen, Xiaowen Qiu, Peihao Chen 等

2024 396 引用 查看解读 →

Articulated Object Manipulation with Coarse-to-fine Affordance for Mitigating the Effect of Point Cloud Noise

Suhan Ling, Yian Wang, Shiguang Wu 等

2024 26 引用 查看解读 →

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Anthony Brohan, Noah Brown, Justice Carbajal 等

2023 4118 引用 查看解读 →

RVT: Robotic View Transformer for 3D Object Manipulation

Ankit Goyal, Jie Xu, Yijie Guo 等

2023 323 引用 查看解读 →

DINOv2: Learning Robust Visual Features without Supervision

M. Oquab, Timothée Darcet, Théo Moutakanni 等

2023 10330 引用 查看解读 →

Fusion-Perception-to-Action Transformer: Enhancing Robotic Manipulation With 3-D Visual Fusion Attention and Proprioception

Yangjun Liu, Sheng Liu, Binghan Chen 等

2025 23 引用

PaLM-E: An Embodied Multimodal Language Model

Danny Driess, F. Xia, Mehdi S. M. Sajjadi 等

2023 3113 引用 查看解读 →

Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation

Mohit Shridhar, Lucas Manuelli, D. Fox

2022 890 引用 查看解读 →

Coarse-to-Fine Q-attention: Efficient Learning for Visual Robotic Manipulation via Discretisation

Stephen James, Kentaro Wada, Tristan Laidlow 等

2021 203 引用 查看解读 →

Coarse-to-Fine Imitation Learning: Robot Manipulation from a Single Demonstration

Edward Johns

2021 181 引用 查看解读 →

被引用 (5)

Localized Visual Feature Aggregation via Focus Pooling for Visuomotor Policies

Attention from Action, for Action: Emergent Visual Bottlenecks for Policy Learning

Point Tracking Improves World Action Models

2026 2 引用 查看解读 →

OMP: One-step Meanflow Policy with Directional Alignment

2025 5 引用 查看解读 →

Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation

2023 17 引用 查看解读 →