Grasp-MPC: Closed-Loop Visual Grasping via Value-Guided Model Predictive Control

TL;DR

Grasp-MPC用价值函数引导MPPI闭环抓取,仿真成功率最高74.9%,真实场景总体74.4%。

cs.RO 🔴 高级 2025-09-08 24 次浏览
Jun Yamada Adithyavairavan Murali Ajay Mandlekar Clemens Eppner Ingmar Posner Balakumar Sundaralingam
机器人抓取 模型预测控制 视觉闭环 点云学习 离线强化学习

核心发现

方法论

Grasp-MPC将M2T2抓取预测、CuRobo运动规划与MPPI模型预测路径积分控制结合。作者用8515个Objaverse物体生成2105296条轨迹、约1.15亿状态,以成功/失败稀疏标签训练PointNet++-MLP价值函数;在线目标为最小化CuRobo碰撞、平滑性成本与价值成本之和。

关键结果

  • 在FetchBench的5400个测试案例中,使用标注抓取位姿时成功率为74.9%,接近开放环OSC的79.0%,明显高于IQL的64.4%及其他闭环基线。
  • 对抓取位姿加入±2 cm、±18°扰动后,Grasp-MPC成功率为60.3%,仅下降14%;使用M2T2预测位姿时达到67.2%,高于OSC的63.6%和模仿学习方法的36.5%。
  • 真实实验中,空桌、杂乱桌面和杂乱货架成功率分别为86.7%、67.7%和70.0%,总体74.4%,均高于CuRobo-GraspAPI的50.0%、43.3%、30.0%和41.1%。

研究意义

该研究把大规模视觉数据学习的泛化能力与MPC的实时反馈、安全约束结合起来,回应了新物体、遮挡、碰撞和抓取目标漂移长期难以同时解决的问题。它表明价值函数不必直接输出动作,也可作为在线规划器的任务成本,从而减少离线策略提取造成的误差。对工业拣选、仓储机器人和家庭服务机器人而言,这种设计尤其适合传感器噪声和环境变化明显的场景。

技术贡献

核心技术是从点云和末端执行器相对位姿估计成功代价,并将其嵌入MPPI-MPC。训练目标采用Bellman误差:yt=ct+γVϕ′(xt+1),损失为(yt−Vϕ(xt))²,γ=0.99;在线代价为CGrasp-MPC=CCuRobo+1000Cgrasp。数据同时包含成功与失败轨迹,输入含完整和随机视角部分点云,并以噪声增强提升真实部署鲁棒性。

新颖性

相较依赖几何距离的抓取MPC、少量示范的CV-MPC及仅在简化桌面运行的闭环策略,Grasp-MPC首次在本文设定中以超过200万条、覆盖8515个Objaverse物体的视觉轨迹学习任务价值,并直接让MPC探索状态空间。其创新不是替代抓取预测器,而是把不可靠预测转化为可反馈修正的软目标。

局限性

  • 训练轨迹只覆盖距抓取位姿15 cm的运动,真实移动物体实验成功率为60%,长距离接近和大幅动态变化仍未充分学习。
  • 数据轨迹主要由CuRobo生成且未逐条进行物理仿真验证;价值函数可能遭遇分布外状态,论文也未采用集成模型的不确定性上界。

未来方向

作者计划生成更长距离的抓取动作,研究对动态物体的进一步泛化;后续还可引入价值集成、保守不确定性估计和真实数据微调,并系统研究感知分割错误、遮挡程度、控制频率与推理延迟对安全性的影响。

AI 总览摘要

机器人在杂乱环境中抓取陌生物体,难点不只是找到一个看似可行的抓取姿势,还要在手臂接近时应对预测误差、遮挡、碰撞和物体移动。传统开放环方法预测一次便执行,遇到目标偏移就容易失败;已有闭环方法则常局限于单物体桌面和少量训练对象。

Grasp-MPC提出一种折中方案:先用M2T2产生粗略抓取和预抓取位姿,再由CuRobo规划到安全位置,随后用MPPI在视觉反馈下反复重规划。其关键是PointNet++与MLP组成的价值函数。该函数在8515个Objaverse物体的210万条成功或失败轨迹上训练,预测当前点云与机械手姿态距离成功抓取还有多大代价,并与碰撞、最小加加速度等成本共同指导控制。

在FetchBench的5400次测试中,标注抓取位姿下成功率达74.9%,接近OSC的79.0%;加入±2 cm、±18°噪声后仍为60.3%,使用M2T2预测位姿时为67.2%。真实空桌、杂乱桌面和货架场景总体成功率74.4%,高于开放环基线41.1%;物体被扰动后仍有60%成功率。研究显示,大规模价值学习可以让MPC获得更强的泛化和反馈能力,但更长距离动作、分布外状态和感知误差仍是下一步挑战。

深度分析

研究背景

开放环抓取模型如M2T2、ACRONYM类方法能泛化到新物体,却不能根据执行反馈修正目标。RL、IL和FetchBench的Transformer策略提供了闭环能力,但常受数据规模、场景单一和碰撞安全限制。MPC擅长实时约束控制,却依赖能够反映抓取成功的代价函数。

核心问题

给定分割物体点云、末端位姿和粗略抓取目标,机器人需在未知物体动力学下完成6-DoF接近与闭合抓取。核心瓶颈是预测位姿不准确、目标在接近时变化、杂乱障碍物导致碰撞,以及几何距离不能真实表示抓取成功概率。

核心创新

  • �� 用210万条含成功与失败的合成轨迹学习视觉价值,而非只学习动作。
  • �� 用PointNet++编码点云、MLP编码本体感知,将二者融合为正值代价。
  • �� 将价值预测作为MPPI的终端/路径成本,与CuRobo碰撞和最小 jerk 成本联合优化。
  • �� 用部分视角点云和高斯噪声训练,增强从仿真到RealSense真实传感器的迁移。

方法详解

  • �� 数据:对8515个Objaverse物体,将GraspGen可行/不可行抓取位姿后移15 cm,加入平移U(-0.04,0.04) cm和旋转U(-0.04π,0.04π)噪声,再用CuRobo生成轨迹。
  • �� 标签:可行抓取的终端及近终端状态代价为0,其余为1;用γ=0.99的Bellman目标训练价值函数。
  • �� 部署:M2T2生成候选抓取,真实场景使用10 cm预抓取偏移;SAM-Track分割,NVBlox提供SDF障碍表示。
  • �� 控制:CuRobo中的MPPI采样加速度序列,Euler积分预测状态,优化CCuRobo+1000Σγt′−tV(xt′),仅执行当前动作后重新观测。

实验设计

仿真采用UR10、Robotiq 2F-140、Isaac Sim和FetchBench,90个场景、每场60个问题,共5400例;指标是抬升物体至少1 cm。基线包括OSC、Transformer、Diffusion Policy和IQL,并测试真实标注、±2 cm/±18°噪声及M2T2预测位姿。真实实验使用两台RealSense L515、SAM-Track和NVBlox,在空桌、杂乱桌面、杂乱货架各做30次;价值网络用RTX 4090训练六天。

结果分析

标注位姿下Grasp-MPC为74.9%,接近OSC的79.0%,优于IQL的64.4%。噪声位姿下为60.3%,而开放环控制下降约40%;M2T2输入下为67.2%,高于OSC的63.6%和IL方法的36.5%。真实三场景分别为86.7%、67.7%、70.0%,总体74.4%,超过CuRobo-GraspAPI的41.1%。动态扰动实验30次成功率为60%。

应用场景

该系统适合仓储拣选、回收分拣、货架补货和家庭物体整理,尤其适用于目标形状未知、障碍物密集且抓取姿态会变化的任务。实际部署需要深度相机、目标分割、环境SDF、可执行的CuRobo规划以及与机械臂匹配的夹爪模型。

局限与展望

方法依赖可靠的点云分割、目标候选和障碍建模;严重遮挡或错误分割会使价值函数输入失真。训练动作只从预抓取到抓取、距离15 cm,不能保证远距离导航或快速运动物体上的表现。合成数据虽规模大,但未逐条物理验证,且单GPU训练六天、在线MPPI仍有计算成本。未来应扩大动作范围、加入真实失败数据和保守不确定性控制。

通俗解读 非专业人士也能看懂

把机器人想成仓库里负责拿货的员工。开放环方法像是看一眼货物后,提前决定手要放在哪里,然后闭眼伸手;如果货物被碰歪,手就会抓空。Grasp-MPC则像员工边伸手边看:它先得到一个大概位置,再不断比较“现在这样伸过去,成功机会有多大”。

这个“成功机会”来自大量练习。研究人员在电脑里摆放8515种物品,让虚拟机械手尝试超过200万次,并记录哪些动作成功、哪些失败。机器人学到的不是一条死板路线,而是一张“哪些姿势更值得继续尝试”的地图。控制系统每次只走一小步,然后重新看物体和障碍物,再决定下一步。

因此,即使目标位置有误、物体被挪动,机器人也能调整手腕,同时避开货架和其他物品。代价是需要摄像头、较好的目标识别和较强计算能力,而且它练习的主要是最后15厘米,离目标很远时仍可能不可靠。

简单解释 像给14岁少年讲一样

想象你在游戏里操作机械手去捡一件新道具。普通方法像按下“自动寻路”后不再看屏幕:只要道具位置稍微变了,角色就可能撞墙或抓空。Grasp-MPC更像一个会观察的玩家,它先走到附近安全位置,然后每一小段时间看一次画面,重新决定手该往哪儿移动。

它为什么知道怎么走?研究者在电脑游戏场景里准备了8515种不同物品,让虚拟机械手练习了约210万条路线。有些路线成功抓住,有些碰撞或失败。系统把这些经验压缩成一张“成功地图”:当前手的位置和物体形状输入进去,就能估计这个状态离成功还有多远。

真正执行时,M2T2先给出一个大概抓取点,CuRobo负责规划安全路线,MPPI则像同时试跑许多未来动作,选择最安全、最可能成功的一条。它还会避开障碍物,所以在杂乱桌面或货架旁比只执行一次计划更可靠。

结果很酷:仿真中用预测抓取点成功率为67.2%,真实三种环境总体为74.4%。但它不是魔法:看不清物体、物体移动太快,或距离目标太远时仍会失败。研究者下一步要让它练习更长、更动态的动作。

术语表

Model Predictive Control(模型预测控制)

每次预测未来若干步并选择当前最优动作,然后重新观测再规划。它能把实时反馈和碰撞等约束纳入控制。

Grasp-MPC用MPPI实现MPC,在抓取过程中持续修正末端轨迹。

Value Function(价值函数)

估计从当前状态继续执行所需的期望代价;代价越低,通常越接近成功。本文以点云和末端位姿为输入。

它被嵌入MPC,作为抓取任务成本而非直接动作策略。

MPPI

Model Predictive Path Integral是一种通过扰动并评估大量控制序列来选择动作的采样式控制算法。

论文在CuRobo中使用MPPI优化关节加速度。

PointNet++

用于无序三维点集的层次化特征提取网络,能从点云中学习局部与整体几何结构。

它编码分割物体点云,并与MLP提取的本体感知特征融合。

FetchBench

用于评估杂乱场景机器人抓取的基准环境,包含程序生成物体和ACRONYM物体。

论文在Isaac Sim中改造FetchBench并进行5400次仿真测试。

开放问题 这项研究留下的未解疑问

  • 1 价值函数在严重分布外状态下是否可靠仍不清楚;需要不确定性集成、保守上界和系统化校准实验。
  • 2 训练主要覆盖最后15厘米,长距离接近、快速移动物体及持续遮挡下的闭环能力尚未建立。
  • 3 感知分割错误、不同夹爪和真实触觉反馈对性能的影响缺少消融研究。

应用场景

近期应用

杂乱货架拣选

仓储机器人可用深度相机、SAM-Track和NVBlox建立物体与障碍表示,再用Grasp-MPC在货架间修正抓取。论文中杂乱货架成功率为70.0%,高于开放环基线30.0%。

未知物体分拣

回收或电商分拣系统可将M2T2作为候选生成器,把价值控制器用于处理姿态偏差和遮挡。前提是目标能被分割、夹爪和运动规划器已完成标定。

远期愿景

家庭服务机器人

结合更长距离训练、语言指定目标和触觉反馈,机器人可在厨房、书架等动态环境中整理陌生物品。主要障碍是安全认证、极端遮挡和真实数据成本。

原文摘要

Grasping of diverse objects in unstructured environments remains a significant challenge. Open-loop grasping methods, effective in controlled settings, struggle in cluttered environments. Grasp prediction errors and object pose changes during grasping are the main causes of failure. In contrast, closed-loop methods address these challenges in simplified settings (e.g., single object on a table) on a limited set of objects, with no path to generalization. We propose Grasp-MPC, a closed-loop 6-DoF vision-based grasping policy designed for robust and reactive grasping of novel objects in cluttered environments. Grasp-MPC incorporates a value function, trained on visual observations from a large-scale synthetic dataset of 2 million grasp trajectories that include successful and failed attempts. We deploy this learned value function in an MPC framework in combination with other cost terms that encourage collision avoidance and smooth execution. We evaluate Grasp-MPC on FetchBench and real-world settings across diverse environments. Grasp-MPC improves grasp success rates by up to 32.6% in simulation and 33.3% in real-world noisy conditions, outperforming open-loop, diffusion policy, transformer policy, and IQL approaches. Videos and more at http://grasp-mpc.github.io.

cs.RO cs.AI cs.LG