PartialBiGrasp: Inferring Hidden Local Geometry for Bimanual Grasping from Partial Views

TL;DR

提出PartialBiGrasp,通过卷积占据网络在部分点云上推断隐藏局部几何,实现稳健双臂抓取。

cs.RO 🔴 高级 2026-08-20 82 次浏览
Ayush Kaura Vignesh Vembar Md Faizal Karim Keshab Patra K Madhava Krishna
机器人学 双臂操控 点云处理 几何推理 深度学习

核心发现

方法论

本研究提出的PartialBiGrasp框架,基于卷积占据网络(Convolutional Occupancy Networks, ConvOccNet),实现对部分点云的几何推理。模型由全局几何编码器和局部几何编码器组成,前者提取对象整体结构信息,后者捕获抓取点周围的细粒度几何特征。通过隐式几何表示,模型能够推断隐藏的局部厚度、表面连续性和夹持空间,从而生成符合力闭合(force-closure)条件的双臂抓取对。具体流程包括:• 利用点特征编码器提取旋转等变特征,并投影至三平面表示;• 通过共享的U-Net多尺度处理,获得连续特征场;• 采用全局和局部编码器,分别在全局点云和抓取区域采样,学习占据状态(occupancy)预测;• 生成候选单臂抓取,通过力闭合判别网络(Force Closure Critic)筛选稳定抓取对;• 最后利用基于采样的局部占据优化,细化抓取姿态,减少碰撞,提升稳定性。模型在DG16M数据集上训练,结合模拟和真实环境验证其鲁棒性。

关键结果

  • 在DG16M测试集上,PartialBiGrasp实现了55.16%的力闭合(FC%)和67.87%的抓取成功率(GS%),显著优于基线方法(如ContactGraspNet、DAGDiff等)。在真实世界噪声点云上,FC%达51.06%,GS%达81.54%,collision率降低至17.48%,覆盖率提升至16.96%。此外,结合模拟和实物实验,成功实现多样大型物体的双臂稳定抓取,验证了模型在部分视角和复杂几何环境中的适应性。
  • 在消融实验中,去除局部占据引导的优化或残差连接,均导致性能大幅下降,表明全局与局部几何信息融合对抓取质量至关重要。模型在不同场景下表现出优异的泛化能力,特别是在复杂几何和遮挡条件下,仍能生成合理的抓取对。
  • 与基于重建或显式点云补全的方案相比,PartialBiGrasp避免了潜在的几何误差和计算开销,直接利用隐式几何推理实现高效、稳健的双臂抓取,展示了深度学习在复杂机器人操作中的潜力。

研究意义

本研究突破了传统依赖完整点云的局限,提出面向部分观测的几何推理框架,为大规模复杂物体的双臂操控提供了新思路。其在机器人自主操作、仓储搬运、工业装配等场景中具有广泛应用前景。模型通过隐式几何表示,有效应对遮挡和信息缺失问题,提升了机器人在未知环境中的适应能力。该方法的成功实现,推动了基于深度学习的多臂操控技术向更复杂、更真实的应用场景拓展,为未来自主机器人系统的智能化发展奠定基础。

技术贡献

技术上,本文首次将卷积占据网络应用于部分点云的几何推理,结合全局与局部特征,提出了端到端的双臂抓取生成框架。模型通过隐式几何表示,避免了繁琐的点云重建流程,显著提升了处理效率。引入的力闭合判别网络(Force Closure Critic)实现了物理稳定性评估,结合采样优化,有效减少了因几何不完整带来的误判。整体架构实现了从局部细节到全局结构的多尺度信息融合,提供了理论保证和工程实现的双重创新。

新颖性

本研究的创新点在于:首先,首次提出面向部分点云的双臂抓取生成框架,突破了以往依赖完整点云的限制;其次,利用卷积占据网络实现隐式几何推理,能够在遮挡和信息缺失情况下推断隐藏局部几何特征;再次,结合全局与局部特征的多尺度融合,提高了抓取的准确性和稳定性。这些创新使得模型在复杂环境中表现出优异的鲁棒性和泛化能力,填补了部分观测条件下多臂操控的研究空白。

局限性

  • 模型未考虑机械臂的运动学和路径规划限制,部分生成的抓取对在实际操作中可能不可行,需要后续的运动规划验证。
  • 对极端遮挡或极端复杂几何结构的处理仍存在不足,部分隐藏区域推断可能不准确,影响抓取效果。
  • 在高动态环境或多物体场景中,模型的实时性和适应性尚需提升,未来需结合运动规划和环境感知进行优化。

未来方向

未来将结合运动规划模块,验证生成抓取的可执行性,提升整体操作的鲁棒性。还计划引入多模态感知信息(如力/触觉传感器)以增强几何推理能力,扩展到动态场景和多物体交互。此外,优化模型的计算效率,适应实时应用需求,也是未来的重要方向。

AI 总览摘要

在现代工业和服务机器人领域,双臂操控的能力对于处理大型、复杂或重物体具有重要意义。传统方法多依赖于完整的点云信息,然而在实际环境中,受遮挡、视角限制等因素影响,获取完整几何信息往往不可行。这一挑战促使研究者探索如何在部分观测条件下实现稳健的双臂抓取。本文提出的PartialBiGrasp框架,基于深度学习和隐式几何推理,首次实现了在部分点云上生成符合力闭合条件的双臂抓取对。核心技术包括卷积占据网络(ConvOccNet)用于学习隐式几何表示,结合全局和局部特征,推断隐藏的局部几何属性如厚度和连续性,从而实现对遮挡区域的几何推理。模型通过两个阶段:候选抓取生成和基于占据的优化,确保抓取的稳定性和碰撞避免。实验在DG16M数据集和真实场景中均取得了优异表现,显著优于现有方法。该研究不仅突破了部分点云条件下的多臂操控瓶颈,也为未来自主机器人在复杂环境中的应用提供了新的解决方案。未来,结合运动规划和多模态感知,将进一步提升系统的实用性和鲁棒性。

深度分析

研究背景

机器人双臂操控作为工业自动化和服务机器人中的关键技术,经历了从基于规则的运动学控制到深度学习驱动的自主规划的演变。早期方法依赖于精确的几何模型和预定义的操作策略,如基于逆运动学(Inverse Kinematics)和碰撞检测的规划技术。近年来,深度学习模型如PointNet、DGCNN等被引入,用于点云特征提取和抓取点的预测,显著提升了复杂场景下的适应能力。代表性工作包括GQ-CNN、Dex-Net等,它们在小型、规则物体上取得了良好效果。然而,面对大规模、遮挡严重的对象,传统方法依然受限于完整几何信息的需求,难以应对实际应用中的部分观测问题。近年来,隐式几何表示、占据网络和生成模型的兴起,为处理部分点云提供了新的可能性。尽管如此,如何在遮挡和信息缺失条件下实现稳健的多臂操控,仍是当前研究的难点。

核心问题

核心问题在于:在只获得部分点云的情况下,如何推断出隐藏的局部几何特征,从而生成稳定、无碰撞的双臂抓取对。现有方法多依赖于完整点云或显式重建,难以应对遮挡带来的信息缺失。此外,双臂抓取还需满足力闭合条件,确保两个抓手在不同位置能共同稳定夹持大物体。复杂几何结构、稀疏抓取区域以及遮挡引入的误导信息,使得抓取生成变得更加困难。没有有效的几何推理,容易导致抓取不稳定或碰撞风险增大,限制了机器人在实际复杂环境中的应用。

核心创新

本研究的创新点主要包括:1)引入卷积占据网络(ConvOccNet)实现隐式几何推理,能够在部分点云中推断隐藏的局部几何特征;2)设计全局与局部多尺度特征融合机制,提升对复杂几何结构的理解能力;3)提出基于力闭合判别网络的双臂抓取筛选策略,确保生成的抓取对在物理上稳定;4)结合采样优化,细化抓取姿态,减少碰撞风险。这些创新解决了传统方法在遮挡和信息缺失条件下的局限,显著提高了多臂操控的鲁棒性和适应性。

方法详解

  • �� 输入:单视角RGB-D图像与分割掩码,投影生成点云P;• 全局几何编码:利用点特征编码器提取旋转等变特征,投影到三平面,经过U-Net多尺度处理,获得连续特征场;• 局部几何编码:在候选抓取点附近采样局部点云,利用共享的局部编码器学习细粒度几何特征,捕获厚度和表面连续性;• 抓取候选生成:在点云上采样候选点,利用全局编码预测抓取可行性和姿态参数;• 双臂抓取筛选:将两个单臂抓取组合,通过力闭合判别网络评估稳定性,筛选出符合条件的抓取对;• 抓取优化:利用局部占据信息,采样调整抓取姿态,减少碰撞,提升稳定性,最终输出双臂抓取对。

实验设计

模型在DG16M数据集上训练,采用多阶段策略:全局几何编码器训练、双臂抓取判别器训练、局部占据优化训练。评估指标包括力闭合比例(FC%)、抓取成功率(GS%)、碰撞率(PC%)和覆盖率。对比基线包括ContactGraspNet、DAGDiff、RecGen+DAGDiff和VLM方法。在模拟环境中,模型在DG16M测试集表现出55.16%的FC%和67.87%的GS%,在真实场景中实现了51.06%的FC%和81.54%的GS%。此外, Ablation研究验证了全局与局部特征融合的重要性。实物实验中,模型成功操控多种复杂大物体,表现出优异的鲁棒性和泛化能力。

结果分析

实验结果显示,PartialBiGrasp在力闭合比例和成功率方面显著优于传统重建和显式补全方法,尤其在遮挡严重的场景中表现出更高的稳定性和安全性。模型的碰撞率最低,覆盖率最高,验证了其在复杂环境中的适应性。消融实验表明,去除局部占据优化或残差连接会导致性能大幅下降,强调多尺度融合的重要性。实物测试中,模型在不同物体和视角下均能生成合理的双臂抓取对,展现出强大的泛化能力和实用性。

应用场景

该技术适用于仓储自动化、工业装配、救援机器人等场景,尤其在环境复杂、遮挡严重的情况下,能自主生成稳定的双臂抓取策略。只需提供部分点云信息,即可实现大物体的稳固夹持,减少对完整几何模型的依赖。未来还可结合路径规划和运动控制,推动自主机器人在未知环境中的广泛应用。

局限与展望

目前模型未考虑机械臂的运动学约束和路径规划,部分生成的抓取对在实际操作中可能不可行。对极端遮挡或复杂几何结构的推断仍存在误差,影响抓取效果。模型在动态环境中的实时性和多目标场景下的适应性有待提升,未来需结合运动规划和多模态感知进行优化。

通俗解读 非专业人士也能看懂

想象你在厨房里准备做饭,但只看得到锅的一部分,其他部分被锅盖挡住了。你需要猜测锅的形状和位置,才能把锅夹起来放到灶台上。这个过程就像机器人用部分的点云“猜测”隐藏的几何形状一样。传统的方法就像你必须看到整个锅才能抓住它,但实际上,厨房里很多东西都被遮挡,不能总是看到全部。这个研究就像教机器人如何在只看到锅一角的情况下,依靠“猜测”和“推理”来找到最佳的抓取点。它用一种特殊的“隐形几何”技术,像你用手感知锅的厚度和边缘一样,帮助机器人在复杂环境中稳稳抓住大物体。这样,机器人就能在仓库、工厂或家里,灵活应对各种遮挡和复杂形状的任务,就像你用手摸索厨房里的锅一样聪明。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,但只看到拼图的一部分。你需要猜测剩下的部分长什么样,才能把拼图拼好。机器人也是一样,它通过只看到物体的一部分点云,试图猜出隐藏的部分,然后找到最好的抓取位置。以前的方法就像你必须看到整个拼图才能拼,但这不总是可能。这个新方法就像你用手感知拼图的边缘和厚度,帮助机器人在只看到一角的情况下,也能稳稳地抓住大物体。它用一种叫做“隐式几何”的技术,让机器人可以“猜测”隐藏的细节,就像你用手摸到拼图的边缘一样。这样,机器人在工厂、仓库或家庭中,就能更聪明、更灵活地操作各种大物体,即使只看到部分信息,也能做出正确的动作。

原文摘要

Dual-arm robotic grasping is essential for manipulating large, heavy, and geometrically complex objects that cannot be reliably handled using a single manipulator. These large objects often contain only sparse graspable regions determined by local geometric properties such as thickness, edge structure, and gripper clearance. Prior bimanual grasping methods assume access to a full point cloud of the object which inherently contains this geometric information, but may not be accessible in real scenarios. This work proposes PartialBiGrasp, a dual-arm grasp generation framework that operates directly on partial point cloud observations. Our model learns geometric features implicitly through convolutional occupancy networks, enabling local reasoning about graspability, collision-free contact regions, and object thickness. We leverage this understanding to generate force-closure compliant grasp pairs, which are further refined using a sampling-based optimization to correct for ambiguity caused by incomplete geometry. We evaluate our approach using analytical force-closure metrics, large-scale simulation experiments, and real-world robot evaluations on noisy partial point clouds of novel objects, demonstrating robust and physically stable dual-arm grasp generation.

cs.RO

参考文献 (20)

DG16M: A Large-Scale Dataset for Dual-Arm Grasping with Force-Optimized Grasps

Md Faizal Karim, Mohammed Saad Hashmi, Shreya Bollimuntha 等

2025 5 引用 ⭐ 高影响力 查看解读 →

Real-Time Simultaneous Multi-Object 3D Shape Reconstruction, 6DoF Pose Estimation and Dense Grasp Prediction

Shubh Agrawal, Nikhil Chavan-Dafle, Isaac Kasahara 等

2023 6 引用 查看解读 →

A Review of Robot Learning for Manipulation: Challenges, Representations, and Algorithms

Oliver Kroemer, S. Niekum, G. Konidaris

2019 521 引用 查看解读 →

BiGraspFormer: End-to-End Bimanual Grasp Transformer

Kangmin Kim, Seunghyeok Back, Geonhyup Lee 等

2025 1 引用 查看解读 →

Robotic Grasping from Classical to Modern: A Survey

Hanbo Zhang, Jian Tang, Shiguang Sun 等

2022 60 引用 查看解读 →

6-DOF GraspNet: Variational Grasp Generation for Object Manipulation

A. Mousavian, Clemens Eppner, D. Fox

2019 706 引用 查看解读 →

DA$^{2}$ Dataset: Toward Dexterity-Aware Dual-Arm Grasping

Guangyao Zhai, Yu Zheng, Ziwei Xu 等

2022 25 引用 查看解读 →

Contact-GraspNet: Efficient 6-DoF Grasp Generation in Cluttered Scenes

M. Sundermeyer, A. Mousavian, Rudolph Triebel 等

2021 545 引用 查看解读 →

Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning

Fabian Hahne, Vignesh Prasad, Georgia Chalvatzaki 等

2026 2 引用 查看解读 →

Dual arm manipulation - A survey

Christian Smith, Y. Karayiannidis, L. Nalpantidis 等

2012 584 引用

GraspGen: A Diffusion-based Framework for 6-DOF Grasping with On-Generator Training

Adithyavairavan Murali, Balakumar Sundaralingam, Yu-Wei Chao 等

2025 43 引用 查看解读 →

End-to-End Object Detection with Transformers

Nicolas Carion, Francisco Massa, Gabriel Synnaeve 等

2020 19566 引用 查看解读 →

Deep Learning Approaches to Grasp Synthesis: A Review

R. Newbury, Morris Gu, Lachlan Chumbley 等

2022 291 引用 查看解读 →

PoinTr: Diverse Point Cloud Completion with Geometry-Aware Transformers

Xumin Yu, Yongming Rao, Ziyi Wang 等

2021 649 引用 查看解读 →

Vector Neurons: A General Framework for SO(3)-Equivariant Networks

Congyue Deng, O. Litany, Yueqi Duan 等

2021 444 引用 查看解读 →

Grasp Pose Detection from a Single RGB Image

Hu Cheng, Yingying Wang, M. Meng

2021 13 引用

AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains

Haoshu Fang, Chenxi Wang, Hongjie Fang 等

2022 494 引用 查看解读 →

U-Net: Convolutional Networks for Biomedical Image Segmentation

O. Ronneberger, P. Fischer, T. Brox

2015 100285 引用 查看解读 →

Convolutional Occupancy Networks

Songyou Peng, M. Niemeyer, L. Mescheder 等

2020 1147 引用 查看解读 →

Constrained 6-DoF Grasp Generation on Complex Shapes for Improved Dual-Arm Manipulation

Gaurav Singh, Sanket Kalwar, Md Faizal Karim 等

2024 16 引用 查看解读 →