ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

TL;DR

ViTacPhys通过视觉-触觉模型预测物体质量、刚度和摩擦系数,达97.2%的质量分类准确率。

cs.RO 🔴 高级 2026-08-22 72 次浏览
Yiwen Liu Yujun Zhu Kui Jia Zhao Liao Yangwei You Shuaijun Wang
视觉-触觉融合 物理属性预测 机器人抓取 多模态学习 人机迁移

核心发现

方法论

本文提出结合时间序列视觉与触觉信息的多模态预测框架,利用交叉注意力机制融合视觉、触觉特征,并引入预训练的视觉-语言模型(VLM)生成语义先验。模型通过ResNet-18提取内容和流动特征,采用GRU捕获动态信息,并以有序回归和均方误差优化质量、刚度和摩擦系数的预测。数据集由60个不同物体的1800个示范组成,涵盖刚性与软性材料,结合预接触和动态交互协议。模型在已知类别物体上达97.2%的质量分类准确率,97.5%的摩擦系数准确率,刚度MAPE仅5.51%;在未知类别物体上分别达87.5%、97.5%和9.08%。迁移到机器人平台时,结合有限的遥操作数据和图像增强,实现了基于物理属性的自适应抓取策略,成功率达95%(ID)和83.4%(OOD)。

关键结果

  • 模型在已知类别物体上质量分类准确率达97.2%,摩擦系数为98.8%,刚度MAPE为5.51%;在未知类别物体上,质量准确率为87.5%,摩擦系数为97.5%,刚度MAPE为9.08%。
  • 迁移到机器人平台后,基于物理属性的策略在ID物体上成功率为95%,在OOD物体上为83.4%,优于传统ACT方法,且力控特征更贴近人类遥操作。
  • 引入预训练的VLM语义先验显著提升模型对未见物体的泛化能力,验证了多模态融合与人类示范在机器人感知中的潜力。

研究意义

该研究突破了机器人对物体物理属性的感知瓶颈,首次实现从人类示范中学习并迁移到机器人平台的物理属性感知,显著提升了机器人在复杂环境中的适应性和操作精度。通过明确估算质量、刚度和摩擦系数,机器人能更智能地调整抓取力度和策略,解决传统方法中对物理参数估计依赖的局限,推动机器人自主操作向更高层次发展。这不仅丰富了多模态感知的理论体系,也为工业自动化、服务机器人等应用提供了新的技术路径。

技术贡献

本文提出结合时间序列视觉与触觉信息的多模态预测模型,创新性引入预训练VLM生成的语义先验,利用交叉注意力机制实现多模态特征融合,显著提升物理属性预测准确率。模型在复杂交互场景中表现优异,成功实现从人类示范到机器人平台的迁移,验证了多模态信息融合与语义先验在机器人感知中的应用潜力。该方法为未来机器人自主感知提供了理论基础和工程实现路径。

新颖性

首次将人类视觉-触觉示范数据用于物理属性的预测,并通过多模态融合与VLM语义先验实现高精度分类与回归。与以往仅依赖单一模态或离线估计的研究不同,本文实现了实时、连续的物理参数估算,且成功迁移至机器人平台,展现出较强的实用性和泛化能力。

局限性

  • 模型在极端复杂场景或极端材料(如高弹性或极薄薄膜)下的表现仍有限,主要因数据多样性不足。
  • 迁移到机器人平台时,仍依赖有限的遥操作数据,可能影响在未知环境中的适应性。
  • 对高动态交互或极端负载条件下的物理参数估计仍需优化,未来需引入更丰富的交互协议和多模态数据。

未来方向

未来将扩展数据集规模,涵盖更多材料与复杂交互场景,提升模型鲁棒性。还将探索端到端学习框架,结合强化学习优化抓取策略,增强模型在动态环境中的适应能力。此外,计划引入更高精度的传感器和多模态信息,进一步提高物理参数估算的准确性与实时性。

AI 总览摘要

在机器人操作领域,理解物体的物理属性一直是提升自主能力的关键。传统方法多依赖于高成本的传感器或离线估算,难以实现实时适应。本文提出的ViTacPhys框架,通过融合视觉与触觉的时间序列信息,结合预训练的视觉-语言模型(VLM)生成的语义先验,有效预测物体的质量、刚度和摩擦系数。模型在60个物体上进行训练,达到了97.2%的质量分类准确率和98.8%的摩擦系数准确率,刚度预测的MAPE仅为5.51%。在迁移到机器人平台后,结合有限的遥操作和图像增强技术,实现了基于物理属性的自适应抓取策略,成功率分别达到95%(已知类别)和83.4%(未知类别)。实验结果显示,模型在未见物体上的泛化能力优于传统方法,且力控特征更贴近人类遥操作。该研究不仅验证了多模态感知在机器人中的应用潜力,也为未来自主操作提供了新的技术路径。未来工作将继续扩展数据多样性,优化模型鲁棒性,推动机器人在复杂环境中的自主感知与操作能力提升。

深度分析

研究背景

机器人自主操作的核心难题之一是对物体物理属性的准确感知。早期研究主要依赖视觉信息或高精度触觉传感器,诸如GelSight等高端设备,但成本高昂且难以大规模部署。近年来,结合多模态数据的学习方法逐渐兴起,如利用深度学习模型融合视觉、触觉和力信息,提升感知能力。然而,这些方法多为离线估算,缺乏实时性和迁移能力。人类在日常生活中通过视觉和触觉的结合,能快速判断物体的质量、刚度和摩擦系数,启发了将人类示范融入机器人感知的研究。代表性工作包括Physics 101、OmniPush和Fabrics等数据集,提供了丰富的物理属性标签,但多为静态或有限交互场景。当前挑战在于如何将这些感知能力迁移到动态、多模态、实际应用中,特别是在复杂环境和未知物体条件下实现高精度、实时的物理参数估算。

核心问题

核心问题在于机器人如何从有限的视觉和触觉信息中,准确预测物体的质量、刚度和摩擦系数,以实现更智能的抓取策略。传统方法多依赖预定义模型或离线估算,难以应对动态交互和未知物体。人类示范显示出丰富的感知和操作经验,但如何将其转化为机器人可用的模型仍是难题。尤其是在实际场景中,传感器噪声、环境变化和多模态信息的异构性都限制了感知的准确性和鲁棒性。解决这些问题需要融合多模态信息、引入先验知识,并实现模型的迁移与泛化能力。

核心创新

本文的创新点主要包括:1)提出结合时间序列视觉和触觉信息的多模态预测模型,利用交叉注意力机制实现特征融合,显著提升预测精度;2)引入预训练的视觉-语言模型(VLM)生成的语义先验,有效补充接触前的物体信息,增强模型对未知物体的泛化能力;3)通过人类示范数据实现模型训练,结合有限的机器人遥操作数据,成功迁移到机器人平台,验证了方法的实用性。与传统单模态或离线估算方法相比,该模型实现了连续、实时的物理参数估算,为机器人自主感知提供了新思路。

方法详解

  • �� 采集多模态数据:利用带压力阵列的手指传感器和手腕RGB摄像头同步采集视觉与触觉信息,构建包含60个物体的1800个示范数据集。• 特征提取:采用ResNet-18提取内容和流动特征,利用GRU捕获动态交互信息。• 语义先验:利用预训练的GPT-5.4分析前5帧RGB图像,生成物体类别、材质、几何等描述,编码为语义特征。• 多模态融合:通过双向交叉注意力机制融合视觉、触觉特征,并结合语义先验,形成统一表示。• 预测头:分别对质量、刚度(回归)和摩擦系数(分类)进行预测,采用有序回归和交叉熵损失优化。• 迁移策略:结合机器人遥操作和图像增强,微调模型,实现跨域迁移。• 结合预测的物理参数,指导机器人抓取策略,实现自适应调整。

实验设计

采用60个不同物体的示范数据,划分训练、验证和测试集,评估模型在已知和未知类别上的性能。比较不同融合策略和预训练模型的效果,使用准确率、MAPE等指标。在机器人平台上,结合有限遥操作数据,测试基于物理属性的抓取策略,统计成功率和力控特征一致性。通过消融实验验证语义先验和多模态融合的贡献,确保模型在复杂交互中的鲁棒性。

结果分析

模型在已知类别物体上达97.2%的质量分类准确率,98.8%的摩擦系数准确率,刚度MAPE仅为5.51%;在未知类别物体上,分别达到87.5%、97.5%和9.08%。迁移到机器人平台后,基于物理属性的策略在ID物体成功率为95%,在OOD物体为83.4%,优于传统ACT方法,且力控特征更贴近人类遥操作。语义先验显著提升模型泛化能力,验证了多模态融合在实际应用中的有效性。

应用场景

该方法可广泛应用于工业自动化、服务机器人和自主操作系统中,尤其适合复杂环境下的物体识别与抓取。通过准确感知物理属性,机器人能更合理地调整抓取力度和策略,减少损坏和滑落风险。未来,结合更丰富的传感器和强化学习,将进一步提升自主感知和操作的智能水平。

局限与展望

当前模型在极端材料或复杂交互场景下表现仍有限,主要因数据多样性不足。迁移过程中依赖有限遥操作数据,可能影响泛化能力。高动态或极端负载条件下的参数估计仍需优化,未来需引入更丰富的交互协议和多模态数据以增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,手里拿着不同的食材。有些软软的像面包,有些硬硬的像坚果。你可以用眼睛看它们的颜色、形状,还可以用手触摸感受它们的硬度和滑动感。人类在日常生活中就是这样,凭借视觉和触觉的结合,快速判断物体的重量、硬度和表面摩擦力,从而决定用多大力抓取或切割。机器人以前只能用相机看,或者用昂贵的传感器触摸,现在通过学习人类示范,结合视觉和触觉信息,机器人也能像人一样判断物体的物理特性。这样,它们就能更聪明地抓取各种不同的物体,避免滑落或损坏,就像我们用手感受食材一样。这个技术让机器人变得更像人类,能在复杂环境中自主操作,未来可以用在仓库、家庭甚至医疗场景中,帮助人们完成各种任务。

简单解释 像给14岁少年讲一样

想象你在厨房里做饭,你会用眼睛看食材的颜色、形状,还用手摸一摸它们的硬度和滑动感觉。比如,面包很软,坚果很硬。人类就是这样用视觉和触觉一起判断东西的。现在,科学家们让机器人也学会了这种能力。他们用一种特别的学习方法,让机器人看和摸东西,然后告诉它们这些东西的重量、硬度和摩擦力。这样,机器人就能像我们一样,用眼睛和手感判断物体,知道用多大力抓取,避免滑落或损坏。研究还发现,把人类示范的动作和感觉结合起来,机器人能更好地适应不同的物体。未来,这项技术可以让机器人在仓库、家里帮忙,甚至在医院里做事情,变得更聪明、更贴心!

原文摘要

Recent vision-based action models have demonstrated strong capabilities in complex manipulation, but they rarely leverage explicit object physical properties to adapt their policies. We introduce ViTacPhys, a visual-tactile framework and data acquisition system that estimates object mass and friction-coefficient classes, together with continuous stiffness, from human manipulation demonstrations. Trained on data from 60 rigid and deformable objects, ViTacPhys combines temporal visual-tactile modeling, cross-attention multimodal fusion, and a semantic prior derived from a vision-language model. On seen objects, it achieves 97.2% mass classification accuracy, 98.8% friction-coefficient classification accuracy, and a stiffness mean absolute percentage error (MAPE) of 5.51%. On held-out objects from known categories, it achieves 87.5% mass accuracy, 97.5% friction-coefficient accuracy, and a stiffness MAPE of 9.08%. We transfer ViTacPhys from the human domain to the robot domain using limited robot teleoperation data, robot-style video augmentation, and human demonstrations with matched actions, and deploy it as an online module for adaptive grasping. The resulting physical-property-conditioned policy achieves total grasping success rates of 95.0% on in-distribution objects and 83.4% on out-of-distribution objects. For out-of-distribution objects successfully grasped by both methods, its force profiles are more consistent with human teleoperation than those produced by ACT. These results demonstrate the feasibility of explicitly estimating and conditioning on object physical properties for real-world adaptive grasping.

cs.RO