CoFreeVLA: Short-Horizon Collision-Free Dual-Arm Manipulation via Vision-Language-Action Model and Risk Estimation

TL;DR

CoFreeVLA通过视觉-语言-动作模型和风险估计,将双臂机器人自碰撞率从0.54降至0.23,任务成功率提升至0.61。

cs.RO 🔴 高级 2026-01-29 36 次浏览
Yaohua Liu Binkai Ou Hengjun Zhang
机器人控制 视觉-语言-动作 双臂操作 碰撞规避 风险估计

核心发现

方法论

CoFreeVLA框架结合视觉-语言-动作(VLA)模型与轻量级短时域风险估计器。风险估计器通过视觉嵌入、关节状态和候选动作序列预测碰撞概率,并嵌入闭环控制系统,动态阻止高风险动作,生成安全恢复轨迹,并优化策略以减少碰撞风险。

关键结果

  • 在5个双臂任务中,CoFreeVLA将平均自碰撞率从0.54降低至0.23,减少57.6%。
  • 任务成功率从0.45提升至0.61,增幅达34.5%。
  • 与基线方法相比,CoFreeVLA在所有任务和模型中均显著改善安全性和任务完成率。

研究意义

该研究解决了双臂机器人操作中长期存在的自碰撞问题,为多臂机器人在复杂环境中的安全部署提供了重要技术支持。通过结合风险估计与VLA模型,CoFreeVLA实现了任务性能与安全性的平衡,推动了机器人操作领域的前沿发展。

技术贡献

提出了首个将短时域风险估计器与VLA模型深度集成的框架,显著降低了自碰撞风险。引入了两阶段训练流程,结合模拟与真实数据,确保风险估计器的鲁棒性和精度。此外,框架支持实时风险评估和动作优化,适用于多种任务和平台。

新颖性

CoFreeVLA首次在VLA模型中引入显式的自碰撞风险预测,并通过实时控制和策略优化实现安全性提升。相比传统几何规划方法,该框架更适合动态复杂场景。

局限性

  • 风险估计器对视觉嵌入的质量高度依赖,可能受传感器噪声影响。
  • 恢复策略在高动态场景中可能存在延迟,影响实时性。
  • 当前实验仅限于特定任务,尚需验证更广泛的适用性。

未来方向

未来工作包括扩展至多机器人协作场景,优化风险估计器的实时性能,以及探索更复杂任务中的应用潜力。

AI 总览摘要

双臂机器人操作因其高自由度和复杂的空间协调需求,一直面临自碰撞风险。现有方法多依赖几何规划,难以实时预测和规避自碰撞。CoFreeVLA通过结合视觉-语言-动作(VLA)模型与短时域风险估计器,提出了一种全新框架,实时预测并规避自碰撞风险。

该框架的核心是一个轻量级风险估计器,利用视觉嵌入、关节状态和候选动作序列预测碰撞概率,并动态阻止高风险动作。实验表明,CoFreeVLA在5个双臂任务中显著降低了自碰撞率(从0.54降至0.23),并提升了任务成功率(从0.45增至0.61)。

尽管该方法在安全性和任务性能上取得了显著进展,但其对传感器精度和实时性的依赖仍是未来优化的重点。研究团队计划进一步扩展该框架至多机器人协作场景,以应对更复杂的操作需求。

深度分析

研究背景

近年来,视觉-语言-动作(VLA)模型因其将自然语言指令转化为机器人操作的能力而备受关注。早期的VLA模型如RT-2和PaLM-E,通过多模态学习实现了单臂机器人的任务泛化。然而,双臂操作因其空间协调和安全规划的复杂性,仍面临显著挑战,尤其是自碰撞问题在现有VLA框架中鲜有研究。

核心问题

双臂机器人操作需要协调两只高自由度机械臂,避免自碰撞是实现安全操作的关键。然而,现有方法多依赖几何规划,难以实时预测和规避自碰撞。此外,感知不确定性和动态交互增加了意外接触的风险,限制了VLA模型在实际场景中的应用。

核心创新

  • �� 提出CoFreeVLA框架,将短时域风险估计器与VLA模型深度集成。
  • �� 风险估计器通过视觉嵌入、关节状态和候选动作序列预测碰撞概率。
  • �� 引入两阶段训练流程,结合模拟和真实数据,确保风险估计器的鲁棒性。
  • �� 实现实时风险评估和动作优化,动态规避高风险动作并生成恢复轨迹。

方法详解

  • �� 风险估计器:基于视觉嵌入和动作序列预测碰撞概率,采用交叉注意力模块和多任务学习。
  • �� 数据集构建:结合模拟和真实机器人数据,生成包含碰撞标签、最小距离和碰撞时间的数据集。
  • �� 实时控制:通过风险门控阻止高风险动作,动态调整策略并生成安全恢复轨迹。
  • �� 策略优化:基于风险反馈对VLA模型进行安全性优化,提升任务完成率。

实验设计

实验在AgileX双臂机器人平台上进行,涵盖5个任务(如工具传递、精密对接)。使用6种VLA模型作为基线,包括TinyVLA、OpenVLA、RDT-1B等。每种方法在每个任务上进行30次试验,评估自碰撞率和任务成功率。

结果分析

实验结果显示,CoFreeVLA在所有任务和模型中均显著降低了自碰撞率(平均从0.54降至0.23),并提升了任务成功率(从0.45增至0.61)。尤其是在高干扰任务(如倒豆子)中,碰撞率降低了57.6%。

应用场景

该框架适用于需要高精度和安全性的双臂机器人任务,如工业装配、医疗手术和协作机器人操作。其实时性和鲁棒性使其在动态复杂环境中具有广泛应用潜力。

局限与展望

风险估计器对传感器质量高度依赖,可能受噪声影响。此外,恢复策略在高动态场景中可能存在延迟,限制了实时性。未来需进一步验证其在更复杂任务中的适用性。

通俗解读 非专业人士也能看懂

想象你在厨房里用两只手同时操作:一只手拿着刀切菜,另一只手拿着碗接住切好的菜。如果两只手配合不好,很可能会切到自己或者打翻碗。CoFreeVLA就像一个聪明的助手,它能实时监控你的手和刀的位置,提前预测可能发生的碰撞,并提醒你调整动作,甚至帮你重新规划更安全的操作方式。这样,你就能专注于切菜,而不必担心意外发生。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人游戏,控制两个机械臂同时完成任务,比如把一个杯子放进另一个杯子里。如果两个机械臂碰到一起,游戏就会失败!CoFreeVLA就像游戏里的外挂,它能帮你提前预测机械臂会不会撞到,然后自动调整动作,避免失败。这样你就能更快更安全地完成任务,是不是很酷?

术语表

Vision-Language-Action (VLA) 模型

一种结合视觉、语言和动作的模型,用于将自然语言指令转化为机器人操作。

用于将任务指令转化为双臂机器人的操作。

自碰撞风险估计器

一种预测机器人未来动作是否会导致自碰撞的模型,基于视觉、关节状态和动作序列。

用于实时预测双臂机器人操作中的自碰撞风险。

短时域计划

在较短时间范围内生成的动作序列,用于提高实时性和安全性。

用于风险估计器预测未来短时间内的碰撞风险。

两阶段训练流程

先用模拟数据预训练,再用真实机器人数据微调模型的训练方法。

用于提高风险估计器的鲁棒性和精度。

恢复轨迹

当检测到高风险时,生成的将机器人恢复到安全状态的动作序列。

用于在高风险情况下保护机器人硬件和任务安全。

开放问题 这项研究留下的未解疑问

  • 1 如何在多机器人协作场景中扩展CoFreeVLA的应用?
  • 2 如何进一步提高风险估计器在高动态场景中的实时性?
  • 3 如何减少对传感器精度的依赖以提高鲁棒性?

应用场景

近期应用

工业装配

在生产线上,双臂机器人可以安全高效地完成复杂装配任务,减少人工干预。

医疗手术

在手术中使用双臂机器人,避免因自碰撞导致的医疗事故,提升手术安全性。

远期愿景

多机器人协作

未来可扩展至多机器人协作场景,实现更复杂的任务分工与协作。

原文摘要

Vision Language Action (VLA) models enable instruction-following manipulation, yet their deployment on coordinated dual-arm platforms remains severely constrained by under-modeled self-collisions between manipulators and grasped objects. To address this critical safety gap, we propose CoFreeVLA, a novel framework that augments end-to-end VLA policies with a lightweight, short-horizon self-collision risk estimator. The estimator predicts collision likelihoods directly from proprioceptive states, visual embeddings, and candidate action sequences. Deeply integrated into the closed-loop control system, this estimator proactively gates risky commands, autonomously synthesizes recovery trajectories to safe states via risk-guided adjustments, and biases policy refinement for safer rollouts. To ensure robust calibration, the estimator utilizes a two-stage training pipeline, pre-training with model-based synthetic collision labels, followed by post-training on real-robot rollouts. Across five bimanual tasks, six VLA backbones, and 30 trials per variant, the task-averaged collision rate decreases from 0.54 to 0.23, while the task-averaged success rate increases from 0.45 to 0.61. Compared to representative baselines, CoFreeVLA substantially reduces self-collision frequencies and improves overall task success rates, providing a crucial step toward the safe deployment of foundational models in multi-arm continuous control.

cs.RO