GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

TL;DR

GeoAAC通过几何适应动作分块提高真实任务成功率,从53.3%提升至74.4%。

cs.RO 🔴 高级 2026-09-18 9 次浏览
Xin Chen Sen Chen Yujuan Ding Jian Liu Guoqing Wang Wei Ye Heng Tao Shen Yi Bin
动作分块 几何分析 VLA策略 预测可靠性 机器人操作

核心发现

方法论

GeoAAC是一种基于几何的自适应动作分块方法,利用Flow Matching去噪轨迹的几何变化来调整动作范围。通过分析动作前缀的几何特征,GeoAAC无需额外训练即可确定动作执行边界。

关键结果

  • GeoAAC在LIBERO数据集上,使用GR00T N1.5模型,平均成功率达到95.5%,比固定动作范围基线提高8.7个百分点。
  • 在RoboCasa365任务中,GeoAAC成功率从固定动作范围的53.3%提升至74.4%。
  • 在LIBERO-Pro数据集的空间分布偏移测试中,GeoAAC比其他自适应方法表现更优。

研究意义

GeoAAC为动作生成提供了一种新的自适应机制,解决了固定动作范围无法应对不同任务阶段需求的问题。此方法在机器人操作任务中显示了显著的性能提升,推动了VLA策略的应用。

技术贡献

GeoAAC通过几何分析提供了动作预测可靠性的过程级信号,区别于现有方法中的不确定性估计,提供了更直接的动作范围选择依据。

新颖性

GeoAAC首次利用Flow Matching去噪轨迹的几何特征来进行动作范围选择,与现有的基于不确定性的方法相比,提供了更精确的预测可靠性信息。

局限性

  • GeoAAC在复杂环境中可能需要更多的计算资源来处理几何分析。
  • 在某些任务中,几何变化可能不完全反映动作预测的可靠性。

未来方向

未来工作可以探索GeoAAC在更多类型的任务中的应用,并优化几何分析的计算效率。

AI 总览摘要

GeoAAC是一种创新的几何自适应动作分块方法,旨在解决固定动作范围无法适应不同任务阶段需求的问题。在机器人操作任务中,动作的连续性和反馈频率至关重要,而传统方法无法灵活调整动作范围。GeoAAC通过分析Flow Matching去噪轨迹的几何变化,提供了预测可靠性的过程级信号,能够自适应地选择动作范围。实验结果显示,GeoAAC在多个数据集和真实任务中均表现出色,成功率显著提高。这一方法不仅提升了VLA策略的性能,还为机器人操作领域带来了新的可能性。然而,GeoAAC在复杂环境中的计算资源需求仍需进一步优化。

深度分析

研究背景

随着机器人技术的发展,视觉-语言-动作(VLA)策略成为机器人操作的关键。然而,现有方法通常使用固定动作范围,无法适应不同任务阶段的需求。近年来,研究者们开始探索自适应动作分块,以提高任务执行的灵活性和成功率。

核心问题

固定动作范围在不同任务阶段可能导致动作连续性和反馈频率之间的矛盾,影响任务成功率。如何根据动作预测的可靠性动态调整动作范围是一个亟待解决的问题。

核心创新

GeoAAC通过分析Flow Matching去噪轨迹的几何变化,提供了一种新的自适应动作分块机制。这种方法无需额外训练,能够根据动作预测的可靠性动态调整动作范围。

方法详解

  • �� 使用Flow Matching生成去噪轨迹
  • �� 分析动作前缀的几何变化
  • �� 构建动作范围的几何特征图谱
  • �� 根据几何特征动态选择动作范围

实验设计

实验在LIBERO、LIBERO-Pro和RoboCasa365数据集上进行,使用GR00T N1.5和π0.5模型。评估指标包括成功率和动作范围选择的灵活性。

结果分析

GeoAAC在LIBERO数据集上成功率达到95.5%,在RoboCasa365任务中成功率从固定动作范围的53.3%提升至74.4%。在LIBERO-Pro的空间分布偏移测试中,GeoAAC表现优于其他自适应方法。

应用场景

GeoAAC适用于机器人操作任务中的动作生成和执行,尤其是在需要高精度控制和反馈的场景中。

局限与展望

GeoAAC在复杂环境中可能需要更多计算资源,几何变化可能不完全反映动作预测的可靠性。未来工作需优化计算效率。

通俗解读 非专业人士也能看懂

想象一个机器人在厨房里准备晚餐。传统方法就像让机器人每次只能执行一个步骤,然后停下来检查是否正确。而GeoAAC就像一个聪明的助手,根据每一步的复杂程度和可靠性,灵活地决定下一步该做什么。比如在切菜时,机器人可以快速连续地执行动作,而在摆盘时则需要更精确的控制。这样,机器人不仅能更快地完成任务,还能减少错误。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个超级酷的机器人游戏。你需要让机器人完成任务,比如打开柜子或倒咖啡。传统方法就像让机器人每次只能做一个动作,然后停下来检查。而GeoAAC就像一个超级智能的游戏助手,它能根据任务的难度和可靠性,灵活地决定机器人下一步该做什么。这样,你的机器人不仅能更快地完成任务,还能减少错误,是不是很棒?

术语表

Flow Matching (流匹配)

一种用于连续动作生成的技术,通过时间相关的速度场将初始噪声转化为动作输出。

在GeoAAC中用于生成去噪轨迹。

Action Chunking (动作分块)

预测和执行一系列未来动作的策略,旨在提高动作的连续性。

在VLA策略中广泛应用。

Predictive Uncertainty (预测不确定性)

动作预测的可靠性指标,通常通过多样本预测的熵来估计。

用于指导动作范围选择。

Denoising Trajectory (去噪轨迹)

通过Flow Matching生成的中间速度预测序列,反映动作预测的演变过程。

用于分析几何变化。

Geometric Profile (几何特征图谱)

动作前缀的几何变化汇总,用于指导动作范围选择。

GeoAAC的核心机制。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂环境中优化GeoAAC的计算效率?
  • 2 几何变化是否能完全反映动作预测的可靠性?

应用场景

近期应用

机器人操作任务

GeoAAC可用于提高机器人在复杂任务中的成功率,尤其是在需要高精度控制的场景中。

远期愿景

智能机器人助手

GeoAAC可用于开发更智能的机器人助手,能够根据任务需求动态调整动作策略。

原文摘要

Action chunking is widely used for action generation and execution in Vision-Language-Action (VLA) policies, yet existing approaches commonly use a fixed action horizon. During a rollout, different task stages may require different levels of action continuity, control precision, and closed-loop feedback, making a fixed horizon unable to accommodate changing control requirements. We propose \textbf{GeoAAC}, a geometry-based adaptive action chunking method for flow-based VLA policies that adjusts the action horizon according to the reliability of the current action prediction. We show that the geometry of Flow Matching denoising trajectories provides process-level information for characterizing prediction reliability, with geometric variation across action prefixes remaining positively correlated with predictive uncertainty. GeoAAC uses this prefix-wise geometry to construct a horizon-wise geometric profile and adaptively determine the action horizon from a single generation without additional training. Experiments with GR00T N1.5 and π0.5 on LIBERO, LIBERO-Pro, RoboCasa365, and real-world manipulation tasks show consistent improvements over fixed-action-horizon baselines and existing adaptive methods, including up to 8.7 percentage points in simulation and an increase in average real-world success rate from 53.3\% to 74.4\%.

cs.RO cs.AI cs.LG