Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

TL;DR

提出AAC算法,通过动作熵动态调整动作块大小,提升机器人操作任务成功率达2.3%。

cs.RO 🔴 高级 2026-04-06 32 次浏览
Yuanchang Liang Xiaobo Wang Kai Wang Shuo Wang Xiaojiang Peng Haoyu Chen David Kim Huat Chua Prahlad Vadakkepat
视觉语言模型 机器人操作 动作块 自适应算法

核心发现

方法论

AAC通过计算动作熵动态调整动作块大小。动作熵反映预测动作的可靠性,低熵时执行较大块以提高效率,高熵时执行较小块以增强反应性。无需额外训练或架构修改。

关键结果

  • 在RoboCasa基准上,AAC平均成功率提升2.3%,旋转任务成功率从57.6%提升至61.4%。
  • 在LIBERO基准上,AAC平均成功率提升0.9%,长任务组成功率提升4%。
  • AAC在真实环境中表现优异,复杂任务成功率显著提升。

研究意义

该研究解决了固定动作块大小导致的反应性与一致性冲突问题,为机器人操作任务提供了更高效的解决方案,尤其适用于长时间复杂任务。

技术贡献

提出基于动作熵的自适应动作块选择算法,显著提高了机器人操作任务的成功率,且无需额外训练或架构修改,增强了方法的通用性和可扩展性。

新颖性

首次提出基于动作熵动态调整动作块大小的算法,与现有固定块大小方法相比,显著提高了任务成功率和效率。

局限性

  • AAC需要额外的计算资源来计算动作熵,可能影响实时性。
  • 对动作块大小的选择仍需进一步优化以适应更复杂任务。

未来方向

未来可探索结合强化学习优化动作块选择,进一步提升复杂任务中的性能,或扩展至多机器人协作场景。

AI 总览摘要

现有视觉-语言-动作(VLA)模型在机器人操作任务中表现出色,但固定动作块大小限制了其反应性和一致性。本文提出自适应动作块选择(AAC)算法,通过计算动作熵动态调整动作块大小,在高熵情况下执行较小块以增强反应性,在低熵情况下执行较大块以提高效率。

实验表明,AAC在RoboCasa和LIBERO基准测试中均显著提升了任务成功率,尤其是在长时间复杂任务中表现突出。AAC无需额外训练或架构修改,具有较高的通用性和扩展性。

尽管AAC在性能上取得了显著进步,但其计算动作熵的过程增加了计算成本。未来研究可探索结合强化学习进一步优化动作块选择,并扩展至多机器人协作场景。

深度分析

研究背景

视觉-语言-动作模型结合视觉、语言和机器人状态信息生成控制动作,在机器人操作任务中展现了巨大潜力。现有研究多采用固定动作块大小,但这种方法在复杂任务中存在反应性与一致性冲突。

核心问题

固定动作块大小无法适应不同任务需求,导致反应性不足或动作不连贯。解决这一问题对于提升复杂任务的成功率至关重要。

核心创新

AAC算法通过动作熵动态调整动作块大小,解决了固定块大小的局限性。与现有方法不同,AAC无需额外训练或架构修改,具有更高的灵活性。

方法详解

  • �� 动作熵计算:基于连续控制的高斯微分熵和离散控制的概率熵。
  • �� 动态块大小选择:通过熵变化点确定最优块大小。
  • �� 执行策略:高熵时执行小块以增强反应性,低熵时执行大块以提高效率。

实验设计

在RoboCasa和LIBERO基准上进行实验,分别包含24个厨房任务和40个机器人操作任务。使用GR00T N1.5模型作为基线,评估AAC在不同任务中的表现。

结果分析

AAC在RoboCasa基准上平均成功率提升2.3%,在LIBERO基准上提升0.9%,长时间复杂任务成功率显著提升。

应用场景

AAC适用于机器人操作任务,尤其是需要精细控制的复杂任务,如长时间的多阶段任务。

局限与展望

AAC计算动作熵需要额外资源,可能影响实时性。对复杂任务的块大小选择仍有优化空间。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。AAC就像一个聪明的助手,观察你的动作。如果你在切菜时动作不稳定,它会建议你慢慢来,确保每一刀都准确;而在端盘子时,它会让你加快速度,因为这时不需要太精确。这样既节省时间,又能保证每一步都完成得很好。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人游戏!机器人需要完成任务,比如拿香蕉放进篮子里。如果机器人动作不稳定,它会慢慢来,确保抓住香蕉;如果它很有信心,它会快速行动,把香蕉放到篮子里。这个算法就像是机器人的大脑,帮助它决定什么时候快,什么时候慢。

术语表

动作熵 (Action Entropy)

反映动作预测的不确定性,熵越低动作越可靠。

用于动态调整动作块大小。

动作块 (Action Chunk)

一组连续执行的机器人动作。

用于提高任务效率。

视觉-语言模型 (Vision-Language Model)

结合视觉和语言信息的模型。

用于提取任务条件特征。

高斯微分熵 (Gaussian Differential Entropy)

连续动作熵的计算公式。

用于量化连续控制的不确定性。

自适应动作块选择 (Adaptive Action Chunking)

动态调整动作块大小的算法。

本文提出的核心方法。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化AAC以适应更复杂任务?
  • 2 如何降低动作熵计算的资源消耗?

应用场景

近期应用

机器人装配线

在流水线中动态调整机器人动作块大小以提高效率。

家庭助手机器人

在家庭环境中执行复杂任务,如整理物品。

远期愿景

多机器人协作

在协作任务中动态调整动作块大小以优化团队效率。

原文摘要

In Vision-Language-Action (VLA) models, action chunking (i.e., executing a sequence of actions without intermediate replanning) is a key technique to improve robotic manipulation abilities. However, a large chunk size reduces the model's responsiveness to new information, while a small one increases the likelihood of mode-jumping, jerky behavior resulting from discontinuities between chunks. Therefore, selecting the optimal chunk size is an urgent demand to balance the model's reactivity and consistency. Unfortunately, a dominant trend in current VLA models is an empirical fixed chunk length at inference-time, hindering their superiority and scalability across diverse manipulation tasks. To address this issue, we propose a novel Adaptive Action Chunking (AAC) strategy, which exploits action entropy as the cue to adaptively determine the chunk size based on current predictions. Extensive experiments on a wide range of simulated and real-world robotic manipulation tasks have demonstrated that our approach substantially improves performance over the state-of-the-art alternatives. The videos and source code are publicly available at https://lance-lot.github.io/adaptive-chunking.github.io/.

cs.RO