TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TL;DR

TapSampling用Action-VAE采样与任务进度验证器选择动作,使CALVIN多策略及真实机器人成功率提升。

cs.RO 🔴 高级 2026-05-25 24 次浏览
Sizhe Zhao Shengping Zhang Shuo Yang Weiyu Zhao Shuigen Wang Xiangyang Ji
机器人操作 推理时采样 Action-VAE 任务进度验证 通用策略

核心发现

方法论

TapSampling是与策略无关的推理时框架。Action-VAE将策略生成的动作块编码为低维高斯后验,混合多个后验后采样并解码候选动作;Verifier则以视觉、指令和候选动作预测任务进度变化。它利用专家轨迹的时间顺序自动构造正负样本,并用L1损失训练,从而筛除负进度动作,再按进度分数加权融合候选。

关键结果

  • 在CALVIN ABC→D上,Diffusion Policy平均成功长度由2.41升至2.58,OpenVLA由3.30升至3.51,VPP由4.39升至4.46;OpenVLA五步任务成功率提升1.1–6.4个百分点。
  • 在LIBERO-Long上,π0.5平均成功率由96.8%升至98.0%。真实Franka Research 3实验中,π0平均成功率由78.3%升至83.3%,未见任务成功率也提升。
  • Action-VAE采样约比重复策略采样快5倍;16个候选时,TapSampling验证约比RoboMonkey快12倍,原因是视觉骨干只运行一次并批量评估动作。

研究意义

论文把扩大训练规模之外的计算资源分配引入机器人控制:部署时增加候选搜索与验证,而无需微调原策略。这缓解了扩散模型和自回归策略在相同观测下因随机性导致的成功/失败波动。更重要的是,验证分数具有任务进度语义,便于诊断和解释;该框架还能跨越Diffusion Policy、OpenVLA、VPP与π0.5等不同架构。

技术贡献

核心技术包括相关性保持的Action-VAE后验采样,以及动作条件的Task-Progress Verifier。与独立高斯采样不同,混合后验保留动作块维度间结构;与只评价当前状态的价值模型不同,Verifier直接估计候选动作造成的未来进度变化。其VLA-Adapter骨干基于Qwen2.5-0.5B,隐藏状态共享后由轻量动作头并行回归分数。

新颖性

新颖之处不只是多次采样,而是将候选生成与可解释验证结合为即插即用系统。论文用轨迹内在时序构造正样本和反转动作负样本,无需人工偏好标注或额外数据合成;同时用学习到的后验替代昂贵的策略重复调用,在效率、分布一致性和可解释性之间取得平衡。

局限性

  • 任务进度线性假设p_i=i/t,且反转动作被视为负样本;对非单调任务、可恢复失败或多阶段分支行为,这种标签可能不准确。
  • 候选质量仍受初始策略样本限制;Verifier也依赖视觉理解和训练环境分布,面对遮挡、长时序因果或新物体可能误判。
  • 加大候选数会增加验证开销,动作加权平均未必适合强接触、离散或多模态控制。

未来方向

未来可学习非线性、阶段感知的进度标签,加入真实失败轨迹和不确定性估计,并研究自适应候选数量。进一步方向包括长时域闭环搜索、动作序列级验证、跨机器人和跨环境迁移,以及将Verifier与安全约束、模型预测控制或强化学习结合。

AI 总览摘要

机器人策略正在通过更大模型和更多数据获得能力,但扩散策略与自回归策略的随机性仍使同一场景产生不同结果。传统单次推理一旦采到坏动作,系统通常只能执行它,缺少部署时纠错机制。TapSampling把推理计算视为新的性能杠杆。

框架包含两个环节。Action-VAE先把少量策略动作压缩为低维后验混合分布,再快速采样并解码多个候选动作;任务进度验证器则结合图像、语言和候选动作,预测其对任务完成度的影响。训练标签直接来自专家轨迹:正向动作带来正进度,反转动作被构造成负进度。部署时,低于阈值的候选被丢弃,其余动作按进度分数加权选择。

结果显示,CALVIN ABC→D中Diffusion Policy、OpenVLA和VPP的平均成功长度分别提升至2.58、3.51和4.46;LIBERO-Long中π0.5由96.8%升至98.0%。真实Franka Research 3任务平均成功率由78.3%升至83.3%。Action-VAE约快于策略重复采样5倍,16候选时验证约快于RoboMonkey 12倍。局限在于线性进度假设、候选分布依赖初始策略,以及复杂接触任务中的动作融合风险。

深度分析

研究背景

视觉语言模型、视频扩散模型和动作专家推动了通用机器人策略发展。代表方法包括Diffusion Policy、OpenVLA、VPP和π0.5;它们分别采用扩散、下一词预测、视频特征或流匹配生成动作。然而,非确定性推理造成部署波动。语言模型可用自洽采样,图像生成可用评分器,但低层机器人动作缺少通用、可解释的评估器。

核心问题

给定状态s、指令l和策略π,需要从多个动作候选中选择最可能推进任务的动作。直接重复调用π会线性增加延迟;独立高斯采样忽略动作块的维度相关性;仅依据当前状态的价值函数无法判断某个具体低层动作的后果。因此难点是同时获得真实分布附近的候选、可靠的动作级评分和可接受的实时开销。

核心创新

第一,Action-VAE学习动作块的低维后验,并用少量策略样本构成混合分布,支持任意数量候选。第二,Task-Progress Verifier将动作选择转化为进度变化回归,分数具有“阻碍、稳定或加速”的明确含义。第三,框架策略无关,不修改Diffusion Policy、OpenVLA或VPP;共享视觉骨干后批量验证,兼顾可解释性与效率。

方法详解

  • �� 训练Action-VAE:编码器输出q_E(z|a)=N(μ_E(a),diag(σ_E²(a))),采样z并由解码器重构â;优化L_VAE=L_rec+λ_KL L_KL。
  • �� 推理采样:从π(a|s,l)获得N个动作,计算q_mix(z|Aπ)=1/N∑q_E(z|a_i),再采样M个z并解码为候选。
  • �� 构造标签:轨迹长度t时令p_i=i/t;正样本(a_i…a_{i+k−1})标签k/t,反转序列标签−k/t。
  • �� 训练验证器:VLA-Adapter使用Qwen2.5-0.5B,动作头回归Δp,损失L_tap=|V(s,l,a)−Δp|_1。
  • �� 选择动作:删除低于阈值候选,对剩余候选按分数加权平均;共享骨干隐状态并行计算。

实验设计

实验覆盖CALVIN ABC→D、LIBERO-Long及真实7自由度Franka Research 3。基线包括Diffusion Policy、OpenVLA、VPP和π0.5;指标为任务成功率、CALVIN平均成功长度、采样/验证延迟。真实任务包括Knock Down、Pick and Place和Stack,使用第三视角与腕部相机;每类收集100条成功示范微调π0与TapSampling。论文还比较Policy Sampling、Gaussian Sampling和Learned Posterior Sampling,并评估不同候选数量。

结果分析

CALVIN中,Diffusion Policy平均长度2.41→2.58,OpenVLA 3.30→3.51,VPP 4.39→4.46;OpenVLA五步成功率42.4%→48.8%。LIBERO-Long的π0.5为96.8%→98.0%。真实实验中平均78.3%→83.3%,其中未见Stack为75.0%→85.0%。Action-VAE约快5倍;16样本验证相对RoboMonkey约12倍。

应用场景

该方法适合已有随机通用策略的部署后增强:仓储抓取、整理、放置、堆叠和家庭机器人操作。使用者无需重新训练主策略,只需训练或加载动作VAE与验证器,并提供视觉、语言和动作块接口。对延迟敏感场景,可用少量初始策略样本和中等候选数;对高风险操作,可利用负进度阈值进行安全过滤。

局限与展望

线性进度标签依赖专家轨迹长度,不能完全表达回退、等待或并行子任务。反转动作并不总是物理上真正有害;接触动力学、离散抓取状态和多模态动作也可能使加权平均产生无效动作。虽然Action-VAE降低采样成本,候选验证仍随数量增加而耗时。后续应引入阶段性价值、不确定性、失败数据和动作序列级规划。

通俗解读 非专业人士也能看懂

把机器人想成餐厅厨房。普通策略像一名厨师:看到订单后只做一道菜,虽然大多时候不错,但偶尔会把盐放多或摆错盘。TapSampling让厨师先快速做出几份可能的菜。Action-VAE像一个熟悉厨房规律的备料师:它不会随意混合食材,而是学习哪些食材通常一起出现,因此能快速做出合理的不同版本。

接着,任务进度验证器像一位领班。他同时看订单、当前餐台和每道候选菜,判断哪道会让服务更接近完成。负分表示这道菜可能添乱,小正分表示稳妥,大正分表示可能更快完成。系统丢掉明显糟糕的方案,再综合剩余方案行动。这样机器人不是盲目执行第一次想法,而是先比较再决定。

它的价值在于不必重训整名厨师。无论原策略像扩散模型还是逐字生成模型,都可以接入这个“备选方案加领班检查”流程。但如果原厨师从一开始就不会做某类菜,备料师也无法凭空创造能力;复杂菜品还可能不能简单平均组合。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人闯关游戏。机器人看到“把红方块放进盒子”,控制程序通常只试一次动作。因为程序里有随机性,同样的画面有时成功、有时失败,就像游戏角色每次投骰子决定走法。

TapSampling像给机器人几次试跑机会。Action-VAE先学习高手以前怎样移动手臂,再根据少量原始方案快速生成更多合理方案。它不是乱猜,而是记住“手臂往左时,夹爪和高度通常怎样配合”。

然后验证器像游戏里的进度条裁判:它观察画面、任务要求和每个动作,预测这个动作会让任务前进多少。负数代表倒退,小正数代表安全,大正数代表可能更快。机器人删除坏方案,把较好的方案综合起来执行。

实验中,这招让CALVIN上的OpenVLA平均完成长度从3.30变成3.51,LIBERO-Long上的π0.5从96.8%变成98.0%,真实机械臂平均成功率从78.3%升到83.3%。不过它仍然依赖原程序能提出至少一些好主意;如果任务很复杂,简单混合动作也可能出错。

术语表

Action-VAE(动作变分自编码器)

将动作压缩到低维随机空间,再从中重构动作的模型。它用重构损失和KL正则学习动作分布。

论文用它构造快速、相关性更好的候选动作。

Task-Progress Verifier(任务进度验证器)

预测某个候选动作对任务完成度的影响。输出正负进度变化,而非无明确含义的偏好分数。

用于过滤和加权选择动作。

Action Chunk(动作块)

连续多个控制时刻组成的一段动作序列。动作块中的维度和时间通常存在相关性。

Action-VAE对整段动作块建模。

CALVIN ABC→D

语言条件、长时域机器人操作基准;在A、B、C环境训练并在未见D环境测试。平均成功长度衡量连续完成任务数。

用于零样本泛化评估。

LIBERO-Long

评估长期机器人决策与操作的基准套件。它包含更具挑战性的长程任务。

用于测试π0.5的成功率。

开放问题 这项研究留下的未解疑问

  • 1 进度标签是否应从线性时间改为真实因果进展?非单调任务中,回退、等待和可恢复错误需要更丰富的监督信号。
  • 2 Verifier在跨机器人、跨摄像机和未见物体上的校准能力仍不清楚;需要大规模失败轨迹、不确定性评估和系统性分布外测试。
  • 3 动作加权平均适合连续控制,但对离散抓取或接触动作可能失效;候选选择与安全约束如何联合仍待研究。

应用场景

近期应用

仓储抓取与放置

已有OpenVLA、Diffusion Policy或VPP的团队可在不微调主策略的情况下接入Action-VAE和Verifier。系统可过滤会导致碰撞或放置偏移的候选,适合视觉引导的分拣、装箱和货架整理。

家庭机器人整理

机器人可为同一指令生成多个抓取与摆放方案,再依据预期任务进度选择。部署前需准备专家轨迹、视觉输入和动作接口;论文结果表明该流程能改善未见任务的稳定性。

远期愿景

可解释的通用机器人控制

未来可把进度分数、安全风险和不确定性统一为部署控制面板,使机器人在执行前说明某动作会推进还是阻碍任务,并在高风险场景主动请求人类确认。

原文摘要

Existing embodied control research demonstrates remarkable performance improvements by scaling training data and model size. We instead explore inference-time strategy as an alternative axis. Non-deterministic generative models, such as diffusion and autoregressive models, have been widely adopted in the field of embodied control. However, the single-shot inference paradigm limits their performance. In this paper, we propose \textbf{TapSampling}, a plug-and-play framework for inference-time sampling. First, we introduce an Action-VAE that represents actions in a low-dimensional latent space by mapping policy-generated initial actions into a compressed posterior distribution, from which any number of latent samples can be drawn and decoded into candidate actions that approximate the true action distribution. Second, we formulate action verification as task-progress outcome prediction, using the intrinsic sequential structure of robotic datasets to train a semantically grounded verifier for interpretable action selection. Furthermore, TapSampling is a policy-agnostic framework. Extensive experiments in both simulated and real-world environments demonstrate that our method substantially improves multiple generalist policies without further policy finetuning. Code and models are available at the project page.

cs.RO cs.CV