Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models

TL;DR

PDF以不确定性增强和延迟反馈调节VLA,LIBERO提升约7.4%,Atari达1.07 HNS。

cs.CV 🔴 高级 2026-04-20 20 次浏览
Zehua Zang Xi Wang Fuchun Sun Xiao Xu Lixiang Lium Jiahuan Zhou Jiangmeng Li
视觉语言动作模型 测试时自适应 轨迹过拟合 延迟反馈 机器人控制

核心发现

方法论

PDF是无需验证器、冻结基础VLA参数的测试时自适应框架。它用归一化动作熵估计不确定性,按预算生成增强视图并进行动作投票;同时训练轻量Perturbation Head,以环境延迟奖励通过REINFORCE式目标和正反馈门控KL正则修正动作logits。

关键结果

  • 在LIBERO的Spatial、Object、Goal、Long四套任务上,PDF平均成功率为0.77,平均排名2.5;相较复现OpenVLA的0.69平均值提高约8个百分点,并在Long任务达0.59,超过最佳基线约4.1个百分点。
  • 在Atari-57上,PDF获得1.07 HNS,Jat基线为0.97;57个游戏中47个提升,平均每游戏改善11.28%,BOXING提升约60.25个百分点,但BATTLE ZONE下降10.72个百分点。
  • 消融显示延迟反馈不可或缺:去除DF后Object和Goal分别降至0.50与0.77;最大增强预算设为3通常最优,过多视图会因噪声累积损害性能。

研究意义

论文指出,VLA失败不只是感知错误,还源于把动作与物体、背景或轨迹外观的偶然关系当作任务依据。PDF利用真实环境的延迟结果而非额外验证器或基础模型微调,提升了跨视觉扰动和长时序任务的可靠性,为低成本、在线、可部署的具身智能适应提供了路径。

技术贡献

技术上,PDF将不确定性驱动的多视图增强、维度级动作投票和延迟反馈logit扰动结合起来。核心形式为Ut=−Σp(ak|sk)logp(ak|sk)/logK、Nt=NmaxUt,以及最终logit z~=hϕ(f)+λhθ(f)。损失以−(r−b)logπϕ为奖励导向项,并在r>b时加入KL(πϕ||π~),仅更新约9M参数的P head。

新颖性

相较熵最小化可能强化错误高置信度、以及依赖验证器的best-of-N方法,PDF首次在本文设定中把自适应增强投票与延迟奖励引导的轻量logit学习统一起来。其关键不是改写基础策略,而是以冻结模型为主体、以环境结果校正过度自信。

局限性

  • 论文仅在LIBERO仿真和Atari-57评测,尚未证明真实机器人、传感器噪声或动力学变化下的安全性与稳定性。
  • 延迟反馈仍依赖可获得的回合级成功或奖励;反馈稀疏、错误或极长时可能导致更新缓慢,且增强视图过多会增加推理成本并积累噪声。

未来方向

未来可研究真实机器人和更复杂动力学中的安全更新、反馈信用分配与自动预算策略;还应改进奖励稀疏场景下的校准机制,比较不同基础VLA、增强类型和在线稳定性,并建立更系统的计算—性能理论分析。

AI 总览摘要

视觉语言动作模型把图像、指令和控制统一起来,已能完成机器人操作与游戏决策,但对物体姿态等细微变化仍很脆弱。论文将此归因于“轨迹过拟合”:模型记住与成功轨迹同时出现的背景、外观和动作模式,即使目标被遮挡也可能重复原动作。传统测试时自适应若依赖熵最小化,反而可能放大错误的高置信度预测;验证器式方法又需要额外训练和多次 rollout。

作者提出Perturbation learning with Delayed Feedback(PDF)。每一步先用动作分布的归一化香农熵衡量不确定性,再按Nt=NmaxUt决定增强视图数量;原图和增强图共同推理,通过维度级动作投票降低偶然相关。与此同时,轻量P head产生logit扰动,回合结束后依据成功、失败或累计奖励,以REINFORCE式目标和正反馈门控KL项更新;视觉编码器、Transformer和LM head全部冻结。

实验覆盖OpenVLA上的LIBERO四套任务及Jat上的Atari-57。LIBERO平均成功率达0.77,Long为0.59;Atari达1.07 HNS,相比Jat的0.97提高0.10,47/57游戏改善,BOXING提升60.25个百分点。消融显示DF尤其关键,Object去除DF后仅0.50;预算超过3后性能普遍下降。PDF以约9M可训练参数和无需基础模型梯度的方式,展示了低成本在线适应潜力,但真实机器人安全性、反馈稀疏性和计算开销仍待验证。

深度分析

研究背景

VLA沿着VLM、Gato、RT-1/RT-2和OpenVLA发展,将视觉理解、语言指令与动作预测统一。OpenVLA已在LIBERO等机器人任务上表现强劲,Jat则把Gato式能力用于Atari控制。然而,预训练模型常把背景、夹爪外观和空间位置等线索与动作绑定,面对轻微姿态变化便失效。测试时自适应因此成为连接离线训练与开放环境部署的重要方向。

核心问题

问题是:在没有动作验证器、标签或基础模型微调的条件下,如何纠正错误且过度自信的序列决策?熵最小化假设高置信度等于正确,但轨迹过拟合时该假设失效;多视图采样虽能增加鲁棒性,却带来推理成本和低质量视图。回合奖励又通常延迟,难以直接归因到单步动作。

核心创新

  • ��不确定性预算:用归一化动作熵动态决定增强数量,而非固定采样。•动作投票:对动作维度进行跨视图多数表决,允许局部偏离记忆轨迹。•延迟反馈适应:P head只改logit,不更新基础VLA;正反馈推动成功方向,门控KL抑制不稳定漂移。•统一机制:DA缓解输入相关性,DF利用结果反馈修正过度自信。

方法详解

  • ��输入:状态st=(ot,ct),视觉图像与文本指令经编码形成多模态特征ft。•估计:由LM head输出zt,计算Ut=−Σkp(ak|sk)logp(ak|sk)/logK。•增强:设置Nt=NmaxUt,编码原图及Tj(ot)视图。•扰动:计算z~=hϕ(ft)+λhθ(ft),解码候选动作。•选择:用维度级多数投票得到at,并把特征、logit和反馈存入rollout buffer。•更新:回合结束采样批次,以LPDF=−(r−b)logπϕ+λKLI[r>b]KL(πϕ||π~)训练P head;其余参数冻结。

实验设计

LIBERO使用Franka Panda RGB观测、状态、文本和末端执行器增量动作,包含Spatial、Object、Goal、Long四个10任务套件,每任务50次评测;基础OpenVLA训练50回合。Atari使用全部57款Atari 2600游戏,每款50回合,指标为HNS,基础模型为Jat。比较OpenVLA、OCTO、TraceVLA、SFT-4LIBERO、MG-Select等,并开展DA、DF、预算0—4、KL和REINFORCE项及投票方式消融。

结果分析

PDF在LIBERO平均0.77 SR、平均排名2.5,Spatial为0.90、Goal为0.86、Long为0.59;在Atari为1.07 HNS,Jat为0.97。47/57游戏提升,BOXING、TIME PILOT分别约+0.60、+0.53。去除DF后Object仅0.50、Goal为0.77;去除DA仍多任务优于OpenVLA,但完整PDF最稳定。预算最多3优于更激进采样。

应用场景

PDF适合机器人抓取、放置、整理等需要连续视觉决策的场景,也适合游戏代理和其他有回合级奖励的多模态控制系统。部署前提是能获得图像、文本和延迟任务反馈,并允许少量额外视图推理;其冻结基础模型、约9M可训练参数的设计有利于边缘设备和已有VLA系统插件式接入。

局限与展望

当前证据主要来自仿真LIBERO与Atari,不能直接代表真实机器人中的遮挡、延迟、碰撞和安全约束。增强预算仍需经验设定,过多视图会造成噪声与成本;延迟奖励也可能难以完成单步信用分配。未来需要真实硬件验证、风险约束更新、更强的反馈建模、自动预算和跨模型泛化实验。

通俗解读 非专业人士也能看懂

把VLA想成一名只看过很多厨房录像的厨师。它看到碗、盘子和桌面,就容易照搬录像中的手部路线,即使碗换了位置,甚至碗被挡住,也可能继续做旧动作。PDF先问:这次判断有多犹豫?越犹豫,就从不同角度拍几张“变形照片”,再让多个小厨师分别决定手该怎么动,按每个动作部件的多数意见执行。

做完一整道菜后,厨师才知道结果好不好,这就是延迟反馈。如果成功,PDF稍微加强当时的动作倾向;如果失败,就不盲目强化。它只调整一个很小的“纠偏旋钮”,不重写整本菜谱,因此省计算、改得稳。实验中,机器人任务成功率平均达到0.77,Atari分数从0.97升到1.07。

但照片不是越多越好:最多约3个变体通常最合适,太多会把噪声也当成建议。这个方法仍需在真实厨房般复杂的环境中验证。

简单解释 像给14岁少年讲一样

想象一个打游戏的机器人同学。它以前看过很多通关录像,所以看到相似的画面,就像背答案一样重复老路线。问题是,箱子稍微挪了位置,它仍可能冲向原来的地方;目标被挡住,它甚至还继续做同样动作。论文把这种“只记路线、不看真正目标”的问题叫轨迹过拟合。

PDF像给它安排了几个小队友:先看它有多没把握,没把握时就把画面做一点小变化,让大家各自判断;然后按多数票决定每个动作方向。完成一局后,游戏才告诉它赢没赢。赢了就加强相关动作,输了就别继续迷信它。它只训练一个小模块,基础大脑不动。

结果很酷:在LIBERO机器人任务上平均成功率0.77,在Atari-57上从0.97提高到1.07,57个游戏有47个变好。不过,队友太多也会添乱,所以增强数量最多设为3更好。

术语表

Vision-Language-Action Model(视觉语言动作模型)

把图像、文字指令和可执行动作放进同一决策系统。它根据当前视觉与语言上下文预测下一步控制。

论文以OpenVLA和Jat作为基础VLA。

Test-Time Adaptation(测试时自适应)

模型部署后利用未标注样本或环境反馈调整推理行为,而不是重新完整训练。

PDF在测试期间更新P head,基础VLA保持冻结。

Trajectory Overfitting(轨迹过拟合)

模型记住训练轨迹中的偶然外观—动作关系,而没有真正理解目标。环境轻微变化时便重复错误路线。

论文用遮挡目标和注意力图展示该现象。

Uncertainty-Based Action Voting(基于不确定性的动作投票)

用预测熵衡量犹豫程度,并据此分配增强视图,再以多数意见选择动作。

预算公式为Nt=NmaxUt。

Delayed Feedback(延迟反馈)

动作执行后,环境在回合结束才返回成功、失败或奖励。它提供整体结果而非即时标签。

反馈用于训练Perturbation Head。

KL Divergence(KL散度)

衡量两个概率分布差异的函数,可约束新策略不要偏离原策略过远。

仅当r>b时加入KL正则以稳定更新。

开放问题 这项研究留下的未解疑问

  • 1 真实机器人中的安全性仍未知:PDF是否能在碰撞风险、传感器噪声和动力学变化下稳定更新,需要硬件实验与风险约束。
  • 2 延迟奖励的单步信用分配仍较粗糙;更密集、可靠且不依赖验证器的反馈建模,是提升长时序任务的关键。

应用场景

近期应用

机器人抓取与整理

已有OpenVLA类系统可冻结主模型并接入约9M参数的P head。通过相机视图增强、维度级投票和回合成功反馈,降低物体位置变化造成的失败。

视觉控制游戏代理

在Atari等具有回合奖励的环境中,PDF可作为Jat式代理的插件。它不需要基础模型梯度,适合测试时在线修正错误高置信度动作。

远期愿景

可靠的通用具身智能

若扩展到真实机器人、稀疏奖励和安全约束,PDF式轻量适应可让通用VLA在新环境中持续校准,而无需频繁回实验室微调。

原文摘要

Vision-Language-Action models (VLAs) achieve remarkable performance in sequential decision-making but remain fragile to subtle environmental shifts, such as small changes in object pose. We attribute this brittleness to trajectory overfitting, where VLAs over-attend to the spurious correlation between actions and entities, then reproduce memorized action patterns. We propose Perturbation learning with Delayed Feedback (PDF), a verifier-free test-time adaptation framework that improves decision performance without fine-tuning the base model. PDF mitigates the spurious correlation through uncertainty-based data augmentation and action voting, while an adaptive scheduler allocates augmentation budgets to balance performance and efficiency. To further improve stability, PDF learns a lightweight perturbation module that retrospectively adjusts action logits guided by delayed feedback, correcting overconfidence issue. Experiments on LIBERO (+7.4\% success rate) and Atari (+10.3 human normalized score) demonstrate consistent gains of PDF in task success over vanilla VLA and VLA with test-time adaptation, establishing a practical path toward reliable test-time adaptation in multimodal decision-making agents. The code is available at \href{https://github.com/zhoujiahuan1991/CVPR2026-PDF}{https://github.com/zhoujiahuan1991/CVPR2026-PDF}.

cs.CV