核心发现
方法论
VLA-OPD框架结合了离线监督微调(SFT)的高效性和在线强化学习(RL)的鲁棒性。通过反向KL目标函数,学生模型在自生成轨迹上接收教师模型的密集监督,避免了前向KL的熵爆炸问题,同时保持动作多样性。
关键结果
- 在LIBERO基准上,VLA-OPD仅用10步训练就达到了90%以上的成功率,比GRPO快3倍。
- 在RoboTwin2.0任务中,VLA-OPD在1,000-traj初始化下实现了比GRPO高出15%的成功率。
- 消融实验表明,反向KL目标显著减少了熵爆炸和熵崩塌问题,提升了模型稳定性。
研究意义
该研究解决了SFT的分布偏移问题和RL的样本低效问题,为视觉-语言-动作模型的后训练提供了一种高效且鲁棒的统一框架。它显著降低了训练成本,同时保留了预训练模型的通用能力。
技术贡献
提出了反向KL蒸馏目标,避免了前向KL的模式覆盖问题和硬交叉熵的熵崩塌问题。通过结合密集监督和在线采样,VLA-OPD实现了主动误差修正和灾难性遗忘的缓解。
新颖性
首次将反向KL蒸馏应用于视觉-语言-动作模型的后训练,提出了模式寻求优化策略,有效解决了传统方法的分布偏移和样本低效问题。
局限性
- 需要高质量的教师模型作为先验,可能限制了方法的通用性。
- 在复杂环境中,教师模型的高熵分布可能导致监督信号的噪声。
- 当前实验主要集中于单一任务,缺乏跨任务验证。
未来方向
未来可探索更高效的教师模型生成方法,以及在多任务和多模态环境中的扩展应用。
AI 总览摘要
视觉-语言-动作(VLA)模型在机器人操作中表现出色,但其后训练仍面临挑战。传统的离线监督微调(SFT)容易因分布偏移和灾难性遗忘而失效,而在线强化学习(RL)则因稀疏奖励和样本低效而难以优化。
VLA-OPD框架通过反向KL蒸馏结合了SFT和RL的优势。学生模型在自生成轨迹上接收教师模型的密集监督,从而实现主动误差修正,同时避免了前向KL的熵爆炸问题。实验表明,VLA-OPD在LIBERO和RoboTwin2.0基准上显著提升了样本效率和鲁棒性。
尽管该方法依赖于高质量教师模型,但其在降低训练成本和保留预训练能力方面的表现为视觉-语言-动作模型的持续发展提供了新的可能性。未来研究可探索其在多任务环境中的应用。
深度分析
研究背景
视觉-语言-动作(VLA)模型通过整合视觉感知、语言理解和动作控制,推动了机器人智能的发展。现有方法如SFT和RL在后训练中各有优劣:SFT优化稳定但易受分布偏移影响,而RL通过环境交互提升鲁棒性,但样本效率低。
核心问题
如何在后训练中同时解决SFT的分布偏移和RL的样本低效问题是一个关键挑战。传统方法如DAGGER和GRPO在优化目标上存在局限,难以平衡模式覆盖和动作多样性。
核心创新
VLA-OPD的核心创新包括:
- �� 反向KL目标:避免前向KL的熵爆炸问题,促进模式寻求。
- �� 密集监督:通过教师模型在学生轨迹上的密集标注实现主动误差修正。
- �� 动态采样:学生模型从自身分布中采样,缓解分布偏移。
方法详解
VLA-OPD包括以下步骤:
- �� 学生采样:学生模型与环境交互生成轨迹。
- �� 教师标注:冻结的教师模型为每个状态提供动作分布。
- �� 模式寻求优化:通过反向KL目标最小化学生与教师分布的差异。
实验设计
实验在LIBERO和RoboTwin2.0基准上进行,分别评估单臂和双臂操作任务。学生模型初始化自1-traj或1,000-traj SFT,教师模型为SimpleVLA-RL。对比基线包括GRPO和全数据SFT。
结果分析
VLA-OPD在LIBERO任务中实现了87.4%的平均成功率,比1-traj SFT提升了近40%。在RoboTwin2.0任务中,VLA-OPD比GRPO快3倍收敛,并在复杂任务上表现更鲁棒。
应用场景
该方法适用于机器人操作任务中的后训练,尤其是数据稀缺或任务复杂的场景,如工业自动化和家庭服务机器人。
局限与展望
VLA-OPD依赖于高质量教师模型,可能在教师模型不可靠时表现受限。此外,其在多任务环境中的泛化能力尚待验证。
通俗解读 非专业人士也能看懂
想象你在学习骑自行车。传统方法是看别人骑(SFT),但你可能在实际骑行中摔倒,因为你没学会如何纠正错误。另一种方法是自己练习,但没有人告诉你哪里做得对(RL)。VLA-OPD就像一个经验丰富的教练,他不仅告诉你正确的动作,还在你摔倒时及时纠正你的姿势。这样,你既能快速学会,也能避免反复摔倒。
简单解释 像给14岁少年讲一样
想象你在玩一个机器人游戏。你有一个超级厉害的AI队友(老师),但你自己操作的机器人老是出错。VLA-OPD就像让这个AI队友教你怎么操作,每次你出错时,它都会告诉你正确的动作。这样,你的机器人很快就能变得和AI一样厉害!
术语表
反向KL (Reverse-KL)
一种优化目标,鼓励学生模型专注于教师模型的高概率动作。
用于学生模型的模式寻求优化。
SFT (监督微调)
通过专家演示数据训练模型的方法。
作为VLA-OPD的初始化步骤。
RL (强化学习)
通过环境交互优化策略的学习方法。
与VLA-OPD对比的基线方法。
LIBERO
一个用于评估单臂操作任务的基准数据集。
用于评估VLA-OPD的样本效率。
RoboTwin2.0
一个双臂机器人操作任务的基准数据集。
用于测试VLA-OPD在复杂任务中的表现。
开放问题 这项研究留下的未解疑问
- 1 如何在没有高质量教师模型的情况下实现类似的蒸馏效果?
- 2 VLA-OPD在多任务和多模态环境中的泛化能力如何?
应用场景
近期应用
机器人操作优化
在工业自动化中快速优化机器人操作策略,减少训练时间。
家庭服务机器人
提升家庭服务机器人在稀疏数据环境下的学习能力。
远期愿景
通用机器人智能
实现跨任务、跨环境的通用机器人智能,降低开发成本。
原文摘要
Although pre-trained Vision-Language-Action (VLA) models exhibit impressive generalization in robotic manipulation, post-training remains crucial to ensure reliable performance during deployment. However, standard offline Supervised Fine-Tuning (SFT) suffers from distribution shifts and catastrophic forgetting of pre-trained capabilities, while online Reinforcement Learning (RL) struggles with sparse rewards and poor sample efficiency. In this paper, we propose On-Policy VLA Distillation (VLA-OPD), a framework bridging the efficiency of SFT with the robustness of RL. Instead of relying on sparse environmental rewards, VLA-OPD leverages an expert teacher to provide dense, token-level supervision on the student's self-generated trajectories. This enables active error correction on policy-induced states while preserving pre-trained general capabilities through gentle alignment. Crucially, we formulate VLA-OPD via a Reverse-KL objective. Unlike standard Forward-KL that induces mode-covering entropy explosion, or Hard-CE that causes premature entropy collapse, our bounded mode-seeking objective ensures stable policy learning by filtering out the teacher's epistemic uncertainty while maintaining action diversity. Experiments on LIBERO and RoboTwin2.0 benchmarks demonstrate that VLA-OPD significantly improves sample efficiency over RL and robustness over SFT, while effectively mitigating catastrophic forgetting during post-training.