核心发现
方法论
论文提出iRe-VLA,将在线强化学习与监督学习交替执行。Stage 0以专家数据训练VLA;Stage 1冻结BLIP-2 3B视觉语言模型,仅用PPO式RL更新轻量动作头;Stage 2把成功轨迹加入数据集,与专家数据共同用MSE训练全模型,并通过LoRA高效更新VLM。
关键结果
- MetaWorld中,iRe-VLA在Button-Press、Drawer-Open、Door-Open、Window-Open、Window-Close新任务上的成功率分别为1.00、0.84、0.84、0.80、0.96;10个未见任务平均为0.80,明显高于SFT的0.28与PPO-Replay的0.36。
- Franka-Kitchen中,iRe-VLA在Knob-on、Light-on、Microwave-open、Slide-door-open、Left-door-open上的成功率为0.90、0.98、0.82、0.99、0.83;左门任务由SFT的0.43升至0.83。
- 真实Panda实验使用2,000条示范;结合SACfD、20条成功演示和50%示范/50%在线采样后,eggplant/carrot抓取成功率由0.35升至0.80,未见物体由0.37升至0.61。
研究意义
该工作把大模型微调中的“探索—模仿”思想引入低层机器人控制,回应了专家数据昂贵、环境分布偏移和稀疏奖励难探索等长期问题。它显示机器人可以从少量成功交互中扩展技能,同时保留VLA的常识与视觉泛化能力。对工业部署而言,冻结大模型降低了本地训练门槛;对学术研究而言,论文提供了连接SFT、在线RL和真实操控的可复用范式。
技术贡献
核心贡献是参数分工与数据闭环:在线RL只优化动作头ϕ,避免噪声梯度破坏VLM表征;随后用De∪DRL上的监督目标恢复并扩展整个策略。VLA由BLIP-2 3B、Token Learner和MLP动作头构成,并以LoRA训练VLM。真实系统还在缓存的VLM latent上运行SACfD,每张图只编码一次,兼顾控制频率、样本效率和算力成本。
新颖性
与RLHF主要在离线、短时域、偏好奖励环境中优化语言模型不同,本文直接优化低层动作策略,面对数百至数千步、稀疏二值奖励和未知动力学。其新颖点不是提出全新RL损失,而是以“冻结VLM的在线探索+全模型成功轨迹模仿”的迭代结构稳定大VLA训练,并支持本地—云端计算分工。
局限性
- 在稀疏奖励下,方法主要扩展已有技能类型;作者指出它难以从零学习完全陌生的技能。
- 真实实验规模有限,任务集中于抓取、放置、按键、绕线和抽屉操作,长期安全性与跨机器人迁移仍未验证。
- Stage 2仍需远程大算力;实验中RL用单张RTX 4090,而监督阶段使用4张A100。
未来方向
未来应研究更有效的稀疏奖励探索、层级技能发现和安全约束RL,使模型能学习全新动作组合。还可比较更多VLA骨干、离线数据比例和LoRA配置,建立跨机器人、跨场景长期评测,并优化云端更新与实时控制之间的通信延迟。
AI 总览摘要
视觉语言模型已经能够理解“拿起红色方块”这类指令,并输出机器人低层动作,但传统监督微调依赖昂贵专家示范,也难覆盖真实环境中的变化。直接把标准在线强化学习用于数十亿参数的VLA,往往因稀疏奖励、长时域和噪声梯度而训练崩溃;MetaWorld中五个任务有四个出现性能下降。
Guo等人提出iRe-VLA,采取交替式方案:先用在线RL探索,再把成功轨迹当作新示范进行监督学习。RL阶段冻结BLIP-2 3B,仅训练轻量动作头;监督阶段则用原专家集与在线成功数据联合训练VLA,并借助LoRA更新大模型。它像先让机器人尝试,再让它系统复盘,而不是每次失败都直接改写“大脑”。
结果显示,该方法同时提升已见、新学和未见任务。MetaWorld未见任务平均成功率达到0.80,SFT和PPO-Replay分别为0.28和0.36;Franka-Kitchen左门开启从0.43升至0.83。真实Panda抓取eggplant/carrot从0.35升至0.80,未见物体从0.37升至0.61。局限是稀疏奖励下仍难产生全新技能,且全模型更新需要云端算力。总体而言,iRe-VLA提供了一个更稳定、可部署的VLA持续学习路径。
深度分析
研究背景
RT-1、RT-2、RoboFlamingo和HiRT证明,VLM的视觉知识与语言推理可迁移到低层控制。现有主流流程是用专家机器人数据SFT,但数据昂贵且存在真实环境分布偏移。RLHF主要处理离线偏好和短时域语言生成,不能直接解决机器人长时域、未知动力学和稀疏奖励问题。
核心问题
目标是在不破坏VLA既有能力的情况下,通过环境交互提升新任务与泛化性能。难点包括:二值成功奖励导致探索信号极弱;动作序列可达数百或数千步;大Transformer对RL梯度敏感;完整微调数十亿参数超出多数本地机器,并可能造成灾难性遗忘。
核心创新
- ��冻结式RL:Stage 1只训练动作头和critic,隔离高噪声RL梯度。•成功轨迹回流:将新任务成功片段加入DRL。•联合SFT:Stage 2在De∪DRL上优化全VLA,恢复能力并扩展表征。•工程优化:LoRA降低可训练参数,真实实验在缓存VLM latent上运行SACfD。
方法详解
- ��模型:输入图像o和指令l,BLIP-2 3B产生隐藏表示;Token Learner压缩token,MLP输出da维动作。•Stage 0:最小化J0=E||πθ,ϕ(o,l)-a||²。•Stage 1:初始化critic,冻结θ,仅按J1=E[ΣγᵗRₜ]更新ϕ,收集成功轨迹。•Stage 2:复制策略,在专家与在线数据上最小化J2=E||πθ,ϕ(o,l)-a||²。•重复上述循环,逐任务扩展能力。
实验设计
评测包括MetaWorld、Franka-Kitchen和真实Panda。MetaWorld专家集为25任务、每任务50条轨迹;Kitchen专家任务5个;真实系统收集2,000条遥操作与脚本示范。基线为SFT和PPO-Replay;真实RL使用SACfD、20条成功演示,采样比例为50%示范与50%在线数据,并进行iRe-VLA-freeze消融。
结果分析
MetaWorld中iRe-VLA五个RL任务成功率为1.00、0.84、0.84、0.80、0.96,未见任务平均0.80;PPO-Replay仅0.69、0.24、0.32、0.04、0.36。Kitchen未见变体最高达1.00。持续冻结VLM的消融性能下降,说明在线数据需要改善上层表征。真实抓取新物体由0.35升至0.80。
应用场景
该框架适用于仓储抓取、实验室自动化、家务机器人和柔性装配,尤其适合已有基础技能、但物体外观或位置不断变化的系统。部署前需要专家SFT模型、可判定成功的奖励、少量安全交互和动作头训练算力;成功轨迹可持续回流,减少重新标注。
局限与展望
方法依赖成功奖励和已有技能先验,完全陌生技能在稀疏奖励下仍难发现。真实实验任务与机器人种类有限,尚未证明跨平台迁移、安全约束和长期稳定性。虽然RL阶段可在单张4090上运行,但Stage 2使用4张A100,未来需更高效的端侧更新、风险敏感探索和层级技能学习。
通俗解读 非专业人士也能看懂
把VLA想成一位已经看过大量烹饪示范的厨师。专家数据先教会他基本菜式,这相当于监督学习。但新厨房里的锅、食材和摆放位置可能不同,照着旧菜谱未必成功。
iRe-VLA先让厨师自己尝试新菜。尝试时不重写他多年积累的全部知识,只调整“手部动作技巧”,因此不会因为几次失败就忘掉基本功。成功后,再把成功过程记录成新菜谱,让整位厨师学习。原有菜谱也保留在一起,防止遗忘。
这解释了实验结果:机器人不仅学会新任务,还保持旧任务能力,并能把学到的规律迁移到不同颜色、形状和物体。代价是,它需要明确知道什么叫成功,而且很难凭稀疏反馈凭空发明完全陌生的技能。
简单解释 像给14岁少年讲一样
想象你在玩一个机器人游戏。你已经通过很多教学关卡学会抓方块,但突然遇到茄子、胡萝卜或不同颜色的物体。直接修改整个“大脑”可能很危险:机器人也许学会新关卡,却把旧关卡忘光,甚至操作越来越差!
iRe-VLA的办法很聪明。第一阶段只改机器人的“手柄技巧”,让它在新关卡里反复试。成功一次,就把这次操作保存下来。第二阶段再让整个系统复习:既复习学校发的旧作业,也复习自己刚刚做对的新题。
它使用的VLA像一个能看图、读指令并控制手臂的超级模型。实验里,MetaWorld未见任务平均成功率达到0.80,而普通SFT只有0.28;现实中抓茄子和胡萝卜从0.35提高到0.80!
不过它不是魔法。若任务需要一种完全没学过的技能,而且成功提示很少,机器人仍可能不知道该怎么试。未来还要让它更会探索、更安全,并减少昂贵的服务器训练。
术语表
Vision-Language-Action, VLA(视觉-语言-动作模型)
把图像和文字指令转换为机器人动作的模型。它继承VLM知识,并增加动作输出模块。
本文研究的主体,由BLIP-2 3B与动作头组成。
Online Reinforcement Learning(在线强化学习)
智能体在环境中实时试错,根据奖励更新策略。与固定数据训练不同,它需要探索未知动力学。
用于学习专家数据未覆盖的新任务。
iRe-VLA(迭代强化学习框架)
交替执行冻结大模型的RL和全模型监督学习。成功轨迹会回流为新训练数据。
论文提出的核心方法。
SACfD(带演示的软演员-评论家)
将成功示范与在线经验结合的SAC变体,可提高真实机器人样本效率。
Panda实验中使用20条成功轨迹初始化缓冲区。
LoRA(低秩适配)
冻结原模型,仅学习低秩增量参数的参数高效微调方法。它降低显存和训练成本。
用于Stage 2更新VLM。
Catastrophic Forgetting(灾难性遗忘)
学习新任务后,模型在旧任务上的能力显著下降。联合旧专家数据可缓解该现象。
Stage 2使用De∪DRL进行保持。
开放问题 这项研究留下的未解疑问
- 1 如何在只有成功/失败信号时高效发现完全新技能仍未解决;需要层级探索、自动奖励塑形或更强的世界模型。
- 2 云端全模型更新与实时机器人控制之间的延迟、安全和通信成本尚缺系统评估。
应用场景
近期应用
仓储与实验室抓取
已有抓取基础模型的团队可用少量安全交互适配新颜色、形状和物体。通过成功检测收集轨迹,再按iRe-VLA循环训练,可降低重新遥操作标注成本。
柔性装配与家务操作
在按钮、抽屉、放置等技能已存在的前提下,机器人可针对新位置和外观在线改进。RL阶段可本地运行,较重的监督更新放在远程GPU服务器。
远期愿景
持续学习机器人
未来机器人可把每天成功完成的任务自动整理为经验库,逐步扩大可执行任务范围,同时保留历史技能。关键障碍是安全探索、失败恢复和跨平台迁移。
原文摘要
Recent studies have successfully integrated large vision-language models (VLMs) into low-level robotic control by supervised fine-tuning (SFT) with expert robotic datasets, resulting in what we term vision-language-action (VLA) models. Although the VLA models are powerful, how to improve these large models during interaction with environments remains an open question. In this paper, we explore how to further improve these VLA models via Reinforcement Learning (RL), a commonly used fine-tuning technique for large models. However, we find that directly applying online RL to large VLA models presents significant challenges, including training instability that severely impacts the performance of large models, and computing burdens that exceed the capabilities of most local machines. To address these challenges, we propose iRe-VLA framework, which iterates between Reinforcement Learning and Supervised Learning to effectively improve VLA models, leveraging the exploratory benefits of RL while maintaining the stability of supervised learning. Experiments in two simulated benchmarks and a real-world manipulation suite validate the effectiveness of our method.