V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models
V-Link恢复Action DiT视觉信息,LIBERO-Plus提升31.2%,RoboTwin 2.0提升18.8%。
核心发现
方法论
V-Link以GR00T N1.6为基础,在VLM中加入Spatial Queries与Semantic Queries,并通过定制因果注意力分别提取几何和语义信息。深度头与分割头提供训练期辅助监督;随后,Semantic Queries通过并行交叉注意力补充图像token,Spatial Queries通过专用分支注入Action DiT。推理时移除辅助头。
关键结果
- 在LIBERO上,V-Link平均成功率为99.3%,较GR00T N1.6的97.4%提升1.9%;LIBERO-Long提升5.1个百分点,达到98.0%。
- 在未微调的LIBERO-Plus分布偏移测试中,V-Link总成功率75.0%,基线为43.8%,提升31.2%;噪声、语言和光照条件分别提升60.4%、47.3%和30.6%。
- RoboTwin 2.0六任务平均成功率为56.8%,较基线38.0%提升18.8%;真实A3 Ultra电源开启/关闭成功率为98%/94%,仅增加1.58 ms延迟。
研究意义
论文指出,VLA性能瓶颈不只在VLM是否理解场景,也在这些表示能否真正到达动作专家。该视角解释了为何拥有丰富视觉特征的系统仍可能缺乏精细空间控制能力。通过显式恢复深度与语义表示,V-Link显著增强了分布偏移和接触操作表现,为通用机器人策略提供了低成本、无需推理期标注的改进路径。
技术贡献
核心贡献是把“表示可访问性”作为VL到A传输的可诊断目标。作者用冻结特征加轻量任务头测量信息保留:GR00T Action DiT的深度MAE由VLM的0.015恶化至0.071,分割mIoU由0.665降至0.290。V-Link以辅助任务塑造查询,以非对称注意力确保语义和几何信息分别可用,并保留GR00T的交替注意力结构。
新颖性
多数方法如Spatial Forcing、EVO-0和GEAR-VLA主要增强VLM内部的3D表示;PointVLA或ABot-M0则直接注入点云或3D基础模型特征。V-Link的新意在于不单纯增加视觉能力,而是定位并修复VL到Action DiT过程中的信息损失,并用诊断任务验证恢复效果。
局限性
- 实验主要基于GR00T N1.6、LIBERO系列、RoboTwin 2.0及两个A3 Ultra任务,尚不足以证明对不同VLA架构、机器人形态和更复杂长期任务的普适性。
- 训练依赖深度与分割标注;真实实验还使用Lingbot-Depth、GroundingDINO和SAM3生成伪标签,标注质量可能影响查询学习。
未来方向
后续可研究跨架构的表示可访问性指标、更多中间层和多模态信号的传输方式,并扩展到长时程任务、动态场景和多机器人平台。同时应降低对深度传感器及伪标签的依赖,验证在更大规模真实数据和在线适应中的稳定性。
AI 总览摘要
视觉语言动作模型试图把“看见什么、听懂什么”和“机器人如何移动”统一起来。GR00T N1.6等双系统架构通常只把VLM最后一层特征传给Action DiT。论文发现,这一步会丢失大量2D语义和3D几何信息:冻结特征测试显示,深度MAE从0.015升至0.071,分割mIoU从0.665降至0.290。动作专家因此容易依赖容易优化的语义线索,而忽略精确抓取所需的空间结构。
V-Link在VLM中学习两类查询。Spatial Queries专门编码几何,Semantic Queries补充语义;深度估计和语义分割头只在训练阶段提供约束。进入Action DiT后,语义查询与原始图像token并行融合,空间查询再通过专用交叉注意力强制提供几何条件。该设计像是在信息传输线上增加两条职责明确的通道,而不是简单扩大模型。
结果显示,V-Link在LIBERO达到99.3%,较基线提升1.9%;LIBERO-Plus达到75.0%,提升31.2%;RoboTwin 2.0达到56.8%,提升18.8%。在A3 Ultra上,电源开启和关闭成功率达到98%和94%,分别高出20和24个百分点,延迟仅增加1.58 ms。研究的重要启示是:提升机器人智能不仅要增强感知,还要确保感知表示在生成动作时可被访问。
深度分析
研究背景
VLA模型大致分为统一架构与双系统架构。UniVLA、Cosmos Policy在共享Transformer中联合建模;GR00T N1.6则用VLM负责理解,用Action DiT负责高频控制。SpatialVLA、EVO-0、Spatial Forcing等增强了VLM的空间能力,但更强的VLM特征不保证动作专家能够保留这些信息。V-Link因此把研究重点从“表示是否存在”转向“表示是否可访问”。
核心问题
GR00T仅传递VLM最终层特征,Action DiT在动作损失驱动下可能优先使用容易识别的物体和语言语义,而忽略深度、距离、姿态和接触位置。诊断结果显示其视觉信息明显退化:深度MAE为0.071、分割mIoU为0.290。该瓶颈直接限制精细抓取、放置和接触操作。
核心创新
V-Link包含三项创新:一是加入Spatial/Semantic Queries,将几何与语义解耦;二是用深度和分割辅助头进行训练期专门化,损失为L=Lact+0.1Ldepth+0.002Lseg;三是采用非对称注入,Semantic Queries补充图像token,Spatial Queries作为必经几何条件。与直接接入3D基础模型不同,它修复的是VL到A的传输过程。
方法详解
- �� 输入由文本Et、多视图图像Eo、Spatial Query Ed和Semantic Query Es组成。
- �� 因果注意力掩码Mq使两类查询独立聚合视觉语言信息,输出经Qwen RMSNorm得到E′d、E′s。
- �� 深度头使用LN、Linear(2048,256)、GELU、两层Transformer和卷积解码器,优化smooth-L1、absolute-relative及hard-patch损失,系数为0.1和0.5。
- �� 分割头使用交叉熵加soft Dice损失,Dice系数为0.5。
- �� 在Action DiT的图像交叉注意力层,先融合E′o与E′s,再以E′d进行空间交叉注意力;查询门控gl控制语义分支强度。
- �� 32层AlternateVLDiT仅在ℓ=4k+2层注入,保持原有调度。
实验设计
模型从GR00T N1.6 3B初始化,冻结视觉和语言主干,以rank-128 LoRA训练;使用BF16、4张H100、AdamW,学习率1e-4、权重衰减1e-5和5% warm-up。LIBERO训练80K步,RoboTwin 2.0训练120K步。评测包括LIBERO、未微调的LIBERO-Plus、六个RoboTwin任务及A3 Ultra两个任务;并进行查询、辅助监督、注入方式和查询数量消融。
结果分析
LIBERO四个套件平均99.3%,Long套件较基线高5.1个百分点。LIBERO-Plus总分75.0%,在噪声条件达到87.8%,基线仅27.4%。RoboTwin六任务中,Move、Place、Contact分别为74/55/60、22/55/60等任务级结果,平均56.8%。消融显示Spatial、Semantic及二者联合分别为51.2%、47.8%和56.8%;查询注入或任务监督单独使用仅40.3%或39.8%。
应用场景
该方法适合需要精确空间定位的抓取、放置、按钮操作、开关旋转和双臂协同。它不要求推理时输入深度真值或运行辅助头,适用于已有GR00T式VLA的增量升级。真实A3 Ultra结果表明,它可用于人形机器人自主开关机等任务,并以极低延迟代价换取更高可靠性。
局限与展望
方法仍依赖训练期深度和语义标签,真实数据中的反光、传感器缺失和伪标签误差可能造成监督噪声。实验规模和任务数量有限,LIBERO表现接近饱和,难以充分区分长期规划能力。查询网格增大带来延迟,3×6×6反而略降至56.5%;未来需验证跨机器人、动态环境、长时程任务和更大规模真实部署。
通俗解读 非专业人士也能看懂
把VLA想成一家机器人厨房。VLM像总厨,能看菜单、识别食材,还知道客人要做什么;Action DiT像负责快速切菜和端盘子的厨师。原来的交接方式只给快厨师一张总厨写到最后的便签。便签里虽然有菜名,却可能没有告诉他食材离刀多远、锅在什么角度,所以动作看似合理,细节却容易出错。
V-Link增加两位专职助手:一位只测量位置、距离和形状,另一位只确认物体和任务含义。训练时,前者要画出深度地图,后者要标出不同物体;这样他们不能只说“这是杯子”,还必须说明杯子在哪里。真正工作时,标注助手会被撤走,但他们提炼出的信息会分别交给动作厨师。
结果是,机器人更容易完成放置、按压、旋转等细活。LIBERO-Plus成功率从43.8%提高到75.0%,RoboTwin 2.0从38.0%提高到56.8%,而反应时间只增加1.58毫秒。核心道理很简单:不仅要让专家知道答案,还要把答案以他能直接使用的方式交到手里。
简单解释 像给14岁少年讲一样
想象你在玩一个机器人游戏。游戏里的“眼睛加大脑”能看懂桌面,也能读懂任务,比如“把面包放进锅里”;但真正控制手臂的“小玩家”只收到一份压缩提示。它知道目标大概是什么,却不一定知道手要向左多少、物体离桌面多高,所以会出现抓偏、放歪或按不到按钮的情况。
V-Link像给小玩家配了两张地图。一张地图专门记录“东西在哪里、距离多远”,另一张记录“这是什么、和任务有什么关系”。训练时,机器人必须同时完成画深度图和给画面分区,因此两张地图各自学会擅长的内容。执行任务时,辅助老师不再出现,但地图已经被送进动作控制器。
实验很厉害:LIBERO平均成功率达到99.3%;遇到光线、语言、噪声变化的LIBERO-Plus达到75.0%,比原来的43.8%高很多;RoboTwin 2.0也从38.0%升到56.8%。真实人形机器人开机成功率98%,关机94%。
不过它不是万能的。训练仍需要深度和分割资料,而且目前只测试了少数真实任务。下一步要看看它能不能在更多机器人、移动物体和连续很久的任务中保持稳定。
术语表
Vision-Language-Action (VLA,视觉语言动作模型)
把图像、语言和机器人动作放入同一决策链的模型。它既要理解场景和指令,也要生成连续控制信号。
论文研究双系统VLA中VLM到Action DiT的信息传输。
Action DiT(动作扩散Transformer)
使用Transformer结构预测或去噪动作序列的动作专家。它承担高频、连续的机器人控制。
V-Link重点恢复Action DiT中丢失的视觉表示。
Spatial Query(空间查询)
专门聚合深度、位置和几何结构的可学习token。它为动作生成提供显式空间条件。
Spatial Query由深度损失监督,并通过专用交叉注意力注入Action DiT。
Semantic Query(语义查询)
专门提取物体类别、任务相关区域和语义关系的可学习token。它补充原始图像token的语义信息。
Semantic Query通过分割监督学习,并与图像token并行融合。
Flow Matching(流匹配)
一种训练生成模型连续变换数据分布的方法。模型学习从噪声状态到目标动作的向量场。
V-Link使用动作流匹配损失Lact训练Action DiT。
开放问题 这项研究留下的未解疑问
- 1 表示可访问性目前主要用深度MAE和分割mIoU间接衡量,尚不清楚这些指标与真实动作成功率的因果关系,需要更系统的可解释性验证。
- 2 辅助监督依赖深度或伪分割标签;在无深度传感器、动态遮挡和反光环境中,如何稳定学习空间查询仍是开放问题。
应用场景
近期应用
精细桌面操作
机器人团队可在GR00T N1.6基础上加入V-Link,用于抓取、放置、按压和旋转开关。训练阶段准备多视图深度及语义标签,部署时移除辅助头;预期在噪声、光照和语言变化下获得更稳健控制。
人形机器人设备操作
在A3 Ultra等平台上,V-Link可用于自主开机、关机及面向面板的接触任务。其额外延迟仅1.58 ms,适合对实时性敏感的控制系统,但需校准相机、动作空间和伪标签流程。
远期愿景
通用空间接地策略
若在更多机器人、传感器和长期任务中验证,V-Link可成为VLA的通用视觉传输模块,使高层语义理解更可靠地转化为低层空间动作,推动家庭、仓储和服务机器人部署。
原文摘要
Vision-language-action (VLA) models provide a scalable path toward generalist robotic manipulation by integrating visual perception, language understanding, and continuous action control. However, we reveal a critical limitation of VLA architectures: the action expert has limited access to the 3D geometric and 2D semantic information available in VLM features. This accessibility gap weakens perceptual grounding and limits performance on fine-grained robotic manipulation. To address this issue, we propose V-Link, which explicitly recovers visual representations during the vision-language (VL) to action (A) feature transfer. Specifically, V-Link learns complementary Spatial and Semantic Query representations within the VLM and injects them into Action DiT through asymmetric pathways. Semantic Queries complement the original VLM image tokens, whereas Spatial Queries provide dedicated geometric conditioning for spatially grounded action generation. Across LIBERO, LIBERO-Plus, and RoboTwin 2.0, our V-Link improves the average success rate over base model GR00T N1.6 by +1.9%, +31.2%, and +18.8%, respectively. On the AGIBOT A3 Ultra, V-Link further achieves gains of +20% and +24% on two real-world humanoid tasks.