VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models
VISTA通过轨迹跟随偏好优化增强VLA模型的视觉条件,提升成功率3.15%。
核心发现
方法论
VISTA采用三阶段训练策略:首先在轨迹跟随任务中通过偏好优化强化视觉与动作的对应关系;其次利用潜空间蒸馏将增强的视觉条件迁移到指令跟随任务中。具体包括利用轨迹标注的图像构建偏好对,通过DPO(直接偏好优化)优化逆动力学理解,再通过潜空间蒸馏将训练成果传递到最终任务。该方法无需架构改动或额外数据,便能显著提升模型的视觉条件依赖性和任务表现。
关键结果
- 在LIBERO空间任务中,VISTA提升了平均成功率3.15%,在LIBERO和CALVIN基准上表现优异。与基础OpenVLA相比,成功率提升显著,验证了偏好优化增强视觉条件的有效性。VISTA在连续动作空间的OpenVLA-OFT中也实现了4%的性能提升,从3.87提升到4.02,表现出良好的迁移能力。
- 通过偏好对构建的轨迹数据,模型在早期动作依赖视觉输入的敏感性增强,成功轮次的视觉条件明显优于失败轮次,验证了视觉条件与任务成功的相关性。
- 消融实验显示,采用余弦相似度的蒸馏损失优于L2距离,进一步验证了训练策略的有效性。整体来看,VISTA在不增加架构复杂度的情况下,显著改善了视觉依赖性和任务性能。
研究意义
该研究突破了视觉-语言-动作模型中视觉条件不足的问题,为机器人自主操控提供了更稳健的视觉基础。通过偏好优化和潜空间蒸馏,模型能更好地利用视觉信息,从而提升任务的鲁棒性和泛化能力。这不仅推动了机器人自主学习的发展,也为多模态深度学习提供了新思路,具有广泛的应用潜力。
技术贡献
提出VISTA框架,结合轨迹跟随偏好优化与潜空间蒸馏,有效增强VLA模型的视觉条件。创新点在于利用偏好对构建无须额外数据或架构改动的训练策略,提升视觉依赖性。该方法在离散和连续动作空间中均表现优越,验证了其通用性和有效性,为未来多模态机器人学习提供了新范式。
新颖性
首次提出利用轨迹跟随偏好优化增强VLA模型的视觉条件,避免了昂贵的在线偏好采样和专家标注。该方法通过离线偏好对构建偏好对,结合潜空间蒸馏,实现了视觉-动作对齐的显著提升,区别于传统的外部知识注入或复杂架构调整。
局限性
- 当前方法依赖于轨迹跟踪模型的性能,若跟踪精度不足,可能影响偏好对的质量和训练效果。
- 偏好对的构建仍需一定的手工标注或预处理,可能在大规模应用中面临效率瓶颈。
- 模型在极端复杂场景或未见过的任务中,视觉条件增强的效果可能有限,仍需结合其他感知机制。
未来方向
未来可探索结合强化学习与偏好优化的端到端训练流程,提升偏好对的自动化和鲁棒性。同时,扩展偏好构建方式,利用自监督或无标注数据,降低依赖成本。此外,结合多模态信息如深度和触觉,进一步增强视觉条件的表达能力,推动机器人自主学习的广泛应用。
AI 总览摘要
近年来,机器人自主操控在复杂环境中的表现逐步提升,但仍面临视觉信息利用不足的问题。大规模预训练的视觉-语言模型(VLMs)在感知和推理方面表现出色,但在实际机器人任务中,动作预测对视觉依赖性不足,导致鲁棒性下降。传统方法多依赖外部知识或复杂架构调整,成本高且难以迁移。为解决这一难题,本文提出VISTA框架,通过轨迹跟随偏好优化增强模型的视觉条件,显著提升任务成功率。
VISTA的核心思想是利用轨迹标注的图像构建偏好对,采用直接偏好优化(DPO)在轨迹跟随任务中强化视觉-动作对应关系。随后,通过潜空间蒸馏将增强的视觉条件迁移到指令跟随任务中,无需架构改动或额外数据。实验结果显示,在LIBERO和CALVIN基准上,VISTA平均成功率提升3.15%,连续动作空间中也实现了4%的性能增长。这验证了偏好优化在提升视觉条件中的有效性。
该方法不仅改善了模型对视觉信息的敏感性,还增强了鲁棒性和泛化能力,为机器人自主学习提供了新思路。未来,结合强化学习和无标注偏好构建,将进一步推动多模态机器人系统的智能化发展。尽管如此,偏好对的构建依赖于轨迹跟踪模型的性能,未来需探索更高效的偏好采样和多模态融合策略,以实现更广泛的应用场景。
深度解读
原文摘要
Vision-Language-Action (VLA) models have demonstrated strong performance across a wide range of robotic manipulation tasks. Despite the success, extending large pretrained Vision-Language Models (VLMs) to the action space can induce vision-action misalignment, where action predictions exhibit weak dependence on the current visual state, leading to unreliable action outputs. In this work, we study VLA models through the lens of visual conditioning and empirically show that successful rollouts consistently exhibit stronger visual dependence than failed ones. Motivated by this observation, we propose a training framework that explicitly strengthens visual conditioning in VLA models. Our approach first aligns action prediction with visual input via preference optimization on a track-following surrogate task, and then transfers the enhanced alignment to instruction-following task through latent-space distillation during supervised finetuning. Without introducing architectural modifications or additional data collection, our method improves both visual conditioning and task performance for discrete OpenVLA, and further yields consistent gains when extended to the continuous OpenVLA-OFT setting. Project website: https://vista-vla.github.io/ .