VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning

TL;DR

VLA-Thinker通过动态图像推理提升视觉-语言-动作模型,在LIBERO上成功率达97.5%。

cs.CV 🔴 高级 2026-03-16 33 次浏览
Chaoyang Wang Wenrui Bao Sicheng Gao Bingxin Xu Yu Tian Yogesh S. Rawat Yunhao Ge Yuzhang Shang
视觉推理 强化学习 机器人操作 多模态模型 长时间任务

核心发现

方法论

提出了一个动态图像推理框架,将视觉感知作为可调用的推理动作,并通过两阶段训练(SFT冷启动和GRPO强化学习)优化推理-动作轨迹。

关键结果

  • 在LIBERO基准上,VLA-Thinker成功率达97.5%,比OpenVLA-OFT提升6.5%。
  • 在RoboTwin 2.0基准的短、中、长时间任务中分别提升了41%、23.6%和18.1%。
  • 消融实验表明动态视觉调用显著增强了模型的任务适应性。

研究意义

该研究解决了传统视觉-语言-动作模型中视觉感知静态化的问题,显著提升了机器人在复杂环境中的操作能力,为多模态推理开辟了新方向。

技术贡献

首次将视觉感知建模为动态推理动作,提出了基于GRPO的强化学习方法以优化长时间任务的推理-动作轨迹。

新颖性

VLA-Thinker是首个实现动态视觉推理的模型,突破了传统静态视觉嵌入的限制,显著提升了跨模态交互能力。

局限性

  • 仅使用ZOOM-IN工具,未探索其他视觉工具的潜力。
  • 模型对复杂环境的泛化能力仍需进一步验证。

未来方向

未来可探索更多视觉工具的集成,如3D扫描或多视角融合,并验证模型在真实机器人环境中的性能。

AI 总览摘要

传统视觉-语言-动作模型通常将视觉输入视为静态上下文,导致在长时间任务中难以动态调整策略。VLA-Thinker提出了一种动态图像推理框架,将视觉感知作为推理过程中的可调用动作,通过两阶段训练优化推理-动作轨迹。

实验结果显示,VLA-Thinker在LIBERO基准上成功率达97.5%,显著优于现有方法,并在RoboTwin 2.0基准的多种任务中均表现出色。消融实验进一步验证了动态视觉调用对任务成功率的提升。

尽管该框架目前仅使用ZOOM-IN工具,但其设计具有高度扩展性,为未来多模态推理研究提供了坚实基础。后续研究可探索更多视觉工具的集成及其在真实机器人环境中的应用。

深度分析

研究背景

视觉-语言-动作模型近年来在机器人操作任务中取得了显著进展,但现有方法通常依赖静态视觉嵌入,限制了模型在复杂环境中的动态适应能力。

核心问题

传统模型难以在长时间任务中动态调整视觉感知,导致任务失败率高,特别是在需要多步推理的场景中。

核心创新

VLA-Thinker通过动态图像推理打破了静态视觉嵌入的限制。其核心创新包括:

  • �� 将视觉感知建模为动态推理动作。
  • �� 引入两阶段训练策略(SFT冷启动和GRPO强化学习)。
  • �� 使用ZOOM-IN工具实现视觉信息的动态调用。

方法详解

  • �� SFT冷启动阶段:使用合成的视觉链式推理数据激活模型的基础推理能力。
  • �� GRPO强化学习阶段:优化推理-动作轨迹以实现任务成功。
  • �� 动态视觉调用:通过ZOOM-IN工具获取任务相关的细节图像。

实验设计

在LIBERO和RoboTwin 2.0基准上评估模型性能,分别覆盖多任务场景和双臂协作任务。实验包括消融研究以验证动态视觉调用的有效性。

结果分析

VLA-Thinker在LIBERO基准上成功率达97.5%,比OpenVLA-OFT提升6.5%。在RoboTwin 2.0基准的短、中、长时间任务中分别提升了41%、23.6%和18.1%。

应用场景

适用于机器人操作任务,如家庭助手、工业自动化和复杂环境中的物体操作。

局限与展望

目前仅验证了ZOOM-IN工具的有效性,未探索其他视觉工具的潜力。模型在真实环境中的泛化能力仍需进一步研究。

通俗解读 非专业人士也能看懂

想象一个机器人在厨房中做咖啡。传统机器人只能一次性观察环境,无法动态调整策略。如果它没找到咖啡壶,就会失败。而VLA-Thinker像一个细心的助手,可以随时重新观察环境,找到咖啡壶并完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人游戏,任务是做咖啡。普通机器人只能一次性看厨房,错过了咖啡壶就失败了。VLA-Thinker像一个聪明的玩家,可以随时重新观察环境,找到咖啡壶并完成任务!是不是很酷?

术语表

Chain-of-Thought (链式推理)

一种逐步分解任务的推理方式,帮助模型生成中间决策。

用于分解长时间任务的复杂步骤。

GRPO (群体相对策略优化)

一种强化学习算法,用于优化多步推理-动作轨迹。

用于训练模型以实现任务成功。

ZOOM-IN (放大工具)

一种视觉工具,用于获取目标区域的细节图像。

在动态视觉调用中使用。

LIBERO (基准数据集)

一个多任务机器人操作基准数据集。

用于评估模型的任务成功率。

RoboTwin 2.0 (基准数据集)

一个双臂协作任务的模拟基准。

评估模型在复杂任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何集成更多类型的视觉工具以提升任务适应性。
  • 2 模型在真实环境中的泛化能力仍需验证。

应用场景

近期应用

家庭机器人助手

帮助完成家庭任务,如整理物品或做饭。

工业自动化

在动态环境中执行复杂的物体操作任务。

远期愿景

智能机器人系统

实现完全自主的动态决策和操作能力,适应复杂环境。

原文摘要

Vision-Language-Action (VLA) models have shown promising capabilities for embodied intelligence, but most existing approaches rely on text-based chain-of-thought reasoning where visual inputs are treated as static context. This limits the ability of the model to actively revisit the environment and resolve ambiguities during long-horizon tasks. We propose VLA-Thinker, a thinking-with-image reasoning framework that models perception as a dynamically invocable reasoning action. To train such a system, we introduce a two-stage training pipeline consisting of (1) an SFT cold-start phase with curated visual Chain-of-Thought data to activate structured reasoning and tool-use behaviors, and (2) GRPO-based reinforcement learning to align complete reasoning-action trajectories with task-level success. Extensive experiments on LIBERO and RoboTwin 2.0 benchmarks demonstrate that VLA-Thinker significantly improves manipulation performance, achieving 97.5% success rate on LIBERO and strong gains across long-horizon robotic tasks. Project and Codes: https://cywang735.github.io/VLA-Thinker/ .

cs.CV cs.AI cs.RO