DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching

TL;DR

DFM-VLA通过离散流匹配实现机器人操作动作序列迭代优化,在CALVIN数据集上表现最优。

cs.RO 🔴 高级 2026-03-27 30 次浏览
Jiayi Chen Wenxuan Song Jiaxin Fang Ruiqing Yin Jingbo Wang Shuai Chen Jieyuan Pei Yikai Qin Feifan Chen Haodong Yan Zhide Zhong Wen Chen Yan Wang Yuxiang Gao Haoang Li
机器人操作 离散流匹配 动作优化 视觉语言模型 深度学习

核心发现

方法论

DFM-VLA采用离散流匹配框架,通过构建动作序列的概率速度场实现迭代优化。提出两种速度场构建方法:辅助速度头和嵌入引导。引入了度量对齐动作分词器(MAAT),结合两阶段解码策略,进一步提升预测精度。

关键结果

  • 在CALVIN基准测试中,DFM-VLA平均连续完成任务长度达到4.58,超越UP-VLA的4.42。
  • 在LIBERO-Plus基准测试中,DFM-VLA在所有维度的任务成功率达到77.8%,显著优于其他方法。
  • 消融实验表明,MAAT和嵌入引导速度场对模型性能提升至关重要。

研究意义

该研究解决了现有机器人操作模型中动作序列解码错误无法修正的问题,通过迭代优化显著提升了动作序列质量。其方法对机器人操作的长时间任务和复杂场景具有重要意义。

技术贡献

提出了离散流匹配在动作序列生成中的应用,创新性地结合度量对齐分词器和两阶段解码策略,显著提升了动作预测的精度和稳定性。

新颖性

首次将离散流匹配应用于机器人动作生成领域,突破了传统自回归和离散扩散方法的局限,提供了更灵活的动作序列优化方式。

局限性

  • 在高噪声环境下,模型对动作序列的优化效果可能下降。
  • 度量对齐分词器的训练需要大量计算资源。
  • 实际机器人操作中的动态变化可能未完全覆盖。

未来方向

未来可以探索更高效的速度场构建方法,优化模型在动态环境中的适应性,并扩展至更多机器人操作任务。

AI 总览摘要

现有机器人操作模型在动作序列解码中存在早期错误无法修正的问题,影响了复杂任务的完成质量。DFM-VLA通过离散流匹配框架,构建动作序列的概率速度场,实现动作序列的迭代优化。模型采用度量对齐动作分词器(MAAT)和两阶段解码策略,确保动作生成的精度和稳定性。

在CALVIN和LIBERO基准测试中,DFM-VLA在长时间任务和复杂场景中表现优异,平均任务完成长度和成功率均超越现有方法。消融实验进一步验证了关键组件的有效性。

尽管模型在高噪声环境和动态任务中仍有局限,但其创新性方法为机器人操作领域提供了新的解决方案,并为未来研究指明了方向。

深度分析

研究背景

机器人操作模型近年来取得了显著进展,尤其是视觉语言动作(VLA)模型通过离散化动作序列实现了语言指令到动作的映射。然而,现有方法如自回归和离散扩散模型在解码中存在不可逆错误,限制了复杂任务的完成质量。

核心问题

现有方法在动作序列解码中无法修正早期错误,导致错误传播并影响后续任务完成。这一问题在长时间任务和复杂场景中尤为突出。

核心创新

DFM-VLA提出了离散流匹配框架,通过构建动作序列的概率速度场实现迭代优化。创新点包括:

  • �� 度量对齐动作分词器(MAAT),确保动作嵌入空间的语义一致性。
  • �� 两阶段解码策略,结合探索性优化和稳定性验证。

方法详解

  • �� 使用辅助速度头或嵌入引导构建动作序列的概率速度场。
  • �� 引入MAAT,将连续动作值离散化并保持嵌入空间的距离一致性。
  • �� 采用两阶段解码策略,先进行迭代优化,再进行稳定验证。

实验设计

在CALVIN和LIBERO基准测试中,评估模型在长时间任务和复杂场景中的表现。实验设计包括消融研究以验证关键组件的作用,并分析模型在不同噪声水平下的性能。

结果分析

DFM-VLA在CALVIN基准测试中平均任务完成长度达到4.58,显著优于UP-VLA的4.42。在LIBERO-Plus基准测试中,模型在所有维度的任务成功率达到77.8%。

应用场景

适用于机器人操作中的长时间任务和复杂场景,如工业自动化和家庭服务机器人。

局限与展望

模型在高噪声环境中的性能下降,分词器训练成本高,动态任务适应性仍需优化。

通俗解读 非专业人士也能看懂

可以将DFM-VLA比作一个厨房助手。传统助手只能按照固定步骤完成任务,错误无法修正。而DFM-VLA像一个聪明的助手,可以反复检查每一步,发现错误就修正,确保最终完成任务。比如做菜时,它会不断调整调料比例,直到味道完美。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要机器人帮你完成任务。传统机器人像一个固执的队友,犯了错就不改,害你失败。DFM-VLA像一个聪明的队友,能反复调整动作,帮你赢得比赛!是不是很酷?

术语表

离散流匹配 (Discrete Flow Matching)

一种通过概率速度场优化离散序列的方法。

用于动作序列的迭代优化。

度量对齐动作分词器 (Metric-Aligned Action Tokenizer)

一种保持动作嵌入空间距离一致性的分词器。

用于动作序列离散化。

辅助速度头 (Auxiliary Velocity Head)

一种预测动作序列速度场的组件。

用于构建概率速度场。

两阶段解码策略 (Two-Stage Decoding)

结合探索优化和稳定验证的解码方法。

用于动作序列生成。

CALVIN数据集

一个用于评估长时间机器人操作任务的基准测试。

用于验证模型性能。

开放问题 这项研究留下的未解疑问

  • 1 如何优化模型在高噪声环境中的性能?
  • 2 是否可以进一步减少分词器训练成本?
  • 3 如何扩展模型至更多动态任务?

应用场景

近期应用

工业自动化

用于复杂生产线任务,提升效率和稳定性。

家庭服务机器人

帮助完成家务任务,如清洁和整理。

远期愿景

动态环境机器人

开发适应复杂动态环境的机器人,提升任务完成质量。

原文摘要

Vision-Language-Action (VLA) models that encode actions using a discrete tokenization scheme have been widely adopted for robotic manipulation, but existing decoding paradigms remain fundamentally limited. Whether actions are decoded sequentially by autoregressive VLAs or in parallel by discrete diffusion VLAs, once a token is generated, it is typically fixed and cannot be revised in subsequent iterations. Consequently, early token errors cannot be effectively corrected later. We propose DFM-VLA, a discrete flow matching VLA that iteratively refines action tokens. DFM-VLA models a token-level probability velocity field that dynamically updates the full action sequence across refinement iterations. We investigate two approaches to constructing the velocity field: an auxiliary velocity-head formulation and an embedding-guided formulation. To further improve prediction accuracy, we introduce a metric-aligned action tokenizer (MAAT) tailored to the coarse-to-fine nature of DFM, together with a two-stage decoding strategy. Extensive experiments on CALVIN, LIBERO, LIBERO-Plus, and real-world manipulation tasks demonstrate the effectiveness of our approach. Our project is available at https://chris1220313648.github.io/DFM-VLA/.

cs.RO cs.CV