核心发现
方法论
OTQL结合优势加权条件最优传输(COT)与流匹配,利用机器人经验进行策略微调。核心机制包括:• 通过条件OT计划实现噪声与动作的直线传输路径,避免复杂的推理步骤;• 训练判别器引导流学习高价值样本路径;• 利用优势函数调整传输偏好,增强样本质量。该方法在少量交互轮次(50-60轮)内,显著提升单任务成功率(36%提升至86%)及预训练视觉语言模型(VLA)性能(38%提升至76%),同时减少推理步骤70%。
关键结果
- OTQL在模拟和真实机器人任务中,单任务策略成功率从36%提升至86%,预训练VLA成功率从38%提升至76%,推理步骤减少70%。
- 在离线和在线微调场景中,OTQL表现优于传统方法(如FQL、QAM-F),在少量交互轮次内实现高效策略优化。
- 实验显示,结合优势加权的OT匹配能在保持推理速度的同时,显著改善策略质量,减少训练时间和推理复杂度。
研究意义
该研究突破了流模型在机器人任务中的推理瓶颈,通过引入最优传输机制实现少步推理与高效微调,解决了现有方法在复杂环境下推理慢、泛化差的问题。其技术创新为机器人自主学习、策略迁移和实时适应提供了新途径,有望推动机器人智能的普及与应用。通过结合强化学习与流匹配,显著提升了策略的样本效率和泛化能力,具有重要的理论和实践价值。
技术贡献
本研究提出了OTQL,结合优势加权条件最优传输(COT)与神经ODE流匹配,创新性地实现了:• 利用判别器引导流路径,确保直线传输,降低推理复杂度;• 通过优势函数调节传输偏好,强化高价值样本;• 在少量交互轮次内实现策略微调与加速,避免繁琐的蒸馏过程。该方法在离线和在线场景中均表现出优越性能,显著优于传统的流模型推理和微调技术。
新颖性
本工作首次将优势加权条件最优传输应用于流模型的策略微调,突破了传统流模型推理慢、难以快速适应新任务的限制。创新点在于引入判别器引导的直线传输路径,结合优势函数调节,显著提升少样本微调效率。这一方法区别于现有的扩散模型加速技术,提供了更高效、可解释的策略微调方案,具有较强的理论创新性和实用价值。
局限性
- 该方法依赖于判别器的准确性,若判别器训练不足或偏差较大,可能影响策略微调效果;
- 在极端复杂或高维任务中,传输路径可能仍需多步推理,限制了推理速度提升的潜力;
- 当前实验主要集中在机器人操控任务,泛化到其他领域仍需验证。
未来方向
未来将探索多模态信息融合以提升判别器性能,扩展OTQL在多机器人协作和高维任务中的应用潜力。同时,结合自监督学习优化传输路径,提升泛化能力,推动策略的实时适应与迁移,最终实现更智能、更自主的机器人系统。
AI 总览摘要
机器人在复杂环境中的自主决策能力一直受到推理速度与泛化能力的限制。传统流模型虽能捕获多模态动作分布,但推理复杂、训练耗时,难以满足实时控制需求。本文提出的OTQL方法,结合优势加权条件最优传输(COT)与神经ODE流匹配,有效实现了少步推理与策略微调。通过引入判别器引导的直线传输路径,避免了繁琐的蒸馏过程,显著提升了策略的样本效率和泛化能力。在模拟和真实机器人任务中,OTQL将单任务成功率从36%提升到86%,预训练视觉语言模型性能从38%提升到76%,同时推理步骤减少70%。这一突破为机器人自主学习提供了新思路,特别是在有限交互轮次内实现高效策略微调方面展现出巨大潜力。实验结果显示,OTQL在离线、在线及混合场景中均优于现有方法,验证了其在复杂环境下的鲁棒性和高效性。未来,该技术有望结合多模态信息和自监督学习,推动机器人自主适应与迁移,迈向更智能、更自主的未来。
深度解读
原文摘要
Diffusion and flow policies have recently demonstrated remarkable performance in robotic applications by accurately capturing multimodal robot trajectory distributions, especially in the context of vision language action (VLA) models. However, high quality policy performance also requires fast inference and high quality demonstrations, which are often hard to get. Lack of these leads to suboptimal policy behaviors and failure under distribution shifts. In this work we address the problem of fine-tuning and accelerating suboptimal flow-based policies using the robot's experience through RL post-training. We introduce Optimal Transport Q-Learning (OTQL), a new method for finetuning flow policies using advantage weighted conditional optimal transport flow matching. OTQL can finetune and accelerate flows with an interaction budget of 50-60 episodes while avoiding computationally expensive distillation in simulation and real-world robot tasks. Our results show that OTQL post-trains flow policies using the robot's own experience, increasing average success percentage of single-task policies from 36% to 86% and of a pre-trained VLA from 38% to 76% while reducing the number of inference steps per action generation by 70%.