CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

TL;DR

CreFlow通过组合线性时序逻辑约束,结合局部修正和奖励引导,提升稀疏奖励下的机器人操控视频生成效果,成功率提升23.8%。

cs.CV 🔴 高级 2026-05-14 39 次浏览
Zhenyang Ni Yijiang Li Ruochen Jiao Simon Sinong Zhan Sipeng Chen Zhenfei Yin Minshuo Chen Philip Torr Zhaoran Wang Qi Zhu
机器人操控 视频生成 强化学习 线性时序逻辑 稀疏奖励

核心发现

方法论

该方法提出基于线性时序逻辑(LTL)构建的组合约束奖励模型,自动生成任务需求,结合CreFlow在线强化学习框架。核心包括:• 通过SAM3、VLM和IDM提取状态信息;• 利用LTL监控评估视频中的任务满足情况,生成二元成功信号和局部违规追踪;• 采用基于奖励相关区域的NFT损失,限制梯度更新范围;• 引入基于成功样本的修正重流损失,稳定加速训练。该流程实现了对高维视频的局部优化,有效避免无关区域干扰。

关键结果

  • 在8个双手操控任务中,CreFlow的成功率比现有方法提升23.8个百分点,表现出更优的任务成功判别能力,且奖励信号与人类及模拟器标签一致性显著增强。
  • 相较于基线的DiffusionNFT和DanceGRPO,CreFlow在任务成功率和训练稳定性方面表现优越,验证了局部修正和组合约束的有效性。
  • 通过消融实验验证,奖励区域限制和成功样本引导显著提升训练效率和模型性能,减少了训练过程中的梯度噪声和偏差。

研究意义

该研究突破了视频生成中稀疏奖励的瓶颈,提出结合逻辑约束的可解释奖励模型,为机器人操控任务提供更可靠的训练信号。其技术创新在机器人学、计算机视觉和强化学习交叉领域具有重要推动作用,有助于实现更高效、更安全的自主操作系统,推动智能机器人向复杂环境中的自主适应迈进。

技术贡献

创新点包括:• 提出基于LTL的组合任务约束自动生成机制,增强任务语义表达能力;• 设计局部奖励限制策略,有效缓解高维视频中的梯度噪声;• 引入基于成功样本的修正重流损失,提升训练稳定性和收敛速度;• 将奖励信号与局部违规追踪结合,实现可解释的失败诊断。这些技术突破显著优于传统的全局奖励或低级视觉指标,提供了新颖的强化学习优化路径。

新颖性

本工作首次将线性时序逻辑(LTL)引入机器人操控视频的奖励设计中,实现任务的组合化表达与局部违规诊断。结合局部奖励限制与成功样本引导,创新性地解决了高维视频中稀疏奖励带来的训练不稳定问题,显著优于现有基于像素或全局指标的强化学习方法。

局限性

  • 该方法依赖于预训练的视觉模块(SAM3、VLM、IDM)准确性,若视觉提取出现偏差,可能影响任务约束的正确评估。
  • 线性时序逻辑的表达能力有限,难以覆盖极其复杂或长时序的任务场景,未来需扩展到更丰富的逻辑表达形式。
  • 训练过程中对计算资源要求较高,尤其是在多样任务和高维视频数据下,模型的扩展性仍需优化。

未来方向

未来将探索多模态感知与逻辑约束的融合,提升任务复杂度的表达能力;同时,优化视觉模块的鲁棒性与效率,降低对硬件资源的依赖;此外,将该框架推广至实际机器人系统中,验证其在真实环境中的适应性和泛化能力。

AI 总览摘要

随着机器人自主操作需求的不断增长,如何让视频生成模型在复杂操控任务中表现出符合物理规律的行为成为关键。现有模型虽具备良好的视觉效果,但在物理一致性和任务满足度方面仍存在明显不足。传统强化学习方法通过奖励引导,但多采用低层次的像素指标,难以捕捉任务的逻辑关系,导致生成视频虽看似合理,却无法保证任务成功。

为解决这一难题,本文提出CreFlow框架,结合线性时序逻辑(LTL)构建的组合任务约束,自动生成任务需求的奖励信号。该奖励模型不仅提供任务成功的二元判定,还能定位违规区域,为强化学习提供可解释的局部诊断信息。CreFlow通过局部奖励限制(NFT损失)和成功样本引导(修正重流损失)两大创新,有效缓解高维视频中的梯度噪声,提升训练稳定性和效率。

在八个机器人操控任务中,CreFlow实现了比传统方法高23.8%的成功率,验证了其在复杂任务中的优越表现。实验显示,结合逻辑约束的奖励机制显著优于仅依赖像素指标的方案,为机器人自主学习提供了新的思路。未来,结合多模态感知和更丰富的逻辑表达,将推动机器人在真实环境中的自主适应能力,迈向更智能、更安全的未来。

深度分析

研究背景

机器人操控视频生成技术近年来快速发展,代表性工作包括VideoGPT、VQ-VAE-2等,强调视觉逼真度与场景一致性。然而,生成的高质量视频在物理合理性和任务完成度上仍存差距。传统方法多依赖大规模预训练和像素级评价指标,难以满足复杂操控任务的逻辑要求。强化学习被引入以优化任务相关目标,但奖励设计面临稀疏、非结构化的挑战,导致训练不稳定、效果有限。

核心问题

核心问题在于如何设计既能反映任务成功又具备可解释性的奖励信号,尤其在高维视频中,任务的关键违规行为可能只在少数区域出现。现有奖励模型多忽视任务的组合性和因果关系,导致生成视频虽视觉合理,但实际操控效果差,难以应用于实际机器人系统。此外,稀疏奖励带来的梯度噪声严重影响训练效率和模型性能。

核心创新

本研究的创新点包括:1)引入基于线性时序逻辑(LTL)的组合任务约束,自动生成任务成功的判定标准;2)设计局部奖励限制策略,限制梯度更新范围,减少无关区域干扰;3)提出基于成功样本的修正重流损失,增强训练稳定性与速度;4)结合多模态视觉模块(SAM3、VLM、IDM)实现任务状态的精确提取。这些创新使得奖励信号更具任务相关性和可解释性,有效提升训练效率。

方法详解

  • �� 利用SAM3、VLM和IDM提取视频中的对象、机器人状态和属性信息;• 由编码代理生成任务约束的LTL公式,涵盖持久性、位置、因果关系和顺序;• 在每个视频轨迹上进行状态提升,评估LTL公式,生成成功/失败标记和违规追踪;• 设计局部奖励限制(NFT损失),只在违规区域进行梯度更新;• 采样成功样本的平均值作为修正目标,指导失败轨迹的修正;• 结合KL正则化,保持模型稳定。整个流程实现了对高维视频的局部优化与任务语义的结合。

实验设计

在八个机器人操控任务中,采用预训练的Vidar模型作为基础,利用合成的LTL约束进行后训练。对比基线包括未后训练的模型、DiffusionNFT、DanceGRPO和其他奖励模型。指标为任务成功率和奖励信度,验证CreFlow在真实机器人环境中的表现。通过消融实验分析奖励区域限制和成功样本引导的贡献,确保方法的有效性和鲁棒性。

结果分析

CreFlow在所有任务中均优于对比方法,成功率提升23.8%,且奖励信号与人工标签高度一致。实验还显示,局部奖励限制和样本引导显著改善训练稳定性,减少梯度噪声,提升模型泛化能力。消融分析验证了每个技术组件的必要性,整体表现优异,验证了逻辑约束结合局部优化的有效性。

应用场景

该方法适用于机器人自主学习、工业自动化和智能制造等场景,尤其在复杂操作任务中表现优越。依赖预训练视觉模块和逻辑约束,能快速适应不同任务需求。未来可结合实际机器人硬件,提升自主决策和操作的可靠性,推动机器人在未知环境中的自主适应。

局限与展望

依赖视觉模块的准确性,视觉偏差可能影响任务评估;逻辑表达能力有限,难以覆盖极复杂任务;训练成本较高,模型扩展性需优化。未来应加强视觉鲁棒性,扩展逻辑表达能力,并降低计算资源需求。

通俗解读 非专业人士也能看懂

想象你在厨房里准备一道菜。每一步都要按照顺序做,比如先切菜,再炒,然后装盘。如果你只看菜的颜色或味道,可能会觉得菜看起来不错,但实际上可能没有煮熟或放错了调料。为了确保菜做好,你需要检查每个步骤是否正确,比如菜是否在锅里、火是否开着、调料是否放对了。这就像给机器人设置规则,让它在做事时遵循一系列明确的步骤和条件。当机器人在制作过程中出现问题,比如没有放入调料或火太大,系统会告诉你哪里出错了,帮助它改正。CreFlow就是用类似的方法,让机器人在生成视频时遵守一系列逻辑规则,确保它做的每一步都符合任务要求,从而让机器人更聪明、更可靠。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的积木游戏。你要按照特定的顺序搭建,比如先放底座,再放墙壁,最后放屋顶。如果你只看最终的房子长得漂亮,但没有检查每一块积木是不是放对了,就可能出现墙歪了、屋顶不稳的情况。为了确保房子稳固,你需要逐步检查每一块积木是否正确放置。这就像给机器人设定一套规则,让它在生成动作或视频时遵守这些规则,确保每一步都符合任务目标。CreFlow就像这样,它用一套逻辑规则检测机器人每个动作是否合理,发现问题就帮它修正。这样,机器人不仅能做出漂亮的视频,还能确保每个动作都符合物理和任务要求,变得更聪明、更可靠。

原文摘要

Video generation models trained on heterogeneous data with likelihood-surrogate objectives can produce visually plausible rollouts that violate physical constraints in embodied manipulation. Although reinforcement-learning post-training offers a natural route to adapting VGMs, existing video-RL rewards often reduce each rollout to a low-level visual metric, whereas manipulation video evaluation requires logic-based verification of whether the rollout satisfies a compositional task specification. To fill this gap, we introduce a compositional constraint-based reward model for post-training embodied video generation models, which automatically formulates task requirements as a composition of Linear Temporal Logic constraints, providing faithful rewards and localized error information in generated videos. To achieve effective improvement in high-dimensional video generation using these reward signals, we further propose CreFlow, a novel online RL framework with two key designs: i) a credit-aware NFT loss that confines the RL update to reward-relevant regions, preventing perturbations to unrelated regions during post-training; and ii) a corrective reflow loss that leverages within-group positive samples as an explicit estimate of the correction direction, stabilizing and accelerating training. Experiments show that CreFlow yields reward judgments better aligned with human and simulator success labels than existing methods and improves downstream execution success by 23.8 percentage points across eight bimanual manipulation tasks.

cs.CV