Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

TL;DR

提出Temporal Ratio(TR)衡量视频动作模型对未来潜在状态的依赖,改善机器人任务中的泛化能力。

cs.CV 🔴 高级 2026-07-09 49 次浏览
Utkarsh A. Mishra Yongxin Chen Danfei Xu Yang Liu Xi Chen Jiayuan Mao
视频基础模型 机器人控制 泛化能力 注意力机制 推理指导

核心发现

方法论

本文系统分析了基于预训练视频基础模型的VAM设计空间,提出TR指标衡量动作头对未来潜在状态的依赖。通过在LIBERO基准和真实机器人任务中,结合不同的模型架构、训练策略和推理参数,验证TR与模型泛化能力的相关性。采用注意力分布分析,揭示模型在不同任务阶段对未来帧的关注变化,设计TR自适应引导方法以提升推理时的泛化表现。

关键结果

  • TR指标在LIBERO任务中与模型的组合泛化性能高度相关,表现出在OOD(分布外)任务中,TR高的模型成功率提升至55.7%,比未引导模型提高了约20%。
  • 在真实机器人任务中,基于TR的推理引导使成功率从原始的71.7%提升至83.3%,显著减小了泛化差距,验证了TR作为动态调节信号的有效性。
  • 不同训练策略(如全参数微调和LoRA)对TR的影响明显,表明模型在不同训练配置下对未来潜在状态的利用程度不同,TR能有效反映这种差异。

研究意义

该研究突破了视频基础模型在机器人控制中的泛化瓶颈,通过引入TR指标实现对模型未来依赖的量化与调节,为自主机器人在复杂环境中的泛化能力提供了理论基础和实践路径。这不仅丰富了生成视频模型在控制任务中的应用,也为未来多模态、多任务学习提供了新思路。

技术贡献

提出基于注意力的Temporal Ratio指标,量化动作头对未来潜在状态的依赖,揭示模型在不同任务阶段的注意力动态变化。结合TR的推理引导策略,有效提升了模型在分布外任务中的表现,减少了泛化差距。该方法可在不同模型架构和训练策略中泛用,具有较强的适应性和扩展性,推动了视频生成模型在机器人控制中的应用发展。

新颖性

首次系统提出TR指标作为衡量视频动作模型未来状态利用程度的量化工具,结合动态推理引导策略,显著改善了模型的泛化能力。与传统仅关注模型预测准确性的研究不同,本工作强调模型内部注意力机制的动态变化,为模型解释性和调控提供新途径。

局限性

  • TR指标主要基于注意力分布,可能受模型结构和训练策略影响较大,在某些复杂场景下难以准确反映未来状态的真实利用程度。
  • 推理引导策略在极端任务或高度不确定环境中可能引入误导性信号,导致性能下降。
  • 当前方法主要在模拟环境和有限真实任务中验证,泛化到更复杂、多样化的实际应用仍需进一步研究。

未来方向

未来将探索TR指标在多模态、多任务场景中的适应性,结合强化学习等方法优化推理引导策略,提升机器人自主操作的鲁棒性与泛化能力。同时,研究模型内部机制的可解释性,推动生成模型在复杂环境中的安全应用。

AI 总览摘要

随着生成视频基础模型在机器人控制中的兴起,如何有效转移其强大的时序和物理先验成为关键挑战。传统方法在finetuning后,模型的组合泛化能力显著下降,形成所谓的‘视频-动作泛化差距’。本文提出了Temporal Ratio(TR)指标,基于注意力机制衡量动作头对未来潜在状态的依赖程度。通过在LIBERO基准和真实机器人任务中的系统验证,发现TR高的模型在OOD任务中表现更优,成功率提升至55.7%,比未引导模型高出20%以上。基于TR的推理引导策略,动态调节模型在规划阶段对未来信息的关注,显著改善了泛化性能,成功率从71.7%提升至83.3%。这一方法不仅揭示了模型内部注意力变化的机制,也为未来自主系统的泛化提供了理论基础。尽管如此,TR指标在复杂环境中的适用性和鲁棒性仍需验证,未来将结合多模态学习和强化策略,推动机器人自主操作的广泛应用。整体而言,本研究为生成视频模型在机器人控制中的泛化瓶颈提供了新思路,具有重要的理论和实践意义。

深度解读

原文摘要

Generative video foundation models exhibit strong compositional priors, yet world-action models (WAMs) and video-action models (VAMs) often lose these priors after finetuning on robotic action data. We refer to this discrepancy as the video-action generalization gap. In this paper, we systematically investigate this gap by evaluating a comprehensive design space of VAMs, demonstrating that standard design choices yield no emergent explanation pattern. To explain this behavior, we introduce the Temporal Ratio (TR), an attention-based measure of how strongly the action head relies on future latent rollouts relative to the anchored current frame. TR has two key properties: first, a model's structural reliance on future-predictive latents, measured via TR, acts as a predictor of its compositional generalization capacity; second, it natively fluctuates based on task phase, shifting attention to future frames during planning and reverting to the present frame for precise manipulation. Finally, based on these findings, we propose an inference-time adaptive guidance method, which exploits this intrinsic feature attention pattern to dynamically amplify compositional video conditioning signals precisely when the policy relies on future rollouts. Evaluated on the LIBERO benchmark and real-world tasks, our approach mitigates the OOD-ID compositional generalization gap. More details: https://umishra.me/temporal-ratio/

cs.CV cs.RO