Evolving Cache Schedules for Fast Diffusion Policy Inference

TL;DR

EVO通过进化搜索优化缓存计划,实现动作生成速度提升8.05倍,FLOPs降至1.96G。

cs.CV 🔴 高级 2026-07-22 2 次浏览
Siying Wang Kangye Ji Di Wang Fei Cheng
缓存调度 进化搜索 变分推理 视觉运动控制 实时性

核心发现

方法论

EVO是一种无需训练的加速框架,通过进化搜索全局调度缓存刷新。每个候选方案表示为块-时间步格子上的完整计划。EVO引入冗余感知初始化和目标条件提前停止机制,使搜索更高效。

关键结果

  • EVO在多个操控基准上保持近乎完整的性能,同时显著减少计算量,实现动作生成速度提升高达8.05倍,FLOPs从15.77G减少到最低1.96G。
  • 在Push-T任务中,EVO通过跳过冗余计算块,显著提高了推理速度,同时保持了闭环性能。
  • EVO在Kitchen任务中展示了其在复杂操控环境中的有效性,成功率接近未加速模型。

研究意义

EVO在不改变预训练扩散策略的情况下,显著降低了推理成本,解决了实时部署的计算瓶颈问题。这一方法为视觉运动控制领域提供了新的加速思路,具有重要的学术和工业价值。

技术贡献

EVO通过全局缓存调度策略,突破了现有方法在块间冗余分配上的局限,提出了基于进化搜索的优化框架,提供了新的工程实现可能性。

新颖性

EVO首次将进化搜索应用于缓存调度问题,提出了全局预算分配策略,与现有方法相比,显著提高了性能与效率的平衡。

局限性

  • EVO的性能依赖于初始冗余感知初始化的准确性,可能在某些情况下导致次优结果。
  • 进化搜索的计算开销较高,可能不适用于所有实时应用场景。

未来方向

未来工作可以探索更高效的搜索算法,进一步减少计算开销,并在更多复杂任务中验证EVO的适用性。

AI 总览摘要

扩散策略在视觉运动控制中表现出色,但其迭代去噪过程导致推理开销大,难以满足实时部署需求。现有的缓存方法未能有效利用块间冗余,导致性能与效率的权衡不佳。

EVO通过进化搜索优化缓存计划,跳过冗余计算块,同时保持闭环性能。EVO引入冗余感知初始化和目标条件提前停止机制,使搜索更高效。无需重新训练,EVO可直接应用于预训练的扩散策略。

实验结果表明,EVO在多个操控基准上保持近乎完整的性能,同时显著减少计算量,实现动作生成速度提升高达8.05倍,FLOPs从15.77G减少到最低1.96G。这一方法为视觉运动控制领域提供了新的加速思路,具有重要的学术和工业价值。

深度分析

研究背景

扩散策略因其能够通过条件去噪过程建模多模态动作分布而在机器人控制中受到关注。尽管其在复杂操控环境中表现出色,但迭代去噪过程带来的推理开销限制了其实时控制的能力。现有的加速方法大多依赖于减少去噪步骤或通过剪枝和蒸馏减少计算,但这些方法通常需要额外的训练或改变采样过程。

核心问题

扩散策略的核心问题在于其迭代去噪过程带来的高计算开销,直接限制了可实现的动作频率,难以满足实时、平滑的机器人控制要求。现有的缓存方法未能有效利用块间冗余,导致性能与效率的权衡不佳。

核心创新

EVO的核心创新在于其全局缓存调度策略,通过进化搜索优化缓存刷新计划,跳过冗余计算块。EVO引入冗余感知初始化和目标条件提前停止机制,使搜索更高效。与现有方法相比,EVO显著提高了性能与效率的平衡。

方法详解

  • �� EVO使用进化搜索优化缓存刷新计划,每个候选方案表示为块-时间步格子上的完整计划。
  • �� 冗余感知初始化通过激活冗余引导初始种群,偏向冗余较少的块-时间步位置。
  • �� 目标条件提前停止机制在达到目标性能后终止搜索,减少不必要的评估。
  • �� 选定的缓存计划可直接应用于预训练的扩散策略,无需重新训练。

实验设计

实验在多个机器人操控基准上进行,包括Push-T、Block Push和Kitchen任务。使用预训练的DP-T策略作为基线,评估EVO与代表性训练自由缓存方法的性能。实验中使用成功率作为主要性能指标,并报告动作生成所需的FLOPs和相对速度提升。

结果分析

EVO在多个操控基准上保持近乎完整的性能,同时显著减少计算量,实现动作生成速度提升高达8.05倍,FLOPs从15.77G减少到最低1.96G。在Push-T任务中,EVO通过跳过冗余计算块,显著提高了推理速度,同时保持了闭环性能。

应用场景

EVO可直接应用于视觉运动控制中的实时机器人操控任务,尤其适用于需要高动作频率和低延迟的场景。其无需重新训练的特性使其易于集成到现有系统中。

局限与展望

EVO的性能依赖于初始冗余感知初始化的准确性,可能在某些情况下导致次优结果。进化搜索的计算开销较高,可能不适用于所有实时应用场景。未来工作可以探索更高效的搜索算法,进一步减少计算开销。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们需要在不同的工作站之间传递零件。如果每次都从头开始生产零件,效率会很低。EVO就像一个聪明的工厂经理,他知道哪些工作站的零件可以重复使用,从而节省时间和资源。通过这种方式,工厂可以更快地生产出高质量的产品,而不需要额外的投入。

简单解释 像给14岁少年讲一样

想象你在玩一个需要快速反应的游戏,每次都要从头开始会很慢。EVO就像是游戏中的一个超级助手,它知道哪些步骤可以跳过,从而让你更快地完成任务。这样,你就可以在不牺牲游戏体验的情况下,更快地达到目标!

术语表

Diffusion Policy (扩散策略)

一种通过条件去噪过程建模多模态动作分布的策略,常用于视觉运动控制。

在论文中用于实现强大的视觉运动控制。

Evolutionary Search (进化搜索)

一种优化算法,通过选择、交叉、变异等操作在大规模离散空间中搜索最优解。

用于优化缓存刷新计划。

Cache Scheduling (缓存调度)

通过合理安排缓存刷新位置,减少重复计算,提高推理效率的方法。

EVO通过全局缓存调度策略优化推理效率。

Redundancy-aware Initialization (冗余感知初始化)

一种初始化策略,通过激活冗余引导初始种群,偏向冗余较少的块-时间步位置。

用于提高进化搜索的效率。

Target-conditioned Early Stopping (目标条件提前停止)

一种搜索机制,在达到目标性能后终止搜索,减少不必要的评估。

用于降低进化搜索的计算开销。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务中应用EVO?需要探索更高效的搜索算法以减少计算开销。
  • 2 EVO在不同任务中的适用性如何?需要在更多任务中验证其性能。

应用场景

近期应用

实时机器人操控

EVO可用于需要高动作频率和低延迟的实时机器人操控任务,直接提升系统响应速度。

远期愿景

智能制造

通过优化生产流程中的资源分配,EVO有潜力在智能制造领域实现更高效的生产。

原文摘要

Diffusion policies achieve strong visuomotor control by iteratively denoising action chunks, but repeated denoising makes real-time deployment computationally demanding. Cache-based methods reduce inference cost by reusing intermediate activations, but existing training-free schedules typically allocate computation uniformly across blocks, ignoring heterogeneous redundancy across blocks and leading to a suboptimal performance-efficiency trade-off. To bridge this gap, we introduce Evolving Cache Schedules (EVO), a training-free acceleration framework that globally schedules cache refreshes via evolutionary search. EVO represents each candidate as a complete schedule over the block-timestep lattice. Thus, redundant transformer computations during iterative denoising can be skipped through cache reuse while preserving closed-loop rollout performance. To make the search practical, EVO introduces redundancy-aware initialization, which seeds the population with promising schedules, and target-conditioned early stopping, which verifies and terminates once a desired performance target is reached. The offline-optimized schedule can be directly plugged into pretrained diffusion policies without retraining. Extensive manipulation benchmarks show that EVO preserves near-full performance while substantially reducing computation, achieving up to 8.05x action-generation speedup and reducing FLOPs from 15.77G to as low as 1.96G. Source code is available at https://github.com/pillom/EVO.

cs.CV