GlanceWAM: Sparse Test-Time Imagination for World-Action Models

TL;DR

GlanceWAM通过异步测试时想象,突破速度与成功的两难,达成72.2%成功率。

cs.CV 🔴 高级 2026-08-25 13 次浏览
Linhan Wang Zijian An Mingyuan Zhang Chen Dai Yi Xu Can Cui Zichong Yang Yinlin Chen Lifeng Zhou Chang-Tien Lu
机器人学习 视觉预测 异步推理 深度生成模型 实时控制

核心发现

方法论

本文提出的GlanceWAM基于单一视频DiT模型,将视觉想象与控制解耦。采用异步生成机制,背景中利用缓慢时钟提前想象未来单帧,控制端在纯潜在空间中以48ms的速度解码动作块。引入非干扰注意掩码和抗时效的训练策略,有效隔离未来预测与观察编码,确保异步想象的稳定性。模型在纯演示数据上训练,结合多层次潜在特征融合,实现秒级长远预测与高频动作控制的结合。

关键结果

  • 在24任务的RoboCasa厨房基准测试中,成功率达72.2%,优于同步模型67.1%和无想象的64.4%。在LIBERO测试中达99.0%,在NVIDIA A100 GPU上以48ms每块实现,速度比同步基线快24倍。
  • 异步想象显著提升任务成功率,尤其在长远预测和复杂操作中表现优异。模型在训练中引入随机时延和潜在偏移,增强抗时效性,验证其在实际控制中的鲁棒性。
  • 关键机制包括非干扰的prefix-LM掩码和抗时效的训练策略,确保潜在空间中长距离预测的准确性和稳定性。

研究意义

该研究突破了传统同步视频生成的瓶颈,提出异步潜在空间想象,兼顾实时性与预测精度,为机器人复杂任务中的视觉预测提供新思路。解决了现有WAM模型在高频控制下因生成延迟导致的性能瓶颈,推动视觉预测在实际机器人系统中的应用落地,具有重要的理论和工程价值。未来可扩展到多模态、多任务场景,提升自主系统的长远规划能力。

技术贡献

本文提出的核心技术在于将视觉想象与动作控制在潜在空间中异步解耦,利用非干扰注意掩码确保信息隔离,并引入抗时效训练策略增强鲁棒性。模型架构融合了单一视频DiT和流式动作头,实现秒级长远预测与高频动作解码的结合。该方案在保持预测质量的同时大幅提升推理速度,为未来高效视觉预测提供了新范式。

新颖性

首次提出在单一视频DiT中实现异步潜在空间想象,突破了同步生成的速度限制。通过非干扰掩码和抗时效训练,确保长距离预测的稳定性与实时性,区别于传统同步WAM和离线预训练方法。该创新在机器人视觉预测领域开辟了新路径,兼顾速度与成功率。

局限性

  • 模型依赖大量演示数据,泛化到未见场景仍存在挑战。长远预测的潜在误差可能影响复杂任务的成功率,尤其在动态变化剧烈的环境中。
  • 异步机制虽提升速度,但在极端延迟或潜在失效情况下可能出现预测偏差,需进一步增强鲁棒性。
  • 当前在高端GPU上实现,硬件成本较高,未来需优化模型结构以适应边缘设备。

未来方向

未来将探索多模态融合,结合语义和触觉信息,提升长远预测的准确性。还计划引入自适应异步策略,根据环境复杂度动态调整想象频率与深度。此外,将研究模型在多机器人协作和复杂场景中的扩展能力,推动视觉预测在工业和家庭机器人中的广泛应用。

AI 总览摘要

随着机器人任务的复杂化,视觉预测在自主决策中扮演着关键角色。传统的世界-行动模型(WAM)在同步生成高质量视频时面临延迟瓶颈,限制了实时反应能力。为解决这一难题,本文提出了GlanceWAM,通过异步潜在空间想象实现了速度与成功率的双赢。模型在背景中缓慢生成未来长远帧,控制端在潜在空间中高速解码动作,避免了繁重的像素级生成延迟。引入非干扰注意掩码和抗时效训练策略,确保长距离预测的稳定性。实验结果显示,在24任务的RoboCasa厨房基准中,成功率达72.2%,超越同步模型和无想象方案,同时推理速度提升24倍,达到48ms每块。该方法不仅突破了速度-成功的两难局面,还为未来机器人视觉预测提供了新范式。未来工作将聚焦多模态融合、环境适应性和硬件优化,推动自主系统的智能化发展。

深度分析

研究背景

机器人自主操作依赖于对环境的准确感知与预测。早期方法多采用密集的多帧视频预测,存在高延迟问题。近年来,基于深度生成模型的WAM逐步兴起,如Cosmos Policy和VideoVLA,结合扩散模型和自回归机制,提升了预测能力,但同步生成仍受制于计算瓶颈,难以满足实时控制需求。离线预训练和特征正则化虽降低了推理延迟,但牺牲了视觉前瞻的指导作用。现有研究多在平衡速度与预测质量方面探索,尚未解决长远预测与高频控制的矛盾。

核心问题

核心问题在于同步生成视频导致的推理延迟,限制了机器人在复杂环境中的反应速度。高质量的视觉想象虽能提升任务成功率,但在控制环节中实时生成成本过高,阻碍了实际应用。如何在保证预测准确的同时实现低延迟,成为关键难题。传统模型在高频动作控制中无法兼顾长远预测,导致任务失败率上升。解决此问题需要创新的架构设计,将预测与控制解耦,提升系统的响应能力。

核心创新

本文提出异步潜在空间想象机制,将长远预测在背景中缓慢生成,控制端在潜在空间中高速解码动作。引入非干扰的prefix-LM掩码,确保未来预测信息不污染观察编码。采用抗时效训练策略,使模型在潜在预测偏差下仍能保持稳定。结合单一视频DiT模型,实现长距离预测与高频控制的无缝融合。此方案突破了同步生成的速度瓶颈,兼顾预测质量与实时性,为机器人视觉预测提供新思路。

方法详解

  • �� 构建基于潜在视频扩散Transformer(SkyReels-V2-DF)模型,将视频帧压缩到潜在空间。
  • �� 设计双时尺度架构:背景中缓慢生成未来长远帧(Hf约3秒),控制端在潜在空间中以48ms速度解码动作。
  • �� 引入非干扰prefix-LM掩码,确保观察、未来目标和长远预测在transformer中的信息隔离。
  • �� 采用多层潜在特征融合,将浅层低级细节与深层语义结合,增强预测稳定性。
  • �� 训练过程中,结合随机偏移u和潜在偏差,增强模型对异步时延的鲁棒性。
  • �� 在推理中,背景异步生成未来潜在帧,控制端在潜在空间中连续解码动作块,避免像素级生成延迟。

实验设计

采用RoboCasa厨房和LIBERO两个基准,评估模型在多任务环境中的成功率和推理速度。对比同步视频生成模型和无想象方案,验证异步机制的优势。在不同硬件平台上测试,确保模型在实际控制时间预算内运行。引入消融实验,分析非干扰掩码和抗时效训练的贡献。参数设置包括潜在空间维度、生成步数和偏移随机范围,确保模型在低数据条件下快速收敛。

结果分析

在24任务的RoboCasa厨房测试中,成功率达72.2%,比同步模型提升5.1%,且在LIBERO达99.0%。推理速度在单GPU上实现48ms/块,远超同期同步模型的1秒以上。消融分析显示,异步想象提升任务成功率,且模型对潜在偏差具有良好鲁棒性。非干扰掩码确保预测稳定,抗时效训练增强模型在潜在偏移下的表现。这些结果验证了异步潜在想象的有效性和实用性。

应用场景

该技术适用于高动态环境中的机器人操作,如家庭助手、工业自动化等。只需少量演示数据即可训练,便于快速部署。未来可扩展到多模态感知和多机器人协作,提升自主系统的长远规划能力。模型在硬件成本方面仍有优化空间,适合高端自动化场景。

局限与展望

模型依赖演示数据,泛化能力在未见场景中仍有限。长远预测误差可能累积,影响复杂任务表现。异步机制在极端延迟或硬件故障时可能失效,需增强鲁棒性。硬件需求较高,未来需优化模型结构以适应边缘设备。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,平时每一步都要等前一道菜做好才能开始下一步,非常慢。而这个新方法像是你提前在脑海里想象未来几秒会发生什么,然后在实际操作时只需快速跟着想象做事。这样你既能提前准备,又能快速度完成任务。传统方法每次都要等所有菜都做好才能继续,而新方法则像提前“预演”一遍,节省了很多时间。它让机器人像有了“预知未来”的能力,既聪明又快,能在厨房里快速应对各种变化。

简单解释 像给14岁少年讲一样

你知道有时候我们做事情会提前想象一下接下来要做什么吗?比如准备上学时,脑海里会预演一下路上可能遇到的事情,然后提前做好准备。这个研究就像让机器人也能提前“预演”未来几秒会发生什么,然后再快快行动。以前机器人每次都得等所有信息都准备好才能行动,太慢了。现在这个方法让机器人在后台提前想象未来的场景,然后在需要的时候快速行动,就像你提前预演一遍考试题,考起来更快更准。这样,机器人就能更聪明、更快地完成任务,就像我们提前准备好下一步一样。

术语表

潜在空间 (Latent Space)

一种压缩视频信息的抽象空间,用于高效表示场景内容。技术上是通过变分自编码器(VAE)实现的潜在编码。

模型在潜在空间中进行长远预测和动作解码,避免像素级生成延迟。

非干扰注意掩码 (Non-interfering Attention Mask)

一种限制模型不同部分信息交流的机制,确保观察、未来目标和长远预测信息在transformer中的隔离。

保证未来预测不污染观察编码,提升模型稳定性。

异步潜在推理 (Asynchronous Latent Inference)

在背景中缓慢生成未来潜在帧,控制端在潜在空间中高速解码动作的机制。

实现速度与预测的解耦,满足实时控制需求。

潜在扩散Transformer (Latent Diffusion Transformer)

结合扩散模型与Transformer架构,用于潜在空间中高效生成视频内容。

核心模型架构,支撑异步长远预测。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低模型在极端动态环境中的预测误差,确保长远规划的准确性。当前模型在快速变化场景下仍存在潜在偏差,未来需结合多模态信息增强鲁棒性。
  • 2 模型在边缘设备上的部署效率和硬件适应性仍需优化,尤其是在低算力平台上的实时性能保障。

应用场景

近期应用

家庭机器人

可在家庭环境中实现快速响应和长远规划,帮助完成日常任务如取物、清洁等,减少延迟,提高效率。

工业自动化

在制造线或仓储中实现高效操作,提前预测物体运动轨迹,提升生产效率和安全性。

远期愿景

自主系统长远规划

赋予机器人更强的预知能力,支持复杂多任务协作和环境适应,推动智能自主系统的普及。

原文摘要

Video generative models provide rich physical priors for robot learning, yet existing world-action models (WAMs) face a fundamental trade-off: synchronous video generation at control rate is latency-prohibitive, while abandoning test-time visual imagination sacrifices task success. We show that visual imagination achieves both real-time inference and superior success rates when generated asynchronously off the critical path and consumed directly in latent space. We introduce GlanceWAM, which decouples imagination from control within a single video DiT: an asynchronous proposer glances ahead on a slow clock to imagine a single lookahead frame seconds into the future in the background, while an action head decodes action chunks at control rate (48 ms) purely in latent space without blocking. Enabled by a non-interfering attention mask that isolates video representations and staleness-robust horizon training that accommodates asynchronous lookahead aging, GlanceWAM breaks the speed-success dilemma. Trained purely on demonstrations, it attains 72.2% on the 24-task RoboCasa kitchen benchmark (surpassing synchronous Cosmos Policy at 67.1% and imagination-free co-training at 64.4%) and 99.0% on LIBERO, executing at 48 ms per chunk on an NVIDIA A100 GPU (24x faster than synchronous baselines). Code is available at https://github.com/linhanwang/GlanceWAM.

cs.CV