ActionSplice: In-Flight Action Editing for Interactive World Models

TL;DR

ActionSplice通过Counterfactual State Transport实现飞行中动作编辑,显著降低LPIPS误差,提升响应速度。

cs.CV 🔴 高级 2026-09-08 19 次浏览
Pardis Taghavi Tingyu Guo Jonas Lossner Gaurav Pandey Reza Langari
视频生成 动作控制 世界模型 实时编辑 深度学习

核心发现

方法论

本文提出的ActionSplice框架基于Counterfactual State Transport (CST),通过学习残差预测在冻结世界模型状态下实现动作的实时修正。分为两类:CSTR(全块更新)和CSTT(时序部分更新),利用匹配回滚对训练,避免重复评估。核心机制包括:• 训练残差预测器以估算修正状态;• 采用掩码限制修正范围;• 利用匹配回滚生成监督目标;• 在推理中冻结模型,快速修正中断状态,避免重跑已完成的评估。该方法在minWM-Wan Action2V和HY-WM1.5上均实现显著性能提升。

关键结果

  • 在minWM-Wan Action2V上,CSTR将LPIPS相对直接条件交换降低61.5%,在HY-WM1.5上降低75.9%;CSTT在suffix LPIPS上分别降低56.1%和77.5%。速度方面,CSTT比等待策略快2.73倍和1.69倍。在HY-WorldPlay协议中,CSTR达到25.66 dB的PSNR,0.6902的SSIM,LPIPS为0.1337,优于传统方法。
  • 方法有效应对采样中动作变化,减少重跑和延迟,提升交互响应性。通过匹配回滚训练,模型在不同场景下保持高一致性和稳定性。

研究意义

该研究突破了视频世界模型中实时动作编辑的瓶颈,解决了动作在采样中突发变化导致的状态偏差问题。其创新的状态迁移机制为交互式视频生成提供了更高的灵活性和响应速度,推动虚拟环境、游戏、仿真等应用的实时控制技术发展。该技术的引入极大改善了用户体验,缩短了控制延迟,为未来动态场景编辑奠定基础。

技术贡献

本文提出的ActionSplice框架引入了基于匹配回滚的残差预测机制,创新性地实现了在冻结模型状态下的中途动作修正。区别于传统的条件交换和全重跑方法,CST通过学习状态迁移残差,提供了更高的修正精度和效率。两种变体(CSTR和CSTT)满足不同时间粒度的控制需求,增强了模型的灵活性。该方案无需共享潜空间或迁移权重,具有良好的泛化性和可扩展性,为视频世界模型的交互性提供了新思路。

新颖性

这是首个在冻结世界模型状态下实现飞行中动作编辑的系统,结合匹配回滚和残差学习,突破了传统重跑和条件交换的局限。其创新点在于:• 提出基于匹配回滚的状态迁移机制;• 设计两类细粒度的动作修正策略;• 实现无需模型重训练的快速响应,极大提升交互效率。这些创新为实时视频生成中的动作编辑提供了新范式。

局限性

  • 当前方法依赖匹配回滚的训练样本,可能在极端场景或复杂动作变换中表现不足。
  • 在高复杂度场景下,残差预测的准确性仍有限,可能引入偏差。
  • 模型在极端长序列或多次中断后,状态偏差可能累积,影响生成质量。

未来方向

未来将探索更鲁棒的匹配回滚策略,结合自监督学习提升残差预测的泛化能力。同时,考虑多模态信息融合,增强动作编辑的语义一致性。还将优化算法效率,支持更复杂场景和多动作交互,为虚拟现实和交互式娱乐提供更强支持。

AI 总览摘要

视频世界模型的实时交互能力是虚拟环境、游戏和仿真等领域的核心需求。传统的chunk-autoregressive模型在生成连续视频时,动作的突发变化常导致状态偏差和响应延迟,限制了用户体验。本文提出的ActionSplice框架,通过Counterfactual State Transport(CST)机制,有效解决了采样中动作突变带来的状态不一致问题。

ActionSplice利用匹配回滚生成监督目标,学习在冻结模型状态下的残差迁移,从而在不中断生成流程的情况下,快速修正中断状态。其两种变体——全块更新的CSTR和时序局部更新的CSTT,满足不同控制粒度的需求。实验结果显示,在minWM-Wan Action2V和HY-WM1.5两个基准上,CSTR将LPIPS误差分别降低61.5%和75.9%,而CSTT在suffix LPIPS上降低56.1%和77.5%,同时速度提升2.73倍和1.69倍。

该技术显著提升了视频生成的交互响应速度和质量,为虚拟场景的动态控制提供了新的解决方案。其无需模型重训、兼容多模型架构的特性,为未来多模态、多场景的实时编辑奠定了基础。尽管如此,方法在极端复杂场景和多次中断后仍存在偏差累积的挑战,未来将结合自监督学习和多模态信息,进一步增强鲁棒性和适应性。

深度分析

研究背景

视频世界模型近年来快速发展,基于扩散和变分方法的模型支持高质量的交互式生成。代表性工作包括Valevski等的扩散模型、Wang等的多段自回归模型和HunyuanWorld的实时生成系统。这些模型在保持几何一致性和长时序连续性方面取得突破,但在动作突变、交互响应和状态修正方面仍存在瓶颈。传统方法多依赖等待下一帧或重跑全部评估,导致延迟增加,难以满足实时控制需求。

核心问题

核心问题在于在采样过程中突发动作变化时,如何快速修正模型状态以反映新控制,而不牺牲生成连续性和效率。现有方案多采用条件交换或全重跑,存在状态偏差大、响应慢的问题。尤其在交互式应用中,用户希望在不中断生成流程的情况下,实现动作的即时调整,极大考验模型的中途修正能力。这一挑战限制了视频模型在动态场景中的应用潜力。

核心创新

本文提出的ActionSplice引入了基于匹配回滚的状态迁移机制,创新性地解决了中途动作编辑的难题。具体创新点包括:1)利用匹配回滚生成目标状态,提供精确的监督信号;2)设计两类修正策略(全块和时序局部),满足不同粒度需求;3)在冻结模型状态下,学习残差迁移,实现快速修正;4)避免重跑已完成的评估,极大提升响应速度。这些创新突破了传统的限制,为实时交互提供了新思路。

方法详解

  • �� 训练残差预测器:利用匹配回滚对生成样本,学习在冻结状态下的状态迁移残差;• 设计掩码机制:限制修正范围,确保只在可编辑区域调整状态;• 生成监督目标:通过匹配回滚得到目标状态,训练残差预测器;• 采样修正:在中断点利用预测残差,快速修正状态,继续采样;• 两类变体:CSTR支持全块更新,CSTT支持局部(时序)更新,满足不同控制粒度需求;• 训练策略:利用匹配回滚生成训练样本,确保模型在不同场景下的泛化能力。

实验设计

在minWM-Wan Action2V和HY-WM1.5两个基准上,采用150个场景提示,进行多轮中断采样训练。对比方法包括等待、条件交换、部分重跑、重噪声和理想全回滚。评估指标涵盖LPIPS、PSNR、SSIM、边界误差和响应延迟。通过不同中断点和控制边界,验证ActionSplice在保持生成质量的同时,显著提升响应速度。实验还包括 ablation 研究,分析不同变体和掩码策略的影响。

结果分析

在LPIPS指标上,CSTR较直接条件交换降低61.5%(minWM)和75.9%(HY-WM1.5);CSTT在suffix LPIPS上分别降低56.1%和77.5%。速度方面,CSTT比等待快2.73倍(minWM)和1.69倍(HY-WM1.5)。在图像质量方面,CSTR达到25.66 dB的PSNR,0.6902的SSIM,LPIPS为0.1337,优于对比方法。整体结果显示,该方法在保持高质量生成的同时,大幅提升交互响应速度。

应用场景

该技术适用于虚拟现实、游戏引擎、交互式仿真等场景,支持用户在不中断生成流程的情况下,实时调整动作参数。只需少量训练样本即可实现快速修正,极大缩短了响应延迟。未来可结合多模态信息,增强场景理解和动作语义一致性,推动沉浸式虚拟环境的发展。

局限与展望

目前方法依赖匹配回滚训练样本,难以应对极端复杂场景或连续多次中断带来的偏差累积。残差预测在高复杂度场景下仍存在偏差,可能影响生成质量。此外,模型在长序列或多次中断后,状态偏差可能逐渐放大,未来需引入更鲁棒的状态校正机制和多模态信息融合以提升性能。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,突然有人打断你,要求你换个菜谱。传统做法是重新开始,浪费时间;或者只调整部分步骤,但可能做得不自然。ActionSplice就像有个聪明的助手,能在你还在炒菜时,偷偷观察到你被打断了,然后根据你想换的菜谱,快速调整锅里的内容,继续炒菜,而不用重新开始。它学会了在你还没完成的部分偷偷补救,确保菜肴看起来还很美味。这就像厨房里的魔法师,能在你忙碌中帮你快速改菜,既省时间又保证效果。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,突然想换个角色或者技能,但你还在战斗中。以前的方法是暂停游戏,重新加载新角色,花很多时间。现在,有个聪明的助手可以在你还在战斗的时候,偷偷帮你调整角色的状态,让你不用暂停,直接继续战斗。这就像你有个隐形的帮手,能在你不注意时,把你的角色状态悄悄改好,然后你还能继续打怪,不卡顿。这种技术让游戏变得更流畅,反应更快,玩家体验也更棒。

术语表

Counterfactual State Transport (CST)(反事实状态迁移)

一种在冻结模型状态下,通过学习残差实现状态快速修正的方法。技术上利用匹配回滚生成目标状态,避免重跑已完成的评估。

本文中用于实现飞行中动作编辑的核心机制。

匹配回滚(Matched Rollback)

通过重放部分评估,生成与中断状态对应的目标状态,用于训练残差预测器。确保修正的状态与理想状态一致。

训练中用来提供监督信号。

LPIPS(Learned Perceptual Image Patch Similarity)

一种衡量图像相似度的指标,越低表示图像越相似。用于评估生成内容的视觉一致性。

评估生成视频的质量。

PSNR(Peak Signal-to-Noise Ratio)

衡量图像或视频重建质量的指标,数值越高代表质量越好。

用于比较生成内容的清晰度。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升残差预测在极端复杂场景中的准确性,特别是在多次中断和连续动作变换情况下的鲁棒性。
  • 2 是否可以结合多模态信息(如语音、文本)实现更智能的动作修正和场景理解。

应用场景

近期应用

虚拟现实交互控制

支持用户在虚拟环境中实时调整动作,无需等待下一帧,提升沉浸感和交互体验。

游戏中的动态场景编辑

允许玩家在游戏中即时改变角色动作或场景状态,增强游戏的流畅性和趣味性。

远期愿景

智能虚拟助手

未来可以实现自主学习和修正,支持复杂场景中的多模态交互,推动虚拟环境的智能化。

原文摘要

Chunk-autoregressive video world models typically condition each generated chunk on one action. An action received during sampling must therefore wait for the next chunk, condition future solver evaluations on a state produced under the previous action, or trigger rollback that repeats completed evaluations. We introduce ActionSplice, an inference framework that formulates this problem as Counterfactual State Transport (CST). A lightweight corrector transports the interrupted backbone-native representation toward the matched state induced by the revised action at the same solver step. The world model and sampler remain frozen, and sampling resumes without replaying completed evaluations. The retargeting variant $\mathrm{CST}*{R}$ updates the entire active chunk, while the temporal-splicing variant $\mathrm{CST}*{T}$ preserves a temporal prefix and updates only the suffix. Across minWM-Wan Action2V and HY-WM1.5, $\mathrm{CST}*{R}$ reduces rollback-relative LPIPS by 61.5% and 75.9% relative to direct condition swapping. $\mathrm{CST}*{T}$ reduces suffix LPIPS by 56.1% and 77.5%, respectively, while providing $2.73\times$ and $1.69\times$ pixel-ready speedups over waiting. Under the HY-WorldPlay protocol, $\mathrm{CST}_{R}$ obtains a PSNR of 25.66 dB, an SSIM of 0.6902, and an LPIPS of 0.1337 against the original rollout.

cs.CV cs.LG