LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation

TL;DR

LayerRecall为视频生成引入状态条件的记忆路由器,显著提升长距离内容恢复能力。

cs.CV 🔴 高级 2026-08-28 95 次浏览
Yixuan Ding Jiahao Kong Wei Huang Ruijie Quan Yi Yang
视频生成 记忆机制 深度学习 Diffusion模型 长时一致性

核心发现

方法论

本文提出LayerRecall,通过分析视频DiT层对不同时间范围的偏好,设计了层选择性记忆路由机制。该机制结合当前条件,选择性地将历史KV状态注入到特定记忆敏感层。训练采用无标签的跨时域预测匹配(CHPM)策略,利用长时上下文作为监督信号,优化记忆路由的检索与注入策略。模型在MemoBench、MovieBench等多个长视频一致性评估中表现优异,显著优于现有方法。

关键结果

  • 在100个多场景评测中,LayerRecall在MemoBench和MovieBench上整体得分最高,分别提升了5%以上的记忆一致性指标。其长距离内容恢复能力优于基线模型,尤其在重现主体身份和场景细节方面表现优异,达到了行业领先水平。
  • 在VBench-Long上,模型表现与原始DiT骨干网络持平,验证了其在保持局部连续性的同时增强长距离记忆的能力。引入的层选择性注入策略显著减少了内容漂移和场景错位。
  • 消融实验显示,CHPM训练策略提升了记忆路由的准确性,整体性能比随机初始化提升了0.03分,验证了预测匹配的有效性。

研究意义

该研究突破了视频生成中长距离内容保持的瓶颈,提供了一种高效、可迁移的记忆增强方案。其在多场景、多任务中的优异表现,为未来长时视频生成、虚拟场景重建等应用提供了坚实基础,有望推动行业向更高质量、更长时长的生成目标迈进。

技术贡献

提出层级偏好分析,揭示不同网络层对不同时间范围的偏好差异。设计了状态条件的层选择性记忆路由器,结合无标签的预测匹配训练策略,实现了长距离记忆的有效利用。模型兼容多种骨干网络,具有良好的迁移性和扩展性,极大丰富了视频生成中的记忆机制设计思路。

新颖性

首次系统分析了视频DiT层的时间偏好差异,提出了结合当前条件的层选择性记忆路由器。与传统的全局记忆或固定锚点不同,该方法实现了动态、选择性地注入历史信息,解决了长距离内容保持的关键难题,具有较强创新性。

局限性

  • 模型在极端长距离场景中仍存在内容漂移问题,部分场景细节难以完全还原,可能受限于训练数据的多样性。
  • 训练过程中对长时上下文的依赖较大,计算成本较高,实际部署时需优化推理效率。
  • 对高质量长视频数据的依赖较强,未来需探索更高效的无监督或弱监督训练策略。

未来方向

未来将结合更大规模、多模态数据,提升模型对复杂场景的理解与记忆能力。探索多层次、多粒度的记忆机制,结合强化学习优化记忆注入策略。此外,考虑模型在实时应用中的推理优化,推动其在虚拟现实、长视频编辑等行业的落地。

AI 总览摘要

视频生成技术近年来取得了飞跃发展,但长距离内容一致性仍是核心难题。传统方法多依赖局部记忆或固定锚点,难以应对主体身份、场景细节的长时保持。本文提出LayerRecall,一种基于状态条件的层选择性记忆路由器,结合深度分析不同网络层对历史信息的偏好,有效增强长距离内容恢复能力。

该机制通过无标签的跨时域预测匹配(CHPM)进行训练,利用长时上下文作为监督信号,优化历史信息的检索与注入策略。模型在MemoBench和MovieBench等多个长视频一致性评估中表现优异,整体性能优于现有主流方法,尤其在主体身份和场景细节的长距离重现方面具有明显优势。

实验结果显示,LayerRecall不仅提升了长距离内容的恢复能力,还保持了局部连续性,避免了内容漂移和场景错位的问题。其层级偏好分析揭示不同网络层对不同时间范围的偏好差异,为未来记忆机制设计提供了新思路。该技术具有良好的迁移性和扩展性,有望推动长视频生成、虚拟场景重建等行业的发展,开启视频内容理解与生成的新篇章。

尽管取得了显著进展,模型在极端长距离场景中仍存在一定的内容漂移,训练成本较高,未来需结合更大规模、多模态数据和强化学习策略,进一步提升其性能和实用性。整体而言,LayerRecall为长时视频生成提供了创新的技术路径,具有广泛的应用前景。

深度分析

研究背景

视频生成技术经历了从基于GAN的早期方法到基于扩散模型的高保真合成。Diffusion Transformers(Peebles和Xie 2023)成为主流架构,支持高质量视频合成。近年来,研究者尝试将视频生成转向自回归和因果建模(Yin et al. 2025),利用KV缓存实现长时推理。尽管如此,长距离内容保持仍面临记忆稀疏、内容漂移等挑战,尤其在主体身份和场景细节的连续性方面。

核心问题

长视频生成中,如何在有限的记忆资源下保持内容的长距离一致性,是当前的核心难题。现有方法多依赖局部记忆或固定锚点,难以应对主体反复出现、场景变化等复杂场景,导致内容漂移和场景错位。如何动态选择性地利用历史信息,且保证其在不同网络层的有效注入,是亟待解决的问题。

核心创新

本研究提出LayerRecall,结合网络层偏好分析,设计了状态条件的记忆路由器,实现了:1)基于当前状态选择性检索历史KV;2)在特定记忆敏感层注入历史信息,保持局部连续性。引入无标签的预测匹配(CHPM)训练策略,通过长时上下文作为教师,指导有限记忆模型学习长距离内容的重现。此方案突破了传统全局记忆的局限,提供了高效、迁移性强的记忆增强机制。

方法详解

  • �� 通过分析视频DiT模型不同层对时间范围的偏好,识别出记忆敏感层。• 设计状态条件的检索机制,将历史KV状态与当前状态结合,动态筛选相关内容。• 只将检索到的KV注入到偏好层,保持其他层的局部注意。• 训练采用CHPM策略,利用长时长参考模型(教师)预测目标,指导有限记忆模型(学生)学习长距离内容重现。• 通过无标签的预测匹配,优化记忆路由的检索和注入策略,避免依赖昂贵的标注数据。

实验设计

模型在MemoBench、MovieBench和VBench-Long等多个长视频一致性和记忆诊断数据集上进行评估。训练使用384帧序列,分为48块8帧的片段,采用一阶去噪步骤。对比多种基线模型,评估指标包括主体一致性、场景保持和运动平滑。通过消融实验验证CHPM的有效性,分析不同层选择策略对性能的影响。实验还包括跨骨干迁移和推理效率测试。

结果分析

LayerRecall在100个多场景评测中,整体得分领先,MemoBench和MovieBench提升超过5%。在长距离主体和场景细节恢复方面表现优异,显著减少内容漂移。与原始DiT骨干保持一致的同时,增强了长距离记忆能力。消融实验显示,预测匹配策略提升性能0.03分,层选择性注入降低了内容错位和运动不连续。跨骨干迁移验证了方法的泛用性,推理时间增加极少,实际应用潜力大。

应用场景

该技术适用于长视频内容创作、虚拟场景重建、虚拟主播等行业,尤其在需要保持主体身份和场景一致性的场景中表现优异。未来可结合多模态信息,提升模型对复杂场景的理解能力,为虚拟现实、影视特效等提供技术支撑。

局限与展望

模型在极端长距离场景中仍存在内容漂移问题,部分细节难以完美还原。训练成本较高,推理效率尚需优化。对高质量长视频数据依赖较大,未来需探索更高效的无监督训练策略。

通俗解读 非专业人士也能看懂

想象你在看一本长篇小说,故事中人物会时不时出现、消失,然后又重新出现。传统的技术就像只记住最近几章的内容,遇到人物再出现时就忘记了之前的细节。LayerRecall就像给你装了一个聪明的记忆助手,它能在你需要的时候,从很久以前的章节里找出人物的身份和场景细节,并巧妙地把这些信息插入到当前章节中。这样,即使人物在中间消失一段时间,再次出现时,你还能一眼认出他是谁、场景是哪里。这个助手还会根据故事的发展,自动判断哪些信息需要用到,哪些可以暂时放一放。它通过不断学习,变得越来越聪明,帮助故事变得连贯、真实。未来,这个技术可以让电影、动画甚至虚拟现实中的场景变得更加自然和长久,像看一部永不结束的精彩大片一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级长的游戏,你需要记住很多人物和场景。有时候,你会遇到一个人物,玩了一会儿他又消失了,过了一段时间又出现。以前的游戏只能记住最近的几分钟内容,所以当人物再次出现时,你可能会忘记他是谁或他之前做了什么。LayerRecall就像给你装了一个超级记忆宝盒,它可以存储你之前遇到的所有重要人物和场景信息。当这些人物再次出现时,它会帮你快速找出他们是谁,记住他们之前的动作和特征。这样,你就能一直跟得上故事的发展,不会迷失方向。这个宝盒还能自己判断哪些信息最重要,优先保存和使用。未来,这项技术可以让我们的虚拟世界变得更真实、更长久,就像看一部永远不会结束的精彩电影一样。是不是很酷?

原文摘要

Autoregressive video diffusion enables scalable long-video generation by producing chunks from a bounded recent context. While recency-based caching preserves local continuity, it evicts historical cues needed when subjects, objects, scenes, or attributes reappear. Existing memory mechanisms expose models to nonlocal history, but access alone does not ensure effective use. Our analysis reveals that video DiT layers exhibit distinct preferences for current, recent, and distant context, suggesting that long-range memory requires deciding both what to retrieve and where to use it. We introduce LayerRecall, a current-conditioned, layer-selective memory router that retrieves relevant historical K/V states and injects them only into backbone-specific memory-sensitive layers while preserving local attention elsewhere. To reduce reliance on scarce high-quality long-horizon videos and explicit memory-allocation labels, we further propose Cross-Horizon Prediction Matching (CHPM), which uses a privileged long-context reference to supervise the bounded-memory router in prediction space. Across 100 multi-shot evaluation prompts, LayerRecall achieves the best overall results on MemoBench and MovieBench while matching its backbone on VBench-Long, demonstrating stronger long-range recovery without sacrificing local continuity. Qualitative analyses further reveal memory-guided self-correction, whereby initially mismatched local attributes return to their historical appearance without resetting ongoing motion or scene structure. Additional analyses show cross-backbone portability and negligible inference overhead.

cs.CV