StoryMem: Multi-shot Long Video Storytelling with Memory

TL;DR

StoryMem通过Memory-to-Video机制,将预训练单镜头扩散模型转化为多镜头长视频讲故事工具,显著提升跨镜头一致性。

cs.CV 🔴 高级 2025-12-23 26 次浏览
Kaiwen Zhang Liming Jiang Angtian Wang Jacob Zhiyuan Fang Tiancheng Zhi Qing Yan Hao Kang Xin Lu Xingang Pan
视频生成 多镜头故事 记忆机制 扩散模型 长视频

核心发现

方法论

本文提出Memory-to-Video(M2V)框架,结合显式视觉记忆与单镜头扩散模型,通过动态更新的关键帧记忆库实现多镜头长视频生成。利用CLIP特征筛选语义关键帧,结合Aesthetic过滤确保记忆稳定性。采用Latent拼接与负RoPE偏移(Negative RoPE Shift)技术,将记忆注入模型,仅需LoRA微调,实现跨镜头一致性。该方法在预训练单镜头模型基础上,增强长视频的场景连贯性与人物一致性。

关键结果

  • 在ST-Bench基准上,StoryMem在跨镜头一致性指标上优于HoloCine和单镜头模型,提升约28.7%,整体一致性达0.5337。生成的长视频在视觉质量和故事连贯性方面表现优异,保持角色一致、场景连贯,且支持定制化场景切换。
  • 通过引入语义筛选和美学过滤,确保记忆库内容丰富且稳定,有效减少信息冗余。实验显示,StoryMem在保持高视觉质量的同时,显著提升多镜头长视频的连贯性和符合故事脚本的准确性。
  • 微调仅需少量参数(LoRA),避免大规模重新训练,极大降低训练成本,同时兼容多种应用场景,包括场景过渡和参考图像引导。

研究意义

该研究突破了长视频生成中跨镜头一致性难题,结合人类记忆机制,提出高效且可扩展的多镜头故事生成方案。其技术创新不仅提升了生成视频的连贯性和视觉品质,也为未来自动化影视制作、虚拟角色叙事等应用提供了理论基础和实践工具,推动多模态内容创造的边界。该方法的高效微调策略和多场景适应能力,为行业实现个性化、长时长视频生成提供了可能,具有重要的学术和产业价值。

技术贡献

本文提出Memory-to-Video(M2V)机制,通过显式记忆库结合Latent拼接和负RoPE偏移,有效实现跨镜头一致性。只需微调少量参数(LoRA),便能在预训练单镜头模型基础上,生成长达数十秒的连贯故事视频。引入语义筛选与美学过滤,确保记忆内容丰富且稳定。该框架支持多场景扩展,如场景切换和参考图像引导,极大增强模型的适应性和实用性。

新颖性

首次将显式视觉记忆机制引入长视频生成,结合Latent拼接与负RoPE偏移技术,有效解决多镜头连贯性问题。不同于以往全注意力或独立关键帧方法,本文实现了高效、微调驱动的多镜头长视频生成,兼顾视觉质量与一致性,开创了多模态视频生成的新路径。

局限性

  • 当前方法依赖预训练模型的质量,可能在极端场景或复杂动作中表现不足,且记忆筛选策略在极端多样化场景下仍有优化空间。
  • 模型微调参数虽少,但在极长视频或高复杂度故事中仍存在一定的场景漂移风险,需进一步增强记忆更新机制。
  • 生成过程对计算资源要求较高,尤其在高分辨率和多场景切换时,仍需优化效率与速度。

未来方向

未来将探索更智能的记忆筛选与更新策略,结合多模态信息(如音频、动作)提升故事连贯性。还计划引入强化学习优化生成质量,扩展到更复杂的虚拟场景和交互式叙事,推动长视频自动生成技术的实用化。

AI 总览摘要

长视频故事生成一直是多模态内容创作中的核心难题。传统方法要么依赖全局建模,计算成本高昂,要么采用关键帧分离策略,导致场景切换不自然。本文提出的StoryMem框架,借鉴人类记忆机制,通过Memory-to-Video(M2V)技术,解决了跨镜头一致性和场景连贯性的问题。

核心创新在于引入显式视觉记忆库,结合CLIP语义筛选和Aesthetic过滤,动态维护关键帧信息,指导后续镜头生成。利用Latent拼接和负RoPE偏移技术,将记忆信息融入预训练单镜头扩散模型,仅需微调少量参数(LoRA),即可实现高质量、多镜头、长时间的故事视频生成。

在ST-Bench基准测试中,StoryMem在跨镜头一致性指标上优于现有最先进方法,整体得分提升约28.7%。生成视频中,角色保持一致,场景连贯,故事叙述自然流畅。该方法不仅提升了视觉品质,还支持场景过渡和个性化定制,极大拓展了多模态内容创作的应用场景。

未来,作者计划引入多模态信息融合、强化学习等技术,进一步提升生成的复杂度和真实性。该研究为自动化影视制作、虚拟角色叙事等提供了坚实的技术基础,推动长视频生成迈向更高水平。

深度分析

研究背景

视频生成技术近年来取得显著进展,尤其是基于扩散模型的短视频合成,如Stable Diffusion、Imagen Video等。单镜头高质量生成已较成熟,但长视频和多镜头叙事仍面临挑战。现有方案主要分为全局建模和关键帧分离两类:前者如LCT采用全注意力机制,计算成本高昂;后者依赖独立关键帧,缺乏场景连贯性。多镜头长视频生成需求在影视、虚拟现实等行业日益增长,亟需兼顾效率与一致性的方法。

核心问题

核心问题在于如何在保证生成质量的同时,实现跨镜头的长时间场景连贯。全局建模虽能捕获依赖关系,但计算成本巨大,难以扩展到分钟级视频;关键帧策略虽高效,却导致场景切换不自然,角色不一致。现有方法难以在保持高视觉品质的同时,确保故事的连贯性和人物一致性,限制了其实际应用。

核心创新

本文提出Memory-to-Video(M2V)机制,创新点包括:1)引入显式视觉记忆库,动态筛选语义关键帧,增强场景记忆;2)结合Latent拼接和负RoPE偏移技术,将记忆融入预训练模型,提升长时依赖捕获能力;3)仅需微调少量参数(LoRA),避免大规模训练,极大降低成本。该方案兼顾效率与效果,支持多场景扩展,突破了以往单镜头模型的限制。

方法详解

  • �� 构建基于预训练单镜头扩散模型(Wan2.2-I2V),利用Mask引导生成。
  • �� 设计Memory-to-Video(M2V)机制,将关键帧存入记忆库,动态筛选语义关键帧(CLIP特征)和美学过滤(HPSv3)。
  • �� 采用Latent拼接,将记忆Latent与视频Latent融合,结合负RoPE偏移,处理记忆与当前镜头的时间关系。
  • �� 通过微调LoRA参数,优化模型适应多镜头长视频生成。
  • �� 在每次生成后,更新记忆库,确保记忆内容的代表性和稳定性。
  • �� 支持场景切换和参考图像引导,增强多样性和个性化。

实验设计

在ST-Bench上,使用多场景、多镜头脚本,评估跨镜头一致性、视觉质量和脚本符合度。对比基线包括单镜头模型、关键帧扩展和HoloCine。参数设置包括:记忆长度1-10帧,负RoPE偏移S=5,微调参数约0.7B。通过用户主观评价和ViCLIP指标,验证方法优越性。还进行了消融实验,验证记忆筛选和过滤策略的效果。

结果分析

实验显示,StoryMem在跨镜头一致性指标上达0.5065,优于HoloCine(0.4628)和单镜头模型(0.2452),提升约28.7%。视觉质量和故事符合度也显著优于对比方法。记忆筛选和过滤策略有效减少信息冗余,确保记忆内容丰富且稳定。微调参数少,训练成本低,适应性强,支持多场景扩展。

应用场景

该技术可应用于自动影视制作、虚拟主播、虚拟现实内容创作等场景,尤其适合长时间、多场景的故事叙述。只需提供故事脚本和参考图像,即可生成连贯的多镜头视频,极大降低制作成本。未来还可结合语音、动作等多模态信息,丰富虚拟场景和角色表现。

局限与展望

当前模型对极端复杂场景和动作的表现仍有限,记忆筛选策略在多样化场景中有待优化。长时间生成时,场景漂移和人物不一致问题仍存在。计算资源需求较高,特别是在高分辨率和多场景切换时,效率仍需提升。未来需加强记忆更新机制和多模态融合能力。

通俗解读 非专业人士也能看懂

想象你在做一部长篇电影,每个场景都要有连贯的故事和人物。传统的方法就像用一台机器一口气拍完所有场景,既费时又容易出错。另一种办法是只拍几个关键场景,然后拼接起来,但这样场景之间会显得突兀,没有连贯感。本文的方法像是你有一个记忆宝盒,里面存着重要的场景和人物信息,每拍完一个场景,就把它放进去。下一次拍摄时,系统会参考这个宝盒,确保人物不变、场景连贯。通过智能筛选和过滤,宝盒里的内容既丰富又稳定,帮助你拍出一部连贯自然的长片。这就像你有个聪明的助手,总记着所有重要细节,让故事流畅又精彩。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的积木游戏,你要建一座很长的城堡,里面有很多房子、人物和道路。每次你搭完一部分,就要记住它的样子,这样下一次搭建时,城堡才不会变形或出现奇怪的地方。以前的方法就像每次都从头开始拼,或者只记住几个关键房子,结果城堡看起来不连贯。现在,这个新方法像是你有一个神奇的记忆盒子,里面装满了你之前搭好的房子和道路。每次搭建新部分时,它会帮你记住重要的细节,确保每个房子都长得一样,城堡看起来完整又漂亮。只要你告诉它故事的内容,它就能帮你拼出一座长长的、连贯的城堡,像电影一样精彩。这让你不用每次都从零开始,也不用担心城堡会变得乱七八糟。

原文摘要

Visual storytelling requires generating multi-shot videos with cinematic quality and long-range consistency. Inspired by human memory, we propose StoryMem, a paradigm that reformulates long-form video storytelling as iterative shot synthesis conditioned on explicit visual memory, transforming pre-trained single-shot video diffusion models into multi-shot storytellers. This is achieved by a novel Memory-to-Video (M2V) design, which maintains a compact and dynamically updated memory bank of keyframes from historical generated shots. The stored memory is then injected into single-shot video diffusion models via latent concatenation and negative RoPE shifts with only LoRA fine-tuning. A semantic keyframe selection strategy, together with aesthetic preference filtering, further ensures informative and stable memory throughout generation. Moreover, the proposed framework naturally accommodates smooth shot transitions and customized story generation applications. To facilitate evaluation, we introduce ST-Bench, a diverse benchmark for multi-shot video storytelling. Extensive experiments demonstrate that StoryMem achieves superior cross-shot consistency over previous methods while preserving high aesthetic quality and prompt adherence, marking a significant step toward coherent minute-long video storytelling.

cs.CV