OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

TL;DR

OneStory以自适应记忆生成多镜头视频,T2MSV一致性达0.5813。

cs.CV 🔴 高级 2025-12-09 26 次浏览
Zhaochong An Menglin Jia Haonan Qiu Zijian Zhou Xiaoke Huang Zhiheng Liu Weiming Ren Kumara Kahatapitiya Ding Liu Sen He Chenyang Zhang Tao Xiang Fanny Yang Serge Belongie Tian Xie
多镜头视频生成 自回归生成 自适应记忆 扩散变换器 视频一致性

核心发现

方法论

OneStory将多镜头视频生成重构为逐镜头的next-shot生成任务,并从预训练Wan2.1 I2V模型出发微调。Frame Selection先用当前字幕查询历史潜在帧,依据CLIP与DINOv2相关性选择Top-K帧;Adaptive Conditioner再按重要性分配不同压缩率的patchifier,将紧凑上下文直接与噪声token拼接输入DiT。

关键结果

  • 在T2MSV测试中,OneStory的跨镜头一致性平均分为0.5813,高于StoryDiffusion+Wan2.1的0.5657和Mask2DiT的0.5446;角色一致性为0.5874,环境一致性为0.5752。
  • 在I2MSV中,OneStory取得0.5784的跨镜头平均一致性,角色和环境分数分别为0.5851与0.5716,均超过Mask2DiT的0.5449。
  • 模型在约60K数据上训练后可生成一分钟、十镜头视频;数据包含50K双镜头和10K三镜头样本,并采用shot inflation与progressive coupling稳定训练。

研究意义

该研究针对长叙事视频中角色、环境和动作跨镜头保持困难这一长期瓶颈,提供了比固定窗口和单关键帧更可扩展的记忆机制。它使已有I2V模型能够自然扩展至文本或图像驱动的多镜头生成,降低了重新训练大型视频基础模型的门槛,对广告、影视预演、教育内容和交互式故事具有直接价值。

技术贡献

核心贡献是把全历史上下文压缩为内容相关而非时间邻近的记忆。Frame Selection通过文本引导查询、视觉记忆注意力和帧级打分选择跨越不连续镜头的证据;Adaptive Conditioner以importance-guided patchification控制token数量,并将上下文直接送入DiT联合注意力。相较Mask2DiT的固定窗口和关键帧流水线,该设计兼顾长程信息、计算效率与端到端优化。

新颖性

新颖性不在于简单延长注意力窗口,而在于提出“选择—压缩—直接注入”的自适应记忆链路。它允许第3镜头重新访问第1镜头中与当前字幕相关的角色或场景,同时忽略无关中间镜头,突破了按时间排序或单图像条件的主流范式。

局限性

  • 训练集主要是人类中心视频,虽然论文展示了猫和警察等域外案例,但数据分布可能限制复杂动物、物体或非现实叙事的可靠性。
  • 训练数据以双镜头和三镜头样本为主,十镜头推理依赖自回归累积,长序列仍可能出现误差传播、记忆选择偏差和计算增长。

未来方向

后续可扩大到更长、更丰富的镜头级数据,研究记忆压缩、错误修正和可编辑叙事控制;还应系统评估音频、对白、动作因果与镜头语言,并探索更高效的在线记忆和跨域适配。

AI 总览摘要

现实视频通常由多个不连续镜头组成:人物可能暂时离开画面,地点和视角也会变化,但故事仍需连贯。现有多镜头生成方法主要依赖固定时间窗口或每镜头一个关键帧,前者会遗忘早期内容,后者难以传递复杂叙事信息。

OneStory把任务改写为逐镜头生成。Frame Selection根据当前镜头字幕,从所有历史镜头中选择语义相关帧;Adaptive Conditioner再按重要性进行自适应patch化,把大量历史视觉信息压缩成少量上下文token,并直接注入扩散变换器。模型从Wan2.1 I2V初始化,并在约60K高质量多镜头视频上训练。

结果显示,T2MSV跨镜头一致性达到0.5813,超过StoryDiffusion+Wan2.1的0.5657;I2MSV达到0.5784,高于Mask2DiT的0.5449。OneStory还能生成一分钟、十镜头叙事,并支持文本和图像条件。其局限是训练数据以人类中心、短镜头序列为主;更长故事中的误差累积、跨域可靠性及音视频联合建模仍待解决。

深度分析

研究背景

T2V和I2V模型在单镜头画质上快速进步,Wan、HunyuanVideo、CogVideoX和Mochi代表了扩散或DiT路线。但真实叙事要求多个镜头保持人物身份、环境布局与事件逻辑。Mask2DiT、LCT等固定窗口方法能处理局部上下文,关键帧方法则借助StoryDiffusion和I2V扩展视频;两者都难以保留长程关系。

核心问题

给定逐镜头字幕及可选首帧,模型需生成镜头序列,同时保持角色和环境一致,并允许时间、地点、视角和动作合理变化。难点在于历史镜头数量不受限、相关性并非按时间递减,且全部视觉token会造成高昂注意力开销。

核心创新

  • �� Next-shot formulation:以历史镜头生成当前镜头,复用预训练I2V能力。
  • �� Frame Selection:用字幕调节查询,从全历史记忆选择Top-K语义相关帧。
  • �� Adaptive Conditioner:为重要帧分配更细patchifier,为次要帧分配更强压缩,形成紧凑上下文。
  • �� Dataset与训练:TransNetV2检测镜头,两阶段VLM字幕改写;用CLIP、SigLIP2和DINOv2过滤,并采用三镜头膨胀与渐进耦合。

方法详解

  • �� 编码:3D VAE将每个镜头映射为潜变量,历史帧沿时间维拼成M。
  • �� 查询:可学习query先注意当前字幕,再注意视觉记忆;公式为Q′=Attn(Q,φT(t),φT(t)),Q″=Attn(Q′,φV(M),φV(M))。
  • �� 选择:帧分数S=Mean(φP(M1)Q″ᵀ),按S取Top-Ksel得到cM。
  • �� 压缩:不同patchifier按重要性处理cM并拼成C。
  • �� 注入:C与当前噪声token N拼接输入DiT,联合注意力生成下一镜头。
  • �� 训练:双镜头样本插入或增强为三镜头;预热期随机采样,随后切换选择器驱动条件。

实验设计

模型基于Wan2.1 I2V,使用AdamW,学习率0.0005、权重衰减0.01,在128张A100上训练一轮,分辨率为480×832。数据约60K。基准包括Mask2DiT、StoryDiffusion+Wan2.1、Flux+Wan2.1及LTX-Video组合。评估覆盖T2MSV和I2MSV,指标包括角色、环境、主体和背景一致性、语义对齐、审美质量与动态程度。

结果分析

T2MSV中,OneStory的语义对齐为0.2389,角色一致性0.5874,环境一致性0.5752,平均跨镜头一致性0.5813;最佳竞争者StoryDiffusion+Wan2.1为0.5657。I2MSV中,OneStory跨镜头平均为0.5784,角色0.5851、环境0.5716,也超过Mask2DiT的0.5449。视觉结果显示其更能处理人物重现、构图变化和字幕遵循。

应用场景

广告与影视预演可按镜头字幕快速生成连贯分镜;教育、新闻和社交媒体创作者可从首图或文本扩展分钟级故事。实际部署需要高质量镜头字幕、足够GPU显存以及内容安全过滤。其统一文本—图像接口也适合交互式故事和游戏过场生成。

局限与展望

数据集中50K为双镜头、10K为三镜头,长序列能力主要通过自回归推理获得,历史误差可能累积。Frame Selection还依赖伪标签和CLIP/DINOv2相似性,未必理解高层因果关系。论文主要聚焦视觉一致性,未系统处理对白、音频、角色意图和镜头级时间规划。未来需扩大数据、加入长程监督,并降低记忆与DiT计算成本。

通俗解读 非专业人士也能看懂

把OneStory想成一位拍连续剧的导演。普通导演如果只能看最近几场戏,早先出现的主角很容易被忘掉;如果每场戏只给他一张照片,又看不到人物曾经做过什么。OneStory先把以前所有镜头整理成“素材库”,然后根据下一场戏的剧本,找出最有用的几张画面。例如新镜头要让第一场出现的女孩再次出现,它会主动找回女孩,而不是机械地只看上一场。

找到素材后,系统不会把每个细节全部塞进导演脑中,而是给重要画面更清晰的版本,给不太重要的画面更概括的版本。这样既节省空间,又保留故事需要的信息。它从Wan2.1这个会把图片变成视频的模型出发,逐场生成新的镜头,因此可以从文字或第一张图片开始,连续生成十场、约一分钟的视频。

简单解释 像给14岁少年讲一样

想象你在做一个连续短视频:第一集有一只猫,第二集猫睡觉,第三集猫跑到水边,最后还要让观众认出是同一只猫。很多AI只记得最近几集,或者每集只看一张截图,所以故事越长越容易“串戏”。

OneStory像一个会整理记忆的剪辑师。每次要拍新一幕,它会读这一幕的描述,再从旧镜头里寻找最相关的画面。如果描述说“那只猫回到海边”,它会找猫和海边,而不是把所有旧画面一股脑拿来。

它还会给重要画面更清楚的记忆,给不重要画面更小的摘要,就像考试前重点复习难题、快速浏览简单题。这样AI既能记住人物和地点,又不会因为记忆太多而变慢。

论文中它在文字生成和图片生成两种任务上都赢过Mask2DiT等方法,能做出一分钟、十个镜头的故事。不过,如果故事特别长,错误可能一幕幕累积;而且它主要用人类视频训练,遇到奇幻生物或复杂对白时还需要继续进步!

术语表

Multi-shot Video Generation(多镜头视频生成)

由多个不连续但语义相关的镜头组成的视频生成任务。模型不仅要生成漂亮画面,还要维持人物、环境和叙事关系。

论文的核心任务,覆盖T2MSV和I2MSV。

Next-shot Generation(下一镜头生成)

根据历史镜头和当前字幕,自回归地产生下一个镜头。它把长视频问题拆成可重复的单镜头预测。

OneStory的任务重构方式。

Frame Selection(帧选择)

依据当前字幕与历史视觉内容的相关性,选择最有用的潜在帧。相关性由查询—记忆注意力和帧级分数计算。

构建全局历史记忆。

Adaptive Conditioner(自适应条件器)

根据帧的重要性使用不同压缩率的patchifier,将选定画面转成紧凑上下文token。重要帧保留更多细节。

直接为DiT提供视觉条件。

DiT(Diffusion Transformer,扩散变换器)

以Transformer作为扩散模型去噪骨干的架构。它通过注意力联合处理噪声token与条件token。

OneStory的生成器。

Shot Inflation(镜头膨胀)

将双镜头训练样本插入其他镜头或增强首镜头,转化为三镜头样本。该策略缓解不同长度数据造成的训练不稳定。

统一三镜头训练。

开放问题 这项研究留下的未解疑问

  • 1 如何在数十甚至数百个镜头中稳定纠正早期错误,仍缺乏显式机制;需要长程监督、可回溯记忆和故事级评价。
  • 2 CLIP与DINOv2能衡量视觉相似性,却不一定理解因果、身份和对白关系;更强的叙事相关性标注仍是开放问题。

应用场景

近期应用

影视分镜预演

编剧或导演提供逐镜头字幕和首帧,OneStory即可生成连贯的视觉草案,用于测试人物重现、场景转换和镜头构图,减少传统拍摄前的制作成本。

社交媒体故事制作

创作者可以从文字大纲或一张角色图片开始,逐镜头生成短剧、广告或旅行故事。部署需配备GPU、字幕流程和安全审核,但无需训练全新视频基础模型。

远期愿景

交互式长篇世界

未来系统可把玩家选择、角色记忆和环境状态持续写入自适应记忆,实时生成游戏过场、虚拟角色剧情和个性化电影。关键障碍是长程因果、成本和可控性。

原文摘要

Storytelling in real-world videos often unfolds through multiple shots -- discontinuous yet semantically connected clips that together convey a coherent narrative. However, existing multi-shot video generation (MSV) methods struggle to effectively model long-range cross-shot context, as they rely on limited temporal windows or single keyframe conditioning, leading to degraded performance under complex narratives. In this work, we propose OneStory, enabling global yet compact cross-shot context modeling for consistent and scalable narrative generation. OneStory reformulates MSV as a next-shot generation task, enabling autoregressive shot synthesis while leveraging pretrained image-to-video (I2V) models for strong visual conditioning. We introduce two key modules: a Frame Selection module that constructs a semantically-relevant global memory based on informative frames from prior shots, and an Adaptive Conditioner that performs importance-guided patchification to generate compact context for direct conditioning. We further curate a high-quality multi-shot dataset with referential captions to mirror real-world storytelling patterns, and design effective training strategies under the next-shot paradigm. Finetuned from a pretrained I2V model on our curated 60K dataset, OneStory achieves state-of-the-art narrative coherence across diverse and complex scenes in both text- and image-conditioned settings, enabling controllable and immersive long-form video storytelling.

cs.CV