InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions
InfinityStory以背景一致与多主体转场实现长视频生成,VBench达88.94/82.11。
核心发现
方法论
InfinityStory由背景一致生成流水线和转场感知视频合成模块组成。前者跨镜头维护场景外观、角色身份与空间关系;后者针对多人进出画面建模镜头边界变化,生成连续、平滑的shot-to-shot过渡。作者还构建10,000条合成多主体转场序列,覆盖以往数据集中不足的动态构图。
关键结果
- 在VBench评测中,InfinityStory取得最高Background Consistency分数88.94,说明跨镜头背景与场景结构保持能力优于比较系统;同时Subject Consistency达到82.11,表明角色外观和身份在长叙事中更稳定。
- 模型的VBench总体平均排名为2.80,论文将其报告为最佳平均排名。该结果综合反映了视觉稳定性、主体保持、转场平滑度与时间连贯性,而非仅优化单一画面质量指标。
- 10,000条多主体转场数据专门覆盖多人进入、离开及复杂空间构图。论文显示,加入该数据与转场模块后,系统能够超越以单主体转场为主的既有方案,但未提供完整消融表或逐项基线分数。
研究意义
长视频生成的瓶颈不只是逐帧清晰度,而是跨镜头叙事记忆:房间不能突然变样,人物不能换脸,多个角色也不能在剪辑处无故消失。InfinityStory把背景、主体和镜头转场放进统一目标中,为从短片段生成走向小时级故事提供了重要工程路径。其VBench结果说明,稳定性指标可以与传统视觉质量同等关键;对影视预演、教育内容和交互式媒体尤其有价值。
技术贡献
论文的核心贡献包括三点:第一,提出background-consistent generation pipeline,在场景切换中显式维护背景视觉连贯性及角色—空间关系;第二,提出transition-aware video synthesis module,面向多主体进出画面的复杂转场,而非只处理单主体;第三,发布10,000条合成多主体转场序列,补足动态场景组合的数据缺口。与单镜头扩散生成或单主体插值相比,该框架把镜头级结构约束纳入视频生成流程。
新颖性
新颖性主要体现在问题范围的扩展与模块协同:既保持背景,又处理多人转场,并面向小时级叙事可扩展性。论文摘要未声称绝对意义上的首个长视频系统,也未披露完整网络结构、训练损失或理论保证,因此其创新更准确地属于系统级整合、数据构建和场景覆盖突破。
局限性
- 公开信息只给出VBench三项汇总结果,未列出具体基线、置信区间、生成时长、分辨率或计算成本,因而难以判断收益来自架构、数据还是评测设置。
- 数据集为合成数据,可能无法充分代表真实摄影中的遮挡、镜头运动、光照变化和复杂人物交互;多人转场在极端密集场景下仍可能出现身份或空间关系错误。
未来方向
后续应公布完整消融、基线和长时实测,建立真实多主体转场数据,并研究可扩展记忆、镜头脚本控制和用户可编辑约束。还需评估小时级生成的成本、内容安全与版权风险,以及在不同风格、语言和文化叙事中的泛化能力。
AI 总览摘要
长篇故事视频需要的不只是漂亮画面,还要让观众相信故事发生在同一个世界里。现有视频生成系统通常擅长短片段,却容易在镜头切换时改变背景、角色外观或空间位置;多人同时进出画面时,转场尤其容易断裂。这些问题限制了生成式影视从片段演示走向完整叙事。
InfinityStory提出两部分方案:背景一致生成流水线维护跨镜头的场景外观、角色身份和空间关系;转场感知视频合成模块则专门处理多主体进入或离开画面的镜头边界。为训练后者,作者构建了10,000条合成多主体转场序列,覆盖既有数据较少的动态构图。其目标不是只生成单个高质量镜头,而是让镜头之间像经过剪辑和调度一样自然连接。
在VBench上,InfinityStory取得最高Background Consistency分数88.94和最高Subject Consistency分数82.11,总体平均排名为2.80。结果表明,系统在背景稳定、角色保持和时间连贯方面具有优势。不过,论文摘要没有公布完整基线、消融结果、计算成本或真实长视频规模,因此仍需更严格复现实验。总体而言,该工作为小时级故事生成提供了重要系统框架,也显示未来视频模型必须同时理解场景、人物与镜头语法。
深度分析
研究背景
文本到视频和视频扩散模型已显著提升短片段的清晰度与运动质量,但长叙事要求跨镜头记忆。既有方法常集中于单镜头质量、主体一致或单主体转场;当场景持续数十个镜头,背景纹理、光照、人物身份和相对位置会逐步漂移。InfinityStory针对这一缺口,明确把背景一致性、多主体转场和小时级扩展作为统一问题。
核心问题
核心问题是生成镜头序列时同时保持世界状态与镜头连续性。背景变化会破坏地点认知,角色漂移会破坏叙事理解,而多人进出画面涉及遮挡、轨迹、空间关系和剪辑边界的共同约束。单主体转场机制难以表达这些组合变化;逐镜头独立生成也缺少可持续的场景记忆。
核心创新
- �� 背景一致生成流水线:跨镜头维护场景外观、角色身份和空间关系。
- �� 转场感知视频合成模块:处理多人进入、离开及复杂动态构图,突破单主体假设。
- �� 合成数据集:提供10,000条多主体转场序列,覆盖稀缺场景。
- �� 长时设计:目标从短片段扩展至小时级叙事,而非仅提升单镜头指标。
方法详解
- �� 输入:故事镜头或场景条件,以及需要保持的角色和背景信息。
- �� 世界一致性:背景一致生成流水线在相邻镜头间传递场景外观、角色身份与空间关系,减少地点和人物漂移。
- �� 转场建模:转场感知模块根据多人进出画面的动态变化生成镜头边界,使前后镜头在运动和主体布局上衔接。
- �� 数据支持:使用10,000条合成多主体转场序列训练或强化复杂组合覆盖。
- �� 输出:面向连续叙事的视频镜头序列,并以VBench的Background Consistency、Subject Consistency等指标评价。
实验设计
主要评测使用VBench,并报告Background Consistency、Subject Consistency及总体平均排名。训练支持来自10,000条合成多主体转场序列。论文摘要强调与既有视频生成系统比较,但未给出具体基线名称、采样步数、分辨率、视频长度或完整消融设置。因此可确认实验结论集中于一致性和转场能力,不能据此推断所有画质指标均领先。
结果分析
InfinityStory在VBench的Background Consistency为88.94,Subject Consistency为82.11,均为论文报告的最高值;总体平均排名为2.80,也被报告为最佳。数据支持其在背景稳定和角色保持方面的系统性优势。10,000条多主体转场序列使模型覆盖多人进出等复杂场景,但由于缺少逐基线分数和消融表,具体模块贡献仍需进一步验证。
应用场景
影视和动画团队可用它生成分镜预演、连续场景草稿和多角色调度参考;教育与营销机构可制作较长的情境视频。实际部署仍需要脚本控制、角色资产、内容审核和稳定的算力管线。游戏与虚拟世界也可利用其保持地点和角色关系的能力,生成连续事件而非孤立片段。
局限与展望
现有描述没有证明真正完成小时级视频,也没有报告生成速度、显存、成本或真实用户研究。合成转场数据可能与真实摄影分布存在差异,复杂遮挡、群体交互、快速镜头运动和光照突变仍可能导致身份、背景或轨迹错误。未来应加入真实数据、显式长时记忆、镜头脚本约束,并公开完整基线和消融结果。
通俗解读 非专业人士也能看懂
把InfinityStory想成一个拍连续电视剧的剧组。普通自动拍摄机每拍完一幕就像失忆:同一间教室可能变成另一间,演员的衣服和脸也会改变,几个人进出门时还可能互相穿过去。InfinityStory先安排一位“场景管理员”,记住房间长什么样、演员是谁、他们站在哪里;这样下一幕开始时,布景不会突然换掉。
它还安排一位“剪辑和调度导演”,专门处理多人从画面边缘进来或离开的时刻。导演会让上一幕的动作接到下一幕,而不是突然跳跃。为练习这些情况,研究者准备了10,000段特殊训练片段,里面有不同人数、位置和进出方式。
测试结果显示,它在保持背景方面得分88.94,在保持人物方面得分82.11,VBench平均排名为2.80。简单说,它更像能记住整部故事的剧组,而不是只会拍一张漂亮照片的相机。
简单解释 像给14岁少年讲一样
想象你在做一部超级长的游戏剧情视频。普通AI可能第一关把城堡画得很漂亮,下一关城堡却变成了学校;主角刚才是红外套,转个镜头突然换成蓝衣服。要是两个朋友一起走进画面,AI还可能让其中一个瞬间消失,或者直接穿过另一个人!
InfinityStory就像给AI装上了“剧情记忆本”。它记住背景、人物长相和每个人在空间里的位置,所以镜头换了,故事世界仍然像同一个地方。它还有一个“转场教练”,专门练习多人进场、退场和镜头切换,让动作连接得更自然。
研究者用10,000段多人转场视频训练它,然后在VBench上考试。保持背景得到88.94分,保持人物得到82.11分,总体平均排名是2.80,都是论文报告中的最佳成绩。分数越高,说明视频越不容易突然变样。
不过它还不是魔法。论文没有告诉我们完整视频到底能生成多久、需要多少电脑资源,也没有公开所有对手的分数。未来它还要面对真实电影里的强遮挡、快速运动和复杂灯光。即便如此,它说明了一个重要道理:想让AI讲长故事,不能只会画每一帧,还必须记住整个世界!
术语表
Background Consistency(背景一致性)
衡量不同镜头中的地点、布景和视觉环境是否保持稳定。分数越高,场景越不容易在切镜时漂移。
InfinityStory在VBench上取得88.94。
Subject Consistency(主体一致性)
衡量人物或其他主体在多个画面中的身份、外观和特征是否连续。它关注角色是否保持同一个人。
InfinityStory在VBench上达到82.11。
Shot Transition(镜头转场)
从一个镜头切换到另一个镜头的过程。论文关注多人进出画面时的自然衔接。
转场感知模块负责生成复杂多主体转场。
VBench
用于评估视频生成质量与一致性的基准测试框架。它包含背景、主体和时间相关指标。
论文用其报告88.94、82.11和2.80。
World Consistency(世界一致性)
指故事世界在连续镜头中保持稳定,包括背景、人物和空间关系。它是长叙事可信度的基础。
背景一致生成流水线围绕该目标设计。
开放问题 这项研究留下的未解疑问
- 1 论文摘要未说明小时级视频是否被完整验证,也缺少长度、分辨率、速度和成本数据;需要公开端到端长时实验。
- 2 合成数据能否迁移到真实电影和纪录片场景仍未知,尤其是遮挡、群体交互和快速摄影运动。
- 3 缺少完整消融与基线分数,无法精确区分背景流水线、转场模块和10,000条数据各自的贡献。
应用场景
近期应用
影视分镜预演
导演和动画团队可输入场景脚本,生成背景连续、角色稳定的多镜头草稿,用于检查调度和转场。部署前仍需角色设定、镜头控制、内容审核及足够GPU资源。
教育与营销情境视频
课程设计者或品牌团队可制作包含多个角色的连续短故事,减少逐镜头重做背景的成本。人工审核仍负责事实准确性、品牌一致性和不当内容过滤。
远期愿景
小时级交互式叙事
未来系统可结合剧本、用户选择和持久世界记忆,生成角色关系持续发展的互动电影或游戏事件。关键障碍是计算成本、长时错误累积、可控性和版权安全。
原文摘要
Generating long-form storytelling videos with consistent visual narratives remains a significant challenge in video synthesis. We present a novel framework, dataset, and a model that address three critical limitations: background consistency across shots, seamless multi-subject shot-to-shot transitions, and scalability to hour-long narratives. Our approach introduces a background-consistent generation pipeline that maintains visual coherence across scenes while preserving character identity and spatial relationships. We further propose a transition-aware video synthesis module that generates smooth shot transitions for complex scenarios involving multiple subjects entering or exiting frames, going beyond the single-subject limitations of prior work. To support this, we contribute with a synthetic dataset of 10,000 multi-subject transition sequences covering underrepresented dynamic scene compositions. On VBench, InfinityStory achieves the highest Background Consistency (88.94), highest Subject Consistency (82.11), and the best overall average rank (2.80), showing improved stability, smoother transitions, and better temporal coherence.