CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation

TL;DR

CoAgent采用计划-合成-验证-编辑流程,利用实体记忆和闭环反馈显著提升长视频的连贯性与视觉一致性。

cs.CV 🔴 高级 2025-12-27 24 次浏览
Qinglin Zeng Kaitong Cai Ruiqi Chen Qinhan Lv Keze Wang
视频生成 多模态AI 闭环系统 叙事一致性 多智能体

核心发现

方法论

CoAgent框架由故事板规划器、全局上下文管理器、合成模块和验证器组成。故事板规划器将用户输入的高层概念分解为结构化的镜头计划,明确实体、空间关系和节奏。全局上下文管理器维护实体记忆,确保跨镜头的人物和场景一致性。合成模块在视觉一致控制器引导下生成每个镜头,验证器利用视觉-语言模型评估中间结果,触发有条件的重生成。最后,节奏编辑器调整视频节奏与过渡,形成闭环反馈机制。该流程实现了多模态、多智能体协作的动态规划与质量控制。

关键结果

  • 在VBench和VideoScore数据集上,CoAgent在连贯性和视觉一致性指标上超越SOTA模型,Subject Consistency达94.70%,背景一致性96.50%,Temporal Flickering达99.20%,Motion Smoothness达99.40%。相较于传统prompt方法,提升显著,验证了全局记忆和验证机制的有效性。
  • 在长视频生成中,实体身份保持率提升至100%,视频的时间连续性和风格一致性得到极大改善。ablation研究显示,加入GCM后,主题一致性提升3.9%,加入验证器后,Temporal Flickering提升4.5%,整体性能提升明显。
  • 通过结合实体记忆和闭环验证,显著降低了身份漂移和场景断裂问题,提升了视频的叙事连贯性和风格一致性,为长视频自动生成提供了新思路。

研究意义

该研究突破了长视频生成中的关键瓶颈,首次实现了基于多智能体协作的闭环控制框架,有效融合了叙事规划、实体记忆和质量验证。其技术创新为未来自动化视频创作提供了理论基础和实践工具,推动了多模态生成、内容一致性保障等领域的发展。对影视制作、虚拟现实和内容创作等行业具有深远意义,能显著降低人工成本,提高内容质量与创作效率。

技术贡献

本文提出的CoAgent框架在多模态视频生成中引入实体级记忆和验证机制,打破了传统prompt驱动的单向流程限制。核心创新在于:1)设计了结构化的故事板规划器,实现高层叙事到视觉内容的映射;2)引入全局实体记忆MGCM,保证跨镜头的人物和场景一致性;3)建立基于视觉-语言模型的验证器,进行动态质量评估与重生成。该体系实现了多智能体的协作,提供了可控性和鲁棒性,显著提升长视频的连贯性和风格一致性,为自动化内容生成开辟新路径。

新颖性

本研究首次将结构化叙事规划、实体记忆和闭环验证有机结合,构建了一个具有状态感知和反馈能力的多智能体系统。不同于现有的单向prompt或静态记忆方法,CoAgent实现了动态规划与质量控制的深度融合,突破了长视频生成中身份漂移和场景断裂的技术瓶颈。这种集成方式在多模态视频生成领域具有开创性意义。

局限性

  • 当前模型对复杂场景中的多实体交互和动态变化仍存在挑战,尤其在极端动作或细节丰富的场景中,生成质量仍有提升空间。
  • 验证器的评估依赖预训练视觉-语言模型,可能受到模型偏差影响,导致某些语义或风格错误未能及时检测到。
  • 系统在大规模长视频生成时计算成本较高,实时性和效率仍需优化,未来需探索更高效的模型压缩与推理策略。

未来方向

未来将结合更强大的多模态预训练模型,提升验证器的准确性和鲁棒性,增强实体动态交互建模能力。同时,计划引入用户交互机制,实现可控的内容调整和个性化定制,推动长视频自动生成技术的商业化应用。此外,将探索跨模态多任务学习,提升系统在多样化场景中的适应性和生成质量。

AI 总览摘要

在当今多模态内容生成领域,长视频的连贯性和视觉一致性一直是核心难题。传统的文本到视频模型多采用单步、无反馈的生成流程,导致身份漂移、场景断裂和节奏不稳定,严重影响叙事体验。为解决这一瓶颈,Qinglin Zeng等提出了CoAgent框架,采用计划-合成-验证-编辑的闭环多智能体体系。

该系统由故事板规划器将高层概念拆解为结构化镜头计划,明确实体、空间关系和节奏;全局上下文管理器维护实体记忆,确保跨镜头一致性;合成模块在视觉一致性控制下逐镜头生成内容;验证器利用视觉-语言模型评估中间结果,触发有条件的重生成;最后,节奏编辑器调整视频节奏,确保叙事连贯。实验结果显示,CoAgent在VBench和VideoScore评估中,连贯性指标提升显著,Subject Consistency达94.70%,背景一致性96.50%,Temporal Flickering达99.20%,Motion Smoothness达99.40%。相较于传统prompt方法,性能提升明显,验证了实体记忆和闭环验证机制的有效性。

该方法的核心创新在于:引入实体级记忆MGCM,保证跨镜头的人物和场景一致性;设计了结构化的故事板规划器,实现高层叙事到视觉内容的映射;建立了基于视觉-语言模型的验证器,进行动态质量评估与重生成。这些创新突破了长视频生成中的身份漂移和场景断裂难题,为自动化内容创作提供了新思路。未来,结合更强大的预训练模型和用户交互,将推动长视频自动生成技术迈向商业化应用,开启多模态内容创作的新纪元。

深度分析

研究背景

多模态视频生成技术经历了从早期基于GAN的短片生成,到近年来基于扩散模型的高质量短视频合成。代表性工作包括Video Diffusion Models、CogVideo、Sora2等,解决了单个镜头的视觉逼真和语义对齐问题。然而,长视频生成仍面临身份漂移、场景断裂和节奏不稳定的挑战,尤其在多镜头、多角色、多场景的复杂叙事中表现不足。现有方法多依赖prompt优化或静态记忆,缺乏动态反馈机制,难以保证跨镜头一致性和叙事连贯性。

核心问题

长视频生成的核心难点在于如何保持人物和场景的持续一致性,同时确保故事节奏和视觉风格的连贯。传统模型多采用单步生成,忽略了前后关系和实体状态的动态变化,导致身份漂移和场景断裂。缺乏有效的跨镜头记忆和动态验证机制,使得长视频难以满足实际应用需求。解决这一问题需要引入结构化叙事规划、实体记忆和闭环验证,形成一个具有状态感知和反馈能力的系统。

核心创新

本研究的创新点在于:1)设计了结构化的故事板规划器,将高层叙事拆解为明确的镜头计划,提升内容的可控性;2)引入实体级全局记忆MGCM,确保跨镜头的人物和场景一致性,解决身份漂移问题;3)建立基于视觉-语言模型的验证器,实时评估生成内容的语义和风格,触发有条件的重生成,形成闭环反馈。这种多智能体协作体系突破了传统单向流程的局限,实现了长视频的高质量、连贯生成。

方法详解

  • �� 以用户高层概念为输入,故事板规划器(Aplan)将其拆解为结构化镜头计划,明确每个镜头的文本提示、实体、空间关系、节奏。
  • �� 全局上下文管理器(MGCM)维护实体的视觉表示,确保跨镜头的身份一致。
  • �� 合成模块(Asynth)在视觉一致性控制器引导下,依据镜头计划和实体记忆逐镜头生成内容,支持多种生成模式(T2V、FF2V、LF2V)以保证时间连续性。
  • �� 验证器(Averif y)利用预训练的视觉-语言模型,评估每个镜头的语义和风格一致性,生成反馈信号。
  • �� 反馈机制触发有条件的重生成,优化内容质量,最终通过节奏编辑器调整整体叙事节奏,形成闭环系统。

实验设计

采用VBench和VideoScore两个主流评估基准,比较不同模型在连贯性、视觉质量和语义一致性上的表现。训练使用Wan2.1作为基础生成模型,结合不同的模块进行端到端微调。指标包括Subject Consistency、Background Consistency、Temporal Flickering等。通过对比SOTA模型VISTA、CogVideo、Sora2,验证了加入实体记忆和验证机制后性能的提升。还进行了消融实验,逐步加入GCM和验证器,验证其对性能的贡献。大量定量指标和定性案例说明了系统在长视频生成中的优越性。

结果分析

在VBench上,CoAgent的Subject Consistency达94.70%,背景一致性96.50%,Temporal Flickering仅99.20%,Motion Smoothness达99.40%,远超传统prompt方法。VideoScore评估中,视觉质量由2.788提升至2.953,文本-视频对齐由2.550提升至2.731,显示出在语义一致性和视觉逼真度上的显著改善。ablation结果表明,GCM提升实体一致性3.9%,验证器提升Temporal Flickering 4.5%,整体性能提升明显,验证了设计的有效性。

应用场景

该技术可广泛应用于影视动画、虚拟主播、虚拟现实内容制作等场景,尤其适合需要长时间、多场景、多角色叙事的内容创作。系统依赖结构化的故事板和实体记忆,适合与人类创作者协作,提升内容生产效率。未来还可结合用户交互,实现个性化定制和实时调整,推动自动化内容生成产业的发展。

局限与展望

目前模型在极端复杂场景、多实体交互和细节丰富的内容中仍存在生成不稳定的问题。验证器的评估依赖预训练模型,可能受偏差影响,导致某些语义或风格错误未被检测。系统计算成本较高,长视频生成的实时性和效率有待优化。未来需增强多模态理解能力和模型压缩技术,以实现更广泛的应用和更高的效率。

通俗解读 非专业人士也能看懂

想象你在做一部电影,导演需要规划每个场景、人物和动作,确保故事连贯。传统方法像是每个场景都自己拍,没有联系,容易出现人物变脸或场景不连贯。而这个新方法像是有个聪明的导演助手,能记住每个人物的样子和动作,还能不断检查和调整,确保每个场景都符合故事。它会提前规划好每个镜头,然后一边拍一边检查,如果发现不对,就会重新拍,直到满意为止。这样,电影就能连贯、自然,看起来像真实发生的一样。这个系统用很多“记忆”和“检查”机制,让整个过程变得更智能、更可靠,就像有个贴心的导演在不断把控每一帧画面,确保故事完整精彩。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要把很多小块拼成一幅完整的画。以前的方法就像每次只拼一块,拼完就开始下一块,没有考虑整体,结果拼出来的画可能不连贯或者人物变脸。现在,这个新系统像是有个聪明的朋友,他会提前帮你规划好每一块应该放在哪里,还会记住每个角色的样子,确保他们在不同的拼图块里都一样。每当你拼完一块,他还会帮你检查,看看是不是拼错了,如果发现不对,就会重新拼,直到每一块都完美匹配。这样,最后拼出来的画就会非常完整、自然,就像真正的照片一样。它用记忆和检查的办法,让拼图变得更容易,也更漂亮。

原文摘要

Maintaining narrative coherence and visual consistency remains a central challenge in open-domain video generation. Existing text-to-video models often treat each shot independently, resulting in identity drift, scene inconsistency, and unstable temporal structure. We propose CoAgent, a collaborative and closed-loop framework for coherent video generation that formulates the process as a plan-synthesize-verify pipeline. Given a user prompt, style reference, and pacing constraints, a Storyboard Planner decomposes the input into structured shot-level plans with explicit entities, spatial relations, and temporal cues. A Global Context Manager maintains entity-level memory to preserve appearance and identity consistency across shots. Each shot is then generated by a Synthesis Module under the guidance of a Visual Consistency Controller, while a Verifier Agent evaluates intermediate results using vision-language reasoning and triggers selective regeneration when inconsistencies are detected. Finally, a pacing-aware editor refines temporal rhythm and transitions to match the desired narrative flow. Extensive experiments demonstrate that CoAgent significantly improves coherence, visual consistency, and narrative quality in long-form video generation.

cs.CV cs.AI