Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

TL;DR

提出“Agentic Self-Improvement”框架,通过双阶段优化显著提升图像到视频生成的语义一致性和控制性,优于无指导方法,偏好率达69%。

cs.CV 🔴 高级 2026-08-13 110 次浏览
Aman Tyagi Hemanth Boinpally Jonathan Chen Douglas Gebert Steven Hickson
图像到视频生成 目标导向优化 贝叶斯优化 多模态大语言模型 视频语义一致性

核心发现

方法论

该框架将视频合成转化为闭环、目标导向的优化过程,核心包括两个阶段:第一阶段利用多模态大语言模型(mLLM)通过自动生成的结构化问答(DSG和CMQ)对输入提示进行迭代优化,确保语义一致性和Artifact检测;第二阶段采用贝叶斯优化同时调节随机种子和CFG尺度,最大化基于视频文本一致性(VTA)等多指标的质量评分。整个流程由自动化的多目标评价体系引导,显著提升生成视频的可控性和一致性。

关键结果

  • 在用户偏好测试中,基于Agentic框架生成的视频相较于传统无指导方法,偏好率最高达69%,显著优于随机搜索和基线模型(偏好率约20-30%)。
  • 通过AB实验验证,Prompt优化模块提升了人类偏好评分,优化后偏好提升27%,统计显著(p<0.001)。
  • 贝叶斯超参数调优在100次迭代中,显著优于随机搜索,视频质量指标(UVQ、RAHF、VTA)平均提升20%以上,验证了目标导向搜索的有效性。

研究意义

该研究突破了黑箱图像到视频模型的控制瓶颈,为专业内容创作提供了系统化、可扩展的优化框架。通过结构化语义检测和贝叶斯调优,显著改善了模型的可预测性和稳定性,推动视频生成技术向生产级应用迈进。其方法不仅提升了内容的语义一致性,也为未来多模态生成模型的目标导向控制提供了理论基础和实践路径,具有重要的学术价值和产业应用潜力。

技术贡献

本研究提出了“Agentic Self-Improvement”框架,结合多模态大语言模型(如Gemini)进行提示优化,利用结构化的DSG和CMQ问答体系实现语义检测,创新性地将贝叶斯优化应用于随机种子和CFG尺度的联合调节,形成闭环优化流程。引入的视频-文本一致性(VTA)指标,基于结构化问答的分层评分机制,为视频质量评估提供了新颖的量化工具。这些技术创新共同推动了黑箱模型的可控性和可靠性,为行业提供了可扩展的解决方案。

新颖性

这是首次系统性将多模态大语言模型用于图像到视频生成的提示迭代优化,结合结构化语义检测(DSG)和Artifact检测(CMQ),实现了在复杂参数空间中的目标导向调节。相较于传统的随机或梯度优化方法,本框架引入了自动化、多目标评价体系和贝叶斯调优的结合,显著提升了生成内容的语义一致性和稳定性。这种融合多模态理解与贝叶斯决策的策略,代表了视频生成控制的前沿创新。

局限性

  • 当前方法依赖于结构化问答体系的准确性,若问答生成或VQA模型出现偏差,可能影响优化效果。
  • 贝叶斯优化在高维参数空间中仍存在局限,尤其是在极端复杂或多模态场景下的调节效率有待提升。
  • 模型调优过程较为依赖预设指标(如VTA、UVQ、RAHF),在不同应用场景中可能需要重新校准评价体系。

未来方向

未来将探索多模态大语言模型的更深层次理解能力,结合强化学习或自监督机制,提升提示优化的鲁棒性。还将扩展到多任务、多目标的生成场景,优化更复杂的内容控制策略。此外,计划引入更高效的贝叶斯变体和元学习技术,以缩短调优时间,增强模型在多样化应用中的适应性。

AI 总览摘要

在数字内容快速发展的今天,图像到视频的生成技术成为媒体制作和内容创意的重要工具。然而,现有的黑箱模型虽然在生成质量上取得了突破,但在控制性和可靠性方面仍面临巨大挑战。微小的提示变化或超参数调整,常常导致输出结果的剧烈波动,严重制约了其在专业场景中的应用。为解决这一难题,本文提出了“Agentic Self-Improvement”框架,将视频合成过程转变为一个闭环、目标导向的优化系统。

该框架由两个核心阶段组成:第一阶段利用多模态大语言模型(如Gemini)生成结构化问答(DSG和CMQ),对输入提示进行迭代优化,确保内容的语义一致性和Artifact的检测。通过自动生成的问答体系,模型能够系统性地识别和修正提示中的模糊或偏差部分。第二阶段采用贝叶斯优化,联合调节随机种子和CFG尺度,最大化由视频-文本一致性(VTA)等多指标组成的目标函数。这一过程在自动化、多目标评价体系的引导下,有效提升了生成内容的质量和控制能力。

实验结果显示,基于该框架生成的视频在用户偏好测试中偏好率最高达69%,远超传统无指导搜索的20-30%。此外,AB测试验证了提示优化模块的显著效果,偏好提升27%,统计学意义明显。贝叶斯调优在100次迭代中,平均提升了视频的UVQ、RAHF和VTA指标20%以上,验证了目标导向搜索的优越性。这些成果表明,该方法不仅增强了模型的语义一致性和稳定性,还为行业提供了可扩展的内容控制方案。

整体而言,本文的创新在于将多模态理解、结构化语义检测和贝叶斯决策融合,开创了黑箱视频生成的目标导向控制新路径。未来,随着模型理解能力的提升和优化算法的改进,该框架有望在更复杂、多任务的生成场景中实现广泛应用,推动数字内容生产迈向智能化、可控化的新阶段。

深度分析

研究背景

近年来,随着深度学习的发展,图像到视频的生成技术经历了从GANs、VAEs到扩散模型的演变。早期方法在时间一致性和高分辨率方面存在明显不足,难以满足专业内容制作的需求。Diffusion Transformer(DiT)等大规模模型的出现,极大提升了生成的真实性和语义准确性,但其黑箱特性限制了控制性和可重复性。当前,结合多模态基础模型(如VQ-VAE、CLIP)实现跨模态理解的研究逐渐增多,但在精细控制和语义一致性方面仍有较大提升空间。整体来看,行业亟需一种系统化的目标导向控制策略,以应对模型随机性带来的挑战。

核心问题

现有的黑箱图像到视频模型在生成内容的控制方面存在明显瓶颈。微小的超参数调整(如随机种子、CFG尺度)会导致输出的剧烈变化,难以实现稳定、可控的内容生成。这不仅影响了模型在专业领域的应用,也限制了其在内容创作中的实用性。如何在保证生成质量的同时,实现对语义内容和Artifact的精准控制,成为亟待解决的核心问题。此外,缺乏系统化的优化框架,使得试错过程既低效又昂贵,亟需引入目标导向的自动化调节机制。

核心创新

本研究的创新点主要包括:1)提出“Agentic Self-Improvement”框架,将视频生成转化为闭环、目标导向的优化任务;2)利用多模态大语言模型(如Gemini)自动生成结构化问答(DSG和CMQ),实现提示的迭代优化,确保语义一致性;3)引入基于结构化问答的VTA指标,量化视频与文本的内容一致性;4)采用贝叶斯优化联合调节随机种子和CFG尺度,提升参数调节效率。这些创新结合了多模态理解、结构化语义检测和贝叶斯决策,为黑箱模型提供了可控性保障。

方法详解

  • �� 输入:用户的文本提示和初始图像。
  • �� 第一步:利用多模态大语言模型(如Gemini)生成一组结构化问答(DSG和CMQ),对场景语义和Artifact进行检测。
  • �� 第二步:基于生成的视频,自动化VQA系统(Gemini 2.5 Pro)回答问答,评估内容一致性和Artifact。
  • �� 第三步:根据问答结果,模型自动调整提示,进行多轮迭代,最大化内容符合度(如VTA得分)。
  • �� 第四步:在优化完成后,利用贝叶斯优化(如Google Vizier)调节超参数(随机种子和CFG尺度),以最大化多指标(UVQ、RAHF、VTA)
  • �� 输入:优化后的提示和超参数。
  • �� 第五步:生成最终视频,进行多指标评估,确保内容质量和控制效果。

实验设计

采用V-Bench数据集进行验证,比较基线无指导方法和本框架的性能。通过人类偏好测试,评估生成视频的真实感和语义一致性。设置不同的优化轮次(10次和100次),观察偏好率变化。使用自动化指标(UVQ、RAHF、VTA)进行定量分析,验证优化效果。AB测试中,优化提示后偏好提升27%,贝叶斯调优在多指标上平均提升20%以上。实验还包括不同场景和复杂度的测试,验证框架的泛化能力。

结果分析

实验显示,基于Agentic框架的视频偏好率最高达69%,远超随机搜索(20-30%)。提示优化模块显著改善了内容一致性,偏好提升27%。贝叶斯调优在100次迭代中,UVQ、RAHF、VTA指标平均提升20%以上,验证了目标导向调节的有效性。多指标融合的评价体系,能更全面反映生成内容的质量,显著优于单一指标评估。整体结果表明,该方法在提升内容控制和稳定性方面具有巨大潜力。

应用场景

该框架适用于影视制作、广告创意、虚拟现实等领域,尤其在需要高语义一致性和内容控制的场景中。用户只需提供文本提示和输入图像,系统即可自动优化提示和超参数,生成符合预期的高质量视频。未来,可结合实时反馈机制,应用于交互式内容创作和自动化生产线,极大提升内容生产效率和质量一致性。长远来看,该技术有望推动虚拟主播、数字孪生等新兴产业的发展,实现智能化、个性化的内容生成。

局限与展望

当前方法对结构化问答生成的依赖较大,问答体系的准确性直接影响优化效果。在极端复杂或多模态场景中,贝叶斯调节仍面临维度灾难,调优效率有限。此外,指标体系主要基于静态评价,难以完全捕捉动态视频中的细节变化。未来需要引入更鲁棒的多模态理解和自适应评价机制,以应对多样化应用需求。模型训练和调优过程计算成本较高,限制了实时应用的可能性。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜。每次你想做一道新菜,都需要调整火候、调料的用量和烹饪时间,才能做出满意的味道。传统的方法就像是试错:多次尝试,直到找到合适的配比。而这篇论文提出了一个聪明的厨师助手,它能根据你之前的尝试,自动分析哪些调料用得不对,哪些火候不够,然后给出改进建议。接着,它还会根据你喜欢的口味,调整烹饪的时间和火力,确保每次做出来的菜都符合你的期待。这个助手用了一种叫“目标导向优化”的方法,结合了“问答检测”和“智能调节”,让厨房变得更高效、更精准。最终,你不用再反复试错,就能轻松做出美味佳肴。这就像是给厨房装上了一个聪明的机器人助手,帮你把复杂的调味和火候调节变得简单又可靠。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的电子游戏。每次你想赢,都得调节很多参数,比如角色的装备、技能的使用顺序、甚至每次跳跃的力度。可是,这个游戏很难控制,稍微调整一下参数,结果就可能完全不一样。有时候你试了很多次,花了很多时间,才能找到最好的组合。这篇论文就像是发明了一台智能机器人,它可以帮你自动调节这些参数,让你更快找到最好的策略。它会观察你每次的表现,问自己:“这个角色的动作是不是符合游戏规则?装备是不是合理?”然后自己调整参数,再试一次。它还会用一种叫贝叶斯的方法,聪明地选择哪些参数值得尝试,避免浪费时间。最终,你可以用更少的尝试,赢得比赛,感觉就像有了一个超级聪明的助手在帮你。这个方法让复杂的调节变得简单又高效,就像有个机器人帮你打理一切一样。

术语表

多模态大语言模型 (Multimodal Large Language Model)

一种可以理解和处理多种模态(如文本、图像、视频)的深度学习模型,能进行跨模态理解和生成。在论文中用于生成结构化问答和评估内容一致性。

结构化场景图 (Davidsonian Scene Graph, DSG)

一种将视觉场景拆解为语义关系的图结构,用于检测视频内容的语义一致性。在论文中用于生成验证性问答,确保场景符合提示。

Common Mistake Questions (CMQ)

一组预定义的问题,用于检测生成视频中的常见Artifact和错误,如动作不自然或结构不一致,帮助优化模型的Artifact检测能力。

贝叶斯优化 (Bayesian Optimization)

一种基于贝叶斯统计的全局优化算法,用于在高维参数空间中高效寻找最优参数配置。在论文中调节随机种子和CFG尺度。

视频-文本一致性 (Video-Text Adherence, VTA)

衡量生成视频内容与文本提示匹配程度的指标,结合结构化问答体系进行量化评估。

CFG尺度 (Classifier-Free Guidance Scale)

控制生成模型引导强度的超参数,影响生成内容的多样性和准确性。

随机种子 (Random Seed)

初始化随机数的参数,影响生成的随机性和多样性。在调优中用以控制生成的多样性。

UVQ (Universal Video Quality)

一种视频质量评估指标,基于深度学习模型预测视频的整体质量。

RAHF (Rich Automated Human Feedback)

模拟人类主观偏好的自动化模型,用于评估视频的视觉质量和自然程度。

开放问题 这项研究留下的未解疑问

  • 1 当前方法在多模态问答生成的准确性依赖于预训练模型的性能,若模型出现偏差或理解不足,可能影响优化效果。未来需要结合自监督学习或强化学习,增强问答体系的鲁棒性和适应性。此外,贝叶斯调优在极高维参数空间中的效率仍有限,需探索更高效的优化策略。模型在复杂、多任务场景中的泛化能力也有待验证,特别是在多样化内容和风格的生成中。

应用场景

近期应用

影视内容制作

利用该框架自动优化视频生成流程,提升内容的语义一致性和控制精度,减少人工调节时间,适合动画、广告等行业。

虚拟主播和数字孪生

实现高质量、可控的虚拟人物视频生成,满足个性化定制需求,推动虚拟偶像和虚拟助手的发展。

游戏动画和虚拟现实

为游戏和VR内容提供自动化、精准的场景生成方案,增强沉浸感和交互性,降低制作成本。

远期愿景

智能内容创作平台

构建全自动化的内容生产系统,结合多模态理解和目标导向优化,实现高效、个性化的数字内容生产。

多模态交互与控制

发展人机交互的智能调节机制,让用户通过自然语言实时指导视频生成,推动人机协作的智能化。

原文摘要

Modern black-box Image-to-Video (I2V) models offer powerful capabilities in automated content creation, yet their lack of fine-grained control and reliability presents significant challenges in professional workflows. Their inherent stochasticity causes minor variations in textual prompts or hyperparameters to yield drastically different outputs often necessitating inefficient, brute-force trial-and-error processes. To address these limitations, we introduce the ``Agentic Self-Improvement" framework, which reframes video synthesis into a closed-loop, goal-directed optimization. Our framework systematically navigates the generation parameter space using a novel two-stage approach. In the first stage, an iterative prompt optimization loop uses a multimodal Large Language Model (mLLM) to refine the input prompt. This refinement implements two automated evaluations: Davidsonian Scene Graph (DSG) queries ensure semantic adherence, and Common Mistake Questions (CMQ) for artifact detection. At the second stage, we use Bayesian optimization to efficiently co-optimize stochastic seeds and CFG scales. This search is guided by a suite of quality metrics, including the novel Video-Text Adherence (VTA) score derived from the DSG and CMQ evaluations. Our framework significantly outperforms unguided search methods: in human preference studies, videos generated via our agentic approach were strongly preferred over baseline outputs, achieving win rates up to 69\%. This work provides a practical and extensible methodology for enhancing the predictability and control of state-of-the-art video generation models, moving the field beyond speculative curiosities toward reliable, production-ready tools.

cs.CV cs.AI cs.MM

参考文献 (20)

VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models

Ziqi Huang, Fan Zhang, Xiaojie Xu 等

2025 233 引用 ⭐ 高影响力

Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation

Jaemin Cho, Yushi Hu, Roopal Garg 等

2023 168 引用 ⭐ 高影响力 查看解读 →

GENERATIVE ADVERSARIAL NETS

Individualized Treat, Jinsung Yoon

2018 43342 引用

Q-Bench-Video: Benchmark the Video Quality Understanding of LMMs

Zicheng Zhang, Ziheng Jia, Haoning Wu 等

2024 44 引用 查看解读 →

Rich Human Feedback for Text-to-Image Generation

Youwei Liang, Junfeng He, Gang Li 等

2023 171 引用 查看解读 →

Classifier-Free Diffusion Guidance

Jonathan Ho

2022 6901 引用 查看解读 →

VPO: Aligning Text-to-Video Generation Models with Prompt Optimization

Jiale Cheng, Ruiliang Lyu, Xiaotao Gu 等

2025 24 引用 查看解读 →

WorldSimBench: Towards Video Generation Models as World Simulators

Yiran Qin, Zhelun Shi, Jiwen Yu 等

2024 1246 引用 查看解读 →

Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance

Dazhong Shen, Guanglu Song, Zeyue Xue 等

2024 64 引用 查看解读 →

Video-to-Video Synthesis

Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu 等

2018 1099 引用 查看解读 →

The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-To-Video Generation

Bingjie Gao, Xinyu Gao, Xiaoxue Wu 等

2025 18 引用 查看解读 →

VideoMAR: Autoregressive Video Generatio with Continuous Tokens

Hu Yu, Biao Gong, Hangjie Yuan 等

2025 15 引用 查看解读 →

MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action

Zhengyuan Yang, Linjie Li, Jianfeng Wang 等

2023 621 引用 查看解读 →

Training Diffusion Models with Reinforcement Learning

Kevin Black, Michael Janner, Yilun Du 等

2023 1004 引用 查看解读 →

Rich features for perceptual quality assessment of UGC videos

Yilin Wang, Junjie Ke, Hossein Talebi 等

2021 130 引用

Make It Move: Controllable Image-to-Video Generation with Text Descriptions

Yaosi Hu, Chong Luo, Zhenzhong Chen

2021 114 引用 查看解读 →

Generating Videos with Scene Dynamics

Carl Vondrick, H. Pirsiavash, A. Torralba

2016 1589 引用 查看解读 →

Adding Conditional Control to Text-to-Image Diffusion Models

Lvmin Zhang, Anyi Rao, Maneesh Agrawala

2023 7542 引用 查看解读 →

Align Your Latents: High-Resolution Video Synthesis with Latent Diffusion Models

A. Blattmann, Robin Rombach, Huan Ling 等

2023 1751 引用 查看解读 →

Prompt-A-Video: Prompt your Video Diffusion Model via Preference-Aligned LLM

Yatai Ji, Jiacheng Zhang, Jie Wu 等

2024 21 引用 查看解读 →