VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

TL;DR

VERTIGO通过视觉偏好优化,减少角色离屏率至0%,提升镜头质量。

cs.CV 🔴 高级 2026-04-03 6 次浏览
Mengtian Li Yuwei Lu Feifei Li Chenqi Gan Zhifeng Xie Xi Wang
视觉偏好优化 电影摄影 相机轨迹生成 计算机视觉 生成式AI

核心发现

方法论

VERTIGO框架利用Unity实时图形引擎生成2D视觉预览,并通过视觉语言模型进行评分。该模型采用循环语义相似性机制,将渲染结果与文本提示对齐,提供视觉偏好信号用于直接偏好优化(DPO)后训练。

关键结果

  • VERTIGO显著降低角色离屏率,从38%降至几乎0%,同时保持相机运动的几何保真度。用户研究表明,VERTIGO在构图、一致性、提示遵循和美学质量方面优于基线。
  • 在Unity渲染和基于扩散的Camera-to-Video管道上进行的定量评估显示,条件遵循、构图质量和感知真实性均有一致提升。
  • VERTIGO在视觉质量指标上显著优于所有基线,尤其是在Unity渲染和生成视频设置中。

研究意义

VERTIGO框架通过视觉偏好优化相机轨迹生成器,解决了传统生成系统中镜头构图差、角色离屏等问题。它在学术界和工业界具有重要影响,提供了一种新的视觉反馈机制,提升了生成镜头的美学质量。

技术贡献

VERTIGO是首个完整的视觉奖励后训练框架,利用实时渲染帧作为视觉奖励,并采用有效的视觉语言模型循环语义评分机制,生成偏好信号进行强化式后训练。它在技术上与现有方法有根本性区别,提供了新的工程可能性。

新颖性

VERTIGO首次探索了视觉奖励后训练框架,将视觉语言模型应用于相机轨迹生成,提供了新的视觉偏好信号。与相关工作相比,它在视觉反馈机制上具有根本性创新。

局限性

  • 由于相机轨迹无法直接进行视觉评估,VERTIGO需要构建复杂的视觉反馈机制,这可能增加系统复杂性。
  • 视觉语言模型的评估可能受到渲染质量的影响,导致偏好信号不稳定。

未来方向

未来工作可以探索更复杂的场景设置和多镜头规划,进一步提升视觉偏好优化的效果。同时,研究如何将视觉语言模型应用于其他视觉生成任务也是一个重要方向。

AI 总览摘要

电影摄影依赖于导演与摄影师之间的紧密反馈循环,传统生成相机系统缺乏这种“导演在环”机制,导致镜头构图差、角色离屏等问题。VERTIGO框架通过视觉偏好优化,利用Unity实时图形引擎生成视觉预览,并通过视觉语言模型进行评分,提供视觉偏好信号用于后训练。实验结果显示,VERTIGO显著降低角色离屏率,同时提升镜头质量。用户研究表明,VERTIGO在构图、一致性、提示遵循和美学质量方面优于基线。该研究在学术界和工业界具有重要影响,提供了一种新的视觉反馈机制,提升了生成镜头的美学质量。

深度分析

研究背景

电影摄影在将文本脚本转化为视觉叙事中起着关键作用,通过相机运动、构图和构成传达情感和美学意义。传统电影制作依赖于摄影师和导演之间的密切合作,摄影师通过相机运动解释导演的指示,导演则通过监视器监督屏幕上的构图。随着计算机图形学和计算机视觉的进步,特别是生成式AI的进展,许多研究开始探索自动化或辅助相机控制系统,以模拟人类摄影师的创造力和精确性。

核心问题

现有生成相机系统能够生成多样的文本条件轨迹,但缺乏“导演在环”机制,无法明确监督镜头是否在视觉上令人满意。这导致了分布内相机运动,但镜头构图差、角色离屏和视觉美学不佳的问题。

核心创新

VERTIGO框架通过视觉偏好优化相机轨迹生成器,利用Unity实时图形引擎生成视觉预览,并通过视觉语言模型进行评分,提供视觉偏好信号用于后训练。它在视觉反馈机制上具有根本性创新,与相关工作相比,提供了新的视觉偏好信号。

方法详解

  • �� 利用Unity实时图形引擎生成2D视觉预览。
  • �� 通过视觉语言模型进行评分,采用循环语义相似性机制。
  • �� 提供视觉偏好信号用于直接偏好优化(DPO)后训练。

实验设计

实验设计包括在Unity渲染和基于扩散的Camera-to-Video管道上进行定量评估和用户研究。使用CLaTr和VBench指标评估几何和视觉质量。用户研究参与者进一步比较VERTIGO与基线在构图、一致性、提示遵循和美学质量方面的表现。

结果分析

VERTIGO显著降低角色离屏率,从38%降至几乎0%,同时保持相机运动的几何保真度。用户研究表明,VERTIGO在构图、一致性、提示遵循和美学质量方面优于基线。

应用场景

VERTIGO框架可直接应用于电影制作中的相机轨迹生成,提升镜头的美学质量和构图效果。它在学术界和工业界具有重要影响,提供了一种新的视觉反馈机制。

局限与展望

由于相机轨迹无法直接进行视觉评估,VERTIGO需要构建复杂的视觉反馈机制,这可能增加系统复杂性。视觉语言模型的评估可能受到渲染质量的影响,导致偏好信号不稳定。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。传统的相机系统就像一个没有指导的厨师,虽然能做出不同的菜肴,但味道可能不佳。VERTIGO就像一个经验丰富的厨师,能够根据顾客的反馈不断调整菜肴的味道和摆盘。通过视觉偏好优化,VERTIGO确保每道菜不仅美味,还能让顾客满意。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中有一个角色需要拍摄电影镜头。传统的相机系统就像一个没有指导的玩家,虽然能拍摄不同的镜头,但效果可能不佳。VERTIGO就像一个经验丰富的玩家,能够根据游戏中的反馈不断调整镜头的构图和效果。通过视觉偏好优化,VERTIGO确保每个镜头不仅好看,还能让观众满意。

术语表

视觉偏好优化 (Visual Preference Optimization)

一种通过视觉反馈机制优化生成结果的方法。

用于优化相机轨迹生成器的视觉偏好信号。

Unity实时图形引擎 (Unity Real-time Graphics Engine)

一种用于生成视觉预览的图形引擎。

用于生成2D视觉预览并进行评分。

视觉语言模型 (Vision-Language Model)

一种结合视觉和语言信息进行评分的模型。

用于对视觉预览进行评分并提供偏好信号。

循环语义相似性机制 (Cyclic Semantic Similarity Mechanism)

一种通过语义相似性进行评分的机制。

用于对渲染结果与文本提示进行对齐。

直接偏好优化 (Direct Preference Optimization)

一种通过偏好信号进行后训练的方法。

用于优化相机轨迹生成器的后训练。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中应用视觉偏好优化?
  • 2 视觉语言模型在不同渲染质量下的稳定性如何?

应用场景

近期应用

电影制作

VERTIGO可用于电影制作中的相机轨迹生成,提升镜头的美学质量和构图效果。

远期愿景

视觉生成任务

研究如何将视觉语言模型应用于其他视觉生成任务,提升生成结果的质量。

原文摘要

Cinematic camera control relies on a tight feedback loop between director and cinematographer, where camera motion and framing are continuously reviewed and refined. Recent generative camera systems can produce diverse, text-conditioned trajectories, but they lack this "director in the loop" and have no explicit supervision of whether a shot is visually desirable. This results in in-distribution camera motion but poor framing, off-screen characters, and undesirable visual aesthetics. In this paper, we introduce VERTIGO, the first framework for visual preference optimization of camera trajectory generators. Our framework leverages a real-time graphics engine (Unity) to render 2D visual previews from generated camera motion. A cinematically fine-tuned vision-language model then scores these previews using our proposed cyclic semantic similarity mechanism, which aligns renders with text prompts. This process provides the visual preference signals for Direct Preference Optimization (DPO) post-training. Both quantitative evaluations and user studies on Unity renders and diffusion-based Camera-to-Video pipelines show consistent gains in condition adherence, framing quality, and perceptual realism. Notably, VERTIGO reduces the character off-screen rate from 38% to nearly 0% while preserving the geometric fidelity of camera motion. User study participants further prefer VERTIGO over baselines across composition, consistency, prompt adherence, and aesthetic quality, confirming the perceptual benefits of our visual preference post-training.

cs.CV cs.AI