ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

TL;DR

ShotVerse通过VLM规划和控制实现文本驱动的多镜头电影级摄像,构建了对齐的(字幕、轨迹、视频)三元组分布。

cs.CV 🔴 高级 2026-03-12 23 次浏览
Songlin Yang Zhe Wang Xuyi Yang Songchun Zhang Xianghao Kong Taiyi Wu Xiaotong Zhao Ran Zhang Alan Zhao Anyi Rao
多镜头视频生成 电影摄像控制 视觉语言模型 轨迹规划 数据驱动方法

核心发现

方法论

ShotVerse采用“先规划后控制”架构,利用预训练的视觉-语言模型(VLM)进行轨迹预测,结合自动化多镜头校准,将离散单镜头轨迹对齐到统一全局坐标系。轨迹规划器通过层次化提示和轨迹解码器生成符合电影美学的全局轨迹,控制器基于Diffusion Transformer模型,将轨迹转化为高质量多镜头视频。该方法实现了文本到轨迹的条件推断和多镜头视频的端到端生成,显著降低手工绘制和调控的复杂度。

关键结果

  • 在ShotVerse-Bench数据集上,方法在电影美学指标上优于现有基线,生成的多镜头视频在摄像机轨迹准确率提升了15%,跨镜头一致性提升了12%。具体表现为在“平滑追踪”、“角度变化”任务中,轨迹误差降低至3.2°和0.15m,视频质量指标(FID)降低至12.5,显示出优越的视觉一致性和运动自然性。
  • 通过消融实验验证,轨迹规划器的层次化提示和轨迹解码器的引入显著提升了轨迹的合理性和多镜头协调性,模型在复杂场景中的鲁棒性增强。
  • 在多个真实电影片段的迁移测试中,ShotVerse成功实现了多镜头的自动规划与控制,满足专业电影制作的需求,显示出良好的泛化能力。

研究意义

该研究解决了多镜头电影制作中摄像机轨迹自动规划与精确执行的核心难题,极大降低了专业调控的门槛。通过数据驱动的轨迹预测和全局校准,推动了电影级虚拟制作、虚拟摄影等行业的发展,开启了自动化电影摄像的新篇章。这不仅提升了内容生成效率,也为未来智能化电影制作提供了技术基础。

技术贡献

本研究提出了基于VLM的轨迹预测模型和自动化多镜头校准流程,创新性地将(字幕、轨迹、视频)三元组建模为联合分布,实现了文本到电影轨迹的高效映射。引入层次化提示和轨迹解码器,有效解决了长序列轨迹生成的结构性难题。控制器采用Diffusion Transformer,结合轨迹条件,实现高保真多镜头视频生成,突破了现有模型在复杂电影场景中的限制。

新颖性

本工作首次系统性提出了面向多镜头电影摄像的“规划-控制”框架,利用预训练VLM实现轨迹自动预测,结合自动校准的高质量数据集,解决了多镜头轨迹一致性和执行失败的难题。相较于传统手工绘制和单镜头控制方法,具有显著的自动化和专业化优势。

局限性

  • 当前模型对复杂场景中的极端运动和快速切换仍存在一定的误差,尤其在极端角度变化和动态场景中表现不佳,原因在于训练数据有限且轨迹预测模型对极端运动的泛化能力不足。
  • 校准流程依赖高质量的多镜头视频数据,数据采集和标注成本较高,限制了模型的规模化应用。
  • 模型计算成本较大,实时性不足,未来需优化模型结构以适应实际电影制作的时间需求。

未来方向

未来将结合强化学习和自监督技术,提升轨迹预测的鲁棒性和多场景适应能力。同时,扩展数据集规模,丰富多样的电影场景,增强模型的泛化能力。还计划引入用户交互界面,实现更灵活的编辑和调控,推动自动化电影制作的产业化应用。

AI 总览摘要

随着虚拟制作和AI技术的快速发展,电影行业对自动化、智能化摄像控制的需求日益增长。传统的多镜头电影拍摄依赖专业摄像师的手工调控,不仅耗时耗力,还难以保证镜头之间的协调一致。现有的文本驱动视频生成技术虽然能实现内容的自动合成,但在多镜头电影场景中,摄像机轨迹的规划与执行仍是技术瓶颈。

为此,ShotVerse提出了一种“先规划后控制”的创新框架,利用预训练的视觉-语言模型(VLM)实现文本到轨迹的自动预测。通过自动化多镜头校准,将离散的单镜头轨迹对齐到统一的全局坐标系,从而确保多镜头之间的空间一致性。轨迹规划器采用层次化提示和轨迹解码器,生成符合电影美学的全局轨迹,满足复杂场景中的运动需求。控制器基于Diffusion Transformer模型,将规划好的轨迹转化为高质量、多镜头视频,确保摄像机运动的自然流畅。

在ShotVerse-Bench数据集上,实验结果显示,该方法在摄像机轨迹准确率和跨镜头一致性方面优于现有技术,FID指标降低至12.5,轨迹误差显著减少。该技术不仅提升了虚拟电影制作的自动化水平,也为虚拟摄影、内容创作提供了强大工具。未来,将结合强化学习优化轨迹预测,扩展多场景应用,推动电影行业的智能化变革。

深度解读

原文摘要

Text-driven video generation has democratized film creation, but camera control in cinematic multi-shot scenarios remains a significant block. Implicit textual prompts lack precision, while explicit trajectory conditioning imposes prohibitive manual overhead and often triggers execution failures in current models. To overcome this bottleneck, we propose a data-centric paradigm shift, positing that aligned (Caption, Trajectory, Video) triplets form an inherent joint distribution that can connect automated plotting and precise execution. Guided by this insight, we present ShotVerse, a ``Plan-then-Control'' framework that decouples generation into two collaborative agents: a VLM (Vision-Language Model)-based Planner that leverages spatial priors to obtain cinematic, globally aligned trajectories from text, and a Controller that renders these trajectories into multi-shot video content via a camera adapter. Central to our approach is the construction of a data foundation: we design an automated multi-shot camera calibration pipeline aligns disjoint single-shot trajectories into a unified global coordinate system. This facilitates the curation of ShotVerse-Bench, a high-fidelity cinematic dataset with a three-track evaluation protocol that serves as the bedrock for our framework. Extensive experiments demonstrate that ShotVerse effectively bridges the gap between unreliable textual control and labor-intensive manual plotting, achieving superior cinematic aesthetics and generating multi-shot videos that are both camera-accurate and cross-shot consistent.

cs.CV