Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

TL;DR

提出STALL,无需训练,通过空间-时间似然性检测生成视频,显著优于现有方法。

cs.CV 🔴 高级 2026-03-16 40 次浏览
Omer Ben Hayun Roy Betser Meir Yossef Levi Levi Kassel Guy Gilboa
深度学习 视频检测 生成模型 零样本 概率模型

核心发现

方法论

该方法基于概率模型,结合空间和时间两个维度,利用预训练的DINOv3编码器计算视频帧的空间似然性,并通过归一化的帧间差异构建时间似然性。空间似然性采用高维高斯近似,利用校准集统计参数,计算每帧的对数似然;时间似然性则对帧间差异向量进行归一化,验证其高斯性,结合协方差矩阵,计算转移的对数似然。最终通过归一化的百分位数融合空间和时间得分,实现对视频真实性的判别。该方法无需训练,依赖少量真实视频校准,适应性强,计算效率高。

关键结果

  • 在两个公开基准(VideoFeedback和GenVideo)上,STALL的平均AUC分别达到0.82和0.86,明显优于D3、ZED等基线,且在新引入的ComGenVid数据集上表现优异,平均AUC达0.85,验证其跨模型泛化能力。
  • 在不同生成模型(如Veo3、Sora)中,STALL保持稳定检测性能,单一模型的检测准确率超过80%,且对图像扰动和校准集大小变化具有鲁棒性,显示出良好的实用性。
  • 通过消融实验,空间和时间两个模块的结合明显优于单一模块,融合策略(取最小时间似然和最大空间似然)效果最佳,验证了模型设计的合理性。

研究意义

该研究突破了视频深度伪造检测的传统依赖训练数据的局限,提出基于统计的零样本检测框架,为应对新兴高质量生成模型提供了理论基础和实践工具。其模型简洁高效,适合大规模实时检测,有望在内容验证、平台监管等场景中发挥重要作用,推动生成内容的可信识别技术发展。

技术贡献

创新点在于将空间和时间两个维度的似然性结合,提出基于高维高斯假设的概率模型,理论上证明归一化后帧间差异具有高斯性,提供了严密的数学基础。该方法无需训练,利用预训练编码器和校准集实现快速部署,显著优于现有的监督或半监督检测技术,增强了模型的泛化能力和鲁棒性。

新颖性

本研究首次提出结合空间和时间统计特征的无训练视频检测方法,利用高维高斯近似实现对生成视频的概率评分,填补了零样本检测在视频领域的空白。与仅依赖单一空间或时间信息的先前方法相比,具有更全面、更稳健的检测能力,是技术上的重大突破。

局限性

  • 该方法依赖预训练编码器的表现,若编码器对某些生成模型的特征不敏感,检测效果可能下降。
  • 在极端场景(如完全静止或极端噪声干扰)下,模型可能失效,尤其是当视频内容高度相似或缺乏运动信息时。
  • 高维高斯假设在某些复杂场景中可能不完全成立,未来需考虑更复杂的统计模型以提升鲁棒性。

未来方向

未来将探索多模态信息融合(如声音、文本等)以增强检测能力,结合深度学习与统计模型的优势,提升对复杂伪造视频的识别准确率。同时,研究更鲁棒的高维统计假设,扩展到多样化视频类型和场景,推动工业级应用落地。

AI 总览摘要

随着深度生成模型的快速发展,虚假视频的制作变得愈发逼真,传统检测方法多依赖于大量训练数据,难以应对新兴模型的快速迭代。本文提出的STALL方法,基于空间-时间联合似然性模型,利用预训练编码器和统计分析,实现无需训练的零样本检测。通过对视频帧的空间特征和帧间运动的统计建模,STALL在多个公开基准和新引入的ComGenVid数据集上均表现出优异的检测能力,平均AUC超过0.85,显著优于现有方法。其核心创新在于结合高维高斯假设,归一化帧间差异,构建稳健的概率评分体系,兼顾内容和运动信息,增强模型的泛化能力。此外,方法计算高效,适合大规模实时检测场景,为内容验证和平台监管提供了强有力的技术支撑。未来,结合多模态信息和更复杂的统计模型,将进一步提升检测的鲁棒性和适应性,推动生成内容的可信识别技术迈向更高水平。

深度分析

研究背景

近年来,深度生成模型在图像、文本、视频等多模态领域取得突破性进展,推动内容生产的自动化与多样化。早期研究多依赖监督学习,训练大规模分类器识别伪造内容,但受限于模型更新速度和泛化能力,难以应对新兴生成技术。零样本检测逐渐成为研究热点,利用统计特征或预训练模型实现无需训练的检测方法。视频伪造检测面临更大挑战,因其动态特性和复杂运动,单纯的图像级检测难以捕捉跨帧异常。现有方法如D3仅关注帧间运动,缺乏对内容和动态的联合分析,亟需一种理论基础扎实、兼顾空间和时间的检测框架。

核心问题

当前视频生成检测多依赖训练数据,面临模型快速迭代带来的泛化困难。单一的空间或时间特征难以全面捕捉伪造视频的异常,尤其是在高质量生成模型普及后,伪造内容越来越逼真。缺乏一种无需训练、理论基础稳固的检测方法,限制了其在实际场景中的应用。如何在保证检测准确率的同时,提高模型的泛化能力和计算效率,成为亟待解决的问题。

核心创新

本研究提出结合空间和时间两个维度的统计模型,利用高维高斯近似实现无训练视频检测。创新点包括:1)空间似然性基于预训练编码器的高维特征,采用高斯模型进行概率评分;2)时间似然性通过归一化帧间差异,验证其高斯性,结合协方差矩阵,衡量运动一致性;3)融合空间和时间得分,采用百分位数归一化,增强鲁棒性。该方法无需训练,依赖少量真实视频校准,适应性强,计算高效,能应对多样化生成模型。

方法详解

  • �� 预训练编码器(如DINOv3)提取每帧的高维特征。
  • �� 利用校准集统计参数(均值、协方差),对空间特征进行高斯建模,计算每帧的对数似然。
  • �� 计算帧间差异向量,归一化方向,验证其高斯性,建立时间模型,计算转移的对数似然。
  • �� 归一化空间和时间得分的百分位数,避免尺度差异。
  • �� 采用最小时间似然和最大空间似然融合,得到视频整体的检测分数。
  • �� 该流程无需训练,仅依赖预先采集的真实视频校准数据,适合大规模检测。

实验设计

在VideoFeedback和GenVideo两个公开基准上,采用多种生成模型(如Veo3、Sora)进行测试,比较包括D3、ZED等基线。指标为AUC和AP,评估模型在不同生成模型上的泛化能力。通过不同校准集大小和图像扰动测试验证鲁棒性。结果显示,STALL在所有基准上均优于对比方法,平均AUC超过0.85,检测效果稳定,计算速度快,适合实时应用。

结果分析

在两个公开基准中,STALL的平均AUC分别为0.82和0.86,明显优于D3和ZED,且在新引入的ComGenVid数据集上表现出色,平均AUC达0.85。对不同生成模型的检测准确率均在80%以上,模型对图像扰动和校准集变化具有良好鲁棒性。消融实验验证了空间和时间模块的协同作用,融合策略的有效性。整体表现证明了方法的高效性和泛化能力,为未来视频伪造检测提供了新思路。

应用场景

该方法适用于内容平台、社交媒体、新闻验证等场景,能够在无需训练的情况下快速筛查大量视频,有效识别高质量伪造内容。只需少量真实视频作为校准,便可部署在实时监控系统中,提升内容真实性保障。未来,结合多模态信息,将拓展至多场景、多类型伪造检测,推动行业标准制定。

局限与展望

依赖预训练编码器的特征表达,可能在某些特定生成模型或极端场景下表现不足。高维高斯假设在复杂内容或极端运动条件下可能失效。模型对静止或噪声干扰敏感,未来需引入更复杂的统计模型或深度学习增强机制以提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂每天生产各种商品。工厂的工人(模型)有自己的一套生产流程(生成视频),但有些商品(视频)是伪造的,看起来很像真的。工厂里有一个检测员(STALL),他不需要学习每个商品的详细制作过程,只需要观察商品的整体特征和生产线的流动(空间和时间的特征)。他会用一些统计方法,判断商品是否符合工厂正常的生产规律。比如,商品的外观是否符合工厂的标准(空间特征),以及生产过程中商品的变化是否自然(时间特征)。如果商品在外观或变化上都符合工厂的正常规律,检测员就会认为它是真的;如果不符合,就会判定为伪造。这个检测员不需要提前学习所有可能的伪造方式,只依赖工厂的正常商品样本,快速判断出伪造品。这就像用统计学的“规则”来识别假货一样,简单高效,适合大规模使用。

简单解释 像给14岁少年讲一样

想象你在学校里,有个老师每天检查学生的作业。平时,老师只看作业的内容(图片),但有时候作业可能被抄袭或伪造。现在,有个聪明的助手(STALL),他不用提前学习所有作弊的方法,只需要用一些简单的统计技巧,观察每份作业的内容和变化是否符合正常的学生习惯。比如,他会看作业的风格是否一致,变化是否自然。老师只要用这个助手检查,能很快发现哪些作业是假的,哪些是真的。这个助手特别厉害,因为它不需要提前学习所有作弊技巧,只用正常学生的作业样本,就能判断出伪造的作业。这就像用数学和统计的方法,快速识别出伪造的内容,既简单又可靠。

术语表

空间似然性 (Spatial Likelihood)

衡量每一帧图像内容符合真实数据的概率,基于高维高斯模型,反映图像的真实性。

用于评估视频每帧的内容是否符合真实分布。

时间似然性 (Temporal Likelihood)

衡量连续帧之间运动变化的自然程度,利用归一化的帧间差异构建高斯模型。

检测视频中运动是否符合真实动态。

高维高斯近似 (High-dimensional Gaussian Approximation)

在高维空间中,随机向量的投影趋向高斯分布,便于统计建模。

用于空间和时间特征的概率估计。

归一化百分位数 (Percentile Normalization)

将得分转换为相对于校准集的百分位,避免尺度差异影响。

融合空间和时间得分的关键步骤。

零样本检测 (Zero-shot Detection)

无需训练样本,直接利用统计特征判断内容真假。

本方法的核心优势。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端场景(如静止或噪声干扰)下的鲁棒性仍是未解难题,未来需结合深度学习增强统计模型的表达能力。
  • 2 高维高斯假设在复杂内容或极端运动条件下可能失效,探索更复杂的统计或深度模型以提升检测准确性是未来方向。

应用场景

近期应用

内容平台内容验证

可在社交媒体、视频平台快速筛查上传内容,识别伪造视频,保障信息真实性。

媒体监管与审查

政府或平台可部署在监控系统中,实时检测生成内容,防止虚假信息扩散。

远期愿景

行业标准制定

推动生成内容检测的行业标准,建立可信内容生态。

多模态内容检测

结合声音、文本等多模态信息,提升伪造检测的全面性和准确性。

原文摘要

Following major advances in text and image generation, the video domain has surged, producing highly realistic and controllable sequences. Along with this progress, these models also raise serious concerns about misinformation, making reliable detection of synthetic videos increasingly crucial. Image-based detectors are fundamentally limited because they operate per frame and ignore temporal dynamics, while supervised video detectors generalize poorly to unseen generators, a critical drawback given the rapid emergence of new models. These challenges motivate zero-shot approaches, which avoid synthetic data and instead score content against real-data statistics, enabling training-free, model-agnostic detection. We introduce STALL, a simple, training-free, theoretically justified detector that provides likelihood-based scoring for videos, jointly modeling spatial and temporal evidence within a probabilistic framework. We evaluate STALL on two public benchmarks and introduce ComGenVid, a new benchmark with state-of-the-art generative models. STALL consistently outperforms prior image- and video-based baselines. Code and data are available at https://omerbenhayun.github.io/stall-video.

cs.CV cs.LG