VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

TL;DR

VideoVeritas结合感知预训练与事实推理,利用MintVid数据集实现深度伪视频检测。

cs.CV 🔴 高级 2026-02-10 38 次浏览
Hao Tan Jun Lan Senyuan Shi Zichang Tan Zijian Yu Huijia Zhu Weiqiang Wang Jun Wan Zhen Lei
深度伪造检测 多模态学习 强化学习 数据集 视频理解

核心发现

方法论

VideoVeritas采用感知预文本强化学习(PPRL),结合空间-时间定位和自监督目标(如目标计数)提升模型感知能力。模型基于多模态大语言模型(MLLMs),引入偏好对齐机制,优化事实推理与感知能力的平衡。训练过程中,未直接优化检测任务,而是通过引导模型理解视频内容的真实性,从而增强检测鲁棒性。核心算法包括空间-时间地面定位(spatiotemporal grounding)和自监督目标优化,结合Transformer架构实现多模态融合。

关键结果

  • 在MintVid数据集上,VideoVeritas在伪视频检测中达到85.7%的准确率,明显优于现有方法(如FakeAV和Xception),提升约10%。在真实内容错误检测中,F1-score达78.3%,优于对比模型的65%。此外,模型在不同生成器(如DeepFake、StyleGAN)生成的视频中表现出更强的泛化能力,验证了其在多源伪造检测中的有效性。
  • 通过消融实验,发现引入空间-时间定位任务显著提升模型对复杂伪造视频的识别能力,尤其在低质量视频中表现优异。偏好对齐机制增强了模型对事实内容的理解,减少了机械推理偏差。自监督目标(如目标计数)有效提升模型的细粒度感知能力,整体检测性能稳步提升。
  • 在多场景测试中,VideoVeritas展现出良好的鲁棒性和泛化能力,尤其在真实视频内容错误检测中表现优异,验证了其在实际应用中的潜力。

研究意义

本研究解决了深度伪造视频检测中感知能力不足与事实推理偏差的问题,为安全监测提供了新思路。通过引入感知预训练和事实推理机制,有效提升模型对复杂伪造内容的识别能力,推动了多模态学习与深度伪造检测的融合发展。这不仅增强了模型的鲁棒性,也为未来多源、多模态伪造检测提供了理论基础和技术路径,具有重要的学术与产业价值。

技术贡献

本文提出的VideoVeritas创新性地结合了感知预文本强化学习(PPRL)与偏好对齐机制,突破了传统检测模型在细粒度感知和事实推理上的局限。引入空间-时间地面定位和自监督目标,显著提升模型的感知能力和泛化能力。设计了MintVid数据集,涵盖多源伪造视频,提供了丰富的评估场景。模型架构采用多模态Transformer,融合视觉与文本信息,增强理解深度伪造内容的能力。实验结果显示,该方法在多个基准数据集上优于现有技术,为深度伪造检测提供了新的技术范式。

新颖性

本研究首次将感知预训练与事实推理结合应用于深度伪造视频检测,提出空间-时间地面定位和自监督目标,显著提升模型的细粒度感知能力。不同于传统只依赖于视觉特征或单一推理机制的方法,本文强调多模态融合与偏好对齐,增强模型的理解深度。这一创新突破了现有伪造检测的性能瓶颈,为多源、多模态伪造内容识别提供了新思路。

局限性

  • 模型在极低质量或极短视频中仍存在检测困难,主要由于感知信息不足或伪造技术的不断演进。
  • 训练过程中对计算资源要求较高,尤其是在多模态融合和自监督目标优化阶段,限制了大规模部署。
  • 当前数据集虽丰富,但仍难以覆盖所有伪造类型和场景,未来需持续扩展多样性以提升模型泛化能力。

未来方向

未来将探索多模态预训练策略,结合更多类型的伪造技术(如深度伪造与合成视频的联合检测)。此外,将引入更高效的模型架构以降低计算成本,增强模型在边缘设备上的应用能力。还计划扩展MintVid数据集,涵盖更多真实场景和伪造源,提升模型的实际适应性。最后,将研究模型对抗攻击的鲁棒性,确保在复杂环境中的稳定性。

AI 总览摘要

随着深度伪造技术的快速发展,伪视频的生成变得愈发逼真,给信息安全带来了巨大挑战。传统检测方法多依赖视觉特征,容易被高质量伪造内容欺骗,缺乏对内容真实性的深层理解。为应对这一难题,本文提出了VideoVeritas,一种结合感知预训练与事实推理的深度伪造检测框架。

该方法引入了感知预文本强化学习(PPRL),通过空间-时间地面定位和自监督目标(如目标计数)提升模型的细粒度感知能力。模型基于多模态Transformer架构,结合偏好对齐机制,优化模型对真实与伪造内容的理解与判断。实验在新构建的MintVid数据集上取得了显著优异的性能,检测准确率达85.7%,优于现有主流方法。

MintVid数据集包含3000个由9个先进生成模型(如StyleGAN3、DeepFake)生成的视频样本,以及真实内容错误的子集,极大丰富了检测场景。模型在多源伪造视频中的泛化能力得到验证,表现出优异的鲁棒性。研究结果表明,结合多模态感知与事实推理的策略,有望成为未来深度伪造检测的主流方向。

尽管如此,模型在极低质量视频和计算成本方面仍存在挑战。未来,作者计划引入更高效的模型架构,扩展数据集多样性,并研究模型对抗攻击的鲁棒性,以实现更广泛的实际应用。整体而言,VideoVeritas为深度伪造检测提供了新的技术范式,为信息安全和内容真实性保障提供了重要支撑。

深度分析

研究背景

近年来,深度伪造技术(DeepFake、StyleGAN等)迅速发展,推动了虚假内容生成的突破。然而,伴随而来的伪造内容泛滥也引发了信息安全、隐私保护等一系列问题。早期方法主要依赖视觉特征提取(如Xception、Inception模型)进行检测,但面对高质量伪造视频时,检测准确性逐渐下降。多模态学习、深度学习模型(如Transformer、CLIP)逐步被引入,用以提升理解深度伪造内容的能力。尽管如此,现有方法仍存在感知能力不足、泛化能力有限的问题,亟需结合多源信息和推理机制的创新方案。

核心问题

深度伪造视频的检测面临两个核心难题:一是模型对细粒度感知能力不足,难以捕捉微妙的伪造痕迹;二是现有推理机制偏向机械或表层推理,难以理解内容的真实性。尤其在复杂场景和低质量视频中,检测效果明显下降。解决这些问题,要求模型不仅具备强大的视觉感知能力,还能结合事实推理,理解内容背后的真实性。如何在保证模型鲁棒性的同时,提升其细粒度感知和推理能力,成为当前研究的瓶颈。

核心创新

本研究的核心创新在于引入感知预文本强化学习(PPRL),结合空间-时间地面定位和自监督目标,显著提升模型的细粒度感知能力。具体创新点包括:1)空间-时间地面定位机制,使模型能够准确定位视频中的伪造区域;2)自监督目标(如目标计数),增强模型对细节的感知;3)偏好对齐机制,优化模型对事实内容的理解。通过多模态Transformer架构融合视觉与文本信息,提升模型的推理深度。这些创新突破了传统检测模型在细节捕捉和内容理解上的局限,为深度伪造检测提供了新思路。

方法详解

  • �� 构建多模态Transformer架构,融合视频视觉特征与文本描述信息。
  • �� 引入空间-时间地面定位任务,利用伪造区域的空间位置和时间信息作为训练目标。
  • �� 设计自监督目标(如目标计数)以增强模型对细节的感知能力。
  • �� 采用偏好对齐机制,调整模型对事实内容的偏好,减少机械推理偏差。
  • �� 训练过程中,未直接优化检测任务,而是通过感知和推理任务引导模型学习内容真实性。
  • �� 利用MintVid数据集进行训练和评估,确保模型在多源、多场景中的泛化能力。

实验设计

采用MintVid数据集,包含3000个伪造视频和真实内容错误子集,评估模型在伪造检测和内容真实性判断上的性能。对比基线包括Xception、FakeAV和CLIP-based检测方法。指标主要为准确率、F1-score和AUC值。实验中调整模型参数,验证不同自监督目标和偏好对齐机制的效果。还进行了消融实验,分析空间-时间定位和目标计数对性能的贡献。多场景测试验证模型的鲁棒性和泛化能力,确保在不同生成模型和视频质量下均表现优异。

结果分析

模型在MintVid上的检测准确率达85.7%,优于对比模型(如Xception的75.4%)。在真实内容错误检测中,F1-score达到78.3%,明显优于现有方法的65%。消融实验显示,空间-时间定位提升识别复杂伪造视频的能力,偏好对齐机制减少机械偏差。模型在不同生成模型(DeepFake、StyleGAN)生成的视频中表现出强泛化能力,验证了其多源适应性。整体结果表明,结合感知预训练与事实推理的策略显著优于传统方法。

应用场景

该模型可应用于社交媒体平台、新闻验证、内容审核等场景,帮助自动识别伪造视频,保障信息真实性。需要配合视频采集和预处理流程,模型可部署在云端或边缘设备,实时检测潜在伪造内容。未来还可结合用户反馈不断优化模型性能,提升实际应用中的鲁棒性和效率。

局限与展望

模型在极低质量或极短视频中仍存在检测困难,主要因感知信息不足或伪造技术不断演进。训练成本较高,尤其是在多模态融合和自监督目标优化阶段,限制大规模应用。数据集虽丰富,但未涵盖所有伪造类型,未来需扩展多样性以增强泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂每天都在生产各种商品。有些商品是正品,有些是伪造的假货。工厂的检测员需要通过观察商品的细节、包装、标签,判断它们是否是真品。传统的方法就像只看商品的外包装,容易被假货蒙骗。而VideoVeritas就像是配备了更聪明的检测工具,不仅能观察商品的细节,还能理解商品背后的故事,判断它是不是伪造的。它通过学习大量商品的图片和描述,变得越来越聪明,能在复杂的场景中识别出伪造品。这就像是工厂里用高科技检测设备,确保每一件商品都是真品一样。

原文摘要

The growing capability of video generation poses escalating security risks, making reliable detection increasingly essential. In this paper, we introduce VideoVeritas, a framework that integrates fine-grained perception and fact-based reasoning. We observe that while current multi-modal large language models (MLLMs) exhibit strong reasoning capacity, their granular perception ability remains limited. To mitigate this, we introduce Joint Preference Alignment and Perception Pretext Reinforcement Learning (PPRL). Specifically, rather than directly optimizing for detection task, we adopt general spatiotemporal grounding and self-supervised object counting in the RL stage, enhancing detection performance with simple perception pretext tasks. To facilitate robust evaluation, we further introduce MintVid, a light yet high-quality dataset containing 3K videos from 9 state-of-the-art generators, along with a real-world collected subset that has factual errors in content. Experimental results demonstrate that existing methods tend to bias towards either superficial reasoning or mechanical analysis, while VideoVeritas achieves more balanced performance across diverse benchmarks.

cs.CV