DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning

TL;DR

提出DAVID-XR1,结合细粒度缺陷标注与链式推理,实现可解释的AI生成视频检测,提升泛化能力。

cs.CV 🔴 高级 2025-06-13 8 引用 44 次浏览
Yifeng Gao Yifan Ding Hongyu Su Juncheng Li Yunhan Zhao Lin Luo Zixing Chen Li Wang Xin Wang Yixu Wang Xingjun Ma Yu-Gang Jiang
AI视频检测 可解释性 多模态模型 链式推理 缺陷标注

核心发现

方法论

本文提出基于视频-语言多模态模型DAVID-XR1,通过构建包含缺陷类别、时空定位和自然语言解释的丰富标注数据集DAVID-X,结合视觉链式推理(Visual Chain-of-Thought, CoT)技术,进行端到端训练。模型采用Gemini 2.5 Pro作为知识蒸馏源,将其复杂的推理路径转化为可训练的视觉CoT,辅以链式思维引导(Chain-of-Thought, CoT)策略,增强模型的可解释性和泛化能力。训练过程中引入联合优化策略,将推理路径与二分类任务结合,利用微调(Fine-tuning)和链式推理蒸馏(Chain-of-Thought Distillation)实现对不同生成器和模式的强泛化。模型输出不仅提供二分类结果,还生成详细的缺陷类别、时空位置和自然语言说明,显著提升检测的透明度和可信度。

关键结果

  • 在多源生成器(包括Ve o2、Kling 2.0、Pika v2.2等)上,模型在未见过的生成模式下实现了76.7%的检测准确率(相较于传统黑箱模型的26.7%有大幅提升),在解释精度方面达到54.7%,显著优于传统方法。通过链式推理,模型在缺陷定位和类别识别上表现出更强的鲁棒性,尤其在复杂场景和低质量视频中表现优异。
  • 在跨域测试中,模型展现出优异的泛化能力,准确识别不同生成引擎的伪造视频,验证了其在实际应用中的潜力。实验还表明,结合链式推理的微调策略比单纯分类模型在解释一致性和准确性方面提升了20%以上。
  • 通过消融实验,验证了缺陷类别、时空定位和自然语言解释三者的协同作用对提升检测性能的贡献,特别是在复杂场景和多模态信息融合方面,模型的表现优于单一模态模型。

研究意义

本研究突破了AI生成视频检测的黑箱限制,将检测过程转化为透明、可验证的推理链,极大增强了模型的可信度和可解释性。这对于社交媒体、内容审核和数字取证等行业具有重要意义,有助于应对深度伪造技术带来的挑战,推动AI伦理和可信AI的发展。同时,提出的多模态数据集和推理框架为未来研究提供了新的标杆和方向。

技术贡献

技术上,本文首次结合缺陷级别的细粒度标注与视觉链式推理,提出DAVID-XR1模型,采用Gemini 2.5 Pro的知识蒸馏路径,设计链式思维引导(CoT)策略,有效提升模型的可解释性和泛化能力。引入联合优化机制,将推理路径与二分类任务融合,显著改善了模型在不同生成器和模式下的表现。数据集方面,DAVID-X的缺陷标注细粒度丰富,为多模态模型训练提供了高质量的监督信号。

新颖性

本研究的创新点在于首次将缺陷级别的空间-时间标注融入多模态检测框架,结合链式推理实现可解释的AI生成视频检测。不同于传统的黑箱分类器,模型输出详细的缺陷类别、位置和自然语言解释,增强了模型的透明度。引入基于Gemini 2.5 Pro的知识蒸馏和链式思维训练,显著提升了模型在未见生成器上的泛化能力,填补了现有方法在可解释性和跨域适应性方面的空白。

局限性

  • 模型对极端低质量或极度复杂场景下的缺陷识别仍存在一定困难,尤其在缺陷模糊或被遮挡时表现不佳,可能导致误判。
  • 训练依赖大量高质量标注数据,数据采集和标注成本较高,且在实际应用中难以快速扩展到更多生成器和场景。
  • 模型推理路径较长,计算成本较高,实时检测场景下的部署仍需优化。

未来方向

未来工作将集中在提升模型的推理效率,探索更轻量化的链式推理结构;同时,扩展数据集规模,涵盖更多生成器和场景,增强模型的鲁棒性。还将研究多模态融合策略,结合音频、文本等信息,进一步提升检测的准确性和解释能力。此外,考虑引入主动学习和半监督技术,以降低标注成本,推动模型在实际场景中的落地应用。

AI 总览摘要

随着深度学习技术的飞速发展,AI生成的视频内容已成为数字媒体的重要组成部分。从虚拟主播到虚拟场景,生成模型如Veo 2、Kling和Pika等,能够在几秒钟内创造出逼真的视频内容。这些技术的普及带来了前所未有的便利,但同时也引发了深度伪造、虚假信息传播等严重社会问题。传统的视频真实性检测方法多依赖于二分类模型,虽然在准确率上取得一定突破,但缺乏对模型决策过程的解释能力,难以满足实际应用中对透明性和可信度的需求。

为此,本文提出了DAVID-XR1,一种结合细粒度缺陷标注与链式推理的多模态检测模型。该模型基于新构建的高质量数据集DAVID-X,利用丰富的缺陷类别、空间-时间定位和自然语言解释,训练出具有强泛化能力的检测系统。核心创新在于引入视觉链式推理(Visual Chain-of-Thought, CoT)机制,将检测流程拆解为缺陷发现、空间-时间定位、缺陷分类和解释生成四个步骤,逐步揭示伪造视频中的异常特征。

模型采用Gemini 2.5 Pro的知识蒸馏路径,将复杂推理路径转化为可训练的形式,并通过联合优化策略,将推理路径与二分类目标结合,显著提升模型的准确性和可解释性。在大量实验证明中,模型在未见过的生成器和模式下,检测准确率达76.7%,解释精度达54.7%,远超传统黑箱模型的表现。这一突破极大增强了模型的可信度,为数字内容的真实性验证提供了新工具。

从行业应用角度看,该技术可以广泛应用于社交媒体内容审核、数字取证、虚假信息识别等场景,帮助人类审查员快速、准确地识别伪造内容,减少误判和漏判。同时,提出的多模态标注和推理框架也为未来深度伪造检测提供了理论基础和数据支持。未来,研究将集中在模型推理速度优化、数据集扩展和多模态融合等方面,推动AI生成内容的安全、可信发展。

深度分析

研究背景

近年来,深度生成模型如Veo 2、Kling、Pika等在视频生成领域取得了突破性进展。这些模型通过复杂的神经网络架构,能够在极短时间内生成高质量、具有高度真实性的视频内容。早期研究多关注于检测视频中的伪造痕迹,采用卷积神经网络(CNN)提取特征,结合光流信息或视觉变换进行分类(如[7][44])。随着Transformer模型的引入,研究逐渐转向利用跨帧一致性和全局特征(如DeCoF、UNITE、DIVID等),提升检测的鲁棒性。大规模数据集如DeMamba推动了深度伪造检测技术的快速发展,强调细粒度特征和多模态融合。然而,现有方法多为黑箱操作,缺乏对模型决策依据的解释,难以满足实际应用中对透明性和可信度的需求。

核心问题

尽管检测准确率不断提升,但现有模型普遍缺乏可解释性,难以提供明确的伪造证据,限制了其在内容审核和法律追溯中的应用。此外,模型在面对新型生成器和复杂场景时,表现出明显的泛化不足。如何在保证高检测率的同时,提供细粒度的缺陷定位和自然语言解释,成为当前研究的核心难题。尤其是在多模态信息融合和跨域适应方面,仍存在诸多挑战。

核心创新

本研究的主要创新包括:1)构建细粒度缺陷标注的数据集DAVID-X,涵盖缺陷类别、空间-时间定位和自然语言解释,模拟人类审查流程;2)提出基于Gemini 2.5 Pro的知识蒸馏路径,将复杂推理转化为可训练的视觉链式推理(CoT),实现可解释的检测流程;3)引入联合优化策略,将推理路径与二分类目标结合,提升模型的泛化能力和解释质量;4)实现跨生成器和模式的强适应性,验证模型在真实场景中的应用潜力。

方法详解

  • �� 数据采集:从15个主流生成模型和真实视频中采集共747段视频,进行细粒度缺陷标注,包括缺陷类别、空间位置和时间范围。
  • �� 缺陷标注:定义六类缺陷(对象不一致、纹理抖动、交互异常、运动异常、空间异常、光照异常),结合SAM2实现像素级掩码。
  • �� 训练数据:利用GPT-4对prompt进行多样化生成,确保数据的多样性和代表性,覆盖不同场景和风格。
  • �� 模型训练:采用Gemini 2.5 Pro作为知识蒸馏源,将复杂推理路径转化为视觉CoT,结合链式思维(CoT)策略,进行端到端微调。
  • �� 联合优化:设计损失函数,将语言模型的负对数似然与二分类的交叉熵结合,确保推理路径与最终判定一致。
  • �� 评估策略:在多个未见生成器和场景上进行测试,验证模型的泛化能力和解释效果。

实验设计

实验采用多源生成视频和真实视频组成的测试集,覆盖不同生成器、场景和质量。对比传统黑箱模型和本方法,评估指标包括检测准确率、解释精度和跨域适应能力。通过消融实验验证缺陷类别、空间-时间定位和自然语言解释的贡献。模型在未见生成器上达到了76.7%的检测准确率,解释精度为54.7%。此外,模型在复杂场景和低质量视频中表现出较强的鲁棒性,验证了其实际应用潜力。

结果分析

模型在多源生成器上的检测性能优异,显著优于传统方法。跨域测试显示,模型在未见生成器(如Veo2、MAGI-1)上的检测准确率超过70%,远高于对比模型的30-50%。解释能力方面,模型能准确生成缺陷类别、空间位置和自然语言说明,增强了检测的可信度。消融分析表明,链式推理和联合优化策略共同提升了模型的性能,验证了设计的有效性。

应用场景

该技术适用于社交媒体内容审核、数字取证、虚假信息识别等场景,能够帮助内容审核员快速识别伪造视频,减少误判。其强泛化能力使得模型可以适应不同生成器和场景,具有良好的实用性。未来还可以结合实时检测需求,优化模型推理速度,推动在视频直播、短视频平台等场景中的应用。

局限与展望

模型在极端低质量或高度复杂的视频中仍存在误判风险,尤其在缺陷模糊或被遮挡时表现不足。训练依赖大量高质量标注数据,数据采集和标注成本较高,难以快速扩展到更多场景。推理路径较长,计算成本较高,实时检测和部署仍需优化。此外,模型对新型生成器的适应性仍需进一步验证。

通俗解读 非专业人士也能看懂

想象一下你在一家工厂工作,工厂每天都在生产各种产品。有些产品是正品,有些可能是伪造的。工厂的工人(就像检测模型)需要判断每个产品是否是真品。传统的方法就像只看一眼,觉得它是不是正品,但不能告诉你为什么。现在,研究人员设计了一套更聪明的工人,他不仅能判断,还能告诉你产品哪里出了问题,比如某个零件不对、颜色不对、或者某个部分的细节有瑕疵。这就像给工人配备了放大镜和详细的检查表,还能用自然语言告诉你原因。这样一来,你就能更放心地相信工厂的判断,因为它告诉你具体的缺陷在哪里,为什么是伪造的。这个新方法让工厂的检测变得更透明、更可靠,也帮助我们更好地识别那些用AI伪造的视频内容。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,但这个拼图里面有一些拼块是假的。以前,你只需要看拼图是不是完整的就行了,但有时候假拼块看起来也挺像真的,难以分辨。这就像AI生成的视频,看起来很逼真,但其实里面藏着一些细节上的问题。现在,有个聪明的助手,不仅能告诉你这个拼图是不是假的,还能指出具体哪个拼块有问题,比如颜色不对、形状怪怪的,甚至还能用一句话告诉你为什么这个拼图是假的。它就像一个超级细心的老师,帮你找出所有的瑕疵,让你一眼就知道哪里不对。这种方法让我们在面对虚假视频时,不再迷糊,也能更自信地判断真假,像个侦探一样找到所有隐藏的线索。

术语表

Visual Chain-of-Thought (视觉链式推理)

一种逐步分析视频中缺陷的推理方式,通过空间和时间的细粒度信息,逐层揭示伪造证据,增强模型的可解释性。

在本文中,Visual CoT用于将缺陷检测、定位和解释结合,形成完整的推理链。

知识蒸馏 (Knowledge Distillation)

一种模型压缩技术,将复杂模型(教师)中的知识转移到较小的模型(学生),以提升后者的性能和泛化能力。

本文利用Gemini 2.5 Pro作为知识蒸馏源,将其推理路径转化为可训练的视觉CoT。

缺陷类别 (Defect Category)

对AI生成视频中出现的不同类型缺陷进行分类,如对象不一致、纹理抖动、运动异常等。

通过细粒度标注,模型学习识别和解释各种缺陷,增强检测的可信度。

端到端训练 (End-to-End Training)

从输入到输出全部由单一模型完成的训练方式,避免中间步骤的误差累积。

本文采用端到端微调策略,使模型同时学习缺陷检测和推理路径生成。

多模态模型 (Multimodal Model)

结合多种模态信息(如视觉、语言)进行理解和推理的模型。

DAVID-XR1是基于视频和自然语言的多模态模型,提升检测和解释能力。

空间-时间定位 (Spatio-Temporal Localization)

在视频中精确标记缺陷发生的具体位置和时间范围。

通过SAM2实现像素级掩码,辅助模型理解缺陷的具体表现。

链式推理 (Chain-of-Thought, CoT)

逐步推导和解释的推理策略,将复杂任务拆解为多个子步骤。

引入CoT策略,增强模型的可解释性和推理逻辑。

生成模型 (Generative Model)

用于合成新内容(如视频、图像)的深度学习模型。

本文涉及多种生成模型,用于生成伪造视频样本。

伪造检测 (Forgery Detection)

识别和区分真实内容与AI伪造内容的技术。

核心任务,本文通过细粒度缺陷和推理链实现高效检测。

自然语言解释 (Natural Language Explanation)

用人类可理解的语言描述模型判断依据的过程。

模型输出缺陷类别和位置的同时,生成自然语言说明。

开放问题 这项研究留下的未解疑问

  • 1 模型在面对未来新型生成技术时的适应性不足,如何设计更具泛化能力的推理路径是未来的研究重点。
  • 2 推理过程的计算成本较高,限制了在实时检测中的应用,需优化推理效率。
  • 3 高质量标注数据的获取成本较大,未来应探索半监督或主动学习方法降低标注难度。
  • 4 在极端复杂或低质量视频中表现仍有限,需增强模型的鲁棒性。
  • 5 未来应结合动态场景信息,提升连续缺陷检测能力,增强实用性。

应用场景

近期应用

社交媒体内容审核

利用模型自动识别平台上传的疑似AI伪造视频,协助审核员快速筛查虚假内容,减少误判,提高审核效率。

数字取证与法律追溯

在司法场景中,提供详细的伪造证据链,帮助法官和调查人员验证视频真实性,打击深度伪造犯罪。

虚假信息识别

在新闻和信息传播中,自动检测虚假视频,防止虚假信息扩散,维护信息生态的健康。

远期愿景

可信AI内容生成与监管

推动生成模型的可解释性设计,使内容创作者和监管机构共同建立可信的AI内容生态,减少滥用风险。

自动化内容验证平台

构建全流程、多模态的自动验证系统,支持大规模视频内容的快速检测和解释,助力数字媒体行业的诚信建设。

原文摘要

As AI-generated video becomes increasingly pervasive across media platforms, the ability to reliably distinguish synthetic content from authentic footage has become both urgent and essential. Existing approaches have primarily treated this challenge as a binary classification task, offering limited insight into where or why a model identifies a video as AI-generated. However, the core challenge extends beyond simply detecting subtle artifacts; it requires providing fine-grained, persuasive evidence that can convince auditors and end-users alike. To address this critical gap, we introduce DAVID-X, the first dataset to pair AI-generated videos with detailed defect-level, temporal-spatial annotations and written rationales. Leveraging these rich annotations, we present DAVID-XR1, a video-language model designed to deliver an interpretable chain of visual reasoning-including defect categorization, temporal-spatial localization, and natural language explanations. This approach fundamentally transforms AI-generated video detection from an opaque black-box decision into a transparent and verifiable diagnostic process. We demonstrate that a general-purpose backbone, fine-tuned on our compact dataset and enhanced with chain-of-thought distillation, achieves strong generalization across a variety of generators and generation modes. Our results highlight the promise of explainable detection methods for trustworthy identification of AI-generated video content.

cs.CV cs.AI

参考文献 (20)

VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models

Haoxin Chen, Yong Zhang, Xiaodong Cun 等

2024 682 引用 ⭐ 高影响力 查看解读 →

Open-Sora: Democratizing Efficient Video Production for All

Zangwei Zheng, Xiangyu Peng, Tianji Yang 等

2024 785 引用 ⭐ 高影响力 查看解读 →

HunyuanVideo: A Systematic Framework For Large Video Generative Models

Weijie Kong, Qi Tian, Zijian Zhang 等

2024 1613 引用 ⭐ 高影响力 查看解读 →

Open-Sora Plan: Open-Source Large Video Generation Model

Bin Lin, Yunyang Ge, Xinhua Cheng 等

2024 310 引用 ⭐ 高影响力 查看解读 →

ModelScope Text-to-Video Technical Report

Jiuniu Wang, Hangjie Yuan, Dayou Chen 等

2023 736 引用 ⭐ 高影响力 查看解读 →

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang, Jiayan Teng, Wendi Zheng 等

2024 2305 引用 ⭐ 高影响力 查看解读 →

Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

A. Blattmann, Tim Dockhorn, Sumith Kulal 等

2023 2855 引用 查看解读 →

OpenAI o1 System Card

Ahmed El-Kishky

2024 2012 引用

Gradio: Hassle-Free Sharing and Testing of ML Models in the Wild

Abubakar Abid, Ali Abdalla, Ali Abid 等

2019 367 引用 查看解读 →

K-Means Clustering

Xin Jin, Jiawei Han

2004 732 引用

UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction

Leland McInnes, John Healy

2018 13180 引用 查看解读 →

AI-Generated Video Detection via Spatial-Temporal Anomaly Learning

Jianfa Bai, Man Lin, Gang Cao 等

2024 43 引用

VideoCrafter1: Open Diffusion Models for High-Quality Video Generation

Haoxin Chen, Menghan Xia, Yin-Yin He 等

2023 613 引用 查看解读 →

FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation

Yuanxin Liu, Lei Li, Shuhuai Ren 等

2023 143 引用 查看解读 →

Latent Video Diffusion Models for High-Fidelity Long Video Generation

Yin-Yin He, Tianyu Yang, Yong Zhang 等

2022 442 引用 查看解读 →

Compositional Chain-of-Thought Prompting for Large Multimodal Models

Chancharik Mitra, Brandon Huang, Trevor Darrell 等

2023 235 引用 查看解读 →

VBench: Comprehensive Benchmark Suite for Video Generative Models

Ziqi Huang, Yinan He, Jiashuo Yu 等

2023 1838 引用 查看解读 →

V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs

Penghao Wu, Saining Xie

2023 590 引用 查看解读 →

Intern VL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks

Zhe Chen, Jiannan Wu, Wenhai Wang 等

2023 3299 引用 查看解读 →

Detecting AI-Generated Video via Frame Consistency

Long Ma, Zhiyuan Yan, Qinglang Guo 等

2024 23 引用 查看解读 →

被引用 (8)

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

2026 ⭐ 高影响力 查看解读 →

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

2026 12 引用 ⭐ 高影响力 查看解读 →

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

2025 19 引用 ⭐ 高影响力 查看解读 →

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

2026 1 引用 查看解读 →

Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

2026 4 引用 查看解读 →

Training-free Detection of Text-to-video Generations via Over-coherence

2026 4 引用