BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation

TL;DR

BusterX利用MLLM进行视频伪造检测,采用200K高质量数据集和强化学习,显著提升检测准确率和解释能力。

cs.CV 🔴 高级 2025-05-19 28 引用 66 次浏览
Haiquan Wen Yiwei He Zhenglin Huang Tianxiao Li Zihan Yu Xingru Huang Lu Qi Baoyuan Wu Xiangtai Li Guangliang Cheng
视频取证 多模态大语言模型 深度学习 生成视频检测 可解释性

核心发现

方法论

本文提出了基于多模态大语言模型(MLLM)的深度视频伪造检测框架BusterX,结合强化学习(RL)训练策略,将检测任务转化为视觉推理问题。核心流程包括:• 构建GenBuster-200K,涵盖超过20万高质量真实与伪造视频,确保多样性与公平性;• 设计GenBuster-Bench,分为In-Domain、Out-of-Domain和In-the-Wild三个阶段,逐步评估模型在不同域和生成技术演变下的泛化能力;• 利用RL训练BusterX,使模型通过生成推理链作为判别依据,避免传统二分类的黑箱局限;• 引入MLLM作为裁判,评估其生成的伪造解释的合理性和深度。实验中,BusterX在检测准确率和解释质量方面均优于Qwen3.5和Claude-Sonnet-4.6等领先模型,特别是在复杂真实场景中表现出优异的鲁棒性。

关键结果

  • 在GenBuster-Bench的In-Domain阶段,BusterX达到了86.7%的整体准确率,显著优于传统检测器和通用MLLM(如GPT-5.2),在Out-of-Domain和In-the-Wild阶段也表现出强大的泛化能力,准确率分别达到87.8%和84.7%,比对比模型提升20%以上;
  • 在解释能力方面,BusterX在Wild场景中获得了最高的Rationale Score(0.87),其生成的推理链能准确定位视频中的物理不一致性,获得专家评审的高度认可,验证了模型的可解释性和可信度;
  • 通过规模扩展(参数从4B到122B)观察到检测性能的持续提升,表明模型规模与复杂场景下的检测能力正相关,体现出规模效应的潜力。

研究意义

该研究突破了视频伪造检测的传统边界,提出了结合深度推理与强化学习的多模态模型,显著提升了模型在真实复杂环境中的鲁棒性和可解释性。其构建的高质量、多样性数据集和渐进式评估体系,为未来视频取证技术提供了标准化平台,有助于应对日益复杂的深度伪造技术,推动行业从黑箱检测向可解释、可信的方向发展。这不仅有助于打击虚假信息,还能在法律、媒体和安全等多个领域发挥重要作用。

技术贡献

本文的技术创新主要体现在:• 首次将强化学习引入MLLM的视频伪造检测,训练模型通过生成推理链自我校准,避免传统二分类的局限;• 构建GenBuster-200K,结合最新生成模型,确保数据的真实性、多样性和公平性,弥补现有数据集的不足;• 提出分阶段的GenBuster-Bench,系统评估模型在不同域和生成技术演变下的泛化能力,推动检测技术的未来发展;• 设计MLLM-as-a-Judge协议,严格评估模型的解释深度和合理性,提升模型的可信度。

新颖性

本研究的创新点在于:首次将强化学习融入多模态大语言模型,用于视频伪造检测,强调推理链的生成作为判别依据,突破了传统黑箱分类的限制;同时,提出分层次的渐进式评估体系,有效模拟未来生成技术的演变,增强模型的适应性和鲁棒性。相比以往只关注检测准确率的工作,强调模型的解释能力和实际应用中的可信度,为视频取证领域带来了全新思路。

局限性

  • 尽管BusterX在多场景表现优异,但其训练依赖大量高质量数据,未来在低资源环境或极端伪造技术下的表现仍需验证;
  • 模型在极端复杂的深度伪造场景中仍存在一定的误判风险,尤其是在生成模型不断升级的情况下,检测的持续适应性是一个挑战;
  • 强化学习训练过程计算成本较高,模型规模庞大,实际部署时对硬件要求较高,限制了其广泛应用的可能性。

未来方向

未来工作将聚焦于:• 开发更高效的训练策略,降低模型训练成本,提升模型在边缘设备上的部署能力;• 持续扩展数据集,涵盖更多新兴生成模型,确保检测技术的前瞻性和适应性;• 深入研究模型的解释机制,提升其在法律和伦理场景中的可信度;• 探索多模态融合技术,将音频、文本等信息结合,增强检测的多维度能力。

AI 总览摘要

随着深度学习和生成模型的快速发展,AI生成的视频变得越来越逼真,给视频取证带来了前所未有的挑战。传统的检测方法多依赖于特定的特征或简单的二分类模型,难以应对不断演进的伪造技术,尤其是在复杂的真实场景中表现出明显的鲁棒性不足。为此,本文提出了BusterX,一种基于多模态大语言模型(MLLM)结合强化学习(RL)的深度视频伪造检测框架,旨在实现高精度、可解释的检测能力。

首先,研究团队构建了GenBuster-200K数据集,涵盖超过20万高质量真实与伪造视频,确保数据的多样性、公平性和真实性。这一数据集采用最新的生成模型,过滤掉偏见和低质量内容,为模型训练提供了坚实基础。随后,提出分阶段的GenBuster-Bench评估体系,将检测任务划分为In-Domain、Out-of-Domain和In-the-Wild三个阶段,逐步测试模型在不同生成技术和真实环境中的泛化能力。该体系不仅评估检测准确率,还引入MLLM-as-a-Judge协议,严格衡量模型生成的伪造解释的合理性和深度。

在技术实现上,BusterX将检测任务转化为视觉推理问题,通过生成推理链作为判别依据,避免传统二分类模型的黑箱局限。利用强化学习(采用DAPO算法)训练模型,使其在没有大量标注的情况下,自我校准推理能力。实验结果显示,BusterX在GenBuster-Bench的所有阶段均优于Qwen3.5和Claude-Sonnet-4.6等领先模型,检测准确率在In-Domain达到86.7%,在Out-of-Domain和In-the-Wild阶段分别达到87.8%和84.7%,展现出极强的泛化和鲁棒性。此外,模型在Wild场景中的伪造解释得分也达到了0.87,获得专家和自动评判的一致认可。

这项研究的意义在于:它不仅提升了视频伪造检测的技术水平,更通过引入可解释性,为行业提供了可信赖的工具,有助于打击虚假信息,维护社会信息安全。其创新的训练策略和渐进式评估体系,为未来深度伪造检测提供了标准化平台和研究方向。尽管如此,模型在极端复杂场景和低资源环境下的表现仍需进一步优化,未来将关注模型的效率和多模态融合能力,推动行业迈向更智能、更可信的未来。

深度分析

研究背景

近年来,深度学习和生成模型的快速发展极大推动了虚拟内容的生成技术,从早期的GAN到后续的Transformer基础模型,生成视频的逼真度不断提升。代表性工作如DeepFake、StyleGAN、以及近期的Seedance 2.0等,为虚假视频的制作提供了强大工具。这些技术在娱乐、广告等行业带来了创新,但也引发了严重的安全和伦理问题。传统检测方法多依赖于特征工程或浅层模型,难以应对新兴的深度伪造技术。近年来,基于深度神经网络的检测模型如3D ResNeXt、VideoMAE等,取得了一定的效果,但在跨域泛化和解释能力方面仍存在不足。随着生成模型不断升级,检测技术面临“追赶”压力,亟需更具鲁棒性和可解释性的检测框架。

核心问题

当前视频伪造检测面临多重挑战:一是数据集的陈旧和偏见,导致模型在真实场景中表现不佳;二是评估体系过于简单,不能反映模型在不同生成技术和环境中的泛化能力;三是缺乏深度的物理和空间推理,难以识别深度伪造的细节缺陷。这些问题限制了检测技术的实际应用,尤其是在应对不断演变的伪造技术时。如何构建高质量、多样性且公平的数据集,设计系统的渐进式评估体系,以及开发具有深度推理能力的模型,成为亟待解决的核心问题。

核心创新

本研究的创新主要体现在:1)数据层面,构建了GenBuster-200K,结合最新生成模型,确保数据的真实性、多样性和公平性,弥补了现有数据集的不足;2)评估体系方面,提出分阶段的GenBuster-Bench,将检测任务划分为不同域和生成技术演变的阶段,系统评估模型的泛化能力;3)模型设计上,BusterX采用强化学习训练,将检测任务转化为视觉推理问题,通过生成推理链作为判别依据,突破传统二分类的黑箱限制;4)引入MLLM作为裁判,严格评估模型的解释深度和合理性,提升模型的可信度。

方法详解

  • �� 数据采集:利用OpenVid-1M等公开资源,筛选出超过100K的真实视频,确保多样性和高质量;• 伪造视频生成:采用HunyuanVideo、LTX-Video等最新生成模型,结合文本提示,生成超过100K高逼真度伪造视频,过滤掉偏见和低质量内容;• 数据后处理:统一分辨率(1024×1024)、时长(5秒)、帧率(24FPS),采用HEVC编码,确保不同源视频的标准化;• 数据公平性:通过严格的语义约束,保证性别、年龄、种族的平衡,避免偏见和刻板印象;• 评审筛选:由专业标注员进行质量和伦理审查,剔除有偏差或不当内容。

实验设计

  • �� 评估体系:在GenBuster-Bench的三个阶段(ID、OOD、Wild)上,采用准确率(ACC)作为主要指标,分别评估模型在已知和未知生成模型上的性能;• 训练细节:以Qwen3.5-4B为基础模型,采用AdamW优化器,学习率1×10^-6,结合DeepSpeed ZeRO进行分布式训练,强化学习目标为最大化推理链的合理性和检测准确率;• 比较模型:包括传统检测器(3D ResNeXt、VideoMAE)和多模态大模型(GPT-5.2、Claude-Sonnet-4.6、Qwen3.5系列);• 解释评估:利用Gemini Judge对模型生成的推理链进行评分,衡量其深度、合理性和事实准确性。

结果分析

  • �� 在In-Domain阶段,BusterX检测准确率达86.7%,明显优于Qwen3.5-122B(67.1%)和Claude-Sonnet-4.6(72.4%);• 在Out-of-Domain测试中,BusterX实现87.8%的泛化准确率,优于传统检测器和其他MLLM,显示出强大的跨模型适应性;• 在In-the-Wild场景,BusterX保持84.7%的检测率,远超其他模型,验证其在真实复杂环境中的鲁棒性;• 解释能力方面,BusterX在Wild场景中获得0.87的Rationale Score,专家评审高度认可其推理链的深度和准确性。

应用场景

  • �� 司法和法律:为法庭提供可信的伪造视频证据检测,提升司法公正性;• 媒体监管:帮助新闻机构识别虚假视频,维护信息真实性;• 安全监控:在国家安全和反恐中识别深度伪造内容,保障公共安全。

局限与展望

  • �� 训练依赖大量高质量数据,面对新兴伪造技术时仍需不断更新模型;• 模型规模庞大,部署成本高,难以在资源有限的环境中应用;• 在极端复杂的伪造场景中仍存在误判风险,未来需结合多模态信息提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂的任务是检测每个产品是否是真品还是假货。过去的方法就像用放大镜看产品的表面特征,比如颜色、标签,但这些特征很容易被假货模仿。现在,这个工厂引入了一台聪明的机器人(BusterX),它不仅能观察产品,还能像侦探一样,分析产品内部的结构和制造过程,判断是否有不合理的地方。这个机器人还会自己学习,通过不断尝试和调整,变得越来越聪明。它会用一串推理步骤,解释为什么它认为某个产品是假货,比如“这个零件的材质不符合标准”或“生产线的拼接不自然”。这样,工厂的检测不仅变得更准确,还能告诉你为什么是假的,就像一个专业的侦探写的报告一样。这种方法比单纯用放大镜看表面更可靠,也更容易让人理解和信任。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的同学,他不仅能告诉你一份视频是真是假,还能详细解释原因。比如,你看到一个海滩的视频,表面看起来很真实,但这个同学会用他的“侦探技能”分析:海浪的运动是不是符合自然规律?光线和阴影是不是一致?他会指出:’这个浪突然变大,像是用电脑拼出来的’,因为真实的海浪不会突然变大那么快。这个同学用的不是普通的放大镜,而是一套特别的“侦探工具”,它可以分析视频中的每一帧,找到那些不自然的地方。通过这些分析,他可以告诉你:‘这个视频可能是假的’,而且还能告诉你为什么。就像你在玩游戏时遇到作弊者,他不仅知道谁在作弊,还能告诉你作弊的具体方法。这个新方法让检测假视频变得像侦探破案一样有趣,也更靠谱。未来,这样的技术可以帮助我们在网络上识别虚假信息,保护大家不被误导。

原文摘要

As generative video models become increasingly realistic, detecting AI-generated videos requires systems that offer both accuracy and interpretability. However, applying Multimodal Large Language Models (MLLMs) to video forensics is currently limited by outdated datasets, simplistic evaluation protocols, and a reliance on black-box classification. To address these issues, we introduce a comprehensive dataset, benchmark, and baseline model for video forgery detection. First, we present \textbf{GenBuster-200K}, a fair dataset of over 200,000 high-quality videos sourced from state-of-the-art generators, featuring diverse real-world scenarios. Second, we propose \textbf{GenBuster-Bench}, a diagnostic benchmark spanning three progressive tracks (In-Domain, Out-of-Domain, and In-the-Wild) to evaluate models across \textit{domain shifts} and \textit{generational shifts}. It also introduces an MLLM-as-a-Judge protocol to assess the quality of the generated forensic explanations. Finally, we develop \textbf{BusterX}, an MLLM baseline with RL training. Instead of direct binary classification, BusterX formulates detection as a visual reasoning task, where the generated reasoning chain serves as detector itself. Experimental results demonstrate that BusterX outperforms several leading MLLMs (e.g., Qwen3.5, Claude-Sonnet-4.6) in both detection accuracy and rationale quality.

cs.CV

参考文献 (20)

GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection

Zhenliang Ni, Qi Yan, Mouxiao Huang 等

2025 21 引用 ⭐ 高影响力 查看解读 →

Exploring Temporal Coherence for More General Video Face Forgery Detection

Yinglin Zheng, Jianmin Bao, Dong Chen 等

2021 357 引用 ⭐ 高影响力 查看解读 →

DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark

Haoxin Chen, Yan Hong, Zizheng Huang 等

2024 96 引用 ⭐ 高影响力 查看解读 →

FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset

Hasam Khalid, Shahroz Tariq, Simon S. Woo

2021 398 引用 ⭐ 高影响力 查看解读 →

Protecting Celebrities from DeepFake with Identity Consistency Transformer

Xiaoyi Dong, Jianmin Bao, Dongdong Chen 等

2022 187 引用 ⭐ 高影响力 查看解读 →

ID-Reveal: Identity-aware DeepFake Video Detection

D. Cozzolino, Andreas Rössler, Justus Thies 等

2020 235 引用 ⭐ 高影响力 查看解读 →

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

Zhongwei Ren, Yunchao Wei, Xiao Yu 等

2026 9 引用 查看解读 →

Visual Instruction Tuning

Haotian Liu, Chunyuan Li, Qingyang Wu 等

2023 10999 引用 查看解读 →

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li, Caiming Xiong 等

2022 7279 引用 查看解读 →

Dynamic Graph Learning with Content-guided Spatial-Frequency Relation Reasoning for Deepfake Detection

Yuan Wang, Kun Yu, Chen Chen 等

2023 179 引用

X3D: Expanding Architectures for Efficient Video Recognition

Christoph Feichtenhofer

2020 1392 引用 查看解读 →

Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos.

Haobo Yuan, Xiangtai Li, Tao Zhang 等

2025 169 引用 查看解读 →

Detecting AI-Generated Video via Frame Consistency

Long Ma, Zhiyuan Yan, Qinglang Guo 等

2024 26 引用 查看解读 →

AI-Generated Video Detection via Spatial-Temporal Anomaly Learning

Jianfa Bai, Man Lin, Gang Cao 等

2024 43 引用

AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors

You-Ming Chang, Chen Yeh, Wei-Chen Chiu 等

2023 80 引用 查看解读 →

FaceForensics++: Learning to Detect Manipulated Facial Images

Andreas Rössler, D. Cozzolino, L. Verdoliva 等

2019 3319 引用 查看解读 →

ViViT: A Video Vision Transformer

Anurag Arnab, Mostafa Dehghani, G. Heigold 等

2021 3231 引用 查看解读 →

Quality-based Artifact Modeling for Facial Deepfake Detection in Videos

S. Concas, S. Cava, Roberto Casula 等

2024 16 引用

DeCoF: Generated Video Detection via Frame Consistency

Long Ma, Jiajia Zhang, Hongping Deng 等

2024 15 引用

GLFF: Global and Local Feature Fusion for AI-Synthesized Image Detection

Yan Ju, Shan Jia, Jia Cai 等

2022 66 引用 查看解读 →