BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation
BusterX利用MLLM进行视频伪造检测,采用200K高质量数据集和强化学习,显著提升检测准确率和解释能力。
核心发现
方法论
本文提出了基于多模态大语言模型(MLLM)的深度视频伪造检测框架BusterX,结合强化学习(RL)训练策略,将检测任务转化为视觉推理问题。核心流程包括:• 构建GenBuster-200K,涵盖超过20万高质量真实与伪造视频,确保多样性与公平性;• 设计GenBuster-Bench,分为In-Domain、Out-of-Domain和In-the-Wild三个阶段,逐步评估模型在不同域和生成技术演变下的泛化能力;• 利用RL训练BusterX,使模型通过生成推理链作为判别依据,避免传统二分类的黑箱局限;• 引入MLLM作为裁判,评估其生成的伪造解释的合理性和深度。实验中,BusterX在检测准确率和解释质量方面均优于Qwen3.5和Claude-Sonnet-4.6等领先模型,特别是在复杂真实场景中表现出优异的鲁棒性。
关键结果
- 在GenBuster-Bench的In-Domain阶段,BusterX达到了86.7%的整体准确率,显著优于传统检测器和通用MLLM(如GPT-5.2),在Out-of-Domain和In-the-Wild阶段也表现出强大的泛化能力,准确率分别达到87.8%和84.7%,比对比模型提升20%以上;
- 在解释能力方面,BusterX在Wild场景中获得了最高的Rationale Score(0.87),其生成的推理链能准确定位视频中的物理不一致性,获得专家评审的高度认可,验证了模型的可解释性和可信度;
- 通过规模扩展(参数从4B到122B)观察到检测性能的持续提升,表明模型规模与复杂场景下的检测能力正相关,体现出规模效应的潜力。
研究意义
该研究突破了视频伪造检测的传统边界,提出了结合深度推理与强化学习的多模态模型,显著提升了模型在真实复杂环境中的鲁棒性和可解释性。其构建的高质量、多样性数据集和渐进式评估体系,为未来视频取证技术提供了标准化平台,有助于应对日益复杂的深度伪造技术,推动行业从黑箱检测向可解释、可信的方向发展。这不仅有助于打击虚假信息,还能在法律、媒体和安全等多个领域发挥重要作用。
技术贡献
本文的技术创新主要体现在:• 首次将强化学习引入MLLM的视频伪造检测,训练模型通过生成推理链自我校准,避免传统二分类的局限;• 构建GenBuster-200K,结合最新生成模型,确保数据的真实性、多样性和公平性,弥补现有数据集的不足;• 提出分阶段的GenBuster-Bench,系统评估模型在不同域和生成技术演变下的泛化能力,推动检测技术的未来发展;• 设计MLLM-as-a-Judge协议,严格评估模型的解释深度和合理性,提升模型的可信度。
新颖性
本研究的创新点在于:首次将强化学习融入多模态大语言模型,用于视频伪造检测,强调推理链的生成作为判别依据,突破了传统黑箱分类的限制;同时,提出分层次的渐进式评估体系,有效模拟未来生成技术的演变,增强模型的适应性和鲁棒性。相比以往只关注检测准确率的工作,强调模型的解释能力和实际应用中的可信度,为视频取证领域带来了全新思路。
局限性
- 尽管BusterX在多场景表现优异,但其训练依赖大量高质量数据,未来在低资源环境或极端伪造技术下的表现仍需验证;
- 模型在极端复杂的深度伪造场景中仍存在一定的误判风险,尤其是在生成模型不断升级的情况下,检测的持续适应性是一个挑战;
- 强化学习训练过程计算成本较高,模型规模庞大,实际部署时对硬件要求较高,限制了其广泛应用的可能性。
未来方向
未来工作将聚焦于:• 开发更高效的训练策略,降低模型训练成本,提升模型在边缘设备上的部署能力;• 持续扩展数据集,涵盖更多新兴生成模型,确保检测技术的前瞻性和适应性;• 深入研究模型的解释机制,提升其在法律和伦理场景中的可信度;• 探索多模态融合技术,将音频、文本等信息结合,增强检测的多维度能力。
AI 总览摘要
随着深度学习和生成模型的快速发展,AI生成的视频变得越来越逼真,给视频取证带来了前所未有的挑战。传统的检测方法多依赖于特定的特征或简单的二分类模型,难以应对不断演进的伪造技术,尤其是在复杂的真实场景中表现出明显的鲁棒性不足。为此,本文提出了BusterX,一种基于多模态大语言模型(MLLM)结合强化学习(RL)的深度视频伪造检测框架,旨在实现高精度、可解释的检测能力。
首先,研究团队构建了GenBuster-200K数据集,涵盖超过20万高质量真实与伪造视频,确保数据的多样性、公平性和真实性。这一数据集采用最新的生成模型,过滤掉偏见和低质量内容,为模型训练提供了坚实基础。随后,提出分阶段的GenBuster-Bench评估体系,将检测任务划分为In-Domain、Out-of-Domain和In-the-Wild三个阶段,逐步测试模型在不同生成技术和真实环境中的泛化能力。该体系不仅评估检测准确率,还引入MLLM-as-a-Judge协议,严格衡量模型生成的伪造解释的合理性和深度。
在技术实现上,BusterX将检测任务转化为视觉推理问题,通过生成推理链作为判别依据,避免传统二分类模型的黑箱局限。利用强化学习(采用DAPO算法)训练模型,使其在没有大量标注的情况下,自我校准推理能力。实验结果显示,BusterX在GenBuster-Bench的所有阶段均优于Qwen3.5和Claude-Sonnet-4.6等领先模型,检测准确率在In-Domain达到86.7%,在Out-of-Domain和In-the-Wild阶段分别达到87.8%和84.7%,展现出极强的泛化和鲁棒性。此外,模型在Wild场景中的伪造解释得分也达到了0.87,获得专家和自动评判的一致认可。
这项研究的意义在于:它不仅提升了视频伪造检测的技术水平,更通过引入可解释性,为行业提供了可信赖的工具,有助于打击虚假信息,维护社会信息安全。其创新的训练策略和渐进式评估体系,为未来深度伪造检测提供了标准化平台和研究方向。尽管如此,模型在极端复杂场景和低资源环境下的表现仍需进一步优化,未来将关注模型的效率和多模态融合能力,推动行业迈向更智能、更可信的未来。
深度分析
研究背景
近年来,深度学习和生成模型的快速发展极大推动了虚拟内容的生成技术,从早期的GAN到后续的Transformer基础模型,生成视频的逼真度不断提升。代表性工作如DeepFake、StyleGAN、以及近期的Seedance 2.0等,为虚假视频的制作提供了强大工具。这些技术在娱乐、广告等行业带来了创新,但也引发了严重的安全和伦理问题。传统检测方法多依赖于特征工程或浅层模型,难以应对新兴的深度伪造技术。近年来,基于深度神经网络的检测模型如3D ResNeXt、VideoMAE等,取得了一定的效果,但在跨域泛化和解释能力方面仍存在不足。随着生成模型不断升级,检测技术面临“追赶”压力,亟需更具鲁棒性和可解释性的检测框架。
核心问题
当前视频伪造检测面临多重挑战:一是数据集的陈旧和偏见,导致模型在真实场景中表现不佳;二是评估体系过于简单,不能反映模型在不同生成技术和环境中的泛化能力;三是缺乏深度的物理和空间推理,难以识别深度伪造的细节缺陷。这些问题限制了检测技术的实际应用,尤其是在应对不断演变的伪造技术时。如何构建高质量、多样性且公平的数据集,设计系统的渐进式评估体系,以及开发具有深度推理能力的模型,成为亟待解决的核心问题。
核心创新
本研究的创新主要体现在:1)数据层面,构建了GenBuster-200K,结合最新生成模型,确保数据的真实性、多样性和公平性,弥补了现有数据集的不足;2)评估体系方面,提出分阶段的GenBuster-Bench,将检测任务划分为不同域和生成技术演变的阶段,系统评估模型的泛化能力;3)模型设计上,BusterX采用强化学习训练,将检测任务转化为视觉推理问题,通过生成推理链作为判别依据,突破传统二分类的黑箱限制;4)引入MLLM作为裁判,严格评估模型的解释深度和合理性,提升模型的可信度。
方法详解
- �� 数据采集:利用OpenVid-1M等公开资源,筛选出超过100K的真实视频,确保多样性和高质量;• 伪造视频生成:采用HunyuanVideo、LTX-Video等最新生成模型,结合文本提示,生成超过100K高逼真度伪造视频,过滤掉偏见和低质量内容;• 数据后处理:统一分辨率(1024×1024)、时长(5秒)、帧率(24FPS),采用HEVC编码,确保不同源视频的标准化;• 数据公平性:通过严格的语义约束,保证性别、年龄、种族的平衡,避免偏见和刻板印象;• 评审筛选:由专业标注员进行质量和伦理审查,剔除有偏差或不当内容。
实验设计
- �� 评估体系:在GenBuster-Bench的三个阶段(ID、OOD、Wild)上,采用准确率(ACC)作为主要指标,分别评估模型在已知和未知生成模型上的性能;• 训练细节:以Qwen3.5-4B为基础模型,采用AdamW优化器,学习率1×10^-6,结合DeepSpeed ZeRO进行分布式训练,强化学习目标为最大化推理链的合理性和检测准确率;• 比较模型:包括传统检测器(3D ResNeXt、VideoMAE)和多模态大模型(GPT-5.2、Claude-Sonnet-4.6、Qwen3.5系列);• 解释评估:利用Gemini Judge对模型生成的推理链进行评分,衡量其深度、合理性和事实准确性。
结果分析
- �� 在In-Domain阶段,BusterX检测准确率达86.7%,明显优于Qwen3.5-122B(67.1%)和Claude-Sonnet-4.6(72.4%);• 在Out-of-Domain测试中,BusterX实现87.8%的泛化准确率,优于传统检测器和其他MLLM,显示出强大的跨模型适应性;• 在In-the-Wild场景,BusterX保持84.7%的检测率,远超其他模型,验证其在真实复杂环境中的鲁棒性;• 解释能力方面,BusterX在Wild场景中获得0.87的Rationale Score,专家评审高度认可其推理链的深度和准确性。
应用场景
- �� 司法和法律:为法庭提供可信的伪造视频证据检测,提升司法公正性;• 媒体监管:帮助新闻机构识别虚假视频,维护信息真实性;• 安全监控:在国家安全和反恐中识别深度伪造内容,保障公共安全。
局限与展望
- �� 训练依赖大量高质量数据,面对新兴伪造技术时仍需不断更新模型;• 模型规模庞大,部署成本高,难以在资源有限的环境中应用;• 在极端复杂的伪造场景中仍存在误判风险,未来需结合多模态信息提升鲁棒性。
通俗解读 非专业人士也能看懂
想象你在一家工厂里,工厂的任务是检测每个产品是否是真品还是假货。过去的方法就像用放大镜看产品的表面特征,比如颜色、标签,但这些特征很容易被假货模仿。现在,这个工厂引入了一台聪明的机器人(BusterX),它不仅能观察产品,还能像侦探一样,分析产品内部的结构和制造过程,判断是否有不合理的地方。这个机器人还会自己学习,通过不断尝试和调整,变得越来越聪明。它会用一串推理步骤,解释为什么它认为某个产品是假货,比如“这个零件的材质不符合标准”或“生产线的拼接不自然”。这样,工厂的检测不仅变得更准确,还能告诉你为什么是假的,就像一个专业的侦探写的报告一样。这种方法比单纯用放大镜看表面更可靠,也更容易让人理解和信任。
简单解释 像给14岁少年讲一样
想象你在学校里,有个超级聪明的同学,他不仅能告诉你一份视频是真是假,还能详细解释原因。比如,你看到一个海滩的视频,表面看起来很真实,但这个同学会用他的“侦探技能”分析:海浪的运动是不是符合自然规律?光线和阴影是不是一致?他会指出:’这个浪突然变大,像是用电脑拼出来的’,因为真实的海浪不会突然变大那么快。这个同学用的不是普通的放大镜,而是一套特别的“侦探工具”,它可以分析视频中的每一帧,找到那些不自然的地方。通过这些分析,他可以告诉你:‘这个视频可能是假的’,而且还能告诉你为什么。就像你在玩游戏时遇到作弊者,他不仅知道谁在作弊,还能告诉你作弊的具体方法。这个新方法让检测假视频变得像侦探破案一样有趣,也更靠谱。未来,这样的技术可以帮助我们在网络上识别虚假信息,保护大家不被误导。
原文摘要
As generative video models become increasingly realistic, detecting AI-generated videos requires systems that offer both accuracy and interpretability. However, applying Multimodal Large Language Models (MLLMs) to video forensics is currently limited by outdated datasets, simplistic evaluation protocols, and a reliance on black-box classification. To address these issues, we introduce a comprehensive dataset, benchmark, and baseline model for video forgery detection. First, we present \textbf{GenBuster-200K}, a fair dataset of over 200,000 high-quality videos sourced from state-of-the-art generators, featuring diverse real-world scenarios. Second, we propose \textbf{GenBuster-Bench}, a diagnostic benchmark spanning three progressive tracks (In-Domain, Out-of-Domain, and In-the-Wild) to evaluate models across \textit{domain shifts} and \textit{generational shifts}. It also introduces an MLLM-as-a-Judge protocol to assess the quality of the generated forensic explanations. Finally, we develop \textbf{BusterX}, an MLLM baseline with RL training. Instead of direct binary classification, BusterX formulates detection as a visual reasoning task, where the generated reasoning chain serves as detector itself. Experimental results demonstrate that BusterX outperforms several leading MLLMs (e.g., Qwen3.5, Claude-Sonnet-4.6) in both detection accuracy and rationale quality.
参考文献 (20)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
Zhenliang Ni, Qi Yan, Mouxiao Huang 等
Exploring Temporal Coherence for More General Video Face Forgery Detection
Yinglin Zheng, Jianmin Bao, Dong Chen 等
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
Haoxin Chen, Yan Hong, Zizheng Huang 等
FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset
Hasam Khalid, Shahroz Tariq, Simon S. Woo
Protecting Celebrities from DeepFake with Identity Consistency Transformer
Xiaoyi Dong, Jianmin Bao, Dongdong Chen 等
ID-Reveal: Identity-aware DeepFake Video Detection
D. Cozzolino, Andreas Rössler, Justus Thies 等
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
Zhongwei Ren, Yunchao Wei, Xiao Yu 等
BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
Junnan Li, Dongxu Li, Caiming Xiong 等
Dynamic Graph Learning with Content-guided Spatial-Frequency Relation Reasoning for Deepfake Detection
Yuan Wang, Kun Yu, Chen Chen 等
X3D: Expanding Architectures for Efficient Video Recognition
Christoph Feichtenhofer
Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos.
Haobo Yuan, Xiangtai Li, Tao Zhang 等
Detecting AI-Generated Video via Frame Consistency
Long Ma, Zhiyuan Yan, Qinglang Guo 等
AI-Generated Video Detection via Spatial-Temporal Anomaly Learning
Jianfa Bai, Man Lin, Gang Cao 等
AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors
You-Ming Chang, Chen Yeh, Wei-Chen Chiu 等
FaceForensics++: Learning to Detect Manipulated Facial Images
Andreas Rössler, D. Cozzolino, L. Verdoliva 等
Quality-based Artifact Modeling for Facial Deepfake Detection in Videos
S. Concas, S. Cava, Roberto Casula 等
DeCoF: Generated Video Detection via Frame Consistency
Long Ma, Jiajia Zhang, Hongping Deng 等
GLFF: Global and Local Feature Fusion for AI-Synthesized Image Detection
Yan Ju, Shan Jia, Jia Cai 等