Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation
本研究提出基于频域波let增强的伪视频检测方法,显著提升模型在多模型和压缩条件下的泛化能力。
核心发现
方法论
本文采用基于深度学习的检测框架,结合频域波let变换和伪造样本的架构特征分析。首先,分析不同生成模型(如Diffusion、NOVA、FLUX)的频域伪迹,发现中高频对角线频率成分具有较强的判别性和鲁棒性。其次,设计一种基于小波分解的频带替换数据增强策略,将伪造视频的低频和垂直、水平频带用真实视频对应频带替换,促使模型关注中高频对角线频率特征。最后,利用预训练的DINOv2模型进行端到端训练,结合伪造样本的频域增强,提升检测的泛化能力。实验中,模型在仅用单一生成模型训练的基础上,测试在多达15个不同生成模型上的表现,准确率平均提升12%以上,尤其在最新模型NOVA和FLUX上表现优异。
关键结果
- 在训练仅用Pyramid Flow模型数据的基础上,测试在NOVA、FLUX等新兴模型上,检测准确率从原有的70%提升到82%,实现显著改善。该方法在15个不同生成模型的测试中,平均准确率达到了88%,比当前最优方法提高了12%。
- 通过频域分析,发现中高频对角线频率成分在压缩后依然保持明显的伪迹特征,而高频部分在压缩中被削弱,导致传统检测方法效果下降。利用Wavelet替换增强策略,有效强化模型对中高频伪迹的敏感性,显著提高模型在压缩视频中的鲁棒性。
- 对比分析显示,采用频带替换数据增强的模型在不同压缩率(如H.264、MPEG-4)下,伪迹检测的准确率提升了15%以上,且对不同生成架构的适应性增强,验证了方法的泛化能力和实用性。
研究意义
本研究突破了现有伪视频检测在多模型和压缩环境下的泛化瓶颈,提出的频域波let增强策略有效捕捉生成模型的固有伪迹,为数字取证提供了更稳健的技术支撑。随着深度生成模型的快速发展,传统基于语义或高频特征的检测方法逐渐失效,而本文的方法通过挖掘中高频频域特征,显著提升了检测的鲁棒性和适应性,有望在实际应用中实现快速、准确的伪视频识别,维护数字媒体的可信度。
技术贡献
本文提出一种结合频域波let变换与伪造样本架构特征分析的训练策略,创新性地将频带替换作为数据增强手段,指导模型关注中高频对角线频率特征。利用预训练的深度模型(如DINOv2)进行端到端训练,显著提升模型在未见生成模型上的泛化能力。该方法无需复杂架构设计或大规模多模型数据集,依赖频域特征的深层次挖掘,为伪视频检测提供了一种高效、鲁棒的解决方案。
新颖性
本研究首次系统性地将小波变换频带替换作为数据增强手段,强调中高频对角线频率特征在伪视频检测中的判别作用。不同于以往仅关注高频或语义特征的检测方法,本文通过频域分析发现中频段的鲁棒性和共享性,为模型泛化提供了新的理论基础。这一策略在多模型、多压缩环境下均表现出优异的效果,具有明显的创新性。
局限性
- 该方法依赖于频域特征的稳定性,在极端压缩或噪声环境下,伪迹可能被进一步削弱,影响检测效果。
- 模型训练过程中对预训练模型的依赖较大,可能在不同任务或不同数据分布中表现不一致,需进一步验证其迁移能力。
- 当前实验主要集中在H.264压缩格式,其他编码格式的适应性尚未充分测试,未来需扩展多样化场景验证。
未来方向
未来将探索多模态融合策略,将频域特征与时空一致性特征结合,提升检测的全面性与鲁棒性。同时,考虑引入自监督学习和对抗训练机制,增强模型对未知生成模型的适应能力。此外,扩展到多种压缩格式和真实场景,推动伪视频检测技术的工业化应用。
AI 总览摘要
随着深度生成模型的飞速发展,虚假视频的制作变得愈发逼真,甚至难以用肉眼识别。传统的检测方法多依赖于语义错误或高频噪声特征,但这些特征在最新的生成模型中逐渐消失或被压制,导致检测效果大幅下降。为应对这一挑战,本文提出了一种基于频域小波变换的伪视频检测新策略,旨在挖掘生成架构固有的伪迹特征,从而实现更强的泛化能力。
具体而言,研究团队首先分析了不同生成模型(如Diffusion、NOVA、FLUX)在频域中的伪迹表现,发现中高频对角线频率成分具有较强的判别性和鲁棒性。这些伪迹在压缩后依然存在,成为检测的关键线索。基于此,作者设计了一种频带替换的数据增强策略,将伪造视频的低频和垂直、水平频带用真实视频对应频带替换,促使模型关注中高频对角线频率特征。
在模型训练阶段,作者采用预训练的DINOv2模型,结合频域增强策略,通过端到端学习,使模型在仅用单一生成模型数据的基础上,学会识别多种不同架构的伪迹。实验结果显示,该方法在15个不同生成模型的测试中,平均准确率提升超过12%,在最新模型NOVA和FLUX上表现尤为优异,验证了其强大的泛化能力。
该研究的意义在于提供了一种无需复杂架构或大规模多模型数据集的高效检测方案,为数字取证提供了新的技术路径。通过深度挖掘频域中的中高频伪迹特征,本文突破了现有检测方法在多模型和压缩环境下的局限,有望在实际应用中实现快速、准确的虚假视频识别,维护数字媒体的可信度。未来,研究者将继续探索多模态融合和自监督学习,以应对更复杂的场景和更高的压缩比,推动伪视频检测技术的持续发展。
深度分析
研究背景
近年来,深度学习推动了虚假视频生成技术的迅猛发展。早期方法如Text2Video-Zero、Modelscope和Hotshot-XL,主要基于图像生成模型进行视频合成,面临时间一致性和运动连贯性不足的问题。随着3D自编码器和变换器的引入,模型如Mochi-1、Allegro、CogVideoX等在语义一致性和视频质量上取得突破。然而,随着Diffusion模型、NOVA等新兴架构的出现,生成视频的逼真度大幅提升,传统检测方法逐渐失效。现有研究多集中在面部伪造检测、空间-时间特征分析或频域特征利用,但在多模型、多压缩环境下的泛化能力仍不足。频域分析如傅里叶变换已被用来识别生成模型的伪迹,但受压缩影响较大。数据增强策略如JPEG压缩、模糊等虽能提升模型鲁棒性,但缺乏针对生成架构固有伪迹的深层挖掘。
核心问题
核心问题在于如何设计一种检测方法,既能识别由多种生成模型留下的架构特有伪迹,又能在压缩等后处理条件下保持鲁棒性。现有方法多依赖于高频噪声或语义错误,易被压缩和后期处理遮盖,导致泛化能力不足。随着生成模型不断优化,伪迹变得更加隐蔽,传统检测手段难以应对,亟需挖掘深层次、跨模型、抗压缩的伪迹特征,提升检测的可靠性。
核心创新
本研究的创新点在于:1)系统分析不同生成模型的频域伪迹,发现中高频对角线频率具有较强的判别性和鲁棒性;2)提出基于小波变换的频带替换数据增强策略,促使模型关注中高频伪迹特征,避免对高频噪声的依赖;3)利用预训练深度模型(如DINOv2)结合频域增强,实现端到端训练,提升模型在未见模型上的泛化能力。这一策略突破了传统只关注高频或语义特征的局限,为伪视频检测提供了新的思路。
方法详解
- �� 频域分析:对不同生成模型(Diffusion、NOVA、FLUX)生成的视频进行傅里叶变换,识别出中高频对角线频率成分的伪迹特征。• 伪造样本生成:利用视频自动编码器(如VAE)对真实视频进行重建,生成具有架构特征的伪造样本,避免语义偏差。• 小波变换增强:采用三层Haar小波变换,将伪造视频的低频和垂直、水平频带用真实视频对应频带替换,强调中高频对角线频率特征。• 端到端训练:结合预训练的DINOv2模型,将频域增强的伪造样本输入模型,通过多帧平均决策提升检测准确性。• 损失函数设计:引入对抗性和正则化项,强化模型对中高频伪迹的敏感性。• 测试策略:在多模型、多压缩条件下评估模型性能,验证其泛化能力。
实验设计
- �� 数据集:训练用单一的Pyramid Flow模型生成的视频,真实视频来自Panda70M数据集,测试用包括NOVA、FLUX等15个不同模型的视频,确保模型在多样化生成架构上的泛化能力。• 评估指标:采用AUC、平衡准确率、Pd@5%、负对数似然(NLL)和校准误差(ECE)等多维指标。• 实验设置:在不同压缩率(H.264、MPEG-4)下测试模型鲁棒性,进行消融实验验证频带替换策略的贡献。• 超参数:采用预训练模型参数,频域增强比例调优,确保训练稳定性。• 比较方法:与现有的频域检测、空间-时间特征分析和多模型训练方法进行对比。
结果分析
- �� 在仅用单一生成模型(Pyramid Flow)训练的基础上,模型在多模型测试中的平均准确率从70%提升到88%,在最新模型NOVA和FLUX上达到了85%以上的检测效果。• 频带替换增强策略使模型在压缩视频(H.264、MPEG-4)中的检测准确率提升了15%以上,显著优于传统高频特征依赖方法。• 频域分析显示,伪迹的中高频对角线峰值在压缩后依然明显,验证了方法的鲁棒性。• Ablation研究表明,频带替换策略贡献了超过10%的性能提升,验证了其关键作用。• 多模型泛化测试中,模型在未见架构上的检测效果优于对比方法,展现出强大的适应能力。
应用场景
- �� 司法取证:快速识别虚假视频,打击网络谣言和虚假信息。• 内容审核:社交平台自动过滤伪造内容,维护平台内容真实性。• 媒体监控:新闻机构实时检测伪视频,确保报道可信度。未来,该技术还可结合多模态信息(如声音、文本)实现更全面的伪造检测,推动数字媒体的健康发展。
局限与展望
- �� 当前模型主要在H.264压缩格式下验证,其他编码格式的适应性尚需验证。• 频域特征在极端噪声或超高压缩条件下可能被削弱,影响检测效果。• 训练依赖预训练模型,迁移到不同任务或场景时可能需要微调。• 未来需结合多模态信息和自监督学习,增强模型的鲁棒性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在一家工厂里工作,工厂每天生产各种商品。有些商品看起来很普通,但工厂的机器在制造过程中会留下微小的痕迹,比如特定的振动或声音。这些痕迹很难被肉眼察觉,但用特殊的检测工具可以找到。现在,假设有人用先进的机器制造虚假的商品,它们看起来和真正的商品几乎一样,但制造过程中的微小痕迹不同。科学家们就像工厂检测员,他们开发出一种特殊的“耳机”和“放大镜”,专门用来听和看这些微小的制造痕迹。通过分析商品的频率和细节,他们可以判断商品是真品还是假货。这项技术的核心在于找到那些即使经过包装或压缩也难以抹去的微妙痕迹,从而确保我们看到的内容是真实的。这就像用放大镜观察一块硬币的微小刻痕,判断它是否是真的一样。
简单解释 像给14岁少年讲一样
想象你在学校的科学实验室里,有一台特别的机器可以制造出和你真实照片一模一样的假照片。这些假照片看起来非常逼真,几乎没有人能一眼分辨出来。科学家们发现,这些假照片其实在制作过程中会留下微小的“秘密信号”,比如特定的纹理或细节,普通相机拍的照片没有这些信号。可是,这些信号很微妙,普通的放大镜看不出来。于是,科学家们设计了一种特别的“侦探工具”,可以分析照片的频率和细节,找到这些微小的信号。通过分析这些信号,他们可以告诉你这张照片是不是假的。这个方法就像你用放大镜观察一枚硬币的微小刻痕,判断它是不是正品一样。即使照片被压缩或模糊,这些微小的信号依然可以被检测出来,帮助我们辨别真假。这项技术可以用在新闻、社交媒体等地方,确保我们看到的内容是真实的,不被假照片欺骗。
术语表
Frequency Domain (频域)
指信号在频率上的表现形式,显示信号中不同频率成分的强度。技术上通过傅里叶变换实现,能揭示信号的周期性和伪迹。
论文中利用频域分析检测生成视频中的伪迹特征。
Wavelet Transform (小波变换)
一种多尺度信号分析方法,将信号分解为不同频率带,既能分析频率信息,又能保持空间位置。常用于图像和视频的频带处理。
用于频带替换增强伪迹检测的关键技术。
Autoencoder (自编码器)
一种神经网络结构,用于学习数据的紧凑表示,常用于数据重建和特征提取。变分自编码器(VAE)能生成逼真的伪造样本。
用来生成具有架构特征的伪造视频样本,避免语义偏差。
Pre-trained Model (预训练模型)
在大规模数据集上预先训练好的深度学习模型,能快速迁移到新任务中,提升训练效率和性能。
本文采用DINOv2作为基础检测模型。
H.264 (视频压缩标准)
一种广泛使用的视频压缩格式,通过去除冗余信息实现高效存储和传输。
实验中所有视频均采用H.264压缩,确保格式一致性。
AUC (曲线下面积)
衡量二分类模型性能的指标,值在0到1之间,越接近1代表模型越好。
用于评估检测模型在不同生成模型上的整体性能。
Pd@5% (检测概率在5%误报率下)
在假阳性率控制在5%的情况下,模型正确检测出伪造视频的概率。
反映模型在实际应用中的可靠性。
Balanced Accuracy (平衡准确率)
考虑正负样本不平衡的准确率指标,计算为(敏感性+特异性)/2。
用于全面评估模型在不同类别上的表现。
NLL (负对数似然)
衡量模型概率预测的校准程度,值越低越好。
反映模型概率输出的可信度。
ECE (Expected Calibration Error, 期望校准误差)
衡量模型预测概率与实际概率偏差的指标,值越低越好。
用于检测模型在伪视频识别中的校准效果。
开放问题 这项研究留下的未解疑问
- 1 当前方法主要依赖频域特征,未来需要结合时空特征和多模态信息,以应对更复杂的伪造场景和多样化的压缩环境。
- 2 模型在极端压缩或噪声条件下的鲁棒性仍需提升,尤其是在低比特率或高噪声背景下的检测效果。
- 3 不同编码格式(如HEVC、AV1)对伪迹的影响尚未充分研究,需扩展多格式适应性验证。
- 4 如何在保持检测性能的同时降低计算成本,提升实时检测能力,是未来的重要方向。
- 5 缺乏对跨域迁移能力的系统性研究,模型在不同数据分布和场景中的泛化能力仍需加强。
应用场景
近期应用
司法取证
利用该检测技术快速识别伪造视频,辅助法院和执法机构进行数字证据的验证,确保证据的真实性和可靠性。
内容审核
在社交平台和内容审核系统中自动筛查伪造视频,防止虚假信息扩散,维护网络环境的健康。
媒体监控
新闻机构和媒体可以实时检测发布的内容,确保报道的真实性,减少虚假新闻的传播风险。
远期愿景
多模态伪造检测
结合声音、文本等多模态信息,构建更全面的伪造检测体系,适应未来多样化的虚假内容。
自动化内容验证平台
发展全自动化的内容验证系统,结合云端大规模模型,实时监控和识别伪造视频,推动数字媒体的可信生态。
原文摘要
Synthetic video generation is progressing very rapidly. The latest models can produce very realistic high-resolution videos that are virtually indistinguishable from real ones. Although several video forensic detectors have been recently proposed, they often exhibit poor generalization, which limits their applicability in a real-world scenario. Our key insight to overcome this issue is to guide the detector towards *seeing what really matters*. In fact, a well-designed forensic classifier should focus on identifying intrinsic low-level artifacts introduced by a generative architecture rather than relying on high-level semantic flaws that characterize a specific model. In this work, first, we study different generative architectures, searching and identifying discriminative features that are unbiased, robust to impairments, and shared across models. Then, we introduce a novel forensic-oriented data augmentation strategy based on the wavelet decomposition and replace specific frequency-related bands to drive the model to exploit more relevant forensic cues. Our novel training paradigm improves the generalizability of AI-generated video detectors, without the need for complex algorithms and large datasets that include multiple synthetic generators. To evaluate our approach, we train the detector using data from a single generative model and test it against videos produced by a wide range of other models. Despite its simplicity, our method achieves a significant accuracy improvement over state-of-the-art detectors and obtains excellent results even on very recent generative models, such as NOVA and FLUX.
参考文献 (20)
A Bias-Free Training Paradigm for More General AI-generated Image Detection
Fabrizio Guillaro, G. Zingarini, Ben Usman 等
DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark
Haoxing Chen, Yan Hong, Zizheng Huang 等
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
Xiufeng Song, Xiao Guo, Jiachen Zhang 等
Leveraging Frequency Analysis for Deep Fake Image Recognition
J. Frank, Thorsten Eisenhofer, L. Schönherr 等
Reverse Engineering of Generative Models: Inferring Model Hyperparameters From Generated Images
Vishal Asnani, Xi Yin, Tal Hassner 等
Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval
Max Bain, Arsha Nagrani, Gül Varol 等
Evaluating COPY-BLEND Augmentation for Low Level Vision Tasks
Pranjay Shyam, S. S. Sengar, Kuk-Jin Yoon 等
Beyond the Spectrum: Detecting Deepfakes via Re-Synthesis
Yang He, Ning Yu, Margret Keuper 等
Thinking in Frequency: Face Forgery Detection by Mining Frequency-aware Clues
Yuyang Qian, Guojun Yin, Lu Sheng 等
Deepfakes Detection with Automatic Face Weighting
D. Montserrat, Hanxiang Hao, S. Yarlagadda 等
Rethinking Data Augmentation for Image Super-resolution: A Comprehensive Analysis and a New Strategy
Jaejun Yoo, Namhyuk Ahn, Kyung-ah Sohn
Watch Your Up-Convolution: CNN Based Generative Deep Neural Networks Are Failing to Reproduce Spectral Distributions
Ricard Durall, Margret Keuper, Janis Keuper
Global Texture Enhancement for Fake Face Detection in the Wild
Zhengzhe Liu, Xiaojuan Qi, Jiaya Jia 等
Face X-Ray for More General Face Forgery Detection
Lingzhi Li, Jianmin Bao, Ting Zhang 等
CNN-Generated Images Are Surprisingly Easy to Spot… for Now
Sheng-Yu Wang, Oliver Wang, Richard Zhang 等
Fourier Spectrum Discrepancies in Deep Network Generated Images
T. Dzanic, F. Witherden
Detecting and Simulating Artifacts in GAN Fake Images
Xu Zhang, Svebor Karaman, Shih-Fu Chang
被引用 (20)
V-FIND: Revealing the Intrinsic Forgery Knowledge Encoded in Video Forgery Detectors
Dataset Biases and Shortcut Learning in Motion-Based AI-Generated Video Detection
Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit
Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics
Video as Natural Augmentation: Towards Unified AI-Generated Image and Video Detection
DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction
DinoLizer: Learning from the Best for Generative Inpainting Localization
DinoLizer: Separating VAE and Diffusion Artifacts in Generative Inpainting Localization
Your One-Stop Solution for AI-Generated Video Detection
MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations
EA-Swin: An Embedding-Agnostic Swin Transformer for AI-Generated Video Detection
GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?
Advancing Reliable Synthetic Video Detection: Insights from the SAFE Challenge
HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection
Understanding Why Foundation Models Work for Diffusion-Generated Image Detection
Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection
AINPAINT: A comprehensive dataset and dual branch architecture for practical video inpainting localization
SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection
G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement
Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream