核心发现
方法论
本文提出基于DINOv2的局部化模型,采用LoRA在Query和Value上微调,加入单层线性分类器,实现14×14像素分辨率的操控检测。利用滑动窗口对大图进行推断,结合多尺度融合,提升检测精度。模型区分真实、VAE伪迹和修复区域三类,显著改善传统二分类方法的模糊性。训练过程中引入多样化数据增强,增强模型鲁棒性。
关键结果
- 在FOSSIL及SOTA数据集上,DinoLizer平均IoU提升20%以上,最高达45%,F1得分也优于对比模型。在JPEG双重压缩场景下依然保持稳定性能,验证其抗干扰能力。通过消融实验,LoRA微调和三类训练策略显著提升模型性能,参数量仅2.4M,训练效率高。
- 在不同尺度和噪声干扰下,DinoLizer表现出优异的鲁棒性,尤其在压缩和重采样场景中优于现有方法。多尺度滑动窗口策略有效改善小区域伪迹检测,适应大尺寸图像。
- 实验结果表明,该方法在检测生成式修复伪迹方面具有较强的实用价值,能广泛应用于数字取证、内容验证等场景,有助打击深度伪造技术。
研究意义
该研究突破了现有检测方法在复杂生成伪迹中的局限,通过引入VAE与扩散伪迹的多类别区分,显著提升检测精度和鲁棒性。其高效的模型结构和滑动窗口策略,为大规模实际应用提供了技术基础。推动了深度伪造内容的自动化检测技术发展,有助维护数字内容的真实性和可信度。
技术贡献
创新点在于结合DINOv2视觉Transformer与LoRA微调技术,实现参数高效训练。引入三类别标签,区分VAE和扩散伪迹,增强模型判别能力。采用滑动窗口融合策略,支持大图像检测,提升检测密度和准确率。整体架构兼顾效率与性能,突破了传统二分类的局限,为深度伪造检测提供新思路。
新颖性
首次在生成式修复伪迹检测中引入VAE与扩散伪迹的多类别区分,利用DINOv2的局部特征进行像素级检测。采用LoRA微调实现参数极少的高效训练,结合滑动窗口策略实现大图检测,显著优于现有方法。该方法在鲁棒性和检测精度方面实现突破,为深度伪造内容检测提供新范式。
局限性
- 模型对极端噪声和复杂背景仍存在一定敏感性,尤其在高压缩比场景下性能略有下降。训练依赖大量标注数据,数据多样性不足可能影响泛化能力。模型在极大尺寸图像上的实时性有待提升,未来需优化推理速度和多模态融合能力。
未来方向
未来将结合多模态信息(如文本、视频)提升检测的全面性,探索自监督学习增强模型泛化能力。同时,优化模型结构以实现实时检测,扩大应用范围至视频和高分辨率图像,推动深度伪造内容的自动化识别技术发展。
AI 总览摘要
随着深度生成模型的快速发展,生成式修复和伪造内容的检测成为数字取证的核心难题。传统方法多依赖全局统计特征,难以捕捉局部伪迹,尤其在复杂背景或压缩环境下表现不足。本文提出DinoLizer,基于DINOv2视觉Transformer,通过LoRA微调实现参数高效训练,专注于检测VAE和扩散模型产生的伪迹。模型引入三类别标签(真实、VAE、修复),增强判别能力。采用滑动窗口策略,将检测范围扩展到大尺寸图像,有效捕获局部伪迹特征。实验在FOSSIL及多个SOTA数据集上,平均提升20%的IoU,表现优异,特别在JPEG双重压缩场景中保持鲁棒。该方法不仅提升检测精度,还大幅降低训练成本,为实际应用提供技术支撑。未来,结合多模态信息和优化推理速度,将进一步推动深度伪造内容的自动化检测与治理。
深度解读
原文摘要
We introduce DinoLizer, a DINOv2-based localizer of manipulated areas in generative inpainting. The model is trained to focus on semantically altered regions by treating reconstructed areas outside the inpainted mask as a separate class, which yields significant improvements w.r.t. the conven- tional approach. We train the model with LORA on the Query and Value of the transformer blocks and simply add 1 linear layer on top of the backbone to predict manipulations on a 14 x 14 patch resolution. Because DINOv2 only accepts fixed- sized images, we use a sliding window approach to aggregate the predictions on larger images. Empirical results show that DinoLizer outperforms state-of-the-art methods on our proposed dataset and SOTA inpainting datasets. Furthermore, it is very robust to JPEG (double) compression. On average, DinoLizer achieves a 20% higher Intersection over Union score compared to the second best model. The code is publicly available here: https://github.com/anonyme610/dinolizer.