On the Holistic Approach for Detecting Human Image Forgery

TL;DR

提出HuForDet,结合面部与全身分析,采用多模态大模型实现人像伪造检测,达SOTA性能。

cs.CV 🔴 高级 2026-01-08 35 次浏览
Xiao Guo Jie Zhu Anil Jain Xiaoming Liu
深度伪造检测 多模态模型 全景分析 频域特征 数据集构建

核心发现

方法论

HuForDet采用双分支架构:面部伪造检测分支融合RGB与频域专家(包括自适应拉普拉斯高斯模块)以捕获细粒度与大尺度伪造痕迹;全身语义一致性分析分支利用多模态大模型(MLLM)结合视觉编码与语言推理,输出置信度辅助融合。频域专家通过可学习的多尺度LoG近似捕获不同尺度的伪造特征,融合机制根据内容动态调节贡献比例。全身分析分支利用视觉编码提取高层次语义特征,再由大模型生成推理文本,结合置信度调节融合,提升检测鲁棒性。

关键结果

  • 在新构建的HuFor数据集上,HuForDet实现90.22%的AUC,超越现有方法如NPR(87.75%)和M2F2-Det(86.73%),在低误报率下的TPR95达70.87%,TPR99达33.45%,表现优异。
  • 在面部部分操控(FF++)子集,检测性能达87.80% AUC,优于多种深度学习模型;在全身合成样本(Diff-Cele)中,表现亦优于传统频域方法。
  • 消融实验显示,频域专家(E3/E4)和多尺度自适应融合显著提升检测准确率,结合全身语义分析的多模态融合机制增强模型鲁棒性。

研究意义

该研究突破了以往只关注面部或全身单一检测的局限,提出全景式人像伪造检测框架,显著提升检测范围和鲁棒性。其融合频域与语义信息的策略,为深度伪造技术的快速发展带来有效应对方案,有助于维护数字媒体的可信度,具有重要的学术和实际应用价值。

技术贡献

创新点包括:引入多模态大模型结合视觉与语言推理,设计自适应多尺度LoG频域专家,以及融合置信度机制以动态调节特征贡献。提出的双分支架构实现对局部面部操控和全身合成的同步检测,提升模型泛化能力。模型在频域特征捕获和语义推理方面均优于现有技术,为深度伪造检测提供新思路。

新颖性

首次将多模态大模型引入人像伪造检测,结合频域多尺度专家与全身语义分析,形成全面检测体系。相较于传统仅依赖局部或频域特征的方法,此架构实现了面部操控与全身合成的联合识别,填补了全景检测的空白。

局限性

  • 模型对极其微妙的伪造痕迹仍存在误判,尤其在低质量或压缩严重的图像中表现有限。
  • 频域专家的多尺度设计增加了计算成本,实时应用仍需优化。
  • 对新型伪造技术的适应性有待验证,未来需增强模型的泛化能力。

未来方向

未来将探索更高效的频域特征提取机制,结合自监督学习增强模型鲁棒性;同时扩展多模态模型的推理能力,适应更复杂的伪造场景,推动人像伪造检测向更广泛应用场景发展。

AI 总览摘要

随着AI生成内容(AIGC)技术的飞速发展,深度伪造技术不断突破传统边界,从面部操控到全身合成,威胁着数字身份的可信性。现有检测方法多局限于局部区域或单一特征,难以应对复杂多样的伪造场景。为此,本文提出HuForDet,一种全景式人像伪造检测框架,融合面部细粒度特征与全身语义一致性分析,利用多模态大模型(MLLM)实现高层次推理。其核心创新在于:引入多尺度自适应LoG频域专家,有效捕获不同尺度的伪造痕迹;结合RGB和频域专家,增强面部操控检测能力;同时利用视觉编码与语言推理,分析全身结构异常,输出置信度指导融合。实验在新构建的HuFor数据集上取得了90.22%的AUC,优于现有方法,验证了模型的鲁棒性和泛化能力。该研究不仅提升了深度伪造检测的技术水平,也为未来多模态、多尺度检测提供了新思路,有望在数字媒体安全、法律取证等领域发挥重要作用。尽管如此,模型在极端低质量图像和新型伪造技术面前仍存在挑战,未来需持续优化算法效率和泛化能力,以应对不断演变的伪造手段。

深度分析

研究背景

深度伪造技术的发展推动了虚假内容的生成,从早期的面部交换到近年来的全身合成,极大丰富了虚假内容的表现形式。代表性工作如FaceForensics++、Celeb-DF、DeepFake、StyleGAN等,已在面部操控检测方面取得一定成果,但仍难以应对全景式伪造。随着生成模型(如Diffusion、GAN)不断提升逼真度,检测技术面临更大挑战。传统方法多依赖局部特征或频域分析,缺乏对全身结构和语义一致性的全局理解。近年来,结合视觉与语言的多模态模型逐渐兴起,尝试提升检测的鲁棒性,但在细粒度识别和多尺度特征融合方面仍存不足。

核心问题

现有检测方法多集中于面部区域或全身合成,缺乏统一的全景检测框架。面部操控检测依赖局部特征,易受压缩和噪声影响;全身合成检测则依赖语义一致性,难以捕获微妙的操控痕迹。两者结合不足导致检测鲁棒性不足,难以应对复杂、多样的伪造场景。此外,深度伪造技术不断演进,提出更全面、鲁棒的检测方法成为迫切需求。如何融合多尺度频域特征与全局语义信息,提升检测的准确率和泛化能力,是当前的核心难题。

核心创新

本研究的创新主要包括:1)引入多尺度自适应LoG频域专家,利用可学习的尺度参数,有效捕获不同尺度的伪造痕迹,优于固定尺度的传统方法;2)设计双分支架构,面部分支融合RGB与频域专家,提升局部操控检测能力;3)利用多模态大模型结合视觉编码与语言推理,分析全身结构异常,输出置信度,增强全景检测鲁棒性;4)提出置信度引导的融合机制,根据模型自我评估调节特征贡献,减少误判。这些创新点共同实现了对局部操控和全身合成的同步检测,显著优于单一特征或单一模态方法。

方法详解

  • �� 输入:图像I,裁剪面部区域Iface;• 面部分支:采用四个异质专家(两个空间域、两个频域)分析Iface,利用可学习的多尺度LoG近似捕获不同尺度的伪造痕迹;• 频域专家:通过自适应LoG模块,学习不同尺度的高频与低频特征,增强细粒度与大尺度异常检测;• 频域专家输出经过门控网络加权融合,形成面部特征表示fface;• 全身分支:利用视觉编码(如CLIP)提取全局语义特征,结合大模型(如Vicuna)生成推理文本,输出语义特征fctx和自我置信度c;• 融合机制:根据置信度调节两个分支的特征贡献,最终输出伪造概率。

实验设计

在HuFor数据集上,采用AUC、准确率、TPR95、TPR99等指标评估性能。训练采用三阶段策略:第一阶段训练全身语义分析分支,第二阶段优化面部检测分支,第三阶段冻结两者,结合置信度调节融合。对比多种SOTA方法,进行消融实验验证频域专家、多尺度设计和多模态融合的有效性。模型在不同伪造类型(面部操控、全身合成)均表现优异,验证了其泛化能力和鲁棒性。

结果分析

模型在HuFor数据集上实现90.22%的AUC,优于NPR(87.75%)和M2F2-Det(86.73%),TPR95达70.87%,TPR99达33.45%。在面部操控子集,检测性能达87.80% AUC,优于多种深度学习模型。消融实验显示多尺度LoG和多模态融合机制显著提升检测效果,验证了频域专家和全身语义分析的协同作用。模型在不同伪造场景下表现稳定,说明其强泛化能力。

应用场景

该方法适用于数字内容验证、媒体取证、社交平台内容审核等场景。只需输入图像,即可快速判断伪造概率,帮助识别虚假信息。未来可结合实时检测需求,优化模型推理速度,推广到视频监控、直播内容验证等领域,提升数字媒体的安全性。

局限与展望

模型对极端低质量或高压缩图像的检测能力有限,微妙伪造痕迹仍可能被遗漏。频域专家的多尺度设计增加计算复杂度,影响实时应用。未来需优化算法效率,增强对新型伪造技术的适应性,提升模型的泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂每天生产各种商品。有些商品被偷偷篡改,比如标签换了、部件拼错了,但工厂的检测员只看外表,容易漏掉细节。现在,工厂引入了一套新设备:一台可以用不同的“眼睛”观察商品,既能看清商品表面的细节,也能用特殊的“频率”检测隐藏的瑕疵。这台设备还会结合工厂的生产流程和工人讲的话,判断商品是否被篡改。这样一来,不管商品是外表被改还是内部结构出问题,都能被发现。这个系统就像HuForDet一样,结合多种“观察方式”,让伪造变得难以逃过检测。它不仅能找到明显的假货,还能识别那些微妙的伪造,确保每件商品的真实性。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的朋友,他能用不同的方法判断一张图片是真是假。有时候,他会仔细看图片的细节,比如脸上的纹理或衣服的缝线,像用放大镜一样;有时候,他会用特殊的“频率检测器”来找隐藏的瑕疵,就像用雷达扫描一样。除此之外,他还会结合图片背后的故事,比如人物的姿势是否合理,或者背景是否符合逻辑。这个朋友还能告诉你,他有多大把握,说不定还会说:“我觉得这张图是真的,但也可能有点假。”他的方法就是结合了细节观察、频率分析和语义理解,像HuForDet一样,能全面判断图片的真假。这样一来,即使伪造技术再厉害,也难逃他的“火眼金睛”。

原文摘要

The rapid advancement of AI-generated content (AIGC) has escalated the threat of deepfakes, from facial manipulations to the synthesis of entire photorealistic human bodies. However, existing detection methods remain fragmented, specializing either in facial-region forgeries or full-body synthetic images, and consequently fail to generalize across the full spectrum of human image manipulations. We introduce HuForDet, a holistic framework for human image forgery detection, which features a dual-branch architecture comprising: (1) a face forgery detection branch that employs heterogeneous experts operating in both RGB and frequency domains, including an adaptive Laplacian-of-Gaussian (LoG) module designed to capture artifacts ranging from fine-grained blending boundaries to coarse-scale texture irregularities; and (2) a contextualized forgery detection branch that leverages a Multi-Modal Large Language Model (MLLM) to analyze full-body semantic consistency, enhanced with a confidence estimation mechanism that dynamically weights its contribution during feature fusion. We curate a human image forgery (HuFor) dataset that unifies existing face forgery data with a new corpus of full-body synthetic humans. Extensive experiments show that our HuForDet achieves state-of-the-art forgery detection performance and superior robustness across diverse human image forgeries.

cs.CV