V-FIND: Revealing the Intrinsic Forgery Knowledge Encoded in Video Forgery Detectors

TL;DR

V-FIND通过定位稀疏神经元,提升视频伪造检测性能,达成外部基准的高准确率。

cs.CV 🔴 高级 2026-08-04 66 次浏览
Shichao Kan Chengpeng Hong Jingtong Dou Chuancheng Shi Yuhan Liu Linrui Xu Yixiong Liang Yigang Cen Yanpeng Sun Fei Shen Tat-Seng Chua
视频伪造检测 神经元解释 稀疏表示 深度学习 模型理解

核心发现

方法论

V-FIND框架通过层间差异分析定位关键层,再利用层内的稀疏锚定神经元(LAN)识别出持续携带伪造判别信号的神经元,组织成紧凑的伪造子空间。采用冻结原始骨干网络,仅训练线性分类器,实现高效检测。具体包括:• 计算层间差异信号,筛选出表现出明显差异的层;• 在关键层中训练探针,筛选出效果显著的锚定神经元;• 构建神经元子空间,训练轻量级线性分类器。此方法无需全模型再训练,便能提取稀疏、可重用的伪造判别知识。

关键结果

  • 在Magic Videos和MovieGen数据集上,V-FIND仅用冻结骨干和线性分类器,分别获得89.37%的平均准确率(mACC)和96.92%的平均精确率(mAP),优于多数SOTA方法。AUC指标在DVF测试集上提升至98.2%,显示其强泛化能力。
  • 通过神经元干预实验验证,所发现的LAN在不同视频伪造场景中表现出高度功能特异性,激活响应在复杂纹理和边界区域更为明显,稳定性强。
  • 层级分析显示,后期层(第24-32层)更集中携带伪造判别信息,深层特征对检测效果影响显著。阈值敏感性分析表明,阈值τd=1.5在神经元选择中表现最优,增强模型鲁棒性。

研究意义

该研究揭示了视频伪造检测模型内部存在稀疏、可提取且可重用的判别知识,为模型的可解释性和高效检测提供新思路。避免全模型再训练,降低了检测成本,同时增强模型对不同伪造类型的泛化能力,具有重要的理论价值和实际应用潜力。

技术贡献

提出V-FIND框架,首次系统性地在预训练检测模型中定位伪造判别神经元,组织成紧凑子空间,显著提升检测效率与泛化能力。结合层间差异分析和神经元筛选技术,突破传统黑箱限制,为模型内部机制理解提供新工具。

新颖性

本研究首次提出通过稀疏神经元定位伪造判别知识,区别于传统端到端训练方法,强调模型内部的内在判别能力。利用层差异分析和神经元筛选实现高效、可解释的检测机制,具有创新性。

局限性

  • 当前方法依赖预训练模型的特定结构,迁移到不同架构可能需调整参数;
  • 神经元筛选阈值τd虽有一定鲁棒性,但在极端伪造场景下可能表现不佳;
  • 模型在极端复杂伪造或低质量视频中的表现仍有待验证。

未来方向

未来将探索多模态融合,结合声音、文本信息提升检测鲁棒性;同时研究动态神经元筛选机制,适应不同伪造技术的演变,推动模型向更高的可解释性和泛化能力发展。

AI 总览摘要

随着AI生成内容的不断逼真,视频伪造检测成为亟需解决的关键问题。传统方法多依赖端到端训练,资源消耗大且缺乏对模型内部判别机制的理解。本文提出V-FIND框架,通过分析预训练检测模型内部的层间差异,定位出表现出明显伪造差异的关键层,并在这些层中筛选出一组稀疏且功能特异的锚定神经元(LAN)。这些神经元组织成紧凑的伪造子空间,只需冻结原模型骨干,训练轻量级线性分类器,即可实现优异的检测性能。实验证明,该方法在Magic Videos、MovieGen和DVF等多个公开数据集上均优于现有SOTA方法,准确率和AUC指标均有显著提升。神经元干预实验进一步验证了LAN的功能特异性,激活响应集中在复杂纹理和边界区域,表现出强的判别能力。层级分析显示,后期层更携带判别信息,阈值敏感性分析确保筛选的鲁棒性。这一研究揭示了模型内部稀疏判别知识的存在,为模型可解释性和高效检测提供新思路,有望推动视频伪造检测技术的快速发展。未来,结合多模态信息和动态神经元筛选,将进一步提升模型的适应性和泛化能力。

深度分析

研究背景

近年来,AI生成内容(AIGC)技术飞速发展,尤其在视频合成领域取得突破。代表性技术包括潜空间扩散模型(Ho et al. 2022)、视频扩散模型(Singer et al. 2022)和大规模场景模拟(Brooks et al. 2024),促使合成视频达到极高的逼真度。传统检测方法多依赖端到端训练,采用深度神经网络(如TimeSformer、CLIP)进行二分类,取得一定效果。然而,这些模型多为黑箱,缺乏对判别机制的理解,难以应对新型伪造技术的演变,且训练成本高昂。近年来,研究逐渐关注模型内部的判别特征,尝试解释神经网络的内部机制,但尚未系统性地定位到稀疏、判别性强的神经元。本研究旨在弥补这一空白,探索模型内部的稀疏判别知识,提升检测效率和可解释性。

核心问题

现有视频伪造检测方法多依赖全模型微调或端到端训练,资源消耗大且难以理解模型内部判别机制。随着伪造技术不断升级,模型的泛化能力成为瓶颈。如何在保持检测性能的同时,理解模型内部的判别依据,成为亟待解决的问题。此外,模型内部判别知识的稀疏性和可重用性尚未被充分挖掘,限制了检测效率和可解释性。

核心创新

本研究提出V-FIND框架,核心创新在于:1)层间差异分析定位关键层,筛选出表现出明显伪造差异的中后层;2)在关键层中训练探针,筛选出持续携带判别信号的稀疏锚定神经元(LAN);3)组织LAN形成紧凑的伪造子空间,只需冻结原模型,训练线性分类器即可实现高效检测。此方法突破了传统端到端训练的局限,强调模型内部稀疏判别知识的提取与利用。

方法详解

  • �� 计算层间差异信号(方向性分离和归一化偏移)筛选关键层;• 在关键层中训练线性探针,评估每个神经元的判别贡献;• 根据判别效果大小筛选出LAN集合;• 构建LAN激活的子空间,训练线性分类器实现检测。整个流程在保持模型参数不变的情况下,有效提取稀疏判别信息,提升检测效率。

实验设计

采用Magic Videos、MovieGen和DVF三个公开数据集,分别评估检测性能。模型基于预训练的Qwen2.5-ViT,筛选阈值τd=1.5,得到211个LAN。对比多种SOTA方法,V-FIND在准确率、AP和AUC指标上均优于对手。通过神经元响应可视化验证LAN在复杂纹理和边界区域的激活效果,层级分析确认后期层更携带判别信息。敏感性分析确保筛选阈值的鲁棒性。

结果分析

V-FIND在Magic Videos上实现89.37%的平均准确率(mACC)和96.92%的平均精确率(mAP),在DVF测试集AUC达98.2%,优于多数端到端模型。神经元干预实验显示,激活响应在伪造视频中更为集中,验证了LAN的判别功能。层级分析表明,后期层(第24-32层)更富判别信息,阈值τd=1.5在神经元筛选中表现最佳。这些结果表明,模型内部稀疏判别知识可被有效提取和利用。

应用场景

该方法可广泛应用于视频内容验证、数字取证和媒体真实性检测,特别适合在资源有限环境中快速部署高效检测模型。只需冻结预训练模型,训练少量线性分类器,即可实现高性能检测,降低成本,增强模型可解释性。未来还可结合多模态信息,拓展到音频、文本等多源伪造检测场景。

局限与展望

当前方法依赖预训练模型的结构特性,迁移到不同架构或新型伪造技术时,效果可能下降。神经元筛选阈值虽有一定鲁棒性,但在极端伪造或低质量视频中表现仍需验证。模型在复杂场景下的泛化能力有限,未来需结合多模态信息和动态筛选机制进行优化。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有许多机器在生产不同的产品。每台机器都有很多部件,有的部件负责特定任务,比如装配、检测或包装。现在,工厂的管理者想知道哪些部件最关键,能判断出产品是否有瑕疵。你们通过观察不同产品的生产过程,发现只有少数几个关键部件在检测瑕疵时表现出明显差异。这些关键部件就像稀疏的神经元,只在特定情况下发挥作用。工厂可以只关注这些关键部件,不必重新调整所有机器,就能快速判断出瑕疵产品。这就像V-FIND在视频检测中找到少数神经元,组织成一个小的“判别空间”,用很少的调整就能实现高效检测。这个方法既节省资源,又让工厂的检测变得更透明、更容易理解。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多老师在教不同的科目。有的老师擅长数学,有的老师擅长语文。现在,学校想知道哪些老师最擅长发现学生作弊。其实,只有少数几个老师在观察学生时特别敏感,能一眼看出作弊的迹象。学校只需要找到这些“特别老师”,让他们多关注学生,就能更快发现作弊行为。这就像研究中的神经元筛选,只关注那些在判断视频真假时特别敏感的神经元。这样,检测系统变得更聪明、更快,也更容易理解它是怎么做出判断的。就像找出学校里最厉害的“作弊侦探”,用少量信息就能做出准确判断。这个方法让检测变得简单又高效,就像用少数老师的智慧解决大问题一样。

原文摘要

As generated videos become increasingly realistic, reliable video forgery detection is increasingly important. Existing studies typically optimize and use video forgery detectors as black boxes, while the latent forgery-discriminative knowledge inside them remains largely unexplored. Instead of continuing to rely on resource-intensive full-model retraining to steadily improve detection performance, we ask whether video forgery detection can also be achieved by uncovering and activating sparse forensic knowledge within the detector. We find that forgery-discriminative knowledge is not uniformly distributed across the full representation space, but is concentrated in a sparse set of functionally specialized neurons. Based on this insight, we propose a video forgery-intrinsic neuron discovery (V-FIND) framework. V-FIND first localizes critical layers that exhibit pronounced discrepancies between real and forged videos, and then identifies latent anchor neurons that consistently carry forgery-discriminative signals, organizing them into a compact forensic subspace. With the original backbone frozen and only a lightweight linear classifier trained, this subspace still delivers strong detection performance across multiple external benchmarks for generated videos. Further neuron intervention experiments provide direct evidence for the functional specificity of the discovered neurons. Overall, these results suggest that video forgery detectors contain sparse, extractable, and reusable forgery-discriminative knowledge, offering a new perspective on understanding and exploiting their intrinsic forensic capability.

cs.CV cs.AI