MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations

TL;DR

MPF-Net通过层次化偏差和微观时序波动检测高保真AI视频伪造,利用Manifold Projection Fluctuations实现高效识别。

cs.CV 🔴 高级 2026-01-29 39 次浏览
Xinan He Kaiqing Lin Yue Zhou Jiaming Zhong Wei Ye Wenhui Yi Bing Fan Feng Ding Haodong Li Bo Cao Bin Li
视频取证 深度学习 生成模型检测 Manifold分析 微观时序波动

核心发现

方法论

MPF-Net采用双路径层次框架,包括静态流形偏差分支利用VFMs检测空间异常,微观时序波动分支分析连续帧残差中的结构一致性。算法核心为基于大规模视觉基础模型的偏差检测和残差微结构分析,结合Jacobians和物理噪声特征,揭示高保真伪造中的Manifold Projection Fluctuations。模型通过LoRA微调,增强对微观时序特征的敏感性,实现对“在流形”与“偏离流形”样本的有效区分。

关键结果

  • 在VidProM基准测试中,MPF-Net在检测高保真视频伪造方面达到了99.97%的准确率,明显优于传统空间特征检测方法(如Gram-Net的63.64%),验证其在不同视频质量和生成模型上的鲁棒性。
  • 在真实视频与伪造视频的特征空间中,MPF-Net成功实现了高维特征的线性分离,特别是在高帧率和高分辨率条件下,微观时序残差的结构一致性成为识别关键。
  • 消融实验显示,微观时序分析贡献了约30%的检测性能提升,验证了残差结构的普适性和有效性。

研究意义

该研究突破了内容逻辑和宏观语义之外的伪造检测瓶颈,提供了基于Manifold投影偏差的微观指纹识别技术,为数字取证提供了更稳健的工具。随着生成模型不断逼近真实,传统检测手段逐渐失效,MPF-Net通过分析残差的微观结构,填补了高保真内容检测的空白,具有重要的学术价值和产业应用潜力。

技术贡献

提出层次化双路径检测框架,结合VFMs的空间偏差检测与残差微结构分析,创新性地利用Jacobians和物理噪声特征揭示高保真伪造中的Manifold Projection Fluctuations。引入LoRA微调策略,有效提升模型对微观时序特征的敏感性,增强检测的鲁棒性。该方法在无需大量标注的情况下,显著优于传统空间特征检测和物理约束方法,为深度伪造检测提供了新思路。

新颖性

首次系统性结合大规模视觉基础模型与微观时序残差分析,提出Manifold Projection Fluctuations作为伪造指纹,突破传统只依赖空间特征的局限。该方法在高保真视频中依然有效,填补了内容逻辑一致性检测的空白,是深度伪造检测领域的创新突破。

局限性

  • 模型对极低帧率或极高压缩比的视频检测效果有限,残差信号被严重噪声淹没,导致检测性能下降。
  • 对极端复杂场景(如多主体交互、快速运动)中的微观残差结构识别仍存在挑战,需进一步优化模型鲁棒性。
  • 高精度检测依赖较长时间序列的微观残差分析,计算成本较高,实时应用仍需优化。

未来方向

未来将结合多模态信息(如音频、文本)增强伪造检测能力,探索多尺度残差特征的联合建模。同时,优化模型结构以实现实时检测,提升在实际场景中的适用性。还计划扩展到多类型伪造场景,增强模型的泛化能力,推动深度伪造技术的安全防控体系建设。

AI 总览摘要

随着深度生成模型如Veo和Wan的快速发展,合成视频的视觉质量已逼近真实,宏观语义错误和时间不一致逐渐变得难以检测。传统方法多依赖空间特征或物理规律检测,但在高保真内容中效果有限。本文提出MPF-Net,基于Manifold Projection Fluctuations(MPF)分析,结合层次化双路径架构,突破了这一瓶颈。

第一路径——静态流形偏差分支,利用大规模视觉基础模型(VFM)检测空间异常和物理违规,识别偏离真实流形的伪造内容。第二路径——微观时序波动分支,分析连续帧残差中的结构一致性,揭示伪造的微观指纹。通过Jacobians和物理噪声特征,模型能在高保真视频中依然有效识别伪造。

实验显示,MPF-Net在VidProM基准测试中达到了99.97%的检测准确率,优于传统空间特征方法。其核心创新在于结合深度学习的空间偏差检测与微观残差分析,提供了更稳健的伪造指纹识别手段。未来,将结合多模态信息和优化算法,推动深度伪造检测的实用化与普及。

深度分析

研究背景

近年来,深度学习生成模型如GAN、Diffusion等推动了高质量视频合成技术的发展。代表性工作包括StyleGAN、VQ-VAE和Diffusion Models,极大提升了内容的真实感。然而,随着模型规模和训练数据的增长,生成内容逐渐逼近真实,宏观语义错误和时间不一致难以检测,传统空间特征检测逐渐失效。近年来,研究逐步转向物理规律和内容一致性分析,但高保真内容中的微观结构指纹仍未被充分挖掘,成为新的研究热点。

核心问题

现有检测方法多依赖宏观语义或空间特征,难以应对高保真内容的微观一致性。深度生成模型通过学习复杂的流形映射,掩盖了传统特征的缺陷,使伪造视频在视觉上几乎无差异。如何在内容逻辑一致、视觉质量高的情况下,识别出生成过程中的微观指纹,成为深度伪造检测的核心难题。尤其是在高帧率、高分辨率的视频中,残差的结构性和物理噪声的微观差异被严重掩盖,检测难度大大增加。

核心创新

本研究提出层次化双路径架构,创新点包括:1)利用大规模视觉基础模型(VFM)作为空间偏差检测的“哨兵”,识别偏离真实流形的内容;2)引入Manifold Projection Fluctuations(MPF)作为微观指纹,通过残差结构分析揭示生成模型的内在特征;3)结合Jacobians和物理噪声特征,增强对高保真内容的微观检测能力;4)采用LoRA微调策略,有效提升模型对微观残差的敏感性。这一创新体系突破了传统检测的局限,为高保真伪造内容提供了新思路。

方法详解

  • �� 输入:高保真视频序列;
  • �� 第一阶段:利用预训练的VFM(如MetaCLIP-v2)提取帧级特征,采用线性分类头判断偏离流形的空间异常;
  • �� 采样策略:采用微序列采样,确保Jacobians的局部平滑性,增强残差结构的可检测性;
  • �� 第二阶段:对连续帧残差进行增强处理(放大微观波动),提取[CLS]特征;
  • �� 微调:在模型的最后一层引入LoRA,微调残差指纹特征;
  • �� 结合残差的结构一致性与物理噪声特征,进行二次判别;
  • �� 输出:伪造判定结果。

实验设计

  • �� 数据集:使用VidProM、Youku-mPLUG、Pika等真实与伪造视频,涵盖不同质量和生成模型;
  • �� 评估指标:准确率、AUC、F1-score;
  • �� 实验设置:微序列长度L=8,训练仅调优线性头和LoRA参数,训练1轮;
  • �� 对比方法:Gram-Net、ReStraV等传统空间特征方法;
  • �� ablation:分析空间偏差检测和微观残差分析的贡献。

结果分析

  • �� MPF-Net在VidProM测试中达99.97%的准确率,显著优于Gram-Net的63.64%;
  • �� 在高帧率视频中,微观残差结构的线性可分性大幅提升检测效果;
  • �� 消融实验显示,微观时序残差分析贡献了30%的性能提升,验证其有效性;
  • �� 在不同生成模型(Veo、Wan)上均表现出优异的鲁棒性。

应用场景

  • �� 适用于数字取证机构,快速识别高保真伪造视频,提升司法鉴定效率;
  • �� 可集成于内容审核平台,自动过滤虚假内容,维护网络环境;
  • �� 未来可结合多模态信息,拓展到音频、文本伪造检测,构建全场景防伪体系。

局限与展望

  • �� 对极低帧率或极高压缩比视频检测效果有限,残差信号被严重噪声淹没;
  • �� 在复杂场景(如多主体、快速运动)中,微观残差结构识别仍需优化;
  • �� 实时检测仍受计算成本限制,需进一步模型轻量化和加速。

通俗解读 非专业人士也能看懂

想象你在一家工厂里工作,工厂每天生产各种商品。每个商品都经过一套严格的流程,留下了特定的“指纹”。如果有人偷偷在工厂里偷偷改装商品,虽然外表看起来一样,但这些改装会在生产流程中留下微小的不同,比如某个机器的微调或材料的微小变化。MPF-Net就像一个非常细心的检测员,利用这些微小的“指纹”来判断商品是否被篡改。它通过观察连续商品的微小变化,发现那些看似完美但其实有“内部秘密”的伪造品。这种检测方法比传统的只看外表更聪明、更精准,因为它能找到那些隐藏得很深的伪造痕迹。

简单解释 像给14岁少年讲一样

你知道吗,有时候我们在视频里看到的内容看起来完全一样,但其实是假的。就像你用拼图拼出一幅画,虽然拼得很像,但拼图的每一块其实都藏着不同的秘密。科学家们发明了一种叫MPF-Net的“侦探”,它能用特别的方法找到这些秘密。它会仔细观察视频中每一帧的微小变化,就像用放大镜看拼图的每一块一样。即使伪造者让视频看起来像真的一样,这个侦探也能发现里面藏着的不同之处。它的厉害之处在于,不仅能找到明显的假视频,还能发现那些“完美无瑕”的高质量伪造。这样一来,我们就可以更好地保护自己不被假视频欺骗了。

原文摘要

With the rapid advancement of video generation models such as Veo and Wan, the visual quality of synthetic content has reached a level where macro-level semantic errors and temporal inconsistencies are no longer prominent. However, this does not imply that the distinction between real and cutting-edge high-fidelity fake is untraceable. We argue that AI-generated videos are essentially products of a manifold-fitting process rather than a physical recording. Consequently, the pixel composition logic of consecutive adjacent frames residual in AI videos exhibits a structured and homogenous characteristic. We term this phenomenon `Manifold Projection Fluctuations' (MPF). Driven by this insight, we propose a hierarchical dual-path framework that operates as a sequential filtering process. The first, the Static Manifold Deviation Branch, leverages the refined perceptual boundaries of Large-Scale Vision Foundation Models (VFMs) to capture residual spatial anomalies or physical violations that deviate from the natural real-world manifold (off-manifold). For the remaining high-fidelity videos that successfully reside on-manifold and evade spatial detection, we introduce the Micro-Temporal Fluctuation Branch as a secondary, fine-grained filter. By analyzing the structured MPF that persists even in visually perfect sequences, our framework ensures that forgeries are exposed regardless of whether they manifest as global real-world manifold deviations or subtle computational fingerprints.

cs.CV