SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

TL;DR

SafeGuard结合多智能体感知与推理,提升社会风险视频检测准确率18.7%。

cs.CV 🔴 高级 2026-07-03 49 次浏览
Wenlin Wu Sheng Zhou Peipei Song Wenhao Wang Junbin Xiao Xun Yang
深度学习 多智能体系统 视频伪造检测 社会风险 跨模态推理

核心发现

方法论

SafeGuard采用分层感知求解器与自反验证器组成的多智能体框架。感知求解器通过粗到细策略,从视频中提取细粒度的伪造证据,包括光流、深度、外观和像素级特征。自反验证器则交叉验证语义推理与物理合理性,形成可解释的证据链。该系统结合视觉伪造检测与语义推理,利用特定算法如Grounding DINO、SAM 2和LVLM模型,实现对高风险场景的全面分析。

关键结果

  • 在SafeVid数据集上,SafeGuard检测准确率提升18.7%,优于现有方法。该数据集包含2万视频,涵盖10个社会风险类别,验证其在复杂语义场景中的鲁棒性。多项公开基准测试显示,SafeGuard在LOKI、GenVideo、GenVidBench和DVF等数据集上均优于对比模型,表现出良好的泛化能力。
  • 通过消融实验,感知求解器的多模态特征提取和自反验证的闭环机制显著提升检测性能,尤其在高风险场景中表现优异。模型在细粒度伪造证据的捕获和逻辑推理方面表现出强大优势。
  • 系统的可解释性通过证据链实现,能追溯检测决策的物理和语义依据,增强了模型在社会安全应用中的可信度。

研究意义

该研究突破了现有基于感知或语义的单一检测方法的局限,提出融合多智能体的感知-推理框架,有效应对全场景、全维度的伪造检测难题。尤其在社会风险视频监测中,提升了检测的准确性和解释性,为公共安全、网络治理提供了强有力的技术支撑。该方法的提出,填补了高风险场景下深度伪造检测的空白,推动了多模态、多任务融合的研究方向,具有重要的理论价值和实际应用潜力。

技术贡献

本文提出的SafeGuard框架创新性地将分层感知求解器与自反验证器结合,形成闭环的推理机制。采用多模态特征提取、物理合理性验证和逻辑推理,突破了传统单一感知或语义模型的局限。引入可解释的证据链,增强了模型的透明度和可信度。构建的SafeVid数据集,涵盖多社会风险类别,推动了高风险场景的检测研究。该系统无需端到端微调,利用公开预训练模型实现高效检测,为未来多智能体、多模态融合提供了新范式。

新颖性

首次将多智能体合作机制应用于社会风险视频伪造检测,融合细粒度伪造证据提取与语义推理,解决感知-推理鸿沟。提出的闭环验证机制显著提升检测的可靠性和可解释性,突破了现有方法在复杂场景中的性能瓶颈。这一框架在高风险社会场景中的应用,具有开创性意义。

局限性

  • 模型对极端复杂场景的鲁棒性仍有限,尤其在伪造手段高度隐蔽或多模态交叉伪造时,可能出现误判。
  • 系统依赖预训练模型的性能,存在在特定场景下泛化不足的问题,且计算成本较高,难以实时部署。
  • 当前数据集虽然丰富,但仍难以覆盖所有潜在社会风险类别,未来需持续扩展多样性和复杂性。

未来方向

未来将探索多模态融合的深度优化,提升模型在极端复杂场景下的鲁棒性。计划引入强化学习机制,增强多智能体之间的协作效率。此外,将结合实时视频分析需求,优化模型推理速度,推动其在实际监控系统中的应用落地。进一步扩充数据集,涵盖更多社会风险类别,提升模型的泛化能力。

AI 总览摘要

随着视频生成技术的不断发展,AI伪造视频的真实性检测面临前所未有的挑战。传统方法多依赖于低级伪造痕迹,难以应对全场景、全语义层面的伪造行为。为解决这一问题,Wenlin Wu等提出了SafeGuard,一种融合多智能体感知与推理的检测框架。该系统由分层感知求解器和自反验证器组成,前者通过多模态特征提取,定位并分析高风险区域的伪造证据;后者则交叉验证语义推理与物理合理性,确保检测结果的可靠性。实验结果显示,在包含2万视频的SafeVid数据集上,SafeGuard的检测准确率比现有方法提升18.7%,在多个公开基准中表现优异。该框架不仅提升了检测性能,还实现了可解释性,为社会风险视频监测提供了新思路。未来,研究将聚焦于多模态融合优化、实时检测能力提升及数据集扩展,推动其在公共安全、网络治理等领域的实际应用。整体来看,SafeGuard代表了多智能体、多模态融合在社会风险视频检测中的创新方向,具有重要的理论价值和广泛的应用前景。

深度分析

研究背景

近年来,深度学习推动视频生成技术快速发展,代表性模型如Sora、Pika、Nano Banana Pro等,已能生成全场景、语义一致的虚假视频。早期深伪检测主要依赖低级伪造痕迹分析,但随着生成技术的提升,伪造内容变得更加逼真,单一感知特征已难以应对复杂场景。现有数据集如GenVideo、DVF等,偏重日常场景,缺乏高风险社会场景的覆盖,限制了检测系统的泛化能力。近年来,结合视觉-语言模型的推理方法逐渐兴起,但多偏重语义层面,缺乏细粒度的伪造痕迹分析。整体来看,现有研究在提升检测准确率和解释性方面仍有较大空间,尤其在社会风险场景中。

核心问题

当前深伪检测多依赖单一模态或单一特征,难以兼顾细粒度伪造证据与语义推理的需求。尤其在高风险社会场景中,伪造行为常伴随细微的物理异常或社会逻辑违背,单一模型难以全面捕获。这导致检测的鲁棒性不足,误判率较高,且缺乏可解释性。如何融合多模态信息,建立既能捕获细节又能进行高层语义推理的系统,成为亟待解决的核心问题。

核心创新

本研究创新性提出SafeGuard框架,结合分层感知求解器和自反验证器,形成闭环推理机制。具体创新包括:1)引入多模态特征提取技术,定位高风险区域;2)利用物理和像素级特征,提取细粒度伪造证据;3)通过语义推理验证证据与场景一致性,确保决策的逻辑性;4)构建社会风险类别的专用数据集SafeVid,增强模型在高风险场景中的适应性。这一体系突破了传统单一感知或推理模型的局限,实现了高准确率和良好的解释性。

方法详解

  • �� 采用大规模视觉-语言模型(LVLM)总结场景动态,生成伪造假设。• 通过区域路由机制,筛选高风险区域进行细粒度伪造证据提取,使用Grounding DINO和SAM 2实现区域定位和像素级掩码。• 利用多模态工具(光流、深度、外观、像素)评估区域真实性,形成证据集合。• 构建基于推理的结构化判断,将证据、场景语义和假设结合,生成初步判定。• 引入自反验证器,交叉验证推理链的逻辑一致性,检测潜在矛盾。• 若验证不通过,利用反馈信息迭代修正假设,直至达成一致。• 最终输出具有可解释性的检测结论,支持高风险场景的应用需求。

实验设计

在包含2万视频的SafeVid数据集上,模型通过与多项公开基准(LOKI、GenVideo、GenVidBench、DVF)对比,验证其优越性能。采用准确率、召回率、F1值等指标,进行多场景、多类别的评估。通过消融实验,验证感知求解器中多模态特征提取和自反验证机制的贡献。参数调优包括不同的伪造类别、场景复杂度和检测阈值,确保模型的鲁棒性。还进行了跨域测试,验证模型在未见场景中的泛化能力。

结果分析

在SafeVid上,检测准确率达到了85.3%,比最优对比模型提升了18.7%。在LOKI、GenVideo等公开基准中,均实现了明显优于现有方法的性能,尤其在复杂社会场景中表现出色。消融实验显示,加入自反验证器后,误判率降低了15%,模型在细粒度伪造证据的捕获方面表现优异。多模态特征的融合显著提升了模型的鲁棒性和解释性,验证了设计的有效性。

应用场景

该技术适用于公共安全监控、网络内容审核、社交媒体平台的虚假信息识别等场景。只需输入视频和场景信息,即可实现高精度检测,帮助执法和平台管理部门及时识别高风险伪造内容。未来还可结合实时视频流,应用于动态监控和应急响应中,提升社会治理效率。

局限与展望

模型对极端复杂或高度隐蔽的伪造手段仍存在误判风险,尤其在多模态交叉伪造或新型伪造技术出现时。此外,系统依赖预训练模型,计算成本较高,难以实现实时检测。数据集虽丰富,但覆盖面有限,未来需持续扩展多样性和复杂性,以应对不断演变的伪造技术。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂里有很多不同的工人,每个人负责不同的任务。有的工人专门检查产品的细节,比如颜色和形状,有的工人负责确认产品是否符合设计图纸。现在,如果有人偷偷在产品上做了手脚,单靠检查细节可能会发现一些微小的瑕疵,但很难理解这些瑕疵是否意味着产品被篡改。工厂还需要一个能理解整体流程和设计意图的管理者,来判断这些细节是否合理。SafeGuard就像这样一个工厂管理系统,它既能细致检查每个产品的细节,又能理解整个生产流程的合理性,确保每个出厂的产品都是真实可靠的。这种结合细节和整体理解的方法,让工厂的检测变得更全面、更可信。

简单解释 像给14岁少年讲一样

想象你在学校里,有个老师要检查学生的作业是不是自己写的。单纯看字迹或内容可能会发现一些作弊的迹象,但有时候这些细节不足以判断。老师还需要考虑整个作业的主题和逻辑,看它是否合理、符合题意。SafeGuard就像这个老师,它用两种方式帮忙:一种是仔细检查作业中的细节,比如字迹、格式,找出可能的伪造痕迹;另一种是理解作业的整体内容和逻辑,看是否符合题目的要求。它们合作,确保作业既没有作弊,也符合逻辑。这样,老师就能更准确、更公平地判断学生的作业是否真实。这个系统就像一个聪明的老师,既细心又懂得大局。

原文摘要

As video generation paradigms evolve from localized manipulation to full-scene synthesis, AI-generated video detection becomes increasingly challenging, as forgeries exhibit coherent global structure and high perceptual realism. However, existing benchmarks are biased toward perceptual fidelity and primarily evaluate detectors based on perceptual artifacts, providing limited coverage of scenarios that require reasoning about violations of physical laws, structural coherence, or social logic. This dataset bias shapes current approaches and results in a Perception-Reasoning Gap: artifact-centric models capture low-level statistical irregularities yet lack semantic inference, whereas vision-language models perform semantic reasoning but remain insensitive to fine-grained forensic cues. To bridge this gap, we propose SafeGuard, a multi-agent framework that enables collaborative specialization between forensic perception and semantic reasoning. A hierarchical perceptual solver extracts fine-grained forensic evidence, while a self-reflective verifier enforces consistency between semantic inference and physical plausibility, forming an interpretable evidence chain. To support evaluation, we introduce SafeVid, a novel AI-generated video detection benchmark comprising 20K videos spanning 10 social risk categories, designed to evaluate physical plausibility, structural consistency, and the rationality of social behaviors. Extensive experiments demonstrate the generalization of SafeGuard, improving accuracy on SafeVid by +18.7% and consistently outperforming prior methods across four public benchmarks.

cs.CV