DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts

TL;DR

DEFAME采用六阶段动态多模态证据检索,超越传统文本方法,显著提升事实核查性能。

cs.CV 🔴 高级 2024-12-14 37 次浏览
Tobias Braun Mark Rothermel Marcus Rohrbach Anna Rohrbach
多模态 事实核查 零-shot 外部工具 可解释性

核心发现

方法论

DEFAME基于多模态大模型(MLLM)结合六阶段流程:策略规划、工具执行、证据总结、事实推理、判定及解释。系统动态选择搜索工具(Web、图像、反向搜索、地理定位),结合外部知识检索与模型推理,生成结构化多模态报告。核心算法包括基于RAG(Retrieval-Augmented Generation)架构,利用GPT-4O作为主模型,结合特定工具实现多轮多跳推理,强调端到端可解释性。系统通过逐步引导MLLM,模拟人类核查流程,确保证据的多源、多模态整合,提升核查的准确性与透明度。

关键结果

  • 在VERITE、AVERITEC和MOCHEG基准上,DEFAME分别达到了83.9%、70.5%和59.2%的准确率,超越所有已知方法。特别是在CLAIMREVIEW2024+数据集,DEFAME以83.9%的整体准确率显著优于GPT-4O基线,展现出强大的时间泛化能力和实时核查潜力。
  • 在多模态任务中,DEFAME通过动态检索和多跳推理,有效处理图片与文本的复杂关联,显著优于单模态模型。其端到端结构化报告增强了系统的可解释性,获得人类评审的高度认可。
  • 消融实验显示,外部知识检索(如Web搜索和反向图像搜索)对提升核查准确率起到关键作用,系统在多轮验证中表现出较强的鲁棒性和适应性。

研究意义

该研究突破了传统文本单一的事实核查局限,首次实现多模态信息的端到端整合,极大提升核查的准确性和透明度。其零-shot设计适应快速变化的信息环境,为应对假新闻、虚假图片等多模态谣言提供了强有力的技术支撑。系统的可扩展性和实时性,为行业提供了可落地的解决方案,推动自动化事实核查迈向实用阶段,具有深远的学术和产业价值。

技术贡献

提出六阶段动态多模态核查框架,结合多源外部工具与大模型,创新性地实现端到端可解释的多模态推理。引入多跳检索策略,增强模型在复杂推理场景中的表现。系统实现零-shot能力,避免依赖大量标注数据,显著提升适应性。对比现有方法,系统在多任务、多模态环境中表现优异,推动核查技术的理论和工程发展。

新颖性

首次将多模态证据检索与推理全过程融入单一端到端系统,突破以往多模态核查多为局部子任务的限制。创新性地引入六阶段流程,结合外部工具与大模型,显著提升核查的准确性与透明度。这在多模态核查领域尚属首次,填补了相关研究的空白。

局限性

  • 系统对高质量、多样化证据的依赖较强,证据缺失或误导可能影响最终判定。
  • 多轮检索与推理带来较高计算成本,实时应用仍面临性能瓶颈。
  • 对极端复杂或模糊的多模态场景表现尚不充分,未来需增强鲁棒性。

未来方向

未来将结合更强的多模态预训练模型,提升系统的理解和推理能力。探索更高效的多轮交互策略,降低计算成本。扩展多模态知识库,增强对新兴谣言的识别能力。同时,推动系统在实际场景中的部署与优化,向全自动、可解释、实时的事实核查迈进。

AI 总览摘要

在信息爆炸的时代,虚假信息的传播已成为全球性难题。传统的事实核查方法多依赖人工,效率低且难以应对海量多模态内容的快速变化。为此,Tobias Braun等提出了DEFAME,一种基于多模态大模型(MLLM)的六阶段动态核查系统。该系统通过策略规划、工具执行、证据总结、多跳推理、判定和解释六个环节,模拟人类核查流程,动态选择搜索工具(如网页、图像反向搜索、地理定位)以获取多源、多模态证据。核心在于结合RAG架构和GPT-4O模型,利用多轮推理增强验证能力,确保端到端的可解释性。实验结果显示,DEFAME在VERITE、AVERITEC和MOCHEG等主流基准上均优于现有方法,准确率提升显著,尤其在新颖的CLAIMREVIEW2024+数据集上表现出极强的时间泛化能力。该系统不仅突破了以往单模态、局部任务的限制,更为自动化、实时、多模态事实核查提供了可行方案。未来,系统将结合更先进的预训练模型,优化推理效率,扩展知识库,推动行业实践的落地。整体而言,DEFAME代表了多模态自动事实核查的前沿技术,为应对虚假信息提供了强大工具,具有深远的学术和产业价值。

深度分析

研究背景

随着社交媒体和AI技术的发展,虚假信息的传播呈指数级增长。早期的核查系统多依赖人工,效率低且难以应对海量多模态内容。近年来,基于深度学习的自动核查方法逐渐兴起,代表性工作包括FEVER、LIAR、VERITE等,主要聚焦文本内容的验证。多模态核查方面,Xu等提出了多模态数据集VERITE,强调图片与文本的结合,但多为局部子任务,缺乏端到端解决方案。现有方法多依赖静态知识库或单一模态,难以应对复杂、多跳推理场景。DEFAME的出现,旨在突破这些限制,结合外部工具与大模型,实现多模态信息的动态整合与推理,推动自动核查技术迈向实用化。

核心问题

当前事实核查系统多为文本单一,难以处理多模态内容的复杂关系。多源、多模态证据的动态检索与整合仍是难点,尤其在实时性和可解释性方面存在不足。传统方法缺乏端到端的系统设计,无法充分模拟人类核查流程,导致准确率和透明度有限。如何在保证高性能的同时,实现多模态、多轮推理的端到端系统,是行业亟待解决的问题。

核心创新

本研究提出六阶段动态多模态核查框架,创新点包括:

  • �� 多模态工具动态调度:结合网页、图像反向搜索、地理定位等多源工具,实时获取多模态证据。
  • �� 多跳推理机制:通过多轮信息检索与推理,增强模型对复杂场景的理解。
  • �� 端到端可解释性:结构化报告与逐步推理,确保核查过程透明、可追溯。
  • �� 零-shot能力:无需大量标注数据,利用预训练模型实现泛化。
  • �� 多模态融合策略:结合模型内部推理与外部知识,提升验证准确率。

方法详解

  • �� 策略规划:模型根据当前核查状态,动态选择工具(Web、图像、反向搜索、地理定位),生成搜索指令。
  • �� 工具执行:调用对应API(如Google Search、Google Vision、GeoCLIP)获取网页、图片和地理信息。
  • �� 证据总结:模型对检索到的内容进行摘要,过滤无关信息,形成结构化证据。
  • �� 多跳推理:结合多源证据,逐步推断证据与声明的一致性。
  • �� 判定:模型根据推理结果,输出支持、反驳或无足够信息。
  • �� 解释:生成简洁的理由说明,增强透明度。

实验设计

采用VERITE、AVERITEC、MOCHEG和新提出的CLAIMREVIEW2024+数据集进行评估。对比基线包括GPT-4O、GPT-4O CoT等,指标为准确率。参数设置方面,使用GPT-4O作为主模型,限制最大上下文和图片数。通过多轮验证和消融实验,验证外部工具的重要性及多跳推理的贡献。系统在不同任务和模态下均表现优异,验证了其泛化能力。

结果分析

在VERITE上,准确率达83.9%,比之前最优方案高出25.9个百分点。在AVERITEC中,准确率提升至70.5%,超越现有最优。MOCHEG中,系统达59.2%,成为新SOTA。CLAIMREVIEW2024+测试显示,DEFAME在时间泛化和新颖场景中表现优异,验证了其强大的适应性和实用性。多模态检索和多跳推理显著提升核查精度,结构化报告获得用户好评。

应用场景

该系统适用于新闻验证、社交媒体监控、政府信息核查等场景。依赖多源外部工具,能实时处理多模态内容,帮助记者、平台和机构快速识别虚假信息。未来可集成到自动内容审核平台,实现大规模、全自动的虚假信息识别。

局限与展望

系统对高质量、多样化证据的依赖较大,证据缺失或误导会影响判定。多轮检索带来较高计算成本,实时应用仍有性能瓶颈。复杂场景下的鲁棒性不足,未来需增强模型的泛化能力和效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,面对一份复杂的菜谱。你会先看看食材,确认有哪些,然后根据菜谱一步步准备。每次发现缺少某种调料或步骤,你会去找资料或问别人,直到所有材料都准备齐全,菜肴完成。DEFAME就像这个厨师,它会不断查找各种信息(网页、图片、地理位置),逐步验证一份声明的真假,最后给出一个清晰的结论和理由。它能同时处理文字和图片,就像厨师同时看菜单和食材图片,确保每一步都正确,最终做出一份可靠的“菜肴”。

简单解释 像给14岁少年讲一样

想象你在学校里帮朋友查作业题。题目很难,你得用手机查资料、看图片、问老师。你会先想好要查什么,然后用搜索引擎找答案,找到后再确认是不是对的。如果不确定,就继续查,直到有足够的证据说服你。DEFAME就像这个聪明的朋友,它能用电脑帮你查网页、图片和位置,逐步验证一个声明的真假。它会告诉你这个说法是真的还是假的,还会解释为什么。这样,你就不用自己费劲查证,系统帮你搞定了!

原文摘要

The proliferation of disinformation demands reliable and scalable fact-checking solutions. We present Dynamic Evidence-based FAct-checking with Multimodal Experts (DEFAME), a modular, zero-shot MLLM pipeline for open-domain, text-image claim verification. DEFAME operates in a six-stage process, dynamically selecting the tools and search depth to extract and evaluate textual and visual evidence. Unlike prior approaches that are text-only, lack explainability, or rely solely on parametric knowledge, DEFAME performs end-to-end verification, accounting for images in claims and evidence while generating structured, multimodal reports. Evaluation on the popular benchmarks VERITE, AVerITeC, and MOCHEG shows that DEFAME surpasses all previous methods, establishing itself as the new state-of-the-art fact-checking system for uni- and multimodal fact-checking. Moreover, we introduce a new multimodal benchmark, ClaimReview2024+, featuring claims after the knowledge cutoff of GPT-4o, avoiding data leakage. Here, DEFAME drastically outperforms the GPT-4o baselines, showing temporal generalizability and the potential for real-time fact-checking.

cs.CV cs.CL