DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework

TL;DR

DeALOG采用去中心化多智能体架构,通过共享自然语言日志实现多模态问答的鲁棒性与透明性。

cs.CL 🔴 高级 2026-02-01 43 次浏览
Abhijit Chakraborty Ashish Raj Shekhar Shiven Agarwal Vivek Gupta
多模态问答 去中心化 多智能体系统 可解释性 鲁棒性

核心发现

方法论

DeALOG引入五个专业化智能体(表格、文本、视觉、总结、验证),通过共享的类型化自然语言日志进行通信,无需中央规划器。采用轻量级调度器管理轮次,确保系统的鲁棒性与透明性。每个智能体在日志中追加有序条目,验证器进行交叉验证,确保推理的可靠性。该框架在多模态QA任务中实现了模块化、可解释和鲁棒的推理流程,利用特定算法如BM25+miniLM进行信息检索,结合LLM(如LLaMA-3 8B)进行推理。通过在六个公开数据集(FinQA、TAT-QA、WikiTableQuestions、FeTaQA、CRT-QA、MultiModalQA)上的实验,验证了其在准确率、鲁棒性和透明性方面的优越表现。

关键结果

  • 在FinQA上,DeALOG使用LLaMA-3 8B模型达到了76.5%的EM,优于多智能体基线,且在长推理链和证据腐败条件下表现出更强的鲁棒性(误差率仅增加6.4%),验证了去中心化架构的优势。
  • 在多模态任务MultiModalQA中,DeALOG在不同模型背后保持了最高的准确率(75.3%),且在抗干扰和长距离推理中表现优异,验证了日志共享机制的有效性。
  • 消融实验显示,去除共享日志或验证机制会显著降低系统性能,证明日志的类型化、持久性和验证机制在提升鲁棒性和可解释性中的关键作用。

研究意义

该研究突破了传统依赖中央规划器的多智能体推理框架,提出去中心化的日志驱动机制,极大增强了系统的鲁棒性和透明性。其在多模态问答中的应用,为复杂信息融合提供了新思路,推动了可解释AI的发展。该框架不仅适用于学术研究,也为实际场景中的多模态智能系统设计提供了理论基础和工程方案,有望改善自动问答、知识推理和人机交互的性能瓶颈。

技术贡献

DeALOG的核心创新在于引入类型化、持久的自然语言日志作为通信媒介,取代传统的中央计划器,结合轻量调度器实现多智能体协作。其采用的多智能体架构(表格、文本、视觉、总结、验证)实现了任务的模块化和可扩展性。通过日志的可追溯性和验证机制,显著提升了系统的鲁棒性和透明性,提供了新颖的多模态推理原语。该方法在保证推理准确性的同时,强化了系统的可解释性和抗干扰能力。

新颖性

本研究首次提出基于共享类型化自然语言日志的去中心化多智能体推理框架,避免单点故障和错误传播,显著区别于传统的规划-执行架构。其通过日志的持久性和验证机制,实现了多模态信息的透明融合和鲁棒推理,为多智能体系统设计提供了新范式。

局限性

  • 当前框架依赖于预训练大模型,计算成本较高,尤其在长推理链和多模态融合中表现出一定的延迟。
  • 日志的类型化和验证机制虽然增强了透明性,但在极端噪声或信息缺失情况下仍可能出现性能下降,鲁棒性有限。
  • 系统在多智能体交互中的调度策略较为简单,未来可引入学习型调度机制以优化轮次管理和资源分配。

未来方向

未来将探索动态调度策略和自适应验证机制,提升系统在复杂环境下的鲁棒性。还计划结合强化学习优化智能体交互策略,扩展多智能体架构的适应性与效率。此外,将研究多模态推理的知识融合机制,增强系统的推理深度和泛化能力,推动多模态AI的实际应用落地。

AI 总览摘要

DeALOG提出了一种去中心化、多智能体、多模态问答框架,通过共享的类型化自然语言日志实现智能体间的协作与信息追溯。传统方法多依赖中央规划器,容易在推理链长或证据腐败时出现错误集中和不透明的问题。DeALOG摒弃中央计划器,采用五个专业智能体(表格、文本、视觉、总结、验证),在无中心控制的条件下,通过轮次调度和日志追加实现任务协作。每个智能体在日志中追加有序条目,验证器进行交叉验证,确保推理的可靠性。该机制显著增强了系统的鲁棒性和透明性,尤其在多模态复杂问答任务中表现优异。实验结果显示,DeALOG在六个公开数据集上均优于多智能体和单模型基线,准确率达76%以上,且在抗干扰和长推理链中表现出更强的稳定性。其核心创新在于引入类型化、持久的日志作为通信媒介,避免错误集中和信息丢失,为未来多模态AI系统设计提供了新思路。该框架不仅在学术界具有重要意义,也为工业界的多模态智能应用提供了可扩展、透明、鲁棒的解决方案。未来,作者计划引入学习型调度和知识融合机制,进一步提升系统的智能化水平和实用性。

深度分析

研究背景

多模态问答技术经历了从单一模态到多模态信息融合的演变,早期依赖规则和模板方法,逐步引入深度学习模型(如BERT、GPT系列)实现信息抽取和推理。代表性工作包括WIKITABLEQUESTIONS、TAPEX、TAPAS等,解决了表格理解和推理问题。近年来,结合大规模预训练模型的链式推理(Chain-of-Thought)和多智能体架构逐渐兴起,旨在提升复杂推理能力。然而,现有方法多依赖中央规划器,容易在推理链长或证据噪声时出现错误传播,缺乏透明性和鲁棒性。多模态任务如MultiModalQA引入图像和文本的融合,进一步增加了系统复杂性。尽管取得一定进展,但在推理可解释性、抗干扰能力和系统扩展性方面仍有待突破。

核心问题

现有多模态问答系统多依赖集中式架构,中央规划器在多步骤推理中成为单点故障源,错误易在推理链中传播,导致系统不稳定。此外,缺乏有效的推理过程追溯机制,难以解释推理路径,限制了模型的可信度和调试能力。面对长推理链和多模态信息融合,系统的鲁棒性不足,容易受到噪声和信息缺失影响。如何设计一个既具备模块化、可扩展性,又能保证推理过程透明和鲁棒的系统,成为亟待解决的核心问题。

核心创新

DeALOG的创新点在于引入类型化、持久的自然语言日志作为多智能体间的通信媒介,取代传统的中央计划器。其核心创新包括:• 多智能体架构(表格、文本、视觉、总结、验证)实现任务模块化,便于扩展;• 通过日志的append-only特性,确保推理路径的可追溯性和透明性;• 验证机制在日志中进行交叉验证,提升鲁棒性,减少错误传播;• 采用轻量级调度器管理轮次,避免复杂的计划推导。该设计极大改善了系统的抗干扰能力和可解释性,为多模态推理提供了新范式。

方法详解

  • �� 智能体:包括表格、文本、视觉、总结、验证,分别负责信息抽取、推理和验证。• 日志机制:所有智能体在共享日志中追加类型化条目(如LOOKUP、ANSWER、FLAG),确保推理路径可追溯。• 调度策略:固定轮次调度,轮流激活智能体,无需中央计划器。• 交叉验证:验证器对总结结果进行交叉验证,确保答案支持。• 证据检索:利用BM25+miniLM检索相关文本和表格片段。• 任务流程:从检索开始,逐步由不同智能体补充信息、总结和验证,直到达成一致或触发重检。• 训练:门控策略在WikiTQ上训练,应用于所有任务。• 评估:在六个数据集上进行准确率、鲁棒性和透明性测试,结合消融实验验证机制重要性。

实验设计

采用六个公开多模态问答数据集(FinQA、TAT-QA、WikiTableQuestions、FeTaQA、CRT-QA、MultiModalQA),统一检索和提取流程,评估准确率、鲁棒性和效率。对比多智能体和单模型基线,进行腐败噪声干扰、长链推理和机制消融。模型使用LLaMA-3 8B、Qwen-3 8B等,调研不同配置下的性能表现。指标包括EM、F1、准确率,统计95%置信区间。还测试了不同的日志去重、门控策略和并行检索对性能的影响。实验设计确保公平性和可重复性,验证DeALOG在复杂推理和多模态融合中的优越性。

结果分析

DeALOG在六个数据集中的平均准确率超过75%,在抗噪声和长推理链条件下表现出更强的稳定性。腐败干扰实验显示,去中心化架构的误差传播率明显低于集中式方案(误差增长仅6.4%),验证了其鲁棒性。消融实验表明,日志类型化和验证机制对性能提升至关重要,未使用日志或验证时,准确率下降超过10%。此外,系统在多模态融合任务中保持了较高的准确率,显示出良好的扩展性和适应性。

应用场景

该框架适用于自动问答、知识推理、智能客服、教育辅导等场景,尤其在需要多模态信息融合和高可解释性的应用中表现优越。系统可部署于企业知识库、智能助手和科研工具中,提升信息检索和推理的效率与可信度。未来还可结合强化学习优化智能体调度,扩展到更复杂的环境和任务。

局限与展望

目前系统依赖大模型,计算成本较高,推理速度受限。日志验证机制在极端噪声环境下仍可能失效,鲁棒性有限。调度策略较为简单,未来需引入学习型调度以提升效率。此外,系统在极端信息缺失或多模态信息不一致时表现尚待优化。未来工作将关注模型压缩、动态调度和多模态知识融合,以增强实用性和适应性。

通俗解读 非专业人士也能看懂

想象一个团队合作完成一项复杂任务,比如准备一场盛大的派对。每个人负责不同的部分:有人负责食物,有人负责装饰,还有人负责邀请客人。大家通过写在白板上的笔记(日志)交流,每个人都可以看到所有人的想法和进展。没有一个人是总指挥,大家根据自己的任务轮流行动,确保信息透明且不出错。如果有人发现问题,可以在日志上指出,其他人也可以看到并修正。这样,即使有人犯错,也不会影响整个计划,因为每一步都被记录下来,大家都可以追溯到源头。这就像DeALOG的多智能体系统,通过共享日志合作,确保任务既稳健又透明。

简单解释 像给14岁少年讲一样

想象你和朋友们一起做一个大项目,比如做一个科学实验。每个人负责不同的部分,比如准备材料、设计实验、记录数据。你们用一块白板写下每一步的内容,大家都可以看到。每次完成一部分,就把结果写在白板上,其他人可以检查和确认。如果有人发现问题,可以在白板上指出,大家一起改正。没有一个人是唯一的指挥官,而是大家轮流做事,确保每一步都清楚透明。这样,即使有人犯错,也不会搞砸整个实验,因为每个步骤都被记录下来,大家都能追溯到源头。这就像DeALOG的系统,多个“智能体”合作,通过写日志保证任务的正确和透明。

原文摘要

Complex question answering across text, tables and images requires integrating diverse information sources. A framework supporting specialized processing with coordination and interpretability is needed. We introduce DeALOG, a decentralized multi-agent framework for multimodal question answering. It uses specialized agents: Table, Context, Visual, Summarizing and Verification, that communicate through a shared natural-language log as persistent memory. This log-based approach enables collaborative error detection and verification without central control, improving robustness. Evaluations on FinQA, TAT-QA, CRT-QA, WikiTableQuestions, FeTaQA, and MultiModalQA show competitive performance. Analysis confirms the importance of the shared log, agent specialization, and verification for accuracy. DeALOG, provides a scalable approach through modular components using natural-language communication.

cs.CL cs.AI