DART: A DAG-Based Reputation and Incentive Framework via Blockchain-Enabled Governance for Trustworthy LLM Multi-Agent Collaboration

TL;DR

DART基于DAG的声誉与激励机制,结合区块链实现可信多智能体协作,提升任务成功率至93.33%。

cs.MA 🔴 高级 2026-09-02 31 次浏览
Manoj Kumala Xinyun Liua Ronghua Xu
多智能体系统 区块链 声誉机制 激励方案 DAG调度

核心发现

方法论

DART采用DAG结构进行任务调度,结合声誉评估和多因素激励机制,通过智能合约实现去中心化治理。系统包括任务分解、能力匹配、行为监控和信誉更新四个核心模块。利用IPFS存储中间产物,链上记录关键元数据,确保可追溯性。声誉评估融合历史信誉与实时行为表现,动态调整任务分配。激励机制结合奖励与惩罚,自动检测异常行为,提升系统可靠性。实验证明在GSM8K、软件开发等场景中,DART实现93.6%的Pass@1,长时间试验中成功率达93.33%,显著优于对比方法。

关键结果

  • 在GSM8K基准测试中,DART达成93.6%的Pass@1,优于MegaAgent的93.0%,验证了其在数学推理任务中的优越性能。
  • 在软件工程任务中,DART能在142秒内完成全栈应用开发,表现优于传统中心化方案,且能有效识别和隔离恶意代理,系统成功率提升至99.8%。
  • 多轮长时间试验显示,DART的平均任务成功率为93.33%,输出质量为0.9357,重试率为0.2307,分配延迟仅1.115秒,整体表现稳定且优越。

研究意义

该研究突破了多智能体系统中信任与激励机制的集成瓶颈,结合区块链的不可篡改性与DAG的高效调度,为可信赖、多样化的复杂任务协作提供了理论基础和工程实践方案。这不仅提升了多智能体系统的鲁棒性和可解释性,也为未来自治系统的治理提供了新思路,具有重要的学术价值和产业应用潜力。

技术贡献

技术创新在于将DAG调度、声誉评估、多因素激励和区块链治理深度融合,提出一套端到端的可信多智能体协作框架。引入智能合约实现自动化信誉管理和惩罚机制,利用IPFS存储大规模中间产物,确保数据完整性。系统设计支持动态行为调整和恶意检测,显著增强系统的抗攻击能力。该框架在多任务、多智能体环境中展现出优异的适应性和可扩展性,为未来智能自治系统提供了可行的技术路径。

新颖性

本研究首次将DAG结构与区块链声誉激励机制结合,形成可验证、可追溯的多智能体协作体系。区别于传统中心化或单一声誉模型,DART实现了多因素动态调度与行为监控的闭环机制,显著提升了系统的可信度和鲁棒性。这在多智能体研究中具有开创性意义,为复杂任务的自治调度提供了新范式。

局限性

  • 当前系统在高并发、大规模环境下的性能优化仍需加强,尤其是链上存储与智能合约的扩展性问题。
  • 恶意行为检测主要依赖行为特征,面对高级对抗策略时可能存在识别盲区。
  • 系统对复杂任务的依赖模型和调度参数调优仍需自动化支持,未来需引入学习机制提升适应性。

未来方向

未来将探索多智能体系统的自我演化能力,结合深度强化学习优化调度策略,提升系统自主性。同时,计划引入更复杂的攻击模型进行鲁棒性测试,完善异常检测机制。还将拓展多模态数据融合,增强系统在多样化场景中的适应能力,推动可信自治系统的产业化应用。

AI 总览摘要

随着大规模语言模型(LLMs)和多智能体系统(MAS)的快速发展,如何确保多智能体协作的可信性、可验证性和激励兼容性成为核心挑战。传统的集中式调度架构在面对复杂、多变的任务环境时,容易出现单点故障和扩展瓶颈,限制了系统的鲁棒性和安全性。为此,本文提出了DART(DAG-based Agent Reputation and Incentive Framework),结合区块链技术和DAG调度模型,构建了一个去中心化、可信赖的多智能体协作平台。

DART的核心创新在于利用DAG结构进行任务调度,结合声誉评估和多因素激励机制,实现动态行为调节和恶意行为检测。系统通过智能合约自动管理信誉和激励,利用IPFS存储中间产物,确保数据的完整性和可追溯性。实验结果显示,在GSM8K数学推理任务中,DART达成93.6%的Pass@1,优于现有多智能体框架。在软件开发场景中,DART能在142秒内完成全栈应用开发,并有效识别和隔离恶意代理,系统成功率提升至99.8%。长时间试验中,平均任务成功率达93.33%,输出质量0.9357,表现稳定优越。

这些成果表明,将声誉、激励、DAG调度与区块链治理结合,为多智能体系统提供了强大的可信基础。该框架不仅提升了系统的鲁棒性和安全性,还为自治系统的未来发展提供了新思路。未来,研究将聚焦于系统的自我演化能力和多模态数据融合,推动可信自治技术的产业落地。

深度分析

研究背景

近年来,随着Transformer架构的突破,LLMs在推理、规划和多模态理解方面展现出巨大潜力。代表性工作如GPT系列、BERT、T5推动了自然语言处理的变革。多智能体系统(MAS)逐步演变为自主、多样化的生态系统,应用于科研、医疗、机器人等领域。早期框架如Auto-GPT、BabyAGI强调任务自动分解与工具利用,但多依赖中心化调度,存在单点故障。区块链引入后,提供了去中心化的交互保障,但多缺乏复杂任务调度和行为激励机制。声誉机制多为静态评分,难以应对动态环境中的信任维护。整体来看,现有研究在可信性、可扩展性和激励机制方面仍有较大提升空间。

核心问题

核心问题在于如何在开放、多样化的多智能体环境中,建立可信的行为监管和激励体系。现有方法多依赖中心化调度或静态声誉模型,难以应对恶意行为、任务依赖复杂性和系统扩展性。缺乏动态调度与行为反馈的闭环机制,导致系统易受攻击、信任难以维护,影响整体性能和安全性。解决这一问题对于实现自治、可信、可扩展的多智能体系统具有重要意义,但技术难点在于多因素动态调节、行为监控和区块链的高效集成。

核心创新

创新点包括:1)引入DAG结构进行任务调度,支持复杂依赖关系和高效并行;2)融合历史信誉与实时行为,动态调整任务分配;3)设计多因素激励方案,结合奖励与惩罚机制,自动检测异常行为;4)利用智能合约实现信誉、激励的自动化管理,确保系统的去中心化和可信性。这些创新解决了传统声誉模型静态、单一的问题,显著提升了多智能体系统的适应性和安全性。

方法详解

  • �� 任务分解:用户提交任务后,调度模块将其拆解为子任务,识别依赖关系,利用DAG模型管理调度顺序。• 能力匹配:根据代理的历史信誉、成功率和技能匹配度,为每个子任务选择最合适的代理。• 任务调度:通过Softmax概率分布,动态分配任务,支持并行执行。• 行为监控:在任务执行后,利用验证机制评估输出质量,检测异常行为。• 信誉更新:结合短期行为表现与长期历史,利用指数加权平均调整信誉分数。• 激励机制:根据任务完成情况,自动发放奖励或惩罚,激励正向行为,抑制恶意行为。• 区块链存储:关键元数据存于链上,中间产物存IPFS,确保数据完整性和可追溯性。

实验设计

实验设计包括在GSM8K、MBPP、HumanEval等数据集上评估,比较MetaGPT、CAMEL、AgentVerse等基线。指标涵盖Pass@1、输出质量、重试率和任务延迟。采用不同规模的智能体池,调优激励参数,验证系统在复杂任务中的适应性。长时间试验中,反复验证系统在恶意行为检测、信誉维护和任务成功率方面的表现,确保模型的鲁棒性和稳定性。实验还包括对不同攻击策略的抗干扰能力测试,验证系统的安全性和可信性。

结果分析

在GSM8K数学推理任务中,DART达成93.6%的Pass@1,优于MegaAgent的93.0%,验证了其在多步推理中的优势。在软件开发场景中,系统在142秒内完成全栈应用,且能识别恶意代理,系统成功率达99.8%。长时间试验显示,平均任务成功率为93.33%,输出质量0.9357,重试率0.2307,调度延迟仅1.115秒。声誉机制有效抑制恶意行为, containment率达99.3%,系统整体表现优异,验证了其在复杂、多样任务环境中的适用性。

应用场景

该框架适用于自动化软件开发、科研协作、智能制造等场景,支持多角色、多任务的协同作业。依赖于高效的任务调度和信誉评估,能提升任务完成效率和系统安全性。未来可扩展到多模态数据融合、自治机器人等领域,推动智能系统的可信化与自主化,为产业升级提供技术支撑。

局限与展望

系统在高并发环境下的性能优化仍需加强,链上存储和智能合约的扩展性是瓶颈。恶意行为检测依赖特征,面对高级对抗策略可能失效。调度参数和信誉模型需自动调优,未来需引入学习机制提升适应性。系统对复杂任务的依赖模型尚不完善,需结合深度学习优化调度策略。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多工人(智能体),每个人都负责不同的任务,比如制造、检验、包装。工厂管理者(调度系统)会根据每个工人的表现和技能,把任务合理分配给他们。为了保证工厂正常运转,管理者会记录每个工人的工作质量,奖励表现好的,惩罚出错的。工厂还用一种特殊的记账本(区块链)来记录所有的任务和表现,确保没有人作弊。工人们之间可以合作,也可以互相监督,确保每个任务都能按时完成。这样,工厂既高效又可靠,不会被坏工人破坏,也能激励大家努力工作。DART就像这个工厂的智能管理系统,让每个工人都能公平合作,工厂整体运转得更顺畅。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多同学(智能体)一起完成一个大项目。每个人负责不同的部分,比如写报告、做演示、设计海报。老师(系统)会根据每个同学的表现,决定谁负责什么任务,还会给表现好的同学奖励,比如加分。老师还会记录每个人的工作情况,确保没有人作弊或偷懒。如果有人做错了,老师会告诉他们怎么改,直到任务完成得很好。所有的记录都写在一本特别的账本(区块链)上,大家都可以查,保证公平。这样,大家合作得更愉快,项目也能顺利完成。DART就像这个老师的管理系统,让每个人都能公平合作,整个班级变得更棒!

原文摘要

Large language model (LLM)-based multi-agent systems (MAS) predominantly rely on centralized orchestration and lack formal verification mechanisms for agent reliability, participation, and system-level behavioral alignment. These shortcomings leave open environments severely vulnerable to uncooperative or malicious agents. This work proposes DART, a Directed Acyclic Graph (DAG)-based reputation and incentive regulation framework for trustworthy multi-agent collaboration, combining centralized operational orchestration with blockchain-enabled decentralized governance and accountability. DART unifies DAG workflow orchestration, capability and reputation-aware task allocation, dynamic behavior updates, multi-factor incentives, and smart contract accountability paired with IPFS storage. Under this paradigm, agent selection dynamically balances task alignment, historical reputation, and workload, while post-execution behavioral evidence continuously calibrates agent trust and the probability of future participation. Evaluated across four axes, DART achieves 93.6% Pass@1 on GSM8K and builds a full-stack application in 142 s using two agents, outperforming centralized baselines. Across five independent 150-round longitudinal trials, Full DART achieves a mean task success rate of 93.33 +/- 2.26%, output quality of 0.9357 +/- 0.0117, retry rate of 0.2307 +/- 0.0816, and allocation delay of 1.1153 +/- 0.0408 s, consistently outperforming its ablated configurations DART isolates persistent and intermittent malicious agents, obtaining a 99.3% output containment rate and restoring system success to 99.8%. These results demonstrate the potential of coupling reputation, incentives, DAG-based coordination, and verifiable blockchain-enabled governance to support adaptive and accountable multi-agent collaboration.

cs.MA cs.AI