Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry

TL;DR

提出信息不对称的多智能体预测框架InfoDelphi,通过公共私有证据分割提升预测准确率12-18%。

cs.AI 🔴 高级 2026-07-02 49 次浏览
Yuante Li Yicheng Tao Kate Zhang Taozhi Wang Gefei Gu Yaxin Zhou
多智能体系统 信息不对称 大模型推理 证据路由 集体决策

核心发现

方法论

本文提出InfoDelphi框架,结合基于BM25的相关性路由、基于推理的多轮交流和置信度加权聚合。Evidence被划分为公共池和私有子集,确保信息多样性与沟通基础。 Deliberation通过交换推理摘录实现私有信号传播,优化集体预测。理论证明此策略降低了模型间误差相关性,提升集体预测性能。

关键结果

  • 在PolyGym基准上,InfoDelphi在375个二元预测任务中,Brier分数从0.202降至0.178,提升12-18%;准确率从68.8%提升至77.9%,差异显著。即使不进行多轮交流,单纯证据划分也优于多数单模型。多轮交流结合推理共享进一步提升性能,验证信息多样性是关键。

研究意义

该研究突破了多智能体预测的核心瓶颈,强调信息多样性和有效沟通的重要性,为未来复杂决策系统提供理论基础。通过引入设计的证据划分,显著改善模型的校准和准确性,推动大模型在实际预测中的应用落地,具有深远的学术和工业价值。

技术贡献

创新点在于提出利用公共私有证据划分降低模型间误差相关性,结合推理共享机制实现信息流通,理论上证明了此策略能减少误差相关性,提升集体预测效果。框架中的Evidence Routing、Rationale Deliberation和Confidence-weighted Aggregation为多智能体合作提供新思路,超越传统同质输入和单轮交流的局限。

新颖性

首次系统性引入设计的证据不对称原则,结合多轮推理和置信度加权,显著改善多智能体预测性能。不同于以往单一模型或同质输入的多模型融合,本研究强调信息多样性和推理交流的协同作用,填补了多智能体集体推理中信息分布研究的空白。

局限性

  • 目前方法依赖预定义的证据路由策略,可能在信息检索质量不足时表现受限。多轮交流增加计算成本,且在极端信息分布不均时效果减弱。此外,模型间误差仍存在一定相关性,未来需探索更复杂的多信息源融合机制。

未来方向

未来将探索动态证据划分策略,结合深度检索模型提升信息多样性,研究多轮交流中的信息质量控制,以及在更复杂、多模态预测任务中的应用潜力。同时,考虑模型可解释性和鲁棒性,推动多智能体系统的实际部署。

AI 总览摘要

随着大规模语言模型(LLMs)在未来事件预测中的应用逐渐增多,如何提升多智能体合作的效果成为研究热点。传统多智能体方法多假设所有模型获得相同证据,导致信息重复和 Herding 现象,限制了预测性能的提升。本文提出了基于信息不对称的多智能体预测框架——InfoDelphi,通过将证据划分为公共池和私有子集,确保模型间拥有多样化的信号,从而降低误差相关性,提升集体预测能力。

在理论层面,作者证明了证据划分能有效减少模型间的误差相关性,增强集体决策的多样性。框架核心包括:利用BM25相关性路由实现证据划分、通过多轮推理共享私有信号、采用置信度加权的预测融合机制。实验在PolyGym基准上,显示InfoDelphi在375个二元预测任务中,Brier分数由0.202降低到0.178,提升幅度达12-18%,准确率从68.8%提升至77.9%。即使不进行多轮交流,证据划分本身也优于多数单模型。多轮推理和推理共享进一步显著改善预测效果,验证信息多样性是关键。

这些结果表明,设计的证据不对称策略为多智能体合作提供了新思路,有望推动未来在复杂决策、金融预测和公共政策等领域的应用。未来工作将聚焦于动态证据划分、跨模态信息融合,以及模型可解释性和鲁棒性提升,推动多智能体系统的广泛部署。

深度分析

研究背景

近年来,随着大模型(如GPT系列)在自然语言理解和推理中的突破,基于LLMs的预测系统逐渐成为研究焦点。早期工作如AutoGPT、Chain-of-Thought等强调单模型推理能力,但在集体决策中,模型间的合作效果仍受限。多智能体系统借鉴人类专家委员会、Delphi法等集体决策机制,试图通过模型合作提升预测准确性。现有研究多关注模型融合(如Ensemble、Majority Voting),但忽视了信息分布对合作效果的影响。错误相关性和信息同质化导致集体优势难以发挥,成为瓶颈。

核心问题

核心问题在于:当所有模型获得相同证据时,预测误差高度相关,集体决策的优势被削弱。传统多智能体方法未能有效引入信息多样性,导致 Herding 现象严重,难以实现真正的信念修正。这限制了多智能体系统在复杂预测任务中的潜力。如何设计信息分布策略,激发模型间的多样性,成为亟待解决的关键难题。

核心创新

本文提出“信息不对称”原则,创新点在于:

1)利用BM25相关性路由,将证据划分为公共池和私有子集,确保信息多样性;

2)引入推理共享机制,使模型在多轮交流中传播私有信号,避免信息封闭;

3)采用置信度加权的预测融合,突出信息最充分的模型。此设计突破了以往多智能体合作中信息同质化的限制,理论上证明能降低误差相关性,提升集体预测性能。

方法详解

  • �� Evidence Routing:利用BM25相关性排序,将证据分为公共池和私有子集,确保每个模型拥有独特信息。公共池作为沟通基础,私有子集提供多样信号。
  • �� Iterative Deliberation:模型在多轮中交换推理摘录,利用历史信息逐步传播私有信号,增强模型间的互补性。
  • �� Confidence-weighted Aggregation:在最后一轮,将模型预测在logit空间中加权平均,权重依据预测极端程度,突出最有信息的模型。
  • �� 理论分析:通过误差分解和相关性分析,证明证据划分能显著降低模型间的误差相关性,从而提升集体预测效果。

实验设计

在PolyGym基准上,作者采用375个二元预测任务,固定证据集,比较单模型、多模型和InfoDelphi的性能。模型包括gpt-4o、DeepSeek-V3.2等,指标为Brier分数和准确率。设置多轮交流(R=2),证据划分比例ρ=0.5,进行多次重复验证。对比不同证据路由策略、推理共享与否、轮数变化,验证设计的有效性。还进行了模型跨架构的泛化测试,确保方法的普适性。

结果分析

在PolyGym上,InfoDelphi的Brier分数由0.202降至0.178,提升12-18%;准确率由68.8%提升至77.9%。单纯证据划分(无多轮)已优于多数单模型,加入多轮推理和推理共享后,性能进一步提升。对比传统多模型融合和单模型复杂 prompting,发现信息多样性是关键因素。 ablation研究显示,证据划分和推理共享缺一不可,模型间误差相关性显著降低,验证理论分析。

应用场景

该方法适用于金融市场预测、政策制定、公共危机应对等场景,尤其在信息不对称、数据分散的环境下表现优越。通过合理设计信息分布,提升模型合作的多样性和准确性,推动自动化决策系统的实用化。未来结合深度检索和多模态信息,将拓展其在更复杂场景中的应用潜力。

局限与展望

当前方法依赖预定义的证据路由策略,可能在信息检索效果不足时表现受限。多轮交流增加计算成本,且在极端信息不平衡时效果减弱。模型间误差仍存在一定相关性,未来需探索更复杂的多源信息融合机制。此外,系统的可解释性和鲁棒性仍需提升,以适应实际复杂环境。

通俗解读 非专业人士也能看懂

想象你和几个朋友一起猜一个谜题。每个人都拿到一部分线索,但每个人的线索都不完全一样。有的朋友知道一些秘密信息,有的只知道一些公共信息。大家轮流讨论,分享自己知道的内容,逐渐拼凑出答案。如果每个人都只知道一样东西,讨论就变成了重复,大家的猜测都差不多,没有新意。相反,如果每个人都带来不同的线索,讨论就会变得丰富多彩,大家可以互相补充,最终找到更准确的答案。这就像论文里的方法,把证据分成公共和私有两部分,让每个人都拥有不同的线索,通过交流和推理,集体变得更聪明。

简单解释 像给14岁少年讲一样

想象你和朋友们在玩一个猜谜游戏。每个人都得到一些线索,但每个人的线索都不一样。有的朋友知道一些秘密,有的只知道一些公共信息。你们轮流说出自己的想法,然后互相讨论。因为每个人带来的线索不同,讨论会变得很有趣,也更容易找到正确答案。如果大家都只知道一样的东西,讨论就没什么新意,结果也不会变得更好。这个方法就像论文里的“信息不对称”,让每个人都带来不同的线索,然后通过交流,大家一起变得更聪明,猜出正确答案。这种策略可以让很多复杂的问题变得更容易解决,就像团队合作一样。

术语表

Multi-Agent System (多智能体系统)

由多个自主智能体组成的系统,协同完成任务。技术上指多模型合作与信息交流机制。

论文中用来描述多个LLMs协作预测的框架。

Evidence Routing (证据路由)

根据相关性将证据分配到不同模型,确保信息多样性和沟通基础。

实现证据划分的关键步骤。

Rationale Sharing (推理共享)

模型在多轮交流中交换推理摘录,促进私有信号的传播。

增强模型间信息流通的重要机制。

Confidence-Weighted Aggregation (置信度加权融合)

在预测融合时,根据模型预测的极端程度加权,突出最有信息的模型。

提升集体预测准确性的关键方法。

Brier Score (布里尔分数)

衡量概率预测校准的指标,越低越好。

用作评估预测模型性能的主要指标。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模、多模态环境中保持信息多样性和交流效率仍未解决。未来需结合深度检索和多源信息融合,提升系统鲁棒性。
  • 2 现有方法在极端信息不平衡或噪声环境下表现有限,需研究更强的鲁棒性机制。

原文摘要

Multi-agent systems are increasingly used for forecasting future events, as deliberation among multiple LLMs is believed to improve reasoning and calibration. Yet existing approaches overlook a critical design choice: what information each agent receives. When all agents are given identical evidence, deliberation collapses into herding rather than genuine belief revision, leaving multi-agent systems little better than a single agent. We identify this as a fundamental gap and propose designed information asymmetry to close it: by partitioning evidence into shared public and disjoint private subsets, each agent holds exclusive knowledge that can only reach others through deliberation. We theoretically show that this decomposition reduces inter-agent error correlation, and instantiate it in InfoDelphi, a framework combining relevance-aware evidence routing, rationale-based iterative deliberation, and confidence-weighted aggregation. On PolyGym, a benchmark of 375 binary forecasting questions derived from real-world prediction markets, InfoDelphi outperforms the strongest single-agent and multi-agent baselines by 12--18% in Brier score and 4--8 percentage points in accuracy. More detailed experiments confirm that removing information asymmetry eliminates most deliberation gains, establishing diversity of input as the key enabler of effective multi-agent reasoning.

cs.AI