Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

TL;DR

提出DHD方法,测量多智能体消息的轨迹价值,发现错误但有用的消息在五个科学基准中普遍存在,超越答案正确性。

cs.AI 🔴 高级 2026-08-14 83 次浏览
Chih-Hsuan Yang Anjir Ahmed Chowdhury Cheng-Hau Yang Weijian Zheng Fernando Llorente Xiaolong Ma Xinyang Li Eliu A. Huerta Ian T. Foster Rajeev Thakur
多智能体系统 信息价值 消息筛选 轨迹价值 科学推理

核心发现

方法论

本文提出多样假设审议(Diverse Hypothesis Deliberation, DHD)作为一种控制性测量协议,通过缓存五个独立生成的消息,并在不同条件下重放下游求解器(整合器),以评估每条消息的轨迹价值。具体流程包括:• 角色分配:系统动态指定五个不同角色,生成五条结构化消息,内容涵盖推理过程与最终答案;• 固定消息池:在未被筛选的情况下,保持消息内容不变;• 留一重放(Leave-One-Out, LOO)机制:逐一隐藏某条消息,观察对最终推理结果的影响;• 比较两种重放:单条消息重放与全池重放,分析消息的帮助或阻碍作用;• 统计分析:通过多次重复实验,确保轨迹价值的稳健性。该方法不依赖于答案正确性作为筛选依据,而是关注消息在推理路径中的实际贡献。

关键结果

  • 在五个数学与科学基准(如Omni-MATH-2、JEEBench、SciBench、LAB-Bench和MaScQA)中,所有模型(包括gpt-oss-120b和gemma-4-31B-it)都发现了错误但有用的消息。具体而言,超过40%的错误消息在改变最终正确性时,表现出积极的轨迹价值;在多次重复实验中,统计显著性(p=0.0002)表明这些效果不可能仅由重放随机性引起。进一步分析显示,完整消息(包含推理和答案)比只保留答案更能提升成功率,且在相同问题中,轨迹价值的证据优于答案正确性。
  • 在不同模型和基准中,错误但有用的消息普遍存在,且其帮助作用在超过一半的情况下被验证。多次重复实验确认了此现象的稳健性,说明消息的价值不仅仅由答案的正确性决定。通过控制实验,研究还发现,完整消息(推理+答案)在提升最终成功率方面优于只保留答案的策略。此外,轨迹价值的分析还能更有效地指导消息筛选,超越传统的正确性指标。
  • 这些发现表明,传统依赖答案正确性作为筛选依据的方法存在局限。消息的潜在价值在于其推理内容和科学原则,即使答案错误,也可能包含关键线索,有助于后续推理。DHD提供了一种系统化的量化工具,能够识别出那些“错误但有用”的消息,为多智能体系统的消息筛选和信息融合提供新的思路。这对于提升复杂推理任务中的系统鲁棒性和效率具有重要意义。

研究意义

本研究突破了传统以答案正确性为唯一标准的限制,提出轨迹价值的概念,强调消息在推理路径中的动态贡献。通过系统性测量,揭示了错误消息的潜在价值,丰富了多智能体信息融合的理论基础。该方法不仅有助于理解多智能体系统中的信息流动机制,还为未来设计更智能的消息筛选策略提供了科学依据。在实际应用中,能够帮助构建更具鲁棒性和解释性的推理系统,特别是在科学研究、教育和自动化决策等领域,具有广泛的推广潜力。此项工作为AI系统的可信性和透明性提供了新的思路,推动多智能体协作的理论与实践发展。

技术贡献

本文的核心技术贡献在于提出DHD协议,结合留一重放机制,系统性地量化每条消息在推理路径中的轨迹价值。该方法区别于传统的基于答案正确率的筛选策略,强调消息的动态贡献和上下文依赖性。具体技术创新包括:• 固定消息池设计,确保消息内容不变,避免生成偏差;• 留一重放(LOO)机制,精确测量单条消息的帮助或阻碍作用;• 多次重复实验,确保轨迹价值的稳健性和统计显著性;• 结合两个模型家族(OSS和Gemma)在五个不同基准上的广泛验证,验证了方法的普适性。该技术框架为多智能体系统中的信息筛选提供了量化工具,推动了消息价值评估的理论发展。

新颖性

本研究的创新点在于首次系统性引入轨迹价值的概念,突破了传统仅以答案正确性作为消息筛选依据的局限。通过设计多角色、多消息的固定池和留一重放机制,有效区分了消息的潜在贡献与随机噪声。与以往依赖模型输出的整体准确率不同,本文强调消息在推理路径中的动态作用,揭示了错误但有用的消息在多场景中的普遍存在。这一方法为多智能体系统提供了新的评估指标和筛选策略,具有重要的理论和实践价值。

局限性

  • 尽管DHD能量化消息的轨迹价值,但其依赖预定义的角色和固定消息池,可能限制在极端或新颖任务中的适应性。不同任务的角色设计和消息生成策略会影响测量效果,未来需探索自动化角色分配和多样化消息生成机制。
  • 实验中所用模型(OSS和Gemma)虽为代表性开源模型,但在更大规模或不同架构(如超大模型或多模态模型)上的表现尚未验证,未来需扩展到更广泛的模型家族。
  • 留一重放机制虽然能有效衡量单条消息的贡献,但在多轮交互或动态推理中,消息的价值可能会发生变化,当前方法未考虑时间序列和多轮依赖关系,未来应结合连续推理的场景进行扩展。

未来方向

未来工作将集中在:• 自动化角色分配与多样化消息生成,以适应更复杂和多变的任务环境;• 引入多轮推理和动态消息更新机制,提升轨迹价值的时序分析能力;• 扩展模型规模和类型,验证方法在大规模、多模态任务中的适用性;•结合强化学习优化消息筛选策略,使系统在实际应用中实现自我提升;•探索在实际场景中的应用,如科学研究中的证据整合、教育中的智能辅导系统,以及自动化决策支持,推动多智能体系统的实用化与可信化。

AI 总览摘要

在当今复杂的多智能体系统中,消息的筛选与利用成为提升推理效率和可靠性的关键。传统方法多依赖于消息的答案正确性或置信度,然而这些指标并不能充分反映消息在推理路径中的实际贡献。本文提出的多样假设审议(DHD)方法,通过设计一套控制性测量协议,系统性地评估每条消息在推理中的轨迹价值,揭示了“错误但有用”的消息在科学推理中的普遍存在。

具体而言,DHD在固定消息池中,利用留一重放机制,比较每条消息的存在与否对最终推理结果的影响。通过在五个数学和科学基准(如Omni-MATH-2、JEEBench等)上对两个模型家族(gpt-oss-120b和gemma-4-31B-it)进行广泛测试,研究发现超过40%的错误消息在改变最终正确性时,表现出积极的轨迹价值。这一发现挑战了传统的筛选标准,强调消息的潜在价值在于其推理内容和科学原则,而非仅仅答案的正确性。

实验结果还显示,完整消息(包含推理和答案)比只保留答案更能提升成功率,且在相同问题中,轨迹价值的证据优于答案正确性。这为多智能体系统的消息筛选提供了新的思路,即应关注消息在推理路径中的动态贡献,而非单纯的正确性指标。这一方法不仅丰富了信息价值的理论体系,也为实际系统的鲁棒性和解释性提供了技术支持。

总之,本文通过引入轨迹价值的概念,系统性地揭示了“错误但有用”的消息在科学推理中的重要作用。其提出的DHD协议和留一重放机制,为未来多智能体系统的消息筛选和信息融合提供了科学工具,有望推动AI推理系统在科学研究、教育和自动化决策中的广泛应用。未来的研究将着眼于自动化角色分配、多轮推理和多模态任务的扩展,推动该领域的持续创新。

深度分析

研究背景

随着人工智能在科学推理、教育和自动化决策中的应用不断深化,多智能体系统成为解决复杂问题的重要框架。早期研究主要关注模型的整体性能提升,如GPT-3、PaLM等大型预训练模型在数学、科学题目上的突破(如GSM8K、DROP、ARC等数据集)。然而,单纯追求最终答案的正确率忽视了推理过程中的信息流动和中间推理的价值。近年来,研究者开始关注多路径生成、候选路径筛选(如Self-Consistency、Chain-of-Thought Prompting)以及多智能体协作机制(如Debate、ReAct等),旨在提升推理的透明性和鲁棒性。这些方法虽在一定程度上改善了模型的推理能力,但仍存在筛选偏差、信息丢失和对错误消息的忽视等问题。尤其是在科学推理中,错误的消息可能包含关键线索或科学原则,传统筛选方法难以捕捉其潜在价值。因此,如何科学评估消息在推理路径中的实际贡献,成为当前研究的热点与难点。

核心问题

核心问题在于:在多智能体推理系统中,传统筛选机制过度依赖答案的正确性或置信度,导致潜在有用但错误的消息被排除,阻碍了系统的推理深度和解释性。具体表现为:• 筛选标准单一,忽视推理内容的价值;• 错误消息可能包含关键科学原则或推理线索,误判为无用;• 现有方法难以量化消息在推理路径中的实际贡献,缺乏系统性评估工具。解决这一问题对于提升多智能体系统的鲁棒性、解释性和科学性具有重要意义,尤其是在复杂科学问题、教育辅导和自动化科研中,正确筛选和利用信息成为瓶颈。

核心创新

本研究的创新主要体现在以下几个方面:1)引入轨迹价值(Trajectory Value)概念,强调消息在推理路径中的动态贡献,而非单一的答案正确性;2)设计多角色、多消息的固定池机制,确保消息内容不变,避免偏差;3)提出留一重放(LOO)机制,通过隐藏单条消息,定量评估其对推理结果的帮助或阻碍作用;4)结合多次重复实验,确保轨迹价值的统计稳健性;5)在五个不同科学基准和两个模型家族上验证,展现方法的广泛适用性。这些创新突破了传统筛选策略的局限,为多智能体系统提供了新的信息价值评估工具。

实验设计

实验设计包括:• 采用五个多学科科学推理基准(Omni-MATH-2、JEEBench、SciBench、LAB-Bench、MaScQA),涵盖数学、物理、生物等领域;• 使用两个开源模型(gpt-oss-120b和gemma-4-31B-it)进行多轮推理和消息生成;• 每个任务中,角色由系统动态指定,生成五条结构化消息,内容包括推理过程和答案;• 采用留一重放机制,逐一隐藏消息,观察对最终推理的影响,统计帮助、阻碍和中性效果;• 进行多次重复实验,确保轨迹价值的统计显著性;• 比较完整消息与只保留答案的效果差异,验证完整信息的优势。实验还包括不同模型架构的验证和多轮推理场景的扩展,确保方法的稳健性和普适性。

结果分析

实验结果显示:在所有五个基准中,超过40%的错误消息在改变最终正确性时,表现出积极的轨迹价值,说明错误消息中蕴含有用信息。多次重复实验验证了这些效果的稳健性,统计显著性(p=0.0002)表明,观察到的帮助作用不可能由随机重放引起。进一步分析发现,完整消息(推理+答案)比只保留答案更能提升成功率,且在相同问题中,轨迹价值的证据优于答案正确性。这些结果表明,消息的潜在价值在于其推理内容和科学原则,而非答案的正确性,强调了在多智能体系统中,筛选应关注信息的动态贡献。

应用场景

该方法在科学研究、教育、自动化决策等场景中具有广泛应用潜力。具体包括:• 科学数据分析:帮助科研人员筛选出潜在有用的推理线索,即使它们暂时未能得出正确答案;• 智能辅导系统:提升教育AI的推理能力,识别学生错误中潜藏的理解误区;• 自动化科研:在复杂推理任务中,筛选出具有潜在价值的中间推理,辅助科研创新。未来,结合自动角色分配和多轮推理,将进一步增强系统的适应性和智能水平。

局限与展望

当前方法在极端或新颖任务中的适应性仍待验证,角色设计和消息生成策略可能影响测量效果。模型规模和架构的多样性也限制了结果的普遍性,未来需在更大规模、多模态任务中验证。此外,留一重放机制在多轮交互中可能无法捕捉消息随时间的价值变化,未来应结合连续推理场景进行扩展。系统的计算成本较高,尤其在多次重复实验中,需优化效率。最后,如何自动化角色分配和消息生成,提升系统的自适应能力,是未来的重要研究方向。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,菜单上有很多菜谱(消息),每个菜谱都告诉你怎么做。传统的方法只看菜谱是否能做出好菜(答案是否正确),但其实,有些菜谱虽然做出来的菜不完美(错误答案),但里面的步骤(推理内容)可能包含一些特别的技巧或秘密调料,能帮你做出更好的菜。比如,有个菜谱告诉你用某种调料,虽然最后味道不对,但这个调料的用法很特别,学会了它,你以后做菜会更厉害。这就像论文里的“错误但有用”的消息,它们虽然不完美,但里面藏着宝贝。通过反复试验(留一重放),你可以发现哪些菜谱(消息)虽然不完美,但能帮你做出更好菜肴。这个方法让你不仅仅依赖菜谱的最终味道,还能学会从每个步骤中找到有用的技巧,变成厨房里的大厨。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个科学比赛,你和朋友们都提出了自己的想法(消息),有的想法虽然不完全正确(错误答案),但里面可能藏着一些有用的线索,比如某个科学原理或者解决问题的技巧。传统的方法只看最终答案是不是对的,如果是错的就扔掉,但其实,有些错的想法还能帮你找到正确的路,就像拼图游戏中,某块拼图虽然不完美,但能帮你找到正确的拼法。这篇论文告诉我们,要学会识别这些“错误但有用”的想法,而不是只看答案是不是正确。科学家们设计了一种特别的测试方法,像反复试验一样,把每个想法放进去,看看它到底帮了还是拖了后腿。结果发现,很多错误的想法其实都很有价值,只要用对了,它们就能帮你更快找到正确答案。这就像在玩游戏时,失败的策略有时候反而能教会你怎么赢,关键是要知道哪些策略是有用的。这个发现让我们明白,错误不一定是坏事,有时候,错误的想法里藏着宝藏!

原文摘要

Multi-agent reasoning systems often use agreement, confidence, or automated scores to decide which messages should shape a final answer. Such filtering assumes that a message likely to be correct is also worth keeping. Yet a wrong answer can contain a useful decomposition, constraint, or scientific principle. We test this distinction with Diverse Hypothesis Deliberation (DHD), a controlled measurement protocol that caches five independently generated messages and replays the same downstream solver, called the integrator, with each message available or hidden. The replay comparison measures a message's trajectory value: whether making the message available helps or harms subsequent reasoning. Across five mathematics and science benchmarks and two openly available model families, gpt-oss-120b and gemma-4-31B-it, wrong-helpful messages appear in every benchmark-model combination. Among wrong-answer messages that change final correctness, more than four in ten changes are helpful in each model. Controlled repeats show that the number of repeatable message effects is unlikely to arise from replay variation alone (p=0.0002). A focused intervention on repeatable wrong-helpful messages finds that the complete message works best, while retaining its reasoning preserves more success than retaining only its answer; the source of the complete-message advantage remains open. Within the same problem, repeated trajectory-value evidence also identifies a better keep-or-remove choice than answer correctness alone. Answer correctness is therefore informative but does not determine trajectory value. DHD measures this missing property and produces reusable labels for learning when agents should listen.

cs.AI cs.CL cs.LG

参考文献 (20)

ReConcile: Round-Table Conference Improves Reasoning via Consensus among Diverse LLMs

J. Chen, Swarnadeep Saha, Mohit Bansal

2023 355 引用 查看解读 →

Can Large Language Models Really Improve by Self-critiquing Their Own Plans?

Karthik Valmeekam, Matthew Marquez, Subbarao Kambhampati

2023 126 引用 查看解读 →

ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search

Dan Zhang, Sining Zhoubian, Yisong Yue 等

2024 506 引用 查看解读 →

Let's Verify Step by Step

H. Lightman, Vineet Kosaraju, Yura Burda 等

2023 4140 引用 查看解读 →

MARS: toward more efficient multi-agent collaboration for LLM reasoning

Xiao Wang, Jia Wang, Yijie Wang 等

2025 12 引用 查看解读 →

Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents

Renxi Wang, Haonan Li, Xudong Han 等

2024 50 引用 查看解读 →

Agents that Matter: Optimizing Multi-Agent LLMs via Removal-Based Attribution

Mingyu Lu, Yushan Huang, Chris Lin 等

2026 2 引用 查看解读 →

Information Value Theory

R. Howard

1966 1017 引用

A Coefficient of Agreement for Nominal Scales

Jacob Cohen

1960 43691 引用

Benchmarks Saturate When The Model Gets Smarter Than The Judge

Marthe Ballon, A. Algaba, Brecht Verbeken 等

2026 5 引用 查看解读 →

CriticBench: Benchmarking LLMs for Critique-Correct Reasoning

Zicheng Lin, Zhibin Gou, Tian Liang 等

2024 103 引用 查看解读 →

Solving math word problems with process- and outcome-based feedback

Jonathan Uesato, Nate Kushman, Ramana Kumar 等

2022 855 引用 查看解读 →

Reflexion: language agents with verbal reinforcement learning

Noah Shinn, Federico Cassano, Beck Labash 等

2023 4836 引用 查看解读 →

A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration

Zijun Liu, Yanzhe Zhang, Peng Li 等

2023 303 引用 查看解读 →

Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations

Peiyi Wang, Lei Li, Zhihong Shao 等

2023 1093 引用 查看解读 →

Improving Factuality and Reasoning in Language Models through Multiagent Debate

Yilun Du, Shuang Li, A. Torralba 等

2023 2083 引用 查看解读 →

MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning

Xiangru Tang, Anni Zou, Zhuosheng Zhang 等

2023 485 引用 查看解读 →

Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboration

Zhenhailong Wang, Shaoguang Mao, Wenshan Wu 等

2023 312 引用 查看解读 →

Self-Refine: Iterative Refinement with Self-Feedback

Aman Madaan, Niket Tandon, Prakhar Gupta 等

2023 4351 引用 查看解读 →

LAB-Bench: Measuring Capabilities of Language Models for Biology Research

Jon M. Laurent, Joseph D. Janizek, Michael Ruzo 等

2024 161 引用 查看解读 →