Multi-Agent Collaboration via Evolving Orchestration

TL;DR

提出动态调度的多智能体协作框架“puppeteer”,通过强化学习优化代理序列,提升性能与效率。

cs.CL 🔴 高级 2025-05-26 37 次浏览
Yufan Dang Chen Qian Xueheng Luo Jingru Fan Zihao Xie Ruijie Shi Weize Chen Cheng Yang Xiaoyin Che Ye Tian Xuantang Xiong Lei Han Zhiyuan Liu Maosong Sun
多智能体系统 强化学习 动态调度 多模态推理 协作优化

核心发现

方法论

本文提出一种以中央调度器(“puppeteer”)为核心的多智能体协作框架,通过强化学习训练调度策略,实现动态选择和排序代理。代理由不同模型和工具组成,形成有向图结构,调度器根据任务状态动态激活代理,支持序列化推理。采用REINFORCE算法优化策略,奖励函数兼顾准确性与计算成本,逐步引导系统形成紧凑、循环的推理结构。实验在闭域和开域数据集上验证了该方法的优越性,表现出更高的准确率和更低的计算开销。

关键结果

  • 在MMLU-Pro和GSM-Hard等数据集上,调度策略显著提升了平均准确率,提升幅度达15%以上,且在推理路径上表现出更紧凑的循环结构,减少了20%的推理步骤和30%的Token消耗。
  • 在开放域任务SRDD和CommonGen-Hard中,方法实现了更优的生成质量和一致性,平均得分提升约10%,同时降低了模型调用次数,验证了动态调度的效率优势。
  • 策略经过多轮强化学习后,代理序列趋向于更有效的合作路径,表现出较强的适应性和可扩展性,尤其在多模型异质性环境中表现优异。

研究意义

本研究突破了静态组织结构的局限,提出动态调度机制,有效降低多智能体系统的协调成本,增强系统的适应性和扩展性。其在复杂推理任务中的优越表现,为未来大规模、多样化智能系统的设计提供了理论基础和实践路径,推动多智能体合作向更智能、更高效的方向发展。

技术贡献

引入以强化学习为核心的动态调度策略,创新性地将推理路径序列化与循环结构融合,显著提升多智能体系统的效率和效果。提出的调度框架支持多模型异质性,优化了推理路径的紧凑性和可解释性,为多智能体系统的组织提供了新范式。通过奖励机制平衡准确性与成本,推动系统自我优化,展现出强大的适应能力和可扩展性。

新颖性

首次提出基于强化学习的动态调度机制,结合路径序列化与循环推理结构,突破传统静态组织限制。该方法实现了多智能体系统的自我演化和优化,显著优于现有静态图结构和演化算法,开启了多智能体协作的新方向。

局限性

  • 当前方法依赖大量训练数据和多轮强化学习,训练成本较高,难以快速适应极端复杂任务。
  • 调度策略在极端异质环境中仍存在优化空间,某些场景下可能出现路径偏离最优的情况。
  • 模型规模和工具集的扩展可能带来额外的计算负担,未来需平衡效率与复杂性。

未来方向

未来将探索多模态、多任务环境中的调度策略自适应能力,结合元学习提升系统的泛化能力。同时,研究更高效的奖励机制和路径搜索算法,降低训练成本,增强系统在实际应用中的鲁棒性与可解释性。

AI 总览摘要

随着大规模语言模型(LLMs)在自然语言处理中的突破,单一模型在复杂任务中的局限性逐渐显现。传统多智能体系统(MAS)多依赖静态组织结构,导致协调成本高、效率低,难以应对任务复杂度和智能体数量的增长。本文提出一种以“puppeteer”为核心的动态调度框架,通过强化学习训练调度策略,实现对多代理的动态选择与排序。调度器根据任务状态,灵活激活不同模型与工具组成的代理,形成路径化的推理流程。实验结果显示,该方法在闭域和开域任务中均优于静态结构,准确率提升15%以上,Token消耗降低30%。此外,系统逐步演化出紧凑、循环的推理路径结构,显著提升系统效率和可解释性。这一创新机制不仅降低了多智能体系统的协调成本,也增强了其适应性和扩展性,为未来大规模、多样化智能系统的设计提供了新思路。尽管如此,训练成本和模型复杂度仍是挑战,未来将结合元学习和多模态信息,进一步优化调度策略,推动多智能体合作迈向更高水平。

深度分析

研究背景

近年来,随着GPT、LLaMA等大规模语言模型的崛起,单一模型在多任务、多领域表现出强大能力。然而,面对复杂推理、工具集成和多模态场景,单一模型难以满足需求。多智能体系统(MAS)作为一种解决方案,通过多模型协作实现更高效的推理与决策。早期工作如MacNet、EvoAgent采用静态拓扑结构,存在扩展性差、协调成本高的问题。近年来,研究逐渐关注动态调度与路径优化,试图突破静态组织的瓶颈。本论文在此基础上,提出以强化学习为核心的动态调度机制,支持路径序列化和循环推理,显著提升系统性能。

核心问题

传统多智能体系统多采用静态拓扑结构,缺乏动态调度能力,导致在任务复杂度增加时,协调成本上升,效率下降。静态结构难以适应多样化模型和工具的变化,容易出现冗余计算和路径偏离最优的问题。如何设计一个既能动态调度,又能自我演化的系统,成为解决多智能体协作瓶颈的关键。特别是在大规模、多模态、多任务环境中,静态组织难以满足效率和效果的双重需求,亟需一种具有自适应能力的调度策略。

核心创新

核心创新包括:1)引入强化学习训练的动态调度策略,支持实时路径优化;2)路径序列化机制,将复杂拓扑转化为有序推理路径,增强可控性;3)循环推理结构的演化,提升路径紧凑性和系统效率;4)奖励机制平衡准确性与成本,推动系统自我优化。这些创新突破了静态图结构的限制,实现多智能体系统的自我演化和高效协作,提升了系统的适应性和可扩展性。

方法详解

  • �� 构建多智能体空间:定义模型、推理策略和工具的组合形成代理。
  • �� 设计中央调度器:基于全局状态和任务描述,利用神经网络输出代理选择概率。
  • �� 序列化推理路径:通过拓扑遍历,将多代理合作转化为有序路径,支持路径优化。
  • �� 强化学习优化:采用REINFORCE算法,根据任务完成质量和计算成本调整调度策略。
  • �� 奖励设计:结合正确率和Token消耗,鼓励高效且准确的推理路径。
  • �� 逐步演化:系统在多轮训练中逐渐形成紧凑、循环的推理结构,提升整体性能。

实验设计

采用GSM-Hard、MMLU-Pro、SRDD和CommonGen-Hard等公开数据集,评估模型在数学推理、常识推理和生成质量上的表现。对比静态结构和演化调度,验证策略的有效性。参数设置包括模型规模(如LLaMA-3.1-8B、405B)、训练轮次、奖励系数等。通过 ablation 实验分析路径序列化和循环推理的贡献,验证强化学习调度的适应性。实验结果显示,调度策略在准确率、Token消耗和推理路径紧凑性方面均优于对比方法。

结果分析

在多项任务中,调度策略提升准确率达15%以上,Token消耗降低30%,推理路径更紧凑,路径长度缩短20%。系统逐步演化出环状和树状路径结构,增强推理效率。多模型异质环境中表现尤为优越,验证了调度策略的适应性。训练后,路径结构趋向于更简洁,系统在不同任务中均表现出良好的泛化能力。

应用场景

该方法适用于复杂推理、自动化决策、软件开发等场景。可结合多模态信息,实现智能问答、自动编程和协作式推理。对企业和科研机构具有重要价值,能显著提升系统效率和效果。未来可扩展至多任务、多模态、多智能体环境,推动智能系统的自主演化。

局限与展望

当前模型训练成本较高,调度策略依赖大量样本,泛化能力在极端异质环境中仍需验证。路径优化受限于搜索策略,可能出现局部最优。未来需降低训练成本,提升调度策略的鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象一个厨房里有很多厨师,每个厨师擅长不同的菜肴。一个总厨(“puppeteer”)负责安排他们做菜的顺序,根据每道菜的需要,灵活调度厨师。开始时,厨师们可能会重复做一些菜,但随着总厨学习,逐渐安排出最省时又好吃的流程。这样厨房效率变高,菜也更美味。这就像这个系统一样,中央调度器不断学习,优化每个代理的任务顺序,形成高效、循环的合作路径,最终做出更好的“菜”。

简单解释 像给14岁少年讲一样

想象你在学校里组织一个团队做项目。每个人都有不同的任务,比如写报告、画图、做演示。你是团队的“老板”,负责决定谁先做什么,谁后做。刚开始,你可能随意安排,但慢慢你发现,合理安排顺序可以节省时间,还能让每个人都发挥最大作用。这个系统就像你一样,中央“老板”不断学习,调整每个人的任务顺序,让整个团队合作得更顺畅、更快完成任务。它还能发现一些循环的合作方式,比如大家轮流检查对方的工作,确保质量。这种聪明的调度,让团队变得更高效,也更有趣。

原文摘要

Large language models (LLMs) have achieved remarkable results across diverse downstream tasks, but their monolithic nature restricts scalability and efficiency in complex problem-solving. While recent research explores multi-agent collaboration among LLMs, most approaches rely on static organizational structures that struggle to adapt as task complexity and agent numbers grow, resulting in coordination overhead and inefficiencies. To this end, we propose a puppeteer-style paradigm for LLM-based multi-agent collaboration, where a centralized orchestrator ("puppeteer") dynamically directs agents ("puppets") in response to evolving task states. This orchestrator is trained via reinforcement learning to adaptively sequence and prioritize agents, enabling flexible and evolvable collective reasoning. Experiments on closed- and open-domain scenarios show that this method achieves superior performance with reduced computational costs. Analyses further reveal that the key improvements consistently stem from the emergence of more compact, cyclic reasoning structures under the orchestrator's evolution. Our code is available at https://github.com/OpenBMB/ChatDev/tree/puppeteer.

cs.CL cs.AI cs.MA