Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO

TL;DR

提出M-GRPO,基于层级多智能体架构,优化异构轨迹,提升多任务推理性能。

cs.AI 🔴 高级 2025-11-17 37 次浏览
Haoyang Hong Jiajun Yin Yuan Wang Jingnan Liu Zhe Chen Ailing Yu Ji Li Zhiling Ye Hansong Xiao Yefei Chen Hualei Zhou Yun Yue Minghui Yang Chunxiao Guo Junwei Liu Peng Wei Jinjie Gu
多智能体 强化学习 层级架构 策略优化 工具增强

核心发现

方法论

本文提出基于Group Relative Policy Optimization (GRPO)的多智能体扩展M-GRPO,适用于垂直多智能体系统。该方法通过层级信用分配,计算主子智能体的相对优势,解决不同频率和异构轨迹对齐问题。引入轨迹对齐机制,确保批次大小一致,支持跨服务器去耦训练。训练流程采用分布式架构,主、子智能体在不同服务器上运行,利用共享存储交换统计信息,避免端到端梯度传递难题。核心算法包括优势估计、轨迹对齐和策略更新,结合特定奖励设计,优化多轮推理任务的表现。

关键结果

  • 在GAIA、XBench-DeepSearch和WebWalkerQA等真实场景基准上,M-GRPO在训练稳定性和样本效率方面优于单智能体GRPO和冻结子智能体的多智能体系统,性能提升达10%以上。实验显示,异构轨迹对齐显著改善了梯度信号,分布式训练架构实现了规模扩展,验证了方法在复杂推理任务中的有效性。
  • 通过消融实验,验证了联合训练比只训练主智能体效果更优,提升了平均任务成功率约8%。轨迹对齐机制减少了训练中的不稳定性,提升了样本利用率,增强了模型的泛化能力。
  • 在不同任务难度和数据分布下,M-GRPO表现出较强的鲁棒性和适应性,尤其在多轮推理和工具调用场景中,显著优于传统方法。

研究意义

该研究突破了多智能体训练中的异构轨迹对齐与分布式优化难题,为复杂推理和工具增强任务提供了新思路。通过层级架构和去耦训练,有效提升了多智能体系统的稳定性和样本效率,推动了多智能体自主学习的理论与实践发展。该方法适应多样化应用场景,具有广泛的产业潜力,特别是在自动化推理、知识检索和复杂任务协作中具有重要意义。

技术贡献

技术上,本文首次将GRPO扩展到多智能体层级架构,提出轨迹对齐方案解决异步调用带来的训练不稳定性。引入分布式训练流程,结合优势估计和策略剪裁,有效实现多智能体参数同步与优化。该方法在保证层级信用分配的同时,支持异构轨迹的批处理,极大提升了训练效率和模型性能,为多智能体强化学习提供了新范式。

新颖性

创新点在于将层级多智能体架构与群组相对优势估计结合,提出轨迹对齐机制解决异构轨迹不一致问题,首次实现跨服务器去耦训练。相较于传统单模型或参数共享方法,本文实现了角色专属的模型优化,显著改善了多任务多轮推理中的训练稳定性和效率。

局限性

  • 当前方法依赖预设的轨迹对齐目标d,可能在极端异构场景下表现不佳,需动态调整参数。
  • 训练过程中对共享存储的依赖增加了系统复杂性,存在潜在的同步瓶颈。
  • 模型规模和计算成本较大,实际部署时需权衡资源消耗与性能提升。

未来方向

未来将探索自适应轨迹对齐策略,提升异构轨迹处理能力。结合元学习优化参数初始化,增强模型泛化。扩展多智能体架构到更复杂的任务环境,结合自监督和无监督信号,进一步提升训练效率和效果。

AI 总览摘要

多智能体系统在复杂推理任务中展现出巨大潜力,但训练中的异构轨迹对齐和分布式优化难题限制了其发展。本文提出的M-GRPO方法,基于层级多智能体架构,创新性地引入轨迹对齐机制,有效解决了不同频率和异构轨迹带来的训练不稳定性。通过在GAIA、XBench-DeepSearch和WebWalkerQA等真实场景中的实验,验证了该方法在提升模型稳定性、样本效率和任务成功率方面的优势。

该方法结合优势估计、策略剪裁和分布式训练流程,实现了多智能体参数的高效同步与优化。实验结果显示,联合训练显著优于只训练主智能体的方案,提升了整体性能和泛化能力。这一突破为多智能体自主学习提供了新范式,推动了自动推理、知识检索和多轮交互等应用的发展。

未来,研究将聚焦于动态轨迹对齐策略、自适应参数调节,以及更复杂场景的扩展,旨在实现更高效、更鲁棒的多智能体系统,为智能系统的自主学习和协作开辟新路径。

深度解读

原文摘要

Multi-agent systems perform well on general reasoning tasks. However, the lack of training in specialized areas hinders their accuracy. Current training methods train a unified large language model (LLM) for all agents in the system. This may limit the performances due to different distributions underlying for different agents. Therefore, training multi-agent systems with distinct LLMs should be the next step to solve. However, this approach introduces optimization challenges. For example, agents operate at different frequencies, rollouts involve varying sub-agent invocations, and agents are often deployed across separate servers, disrupting end-to-end gradient flow. To address these issues, we propose M-GRPO, a hierarchical extension of Group Relative Policy Optimization designed for vertical Multi-agent systems with a main agent (planner) and multiple sub-agents (multi-turn tool executors). M-GRPO computes group-relative advantages for both main and sub-agents, maintaining hierarchical credit assignment. It also introduces a trajectory-alignment scheme that generates fixed-size batches despite variable sub-agent invocations. We deploy a decoupled training pipeline in which agents run on separate servers and exchange minimal statistics via a shared store. This enables scalable training without cross-server backpropagation. In experiments on real-world benchmarks (e.g., GAIA, XBench-DeepSearch, and WebWalkerQA), M-GRPO consistently outperforms both single-agent GRPO and multi-agent GRPO with frozen sub-agents, demonstrating improved stability and sample efficiency. These results show that aligning heterogeneous trajectories and decoupling optimization across specialized agents enhances tool-augmented reasoning tasks.

cs.AI