Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO
提出M-GRPO,基于层级多智能体架构,优化异构轨迹,提升多任务推理性能。
核心发现
方法论
本文提出基于Group Relative Policy Optimization (GRPO)的多智能体扩展M-GRPO,适用于垂直多智能体系统。该方法通过层级信用分配,计算主子智能体的相对优势,解决不同频率和异构轨迹对齐问题。引入轨迹对齐机制,确保批次大小一致,支持跨服务器去耦训练。训练流程采用分布式架构,主、子智能体在不同服务器上运行,利用共享存储交换统计信息,避免端到端梯度传递难题。核心算法包括优势估计、轨迹对齐和策略更新,结合特定奖励设计,优化多轮推理任务的表现。
关键结果
- 在GAIA、XBench-DeepSearch和WebWalkerQA等真实场景基准上,M-GRPO在训练稳定性和样本效率方面优于单智能体GRPO和冻结子智能体的多智能体系统,性能提升达10%以上。实验显示,异构轨迹对齐显著改善了梯度信号,分布式训练架构实现了规模扩展,验证了方法在复杂推理任务中的有效性。
- 通过消融实验,验证了联合训练比只训练主智能体效果更优,提升了平均任务成功率约8%。轨迹对齐机制减少了训练中的不稳定性,提升了样本利用率,增强了模型的泛化能力。
- 在不同任务难度和数据分布下,M-GRPO表现出较强的鲁棒性和适应性,尤其在多轮推理和工具调用场景中,显著优于传统方法。
研究意义
该研究突破了多智能体训练中的异构轨迹对齐与分布式优化难题,为复杂推理和工具增强任务提供了新思路。通过层级架构和去耦训练,有效提升了多智能体系统的稳定性和样本效率,推动了多智能体自主学习的理论与实践发展。该方法适应多样化应用场景,具有广泛的产业潜力,特别是在自动化推理、知识检索和复杂任务协作中具有重要意义。
技术贡献
技术上,本文首次将GRPO扩展到多智能体层级架构,提出轨迹对齐方案解决异步调用带来的训练不稳定性。引入分布式训练流程,结合优势估计和策略剪裁,有效实现多智能体参数同步与优化。该方法在保证层级信用分配的同时,支持异构轨迹的批处理,极大提升了训练效率和模型性能,为多智能体强化学习提供了新范式。
新颖性
创新点在于将层级多智能体架构与群组相对优势估计结合,提出轨迹对齐机制解决异构轨迹不一致问题,首次实现跨服务器去耦训练。相较于传统单模型或参数共享方法,本文实现了角色专属的模型优化,显著改善了多任务多轮推理中的训练稳定性和效率。
局限性
- 当前方法依赖预设的轨迹对齐目标d,可能在极端异构场景下表现不佳,需动态调整参数。
- 训练过程中对共享存储的依赖增加了系统复杂性,存在潜在的同步瓶颈。
- 模型规模和计算成本较大,实际部署时需权衡资源消耗与性能提升。
未来方向
未来将探索自适应轨迹对齐策略,提升异构轨迹处理能力。结合元学习优化参数初始化,增强模型泛化。扩展多智能体架构到更复杂的任务环境,结合自监督和无监督信号,进一步提升训练效率和效果。
AI 总览摘要
多智能体系统在复杂推理任务中展现出巨大潜力,但训练中的异构轨迹对齐和分布式优化难题限制了其发展。本文提出的M-GRPO方法,基于层级多智能体架构,创新性地引入轨迹对齐机制,有效解决了不同频率和异构轨迹带来的训练不稳定性。通过在GAIA、XBench-DeepSearch和WebWalkerQA等真实场景中的实验,验证了该方法在提升模型稳定性、样本效率和任务成功率方面的优势。
该方法结合优势估计、策略剪裁和分布式训练流程,实现了多智能体参数的高效同步与优化。实验结果显示,联合训练显著优于只训练主智能体的方案,提升了整体性能和泛化能力。这一突破为多智能体自主学习提供了新范式,推动了自动推理、知识检索和多轮交互等应用的发展。
未来,研究将聚焦于动态轨迹对齐策略、自适应参数调节,以及更复杂场景的扩展,旨在实现更高效、更鲁棒的多智能体系统,为智能系统的自主学习和协作开辟新路径。
深度解读
原文摘要
Multi-agent systems perform well on general reasoning tasks. However, the lack of training in specialized areas hinders their accuracy. Current training methods train a unified large language model (LLM) for all agents in the system. This may limit the performances due to different distributions underlying for different agents. Therefore, training multi-agent systems with distinct LLMs should be the next step to solve. However, this approach introduces optimization challenges. For example, agents operate at different frequencies, rollouts involve varying sub-agent invocations, and agents are often deployed across separate servers, disrupting end-to-end gradient flow. To address these issues, we propose M-GRPO, a hierarchical extension of Group Relative Policy Optimization designed for vertical Multi-agent systems with a main agent (planner) and multiple sub-agents (multi-turn tool executors). M-GRPO computes group-relative advantages for both main and sub-agents, maintaining hierarchical credit assignment. It also introduces a trajectory-alignment scheme that generates fixed-size batches despite variable sub-agent invocations. We deploy a decoupled training pipeline in which agents run on separate servers and exchange minimal statistics via a shared store. This enables scalable training without cross-server backpropagation. In experiments on real-world benchmarks (e.g., GAIA, XBench-DeepSearch, and WebWalkerQA), M-GRPO consistently outperforms both single-agent GRPO and multi-agent GRPO with frozen sub-agents, demonstrating improved stability and sample efficiency. These results show that aligning heterogeneous trajectories and decoupling optimization across specialized agents enhances tool-augmented reasoning tasks.