MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation

TL;DR

提出MAO-ARAG多智能体自适应RAG框架,结合强化学习优化流程,提升问答性能。

cs.CL 🔴 高级 2025-08-02 65 次浏览
Yiqun Chen Erhan Zhang Lingyong Yan Shuaiqiang Wang Jizhou Huang Dawei Yin Jiaxin Mao
多智能体 检索增强生成 强化学习 问答系统 自适应流程

核心发现

方法论

该方法将问答任务建模为多智能体半马尔可夫决策过程(MSMDP),由规划器和多个执行器组成。规划器利用PPO算法,根据F1分数和成本惩罚动态选择和组合执行器(如查询重写、文档筛选、生成模块),形成个性化工作流程。通过强化学习不断优化策略,实现高质量答案与成本控制的平衡。核心算法包括Proximal Policy Optimization(PPO)和奖励函数设计,结合格式惩罚和成本惩罚,确保流程可执行且成本合理。

关键结果

  • 在多个QA数据集上,MAO-ARAG平均F1得分达52.91,比最优基线Search-o1高3.08,表现优异。即使未训练的版本也能有效组织流程,表现优于传统固定流程方法。
  • 引入强化学习后,模型在保持较低成本(如Token成本和调用次数)同时,显著提升答案准确率,达到了成本与性能的最佳折中。
  • 调节超参数α可在成本与效果间实现平衡,实验证明合理设置能在保证高性能的同时降低资源消耗。

研究意义

该研究突破了传统固定流程的局限,提出动态规划机制,显著提升多样化问答场景中的表现,为智能问答系统的个性化和高效化提供新思路。其多智能体协作和强化学习优化策略,为未来大规模、多任务、多场景的知识系统设计奠定基础,推动智能系统向更智能、更节能方向发展。

技术贡献

创新点在于将RAG系统建模为多智能体半马尔可夫决策过程(MSMDP),引入规划器-执行器架构,实现流程的动态自适应。采用PPO算法训练规划器,结合多目标奖励(答案质量与成本控制),实现流程的最优配置。该方法区别于传统单一流程或静态策略,提供了可训练、可扩展的多场景适应能力,增强了系统的灵活性和效率。

新颖性

首次将多智能体强化学习引入RAG流程调度,提出基于MSMDP的模型,结合成本与效果的多目标优化,突破了现有固定或手工设计流程的限制,开创了自适应、多任务问答系统的新范式。

局限性

  • 模型对训练数据依赖较大,泛化能力在极端复杂或新颖问题上仍有限,需进一步扩展多样性训练集。
  • 强化学习训练过程计算成本较高,尤其在大规模场景中,效率有待优化。
  • 当前架构主要适用于结构化问答,面对非结构化或开放式任务时表现尚待验证。

未来方向

未来将探索多智能体协作机制的更深层次优化,结合元学习提升模型泛化能力。同时,考虑引入多模态信息和知识图谱,丰富流程调度的决策依据,推动系统在更复杂环境中的应用。此外,优化训练效率和模型压缩,以实现更广泛的工业部署。

AI 总览摘要

在问答系统中,如何高效、准确地应对多样化的问题一直是研究难点。传统的检索增强生成(RAG)方法,虽然在提升答案质量方面取得了显著进展,但其固定的流程设计难以兼顾不同问题的复杂度与成本。为解决这一瓶颈,本文提出了一种名为MAO-ARAG的多智能体自适应RAG框架。该框架将问答任务建模为多智能体半马尔可夫决策过程(MSMDP),由规划器和多个执行器组成。规划器利用强化学习中的PPO算法,根据答案的F1分数和成本惩罚,动态选择和组合不同的模块(如查询重写、文档筛选、答案生成),形成个性化的工作流程。实验结果显示,MAO-ARAG在多个公开QA数据集上均优于传统固定流程方法,平均F1得分提升3.08点,且在成本控制方面表现优异。该方法不仅提升了问答的准确性,还实现了成本与性能的良好平衡,为未来智能问答系统的个性化和高效化提供了新思路。未来工作将聚焦于多智能体协作机制的优化、多模态信息融合以及模型训练效率的提升,推动系统在更复杂、多样化场景中的应用落地。

深度分析

研究背景

近年来,随着大规模预训练语言模型(如GPT、BERT)的崛起,问答系统在信息检索和自然语言理解方面取得巨大突破。检索增强生成(RAG)作为结合外部知识库与生成模型的有效架构,已成为提升问答准确率的重要手段。早期工作如BM25、Contriever、ColBERT等在信息检索方面表现优异,随后引入查询重写、文档筛选等模块,逐步丰富流程架构。然而,现有方法多采用固定流程设计,难以适应问题复杂度的变化,导致成本与效果难以兼顾。近年来,强化学习在流程优化中的应用逐渐兴起,为动态调度提供可能,但在多模块、多场景的问答系统中仍存在挑战。

核心问题

当前的RAG系统多采用静态流程,难以根据不同问题的复杂度和信息需求动态调整模块组合。这导致在简单问题上资源浪费,而在复杂问题上效果不足。此外,成本控制与答案质量之间的平衡难以实现,尤其是在大规模应用场景中,系统的响应时间和资源消耗成为瓶颈。如何设计一个具有自适应能力、能根据问题特性动态调度模块的系统,成为亟待解决的核心问题。该问题的难点在于流程的多样性、优化的多目标性以及训练的复杂性。

核心创新

本研究提出了基于多智能体半马尔可夫决策过程(MSMDP)的自适应RAG框架,创新点包括:

1) 引入规划器-执行器架构,动态调度不同模块以适应不同问题需求;

2) 利用PPO强化学习算法,结合答案质量(F1分数)和成本惩罚,优化流程策略;

3) 设计多目标奖励函数,实现高效平衡性能与成本。这一架构区别于传统固定流程,提供了可训练、可扩展的解决方案,显著提升系统的灵活性和适应性。

方法详解

  • �� 将问答流程建模为多智能体半马尔可夫决策过程(MSMDP),定义状态空间、动作空间(不同模块组合)、转移概率和奖励函数。
  • �� 规划器利用PPO算法,根据当前问题(或子问题)生成工作流程,选择合适的模块(如QDS、QDP、QR、DS、RA、AG、AS)。
  • �� 奖励函数由答案F1分数、成本惩罚(Token成本、延迟、调用次数)和格式惩罚组成,确保流程可行且成本合理。
  • �� 训练过程中,利用多轮交互不断优化策略,平衡答案质量与资源消耗。
  • �� 最终,模型实现了根据问题特性自适应调度流程,提升整体问答性能。

实验设计

在多个公开QA数据集(如NQ、PopQA、HotpotQA)上验证方法效果,采用Wikipedia作为知识库,使用E5进行检索。模型以Qwen2.5-7B-Instruct作为规划器,GPT-4o-Mini作为执行器。评估指标包括F1分数、Token成本、调用次数和流程轮数。对比多种基线(如固定流程、单轮RAG、迭代RAG、基于RL的流程优化),结果显示MAO-ARAG在大部分任务中显著优于对比方法,平均F1提升3.08点,成本控制优异。

结果分析

实验表明,经过强化学习训练的MAO-ARAG在多项问答任务中表现优异,F1得分高于传统固定流程方法,且在成本方面表现优越。调节超参数α可以在性能和成本之间实现平衡,验证了方法的灵活性。未训练版本也能有效组织流程,显示出模型的鲁棒性。整体来看,该方法在多场景、多任务问答中具有广泛适用性,为未来智能问答系统提供了新范式。

应用场景

该框架适用于企业智能客服、学术问答、知识库检索等场景,能根据问题复杂度动态调度模块,提升响应速度和准确性。未来,结合多模态信息和知识图谱,将进一步扩展其应用范围,实现更智能、更高效的知识服务。

局限与展望

模型对训练数据依赖较大,泛化能力在极端复杂或新颖问题上仍有限。强化学习训练成本较高,需大量资源。此外,当前架构主要适用于结构化问答,面对非结构化或开放式任务时表现尚待验证。未来需优化训练效率和模型泛化能力,拓展应用场景。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。不同的菜需要不同的步骤,有时候你只需要快手菜,有时候要做复杂的菜。传统的方法就像用同一种菜谱做所有菜,不管菜难不难,既浪费时间又不够好吃。现在,新的方法像是有一个聪明的厨师(规划器),根据每道菜的难度,选择不同的厨师(模块)合作:有的负责切菜,有的负责调味,有的负责摆盘。这个厨师会不断学习,知道什么时候用快手方法,什么时候用复杂方法。这样,既保证菜好吃,又节省时间和材料。这个系统就像厨房里的智能团队,能根据不同的需求灵活调度,做出最合适的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的作业。有些很简单,只需要用平时学到的知识就能搞定;有些很难,需要查资料、思考、写很多东西。以前老师给你一套固定的做作业的方法,不管作业难不难,都用一样的流程。现在,有个聪明的帮手(规划器),它会根据每个作业的难度和内容,安排不同的帮手(模块)合作:有的帮你查资料,有的帮你写草稿,有的帮你检查。这个帮手会不断学习,知道什么时候用快的方法,什么时候用细心的方法。这样,你的作业既能做得快,又能做好。就像有个聪明的团队,能根据任务的不同,灵活安排工作流程,帮你高效完成各种作业。

术语表

MSMDP (多智能体半马尔可夫决策过程)

一种模型,用于描述多个智能体协作完成任务的决策过程,考虑动作持续时间和多智能体协调。

将问答流程建模为多智能体系统,优化流程调度。

PPO (近端策略优化)

一种强化学习算法,通过限制策略变化范围稳定训练,适合连续空间策略优化。

用于训练问答流程中的规划器,提升调度策略。

F1分数

衡量模型准确率的指标,结合精确率和召回率,适合评估问答答案的质量。

作为奖励函数的核心指标,用于优化问答系统性能。

检索增强生成 (RAG)

结合信息检索和生成模型的架构,用于提升问答的准确性和信息覆盖。

本文的基础架构,结合外部知识库实现动态问答。

强化学习

一种机器学习方法,通过与环境交互学习最优策略,最大化累计奖励。

用于训练流程调度器,实现动态流程优化。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或新颖问题中保持高性能仍是挑战,模型泛化能力不足,需探索更强的迁移学习和多任务训练策略。
  • 2 当前方法主要在结构化问答场景验证,面对开放式或非结构化任务时效果未知,未来需扩展适应性。

应用场景

近期应用

智能客服系统

根据用户提问的复杂度,动态调度不同模块,提升响应速度和准确率,降低运营成本。

学术问答平台

结合多模态信息和知识图谱,实现个性化、精确的学术信息检索与解答。

远期愿景

全自动知识管理系统

实现企业或机构的知识库智能调度与维护,支持多场景、多语言、多任务的知识服务。

原文摘要

In question-answering (QA) systems, Retrieval-Augmented Generation (RAG) has become pivotal in enhancing response accuracy and reducing hallucination issues. The architecture of RAG systems varies significantly, encompassing single-round RAG, iterative RAG, and reasoning RAG, each tailored to address different types of queries. Due to the varying complexity of real-world queries, a fixed RAG pipeline often struggles to balance performance and cost efficiency across different queries. To address this challenge, we propose an adaptive RAG framework called MAO-ARAG, which leverages multi-agent orchestration. Our adaptive RAG is conceived as a multi-turn framework. Specifically, we define multiple executor agents, representing typical RAG modules such as query reformulation agents, document selection agent, and generation agents. A planner agent intelligently selects and integrates the appropriate agents from these executors into a suitable workflow tailored for each query, striving for high-quality answers while maintaining reasonable costs. During each turn, the planner agent is trained using reinforcement learning, guided by an outcome-based reward (F1 score) and a cost-based penalty, continuously improving answer quality while keeping costs within a reasonable range. Experiments conducted on multiple QA datasets demonstrate that our approach, which dynamically plans workflows for each query, not only achieves high answer quality but also maintains both cost and latency within acceptable limits.The code of MAO-ARAG is on https://github.com/chenyiqun/Agentic-RAG.

cs.CL cs.IR