SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach

TL;DR

通过渐进式SFT和强化学习训练小语言模型,提升多代理检索的相关性,NDCG@10达0.918。

cs.CL 🔴 高级 2026-07-15 3 次浏览
Gayathri V Kondapalli Alexander Ng Hirsh Pithadia Rahul Monish Harvey Yorke Amir Kayhani
多代理检索 查询路由 强化学习 小语言模型 渐进训练

核心发现

方法论

本文采用渐进式监督微调(SFT)和强化学习(RL)相结合的方法,训练小语言模型进行代理选择和参数生成。首先通过SFT学习查询特征,然后通过RL根据检索结果质量进行选择优化。使用分层奖励函数,结合查询-代理主题对齐和检索相关性,提升模型的选择能力。

关键结果

  • 在代理-查询不匹配的子集上,训练模型的NDCG@10达到0.918,而基于意图的两种LLM基线(Amazon Nova Lite和Claude Haiku 4.5)分别为0.539和0.490。
  • 整体NDCG@10为0.771,比Nova Lite高0.177,比Haiku高0.219,选择延迟平均为120.1ms,比Nova Lite减少82.4%。
  • 实验表明,RL训练的路由器能够识别意图路由无法检测的代理-查询不匹配。

研究意义

该研究通过结合SFT和RL,显著提升了多代理检索系统的选择准确性和效率。其结果表明,基于检索质量信号的代理选择能够超越传统意图路由方法,解决了长期存在的代理选择问题,具有重要的学术和工业应用价值。

技术贡献

技术贡献包括:1) 提出了一种结合SFT和RL的代理选择新方法;2) 通过分层奖励函数实现了基于检索质量的选择优化;3) 在小语言模型上实现了高效的代理选择,显著降低了选择延迟和计算成本。

新颖性

本文首次将检索质量信号引入代理选择,通过RL优化选择决策,而非仅依赖查询意图。这种方法在代理选择领域具有创新性,超越了现有的意图路由方法。

局限性

  • 模型在处理极端短查询时可能表现不佳,因为缺乏足够的上下文信息。
  • 需要大量标注数据进行初始SFT训练,数据获取成本较高。

未来方向

未来工作可以探索更复杂的奖励函数设计,进一步提高选择精度。此外,研究如何在更大规模的代理池中应用该方法也是一个重要方向。

AI 总览摘要

本文提出了一种结合渐进式监督微调(SFT)和强化学习(RL)的新方法,用于多代理检索系统中的代理选择。传统的意图路由方法仅依赖于查询主题,无法检测到代理-查询不匹配的问题。通过引入检索结果质量信号,本文的方法显著提升了选择准确性。

在实验中,训练模型在代理-查询不匹配的子集上实现了NDCG@10为0.918,显著优于基于意图的LLM基线。整体NDCG@10为0.771,选择延迟平均为120.1ms,较Nova Lite减少82.4%。

该研究不仅在学术上具有重要意义,还为工业应用提供了高效的解决方案。未来工作将继续优化奖励函数设计,并探索在更大规模代理池中的应用。

深度分析

研究背景

随着AI系统越来越依赖于专用检索代理来回答复杂查询,选择最合适的代理成为决定检索质量的关键因素。传统的意图路由方法无法检测到代理-查询不匹配的问题,导致检索结果质量下降。

核心问题

核心问题在于如何在多代理环境中选择最合适的代理,以确保高质量的检索结果。现有方法仅依赖于查询意图,无法利用检索结果的质量信号。

核心创新

本文的创新在于:1) 结合SFT和RL进行代理选择;2) 使用分层奖励函数优化选择决策;3) 在小语言模型上实现高效的代理选择。

方法详解

  • �� 使用SFT学习查询特征,提供选择基础
  • �� 通过RL优化选择决策,利用检索质量信号
  • �� 使用分层奖励函数结合查询-代理主题对齐和检索相关性

实验设计

实验设计包括使用多个基线模型进行对比,评估NDCG@10和选择延迟等指标。实验数据来自真实查询日志,涵盖多个领域。

结果分析

实验结果表明,训练模型在代理-查询不匹配的子集上表现优异,NDCG@10达到0.918,整体NDCG@10为0.771,选择延迟显著降低。

应用场景

该方法可用于需要高效代理选择的多领域检索系统,特别是在需要快速响应的实时应用中。

局限与展望

模型在处理极端短查询时可能表现不佳,且需要大量标注数据进行初始训练。未来工作将优化奖励函数设计,并探索更大规模应用。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里,有很多不同的书架,每个书架上都有不同主题的书。你需要找一本关于生物医学的书,但有些书架上的书虽然主题相关,但内容并不适合你。我们的模型就像一个聪明的图书管理员,它不仅根据书的主题选择书架,还会根据书的内容质量来决定是否推荐给你。通过这种方式,它能更好地帮助你找到最合适的书。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要选择不同的角色来完成任务。每个角色都有自己的特长,但有时你选的角色并不适合当前任务。我们的模型就像一个超级聪明的游戏助手,它不仅根据任务类型选择角色,还会根据角色的实际表现来调整选择。这样,你就能更快更好地完成任务!

术语表

小语言模型 (Small Language Model)

一种参数较少的语言模型,适用于低延迟和低成本的应用场景。

用于代理选择时,提供更快的响应速度。

强化学习 (Reinforcement Learning)

一种通过奖励信号来优化模型决策的机器学习方法。

用于优化代理选择决策,提升检索结果质量。

监督微调 (Supervised Fine-Tuning)

在标注数据上进一步训练模型,以提高其在特定任务上的表现。

为代理选择提供初始的选择基础。

NDCG@10

一种评估检索结果质量的指标,考虑结果的相关性和排序。

用于评估模型在代理选择上的表现。

分层奖励函数 (Hierarchical Reward Function)

一种结合多个信号的奖励函数,用于优化模型决策。

用于结合查询意图和检索结果质量进行代理选择。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的代理池中应用该方法,仍需进一步研究。
  • 2 奖励函数设计的复杂性可能影响模型的训练效率。

应用场景

近期应用

实时检索系统

可用于需要快速响应的多领域检索系统,提高检索结果的相关性和效率。

远期愿景

智能信息检索

通过不断优化代理选择,推动智能信息检索技术的发展,提升用户体验。

原文摘要

Specialised retrieval agents typically surface higher quality results than general-purpose search, but selecting the optimal agent for a given query remains an open problem. Current approaches route queries based on inferred topic or intent, however intent-based selection is fundamentally limited: it does not incorporate signal from retrieved content, and cannot detect when a topically aligned agent produces low-relevance results. We address this by training a small language model via supervised fine-tuning followed by reinforcement learning to jointly perform agent selection and structured parameter generation for downstream tool calls, using a hierarchical reward function grounded in retrieval relevance along with query-agent topic alignment. This enables the model to learn task-dependent agent suitability from retrieval performance: which agents reliably yield high-relevance results for which query distributions, and when to redirect queries away from specialised agents despite surface-level topical overlap. On a targeted subset of such agent-query mismatches, the trained model achieves an NDCG@10 of 0.918 compared to 0.539 and 0.490 for two LLM baselines (Amazon Nova Lite and Claude Haiku 4.5) that route on intent alone. Overall, it achieves a mean NDCG@10 of 0.771 (+0.177 over Nova Lite, +0.219 over Haiku) with a mean selection latency of 120.1ms, an 82.4% reduction over Nova Lite.

cs.CL cs.AI