核心发现
方法论
本文采用渐进式监督微调(SFT)和强化学习(RL)相结合的方法,训练小语言模型进行代理选择和参数生成。首先通过SFT学习查询特征,然后通过RL根据检索结果质量进行选择优化。使用分层奖励函数,结合查询-代理主题对齐和检索相关性,提升模型的选择能力。
关键结果
- 在代理-查询不匹配的子集上,训练模型的NDCG@10达到0.918,而基于意图的两种LLM基线(Amazon Nova Lite和Claude Haiku 4.5)分别为0.539和0.490。
- 整体NDCG@10为0.771,比Nova Lite高0.177,比Haiku高0.219,选择延迟平均为120.1ms,比Nova Lite减少82.4%。
- 实验表明,RL训练的路由器能够识别意图路由无法检测的代理-查询不匹配。
研究意义
该研究通过结合SFT和RL,显著提升了多代理检索系统的选择准确性和效率。其结果表明,基于检索质量信号的代理选择能够超越传统意图路由方法,解决了长期存在的代理选择问题,具有重要的学术和工业应用价值。
技术贡献
技术贡献包括:1) 提出了一种结合SFT和RL的代理选择新方法;2) 通过分层奖励函数实现了基于检索质量的选择优化;3) 在小语言模型上实现了高效的代理选择,显著降低了选择延迟和计算成本。
新颖性
本文首次将检索质量信号引入代理选择,通过RL优化选择决策,而非仅依赖查询意图。这种方法在代理选择领域具有创新性,超越了现有的意图路由方法。
局限性
- 模型在处理极端短查询时可能表现不佳,因为缺乏足够的上下文信息。
- 需要大量标注数据进行初始SFT训练,数据获取成本较高。
未来方向
未来工作可以探索更复杂的奖励函数设计,进一步提高选择精度。此外,研究如何在更大规模的代理池中应用该方法也是一个重要方向。
AI 总览摘要
本文提出了一种结合渐进式监督微调(SFT)和强化学习(RL)的新方法,用于多代理检索系统中的代理选择。传统的意图路由方法仅依赖于查询主题,无法检测到代理-查询不匹配的问题。通过引入检索结果质量信号,本文的方法显著提升了选择准确性。
在实验中,训练模型在代理-查询不匹配的子集上实现了NDCG@10为0.918,显著优于基于意图的LLM基线。整体NDCG@10为0.771,选择延迟平均为120.1ms,较Nova Lite减少82.4%。
该研究不仅在学术上具有重要意义,还为工业应用提供了高效的解决方案。未来工作将继续优化奖励函数设计,并探索在更大规模代理池中的应用。
深度分析
研究背景
随着AI系统越来越依赖于专用检索代理来回答复杂查询,选择最合适的代理成为决定检索质量的关键因素。传统的意图路由方法无法检测到代理-查询不匹配的问题,导致检索结果质量下降。
核心问题
核心问题在于如何在多代理环境中选择最合适的代理,以确保高质量的检索结果。现有方法仅依赖于查询意图,无法利用检索结果的质量信号。
核心创新
本文的创新在于:1) 结合SFT和RL进行代理选择;2) 使用分层奖励函数优化选择决策;3) 在小语言模型上实现高效的代理选择。
方法详解
- �� 使用SFT学习查询特征,提供选择基础
- �� 通过RL优化选择决策,利用检索质量信号
- �� 使用分层奖励函数结合查询-代理主题对齐和检索相关性
实验设计
实验设计包括使用多个基线模型进行对比,评估NDCG@10和选择延迟等指标。实验数据来自真实查询日志,涵盖多个领域。
结果分析
实验结果表明,训练模型在代理-查询不匹配的子集上表现优异,NDCG@10达到0.918,整体NDCG@10为0.771,选择延迟显著降低。
应用场景
该方法可用于需要高效代理选择的多领域检索系统,特别是在需要快速响应的实时应用中。
局限与展望
模型在处理极端短查询时可能表现不佳,且需要大量标注数据进行初始训练。未来工作将优化奖励函数设计,并探索更大规模应用。
通俗解读 非专业人士也能看懂
想象你在一个图书馆里,有很多不同的书架,每个书架上都有不同主题的书。你需要找一本关于生物医学的书,但有些书架上的书虽然主题相关,但内容并不适合你。我们的模型就像一个聪明的图书管理员,它不仅根据书的主题选择书架,还会根据书的内容质量来决定是否推荐给你。通过这种方式,它能更好地帮助你找到最合适的书。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,需要选择不同的角色来完成任务。每个角色都有自己的特长,但有时你选的角色并不适合当前任务。我们的模型就像一个超级聪明的游戏助手,它不仅根据任务类型选择角色,还会根据角色的实际表现来调整选择。这样,你就能更快更好地完成任务!
术语表
小语言模型 (Small Language Model)
一种参数较少的语言模型,适用于低延迟和低成本的应用场景。
用于代理选择时,提供更快的响应速度。
强化学习 (Reinforcement Learning)
一种通过奖励信号来优化模型决策的机器学习方法。
用于优化代理选择决策,提升检索结果质量。
监督微调 (Supervised Fine-Tuning)
在标注数据上进一步训练模型,以提高其在特定任务上的表现。
为代理选择提供初始的选择基础。
NDCG@10
一种评估检索结果质量的指标,考虑结果的相关性和排序。
用于评估模型在代理选择上的表现。
分层奖励函数 (Hierarchical Reward Function)
一种结合多个信号的奖励函数,用于优化模型决策。
用于结合查询意图和检索结果质量进行代理选择。
开放问题 这项研究留下的未解疑问
- 1 如何在更大规模的代理池中应用该方法,仍需进一步研究。
- 2 奖励函数设计的复杂性可能影响模型的训练效率。
应用场景
近期应用
实时检索系统
可用于需要快速响应的多领域检索系统,提高检索结果的相关性和效率。
远期愿景
智能信息检索
通过不断优化代理选择,推动智能信息检索技术的发展,提升用户体验。
原文摘要
Specialised retrieval agents typically surface higher quality results than general-purpose search, but selecting the optimal agent for a given query remains an open problem. Current approaches route queries based on inferred topic or intent, however intent-based selection is fundamentally limited: it does not incorporate signal from retrieved content, and cannot detect when a topically aligned agent produces low-relevance results. We address this by training a small language model via supervised fine-tuning followed by reinforcement learning to jointly perform agent selection and structured parameter generation for downstream tool calls, using a hierarchical reward function grounded in retrieval relevance along with query-agent topic alignment. This enables the model to learn task-dependent agent suitability from retrieval performance: which agents reliably yield high-relevance results for which query distributions, and when to redirect queries away from specialised agents despite surface-level topical overlap. On a targeted subset of such agent-query mismatches, the trained model achieves an NDCG@10 of 0.918 compared to 0.539 and 0.490 for two LLM baselines (Amazon Nova Lite and Claude Haiku 4.5) that route on intent alone. Overall, it achieves a mean NDCG@10 of 0.771 (+0.177 over Nova Lite, +0.219 over Haiku) with a mean selection latency of 120.1ms, an 82.4% reduction over Nova Lite.