Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching

TL;DR

DecoR通过查询分解与历史匹配优化LLM路由,提升准确率并降低推理成本。

cs.AI 🔴 高级 2026-05-25 29 次浏览
Bo Lv Jingbo Sun
大语言模型 路由优化 查询分解 历史匹配 泛化能力

核心发现

方法论

提出DecoR框架,将路由任务转化为基于能力分解的历史匹配过程。包括查询分解阶段、分层筛选阶段和经验决策阶段,显著提升泛化能力。

关键结果

  • 在ID任务中,DecoR的准确率达95.59%,推理成本仅为1.4倍,显著优于其他路由方法。
  • 在OOD任务中,DecoR表现稳定,准确率仅下降3%,而其他方法下降幅度更大。
  • 消融实验表明,查询分解阶段对性能提升贡献最大,缺失该阶段导致准确率下降达2.1倍。

研究意义

该研究解决了现有路由方法在OOD场景下泛化能力差的问题,为动态模型选择提供了新的思路,减少了高性能模型的冗余使用。

技术贡献

提出基于能力分解的路由框架,避免了传统方法的记忆陷阱;引入CodaSet基准测试,全面评估路由系统的泛化能力。

新颖性

首次将查询分解与历史匹配结合用于LLM路由,显著提升了泛化能力并降低了推理成本,与现有方法形成显著差异。

局限性

  • 对历史日志的依赖较高,若日志不足可能影响性能。
  • 在极端复杂任务中,可能需要更高性能的模型支持。

未来方向

未来可探索更高效的日志筛选算法,以及在动态模型池中的应用扩展。

AI 总览摘要

现有的大语言模型路由方法在处理分布外数据时常表现不佳,且推理成本高昂。为解决这一问题,本文提出了DecoR框架,通过查询分解与历史匹配优化路由决策,显著提升了泛化能力和效率。

DecoR框架包括三个阶段:查询分解阶段将用户查询转化为能力需求;分层筛选阶段通过匹配历史日志筛选最相关的记录;经验决策阶段综合性能与成本选择最优模型。实验表明,DecoR在多个基准测试中均表现优异,显著优于现有方法。

该研究不仅提出了新的路由方法,还开发了CodaSet基准测试,为评估路由系统的泛化能力提供了标准。未来工作可进一步优化筛选算法,并探索动态模型池中的应用。

深度分析

研究背景

随着大语言模型的广泛应用,模型路由成为优化性能与成本的重要手段。然而,现有方法多依赖于查询与模型的直接映射,易陷入记忆陷阱,导致泛化能力差。

核心问题

核心问题在于如何在保证预测性能的同时降低推理成本,尤其是在分布外数据场景下,现有方法的泛化能力不足。

核心创新

DecoR通过查询分解与历史匹配重新定义路由任务。查询分解提取任务内在需求,避免表面语义干扰;历史匹配基于能力需求筛选日志,提升决策可靠性。

方法详解

  • �� 查询分解阶段:将查询转化为能力需求,包括技能集、知识领域和难度。
  • �� 分层筛选阶段:利用Jaccard相似度和BGE-M3模型筛选相关日志。
  • �� 经验决策阶段:根据性能与成本综合评分选择最优模型。

实验设计

实验使用CodaSet基准测试,包括ID任务(如MMLU-Pro)和OOD任务(如Math500)。评估指标包括准确率和推理成本,比较了多种路由方法。

结果分析

DecoR在ID任务中准确率达95.59%,推理成本仅为1.4倍;在OOD任务中表现稳定,准确率下降幅度显著低于其他方法。

应用场景

可用于动态选择模型以优化推理效率,适用于搜索引擎、问答系统等场景。

局限与展望

对历史日志依赖较高,可能限制在新领域中的应用;极端复杂任务可能需要更高性能模型支持。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,DecoR就像一个智能助手,根据你的食材和需求推荐最合适的厨具。它先分析你的菜谱(查询分解),然后从历史经验中找到类似的烹饪记录(历史匹配),最后综合效率和效果选择最佳工具(经验决策)。

简单解释 像给14岁少年讲一样

想象你在玩游戏,DecoR就像一个队友推荐系统。它会先分析你的任务需求,比如需要远程攻击还是近战防御(查询分解)。然后,它会从历史记录中找到类似的任务,看看哪些队友表现最好(历史匹配)。最后,它会根据效率和胜率推荐最合适的队友(经验决策)。聪明吧?

术语表

Query Decomposition (查询分解)

将查询转化为技能、知识和难度需求的过程。

用于提取任务内在需求,避免表面语义干扰。

Historical Matching (历史匹配)

通过能力需求筛选历史日志以支持决策。

用于提升路由决策的可靠性。

CodaSet (能力基准数据集)

评估路由系统泛化能力的基准测试。

包含ID和OOD任务,用于实验验证。

Empirical Decision (经验决策)

综合性能与成本选择最优模型的过程。

用于最终路由决策。

Memorization Trap (记忆陷阱)

路由系统过度依赖训练数据而泛化能力差的现象。

现有方法的主要问题之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在无历史日志的情况下提升性能?
  • 2 如何优化复杂任务的路由决策?

应用场景

近期应用

搜索引擎优化

通过动态选择模型提升查询响应效率。

问答系统

根据问题复杂度选择最优模型以降低成本。

远期愿景

动态模型池管理

实现模型池的自动化扩展与优化,适应更多场景。

原文摘要

Optimizing the trade-off among predictive performance and computational cost is a central focus in the deployment of Large Language Models (LLMs). Current routing methods primarily rely on direct mapping from queries to models based on surface-level features, making them susceptible to the memorization trap and leading to poor generalizability on out-of-distribution (OOD) data. In this paper, we propose DecoR, a novel routing framework that recasts the routing task as a matching process of sifting similar queries from historical logs, effectively mitigating the memorization trap. To enhance matching accuracy, we introduce a query capability deconstruction method that decouples linguistic surface forms from task-intrinsic requirements, directing matching toward capability dimensions to ground decisions in essential task attributes. Furthermore, we develop CodaSet, a comprehensive benchmark for assessing routing generalization, where experimental results demonstrate that DecoR maintains superior accuracy while substantially lowering inference costs across both in-distribution and OOD settings. All the codes and data are available at https://github.com/lvbotenbest/DecoR.

cs.AI