核心发现
方法论
提出DecoR框架,将路由任务转化为基于能力分解的历史匹配过程。包括查询分解阶段、分层筛选阶段和经验决策阶段,显著提升泛化能力。
关键结果
- 在ID任务中,DecoR的准确率达95.59%,推理成本仅为1.4倍,显著优于其他路由方法。
- 在OOD任务中,DecoR表现稳定,准确率仅下降3%,而其他方法下降幅度更大。
- 消融实验表明,查询分解阶段对性能提升贡献最大,缺失该阶段导致准确率下降达2.1倍。
研究意义
该研究解决了现有路由方法在OOD场景下泛化能力差的问题,为动态模型选择提供了新的思路,减少了高性能模型的冗余使用。
技术贡献
提出基于能力分解的路由框架,避免了传统方法的记忆陷阱;引入CodaSet基准测试,全面评估路由系统的泛化能力。
新颖性
首次将查询分解与历史匹配结合用于LLM路由,显著提升了泛化能力并降低了推理成本,与现有方法形成显著差异。
局限性
- 对历史日志的依赖较高,若日志不足可能影响性能。
- 在极端复杂任务中,可能需要更高性能的模型支持。
未来方向
未来可探索更高效的日志筛选算法,以及在动态模型池中的应用扩展。
AI 总览摘要
现有的大语言模型路由方法在处理分布外数据时常表现不佳,且推理成本高昂。为解决这一问题,本文提出了DecoR框架,通过查询分解与历史匹配优化路由决策,显著提升了泛化能力和效率。
DecoR框架包括三个阶段:查询分解阶段将用户查询转化为能力需求;分层筛选阶段通过匹配历史日志筛选最相关的记录;经验决策阶段综合性能与成本选择最优模型。实验表明,DecoR在多个基准测试中均表现优异,显著优于现有方法。
该研究不仅提出了新的路由方法,还开发了CodaSet基准测试,为评估路由系统的泛化能力提供了标准。未来工作可进一步优化筛选算法,并探索动态模型池中的应用。
深度分析
研究背景
随着大语言模型的广泛应用,模型路由成为优化性能与成本的重要手段。然而,现有方法多依赖于查询与模型的直接映射,易陷入记忆陷阱,导致泛化能力差。
核心问题
核心问题在于如何在保证预测性能的同时降低推理成本,尤其是在分布外数据场景下,现有方法的泛化能力不足。
核心创新
DecoR通过查询分解与历史匹配重新定义路由任务。查询分解提取任务内在需求,避免表面语义干扰;历史匹配基于能力需求筛选日志,提升决策可靠性。
方法详解
- �� 查询分解阶段:将查询转化为能力需求,包括技能集、知识领域和难度。
- �� 分层筛选阶段:利用Jaccard相似度和BGE-M3模型筛选相关日志。
- �� 经验决策阶段:根据性能与成本综合评分选择最优模型。
实验设计
实验使用CodaSet基准测试,包括ID任务(如MMLU-Pro)和OOD任务(如Math500)。评估指标包括准确率和推理成本,比较了多种路由方法。
结果分析
DecoR在ID任务中准确率达95.59%,推理成本仅为1.4倍;在OOD任务中表现稳定,准确率下降幅度显著低于其他方法。
应用场景
可用于动态选择模型以优化推理效率,适用于搜索引擎、问答系统等场景。
局限与展望
对历史日志依赖较高,可能限制在新领域中的应用;极端复杂任务可能需要更高性能模型支持。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,DecoR就像一个智能助手,根据你的食材和需求推荐最合适的厨具。它先分析你的菜谱(查询分解),然后从历史经验中找到类似的烹饪记录(历史匹配),最后综合效率和效果选择最佳工具(经验决策)。
简单解释 像给14岁少年讲一样
想象你在玩游戏,DecoR就像一个队友推荐系统。它会先分析你的任务需求,比如需要远程攻击还是近战防御(查询分解)。然后,它会从历史记录中找到类似的任务,看看哪些队友表现最好(历史匹配)。最后,它会根据效率和胜率推荐最合适的队友(经验决策)。聪明吧?
术语表
Query Decomposition (查询分解)
将查询转化为技能、知识和难度需求的过程。
用于提取任务内在需求,避免表面语义干扰。
Historical Matching (历史匹配)
通过能力需求筛选历史日志以支持决策。
用于提升路由决策的可靠性。
CodaSet (能力基准数据集)
评估路由系统泛化能力的基准测试。
包含ID和OOD任务,用于实验验证。
Empirical Decision (经验决策)
综合性能与成本选择最优模型的过程。
用于最终路由决策。
Memorization Trap (记忆陷阱)
路由系统过度依赖训练数据而泛化能力差的现象。
现有方法的主要问题之一。
开放问题 这项研究留下的未解疑问
- 1 如何在无历史日志的情况下提升性能?
- 2 如何优化复杂任务的路由决策?
应用场景
近期应用
搜索引擎优化
通过动态选择模型提升查询响应效率。
问答系统
根据问题复杂度选择最优模型以降低成本。
远期愿景
动态模型池管理
实现模型池的自动化扩展与优化,适应更多场景。
原文摘要
Optimizing the trade-off among predictive performance and computational cost is a central focus in the deployment of Large Language Models (LLMs). Current routing methods primarily rely on direct mapping from queries to models based on surface-level features, making them susceptible to the memorization trap and leading to poor generalizability on out-of-distribution (OOD) data. In this paper, we propose DecoR, a novel routing framework that recasts the routing task as a matching process of sifting similar queries from historical logs, effectively mitigating the memorization trap. To enhance matching accuracy, we introduce a query capability deconstruction method that decouples linguistic surface forms from task-intrinsic requirements, directing matching toward capability dimensions to ground decisions in essential task attributes. Furthermore, we develop CodaSet, a comprehensive benchmark for assessing routing generalization, where experimental results demonstrate that DecoR maintains superior accuracy while substantially lowering inference costs across both in-distribution and OOD settings. All the codes and data are available at https://github.com/lvbotenbest/DecoR.