Large Language Model Routing with Benchmark Datasets

TL;DR

提出基于基准数据学习“路由器”模型,有效提升多任务LLM选择性能,实验在29个数据集上实现显著改进。

cs.CL 🔴 高级 2023-09-28 192 引用 38 次浏览
Tal Shnitzer Anthony Ou Mírian Silva Kate Soule Yuekai Sun Justin Solomon Neil Thompson Mikhail Yurochkin
大规模语言模型 模型选择 基准数据 二分类 迁移学习

核心发现

方法论

本文将多任务场景下的LLM模型选择问题转化为一系列二分类任务,通过利用现有基准数据中的样本性能指标,训练每个候选模型的正确性预测器(如kNN分类器),实现对新任务的模型路由。具体流程包括:1)利用基准数据中的输入-输出样本,计算模型在每个样本上的性能指标(如正确率或得分);2)将样本特征(如句子嵌入)作为输入,训练二分类器预测模型在该样本上的正确性;3)在新任务中,通过输入样本特征,预测各模型的正确性概率,结合任务特征估算模型整体表现,从而选择最优模型。本文提出了三种评分机制(S1、S2、S3),其中S3考虑模型在OOD(out-of-distribution)数据上的不确定性,结合贝叶斯模型和任务描述,提升模型路由的鲁棒性。实验中采用HELM(42个任务)和MixInstruct(instruction-following任务)两个基准,验证了该方法在模型性能提升和成本降低方面的有效性。

关键结果

  • 在29个HELM数据集上,使用kNN预测器的模型路由方法(S3)平均准确率达到0.694,显著优于单一模型(如llama-2-70b的0.688),且在模型参数方面选择了更小的模型(平均参数数为33.8B),实现性能与成本的平衡。通过引入真实p(d′, m)的“oracle”评分,性能提升至0.735,验证了模型正确性预测的潜力。实验还显示,结合少量(如50个样本)在分布内样本进行微调,可显著改善OOD泛化能力,正确性预测准确率提升至0.65,从而进一步优化模型选择效果。
  • 在MixInstruct任务中,S1评分在每个实例上实现了73%的平均准确率,优于传统的模型评分方法(如log-likelihood),且只需调用一次候选模型,显著降低了计算成本(模型调用次数从347B降至数十亿级别)。此外,模型在不同指标(BERTScore、BARTScore、BLEURT)上的表现均优于基线方法,验证了该路由策略在指令调优任务中的实用性。

研究意义

该研究突破了传统模型选择的局限,提出利用现有基准数据训练模型路由器,显著提升多任务环境下的模型选择效率和效果。其核心创新在于将模型性能预测转化为二分类问题,结合贝叶斯推断和任务描述,实现对新任务的鲁棒预测。这不仅降低了推理成本,还增强了模型在不同任务和域中的泛化能力,为大规模语言模型的实际应用提供了新思路。未来,随着模型规模和任务复杂度的增加,该方法有望在自动化模型调度、个性化推荐和多任务学习中发挥更大作用,推动AI系统的智能化和高效化。

技术贡献

本文提出了一种基于基准数据的模型路由框架,将多任务模型选择问题转化为多个二分类任务,通过训练正确性预测器实现模型性能的快速估算。引入三种评分机制(S1、S2、S3),特别是考虑OOD数据的S3评分,结合贝叶斯模型和任务描述,增强了模型在未知任务中的鲁棒性。采用简单的kNN分类器和句子嵌入技术,降低了训练复杂度,验证了即使在基础模型上也能取得优异效果。此外,论文还建立了与元学习的联系,证明了自适应路由策略在理论上的优越性,为未来模型调度提供了理论基础。

新颖性

本研究首次将多任务模型选择问题形式化为一组二分类任务,利用基准数据中的样本性能信息训练模型正确性预测器,突破了传统模型选择依赖生成样本的限制。引入考虑OOD数据的贝叶斯模型和任务描述的评分机制(S3),显著提升了模型在新任务中的泛化能力。与以往仅依赖模型输出得分或生成结果的路由方法不同,本文的方法只需少量样本特征即可实现高效模型选择,极大降低了推理成本。这一创新在模型调度和多任务学习领域具有开创性意义。

局限性

  • 正确性预测器的准确率(约59%)仍有提升空间,尤其在任务分布偏移较大时表现有限,可能影响模型路由的效果。
  • 该方法在极端OOD场景下的鲁棒性尚未充分验证,未来需结合更复杂的模型和特征增强策略。
  • 依赖预训练句子嵌入和kNN分类器,可能在高维空间中存在维度灾难问题,影响预测性能和泛化能力。

未来方向

未来工作将聚焦于提升正确性预测器的准确率,探索深度学习模型(如Transformer)作为预测器的潜力,增强对复杂任务的适应性。同时,将结合主动学习策略,动态采样样本以优化模型路由的鲁棒性。此外,研究将扩展到多模态场景,结合视觉、语音等多模态信息,推动多任务、多模态模型调度的智能化发展。最后,期望通过大规模实地应用验证方法在工业界的实际效果,推动AI系统的自动化和个性化升级。

AI 总览摘要

在当今人工智能快速发展的背景下,大规模语言模型(LLMs)在多任务、多领域中的应用日益广泛。然而,随着模型数量的激增,如何高效、准确地选择最适合特定任务的模型成为一大挑战。传统的模型选择方法多依赖于在所有任务上平均性能的排名,难以满足实际应用中对个性化和成本控制的需求。本文提出了一种创新的模型路由策略,利用现有基准数据中的样本性能信息,训练模型正确性预测器,从而实现对新任务的高效模型选择。该方法将模型性能预测问题转化为一组二分类任务,训练简单、计算高效,且在多个公开基准(如HELM和MixInstruct)上验证了其优越性。

具体来说,研究采用句子嵌入技术,将输入样本映射到特征空间,利用kNN分类器预测模型在样本上的正确性。通过结合贝叶斯推断和任务描述,提出了三种评分机制(S1、S2、S3),其中S3考虑模型在OOD(out-of-distribution)数据上的不确定性,显著提升了在未知任务中的泛化能力。在29个HELM数据集和MixInstruct任务中,模型路由方法均优于传统的平均模型(BMA)和单一模型,平均性能提升达0.694(相较于BMA的0.688),且成功实现了模型参数的缩减,降低了推理成本。

实验结果表明,该方法不仅提升了模型选择的准确性,还增强了系统的鲁棒性和适应性。通过引入少量样本进行微调,正确性预测器的性能得以改善,OOD泛化能力显著增强。未来,结合深度学习预测器和主动学习策略,有望进一步推动多任务、多模态AI系统的智能调度,满足工业界对高效、个性化AI的需求。这一研究为大规模模型的自动化调度提供了理论基础和实践路径,具有重要的学术价值和应用前景。

深度分析

研究背景

近年来,随着Transformer架构的普及,LLMs如GPT、BERT、LLaMA等在自然语言处理领域取得了突破性进展。这些模型通过在大规模语料上预训练,展现出强大的泛化能力,广泛应用于文本分类、问答、摘要、对话等任务。为了评估模型性能,研究者提出诸如HELM、MMLU、Open LLM Leaderboard等基准,涵盖多任务、多领域,旨在比较不同模型的能力。尽管如此,现有评估多依赖平均性能指标,难以满足实际应用中对个性化模型选择的需求。模型选择问题由来已久,传统方法如交叉验证在大规模模型上难以实现,且无法应对模型在不同任务中的表现差异。近年来,研究关注于迁移学习、迁移评估、模型路由等方向,试图在保证效率的同时提升模型调度的准确性。

核心问题

核心问题在于如何在多模型、多任务环境中,快速、准确地为新任务选择最优模型。现有方法多依赖于在所有模型上生成输出,再进行后续评分,计算成本极高,尤其是在模型数量庞大的情况下。此外,模型在训练数据和实际任务中的表现存在分布偏移,导致模型性能预测的准确性下降。如何利用已有的基准数据,构建高效、鲁棒的模型性能预测机制,成为亟待解决的难题。特别是在实际应用中,模型调用成本、响应时间和资源限制都要求我们开发出更智能、更节省资源的模型调度方案。

核心创新

本文的创新点主要体现在:1)将多任务模型选择问题形式化为二分类任务,通过训练模型正确性预测器实现性能估算,避免了昂贵的生成过程;2)引入三种评分机制(S1、S2、S3),特别是S3考虑模型在OOD数据上的不确定性,结合贝叶斯推断和任务描述,增强鲁棒性;3)采用简单的句子嵌入和kNN分类器,降低训练复杂度,验证了基础模型也能取得优异效果;4)建立了与元学习的联系,证明了自适应路由策略在理论上的优越性,为未来模型调度提供了理论基础。这些创新共同推动了多任务、多模型环境下的智能调度技术发展。

方法详解

  • �� 数据准备:利用HELM和MixInstruct中的样本,计算每个模型在样本上的性能指标(如正确率或得分),作为训练标签。
  • �� 特征提取:采用句子嵌入技术(如Reimers和Gurevych的SentenceTransformer)将输入样本映射到特征空间。
  • �� 训练正确性预测器:使用kNN分类器(k=5)作为二分类模型,输入特征,输出模型在样本上的正确性概率。
  • �� 评分机制设计:提出S1(模型正确性预测概率)、S2(阈值化的正确性预测)、S3(结合贝叶斯模型考虑OOD不确定性)三种评分方法。
  • �� 任务描述建模:通过任务描述u(d),利用核平滑(Nadaraya-Watson)模型预测模型在新任务中的正确性概率p(d′, m),实现对未知任务的鲁棒估计。
  • �� 模型路由:在新任务中,根据样本特征和评分机制,选择得分最高的模型,确保在保证性能的同时降低推理成本。

实验设计

  • �� 数据集:采用29个HELM数据集和MixInstruct中的指令调优任务,涵盖问答、文本分类、推理等场景。
  • �� 模型:评估18个开源模型(如Llama 2系列,参数从3B到70B),包括基础和对话版本。
  • �� 评估指标:模型性能用准确率、Pearson和Spearman相关系数衡量,模型调用成本用参数数量和调用次数衡量。
  • �� 训练细节:所有正确性预测器采用kNN(k=5),特征为句子嵌入,训练集为基准数据中的样本。
  • �� 比较方法:包括平均模型(BMA)、log-likelihood评分、以及“oracle”理想评分。
  • �� 实验流程:每次用28个任务作为训练集,剩余任务作为测试,重复多次以确保结果稳定,分析不同评分机制在模型选择中的表现。

结果分析

  • �� S3评分在29个HELM数据集上平均准确率达0.694,优于单一模型(如llama-2-70b的0.688),且模型参数平均缩减至33.8B,表现出良好的性能和成本平衡。
  • �� 引入真实p(d′, m)的“oracle”评分后,性能提升至0.735,验证了正确性预测器在模型选择中的潜力。
  • �� 在MixInstruct任务中,S1评分实现了73%的平均实例级准确率,优于传统的log-likelihood评分(约65%),且显著降低了模型调用次数(从347B参数调用降至数亿级别),显示出高效的模型调度能力。

应用场景

  • �� 实时多任务系统:可应用于智能客服、自动问答系统,通过模型路由实现个性化和高效响应,降低计算成本。
  • �� 自动模型调度:在云端AI平台中,根据任务特征动态选择最优模型,提升整体性能和资源利用率。
  • �� 研究与开发:为多任务学习和迁移学习提供模型性能预测工具,加速新模型的验证和部署。未来,结合主动学习和多模态信息,有望实现更智能的模型调度和个性化推荐。

局限与展望

  • �� 预测准确率仍有提升空间,尤其在任务分布偏移较大时表现有限,可能影响模型选择效果。
  • �� 目前采用简单的kNN和句子嵌入,面对高维特征空间可能存在性能瓶颈。
  • �� 依赖基准数据的样本性能,难以应对极端OOD场景,未来需引入更复杂的特征和模型以增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家餐厅点餐,菜单上有许多不同的菜肴(模型),每个菜肴都擅长做某些菜(任务)。如果你想吃一道新菜(新任务),你会怎么选择?传统的方法可能是每次都点所有菜,然后尝试,既费时间又浪费食材。现在,假设你有一个聪明的助手(模型路由器),它事先根据菜单和以往的用餐经验,学习了每道菜在哪些场合表现最好。每次你点餐时,它会根据你的偏好和当前的需求,推荐最合适的菜肴。这个助手不是凭空猜测,而是通过分析过去的用餐记录(基准数据)学会了判断哪道菜在什么情况下会更好吃。它还会考虑一些特殊情况,比如你喜欢辣的(OOD数据),让推荐更智能、更贴心。这样一来,你就能用更少的时间和食材,吃到更合你口味的菜肴,整个用餐体验变得更高效、更满意。这就是本文提出的模型路由思想,用数据训练一个“智能助手”,帮你在众多模型中找到最适合当前任务的那一个。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里,有很多不同的书(模型),每本书都擅长讲某一类故事(任务)。如果你想写一篇关于科学的文章(新任务),你会怎么找最合适的书?以前,你可能会随便拿几本书,看看哪个讲得比较好,但这样既浪费时间,也不一定找到最合适的。现在,假设你有一个聪明的朋友(路由器),他以前看过很多书,知道哪些书在讲科学、历史、小说等方面最厉害。每次你需要写新文章时,他会根据你的题目和已有的知识,推荐最适合的那本书。这个朋友不是随便猜的,而是通过学习以前看过的书和评价,变得越来越聪明。它会考虑一些特殊情况,比如你喜欢看图片(OOD场景),让推荐更贴心。这样,你就不用翻遍所有书,只需要听朋友的推荐,就能快速找到最合适的书,写出好文章。这就像本文的想法,用已有的评价数据训练一个“聪明的助手”,帮你在众多模型中找到最适合当前任务的那一个。

原文摘要

There is a rapidly growing number of open-source Large Language Models (LLMs) and benchmark datasets to compare them. While some models dominate these benchmarks, no single model typically achieves the best accuracy in all tasks and use cases. In this work, we address the challenge of selecting the best LLM out of a collection of models for new tasks. We propose a new formulation for the problem, in which benchmark datasets are repurposed to learn a "router" model for this LLM selection, and we show that this problem can be reduced to a collection of binary classification tasks. We demonstrate the utility and limitations of learning model routers from various benchmark datasets, where we consistently improve performance upon using any single model for all tasks.

cs.CL cs.LG

参考文献 (20)

Masked Language Model Scoring

Julian Salazar, Davis Liang, Toan Q. Nguyen 等

2019 628 引用 ⭐ 高影响力

Measuring Massive Multitask Language Understanding

Dan Hendrycks, Collin Burns, Steven Basart 等

2020 9427 引用 ⭐ 高影响力 查看解读 →

SimCLS: A Simple Framework for Contrastive Learning of Abstractive Summarization

Yixin Liu, Peng Liu

2021 299 引用 ⭐ 高影响力 查看解读 →

SummaReranker: A Multi-Task Mixture-of-Experts Re-ranking Framework for Abstractive Summarization

Mathieu Ravaut, Shafiq R. Joty, Nancy F. Chen

2022 122 引用 ⭐ 高影响力 查看解读 →

LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion

Dongfu Jiang, Xiang Ren, Bill Yuchen Lin

2023 689 引用 ⭐ 高影响力 查看解读 →

Holistic Evaluation of Language Models

Percy Liang, Rishi Bommasani, Tony Lee 等

2023 2008 引用 ⭐ 高影响力

Language Models are Unsupervised Multitask Learners

Alec Radford, Jeff Wu, R. Child 等

2019 30058 引用

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Jacob Devlin, Ming-Wei Chang, Kenton Lee 等

2019 120504 引用 查看解读 →

Active Learning Literature Survey

Burr Settles

2009 6767 引用

GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding

Alex Wang, Amanpreet Singh, Julian Michael 等

2018 8922 引用 查看解读 →

Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning

S. Raschka

2018 1096 引用 查看解读 →

BERTScore: Evaluating Text Generation with BERT

Tianyi Zhang, Varsha Kishore, Felix Wu 等

2019 9526 引用 查看解读 →

SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems

Alex Wang, Yada Pruksachatkun, Nikita Nangia 等

2019 2910 引用 查看解读 →

Scaling and Benchmarking Self-Supervised Visual Representation Learning

Priya Goyal, D. Mahajan, A. Gupta 等

2019 431 引用 查看解读 →

Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift

Yaniv Ovadia, Emily Fertig, Jie Jessie Ren 等

2019 2413 引用 查看解读 →

Invariant Risk Minimization

Martín Arjovsky, L. Bottou, Ishaan Gulrajani 等

2019 2963 引用 查看解读 →

Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Nils Reimers, Iryna Gurevych

2019 20251 引用 查看解读 →

Mixtral of Experts

Albert Q. Jiang, Alexandre Sablayrolles, Antoine Roux 等

2024 2111 引用 查看解读 →

BLEURT: Learning Robust Metrics for Text Generation

T. Sellam, Dipanjan Das, Ankur P. Parikh

2020 1995 引用 查看解读 →

On Calibration of Modern Neural Networks

Chuan Guo, Geoff Pleiss, Yu Sun 等

2017 9577 引用 查看解读 →

被引用 (20)

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

2026 ⭐ 高影响力 查看解读 →

Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration

2026 ⭐ 高影响力 查看解读 →

Computational Arbitrage in AI Model Markets

RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization

2026 1 引用 查看解读 →

ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing

2026 1 引用 查看解读 →

Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios

2026 6 引用 查看解读 →

MonoRouter: Enforcing Monotonicity in Item Response Theory for LLM Routing

2026

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

2026 2 引用 查看解读 →

Evaluating Small Language Models for Front-Door Routing: A Harmonized Benchmark and Synthetic-Traffic Experiment

RouteProfile: Graph-Based Profiling for Cold-Start LLM Routing

2026 1 引用 查看解读 →

EAFAL: An Edge-Based Agentic Framework for Adaptive Selection Between SLMs and LLMs

2026

Learning Agent Routing From Early Experience

2026 2 引用 查看解读 →

Switchcraft: AI Model Router for Agentic Tool Calling

2026 3 引用 查看解读 →

SOMA: Efficient Multi-turn LLM Serving via Small Language Model

2026 1 引用 查看解读 →

Capturing LLM Capabilities via Evidence-Calibrated Query Clustering

When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

FlyRoute: Self-Evolving Agent Profiling via Data Flywheel for Adaptive Task Routing

RouterHGC: Optimized Router for LLM-based Multi-Agent Systems via Heterogeneous Graph Contrastive Learning

2026

Beyond Query Memorization: Large Language Model Routing with Query Decomposition and Historical Matching

Codifying the Judge: Scalable Evaluation via Program Distillation