核心发现
方法论
PROTEUS采用拉格朗日双变量控制,通过学习的λ变量动态调整策略网络以满足用户指定的准确率目标τ。其核心包括DeBERTa-v3编码器、质量偏好μ输出以及动态路由评分公式。
关键结果
- 在RouterBench数据集上,PROTEUS实现90.1%的准确率,仅比Oracle低1.3%,成本节省达89.8%。
- 在SPROUT数据集上,准确率达94.0%,比Oracle低4.6%,同时实现9.5倍的成本范围动态调整。
- 与基线OmniRouter相比,PROTEUS在所有τ范围内保持100%的准确率底线合规,而OmniRouter仅达成22%。
研究意义
该研究解决了多LLM系统中无法直接指定准确率目标的问题,为动态SLA适配提供了新的解决方案,显著提升了模型服务的灵活性和效率。
技术贡献
提出了基于τ条件的策略网络和拉格朗日约束反馈机制,首次实现了单一模型在多种准确率目标下的动态适配,显著优于现有的静态或参数调优方法。
新颖性
PROTEUS是首个支持运行时指定准确率目标的路由系统,其创新在于将拉格朗日优化与强化学习结合,用于动态调整模型选择策略。
局限性
- 在极端高准确率目标(如τ>0.95)下,成本显著增加。
- 对模型池的性能预测依赖于训练数据的分布,可能在分布偏移时表现下降。
未来方向
未来可探索更高效的约束反馈机制,以及扩展至更多动态SLA场景如实时负载变化。
AI 总览摘要
PROTEUS是一种新型的多LLM路由系统,专为满足动态SLA目标而设计。现有路由方法无法直接指定准确率目标,操作员需通过参数调优间接控制,效率低下且不灵活。
通过拉格朗日强化学习,PROTEUS实现了动态适配,允许用户在运行时指定准确率目标τ。系统通过学习的λ变量动态调整策略网络,输出质量偏好μ,并结合路由评分公式选择最优模型。
实验显示,PROTEUS在RouterBench和SPROUT数据集上均实现了显著的准确率和成本优化,准确率达94.0%,成本节省达89.8%。其创新性和灵活性为多LLM服务系统的未来发展提供了重要启示。
深度分析
研究背景
多LLM服务系统需要在不同客户层级和查询复杂度下平衡质量与成本。现有方法如OmniRouter和CARROT通过参数调优间接控制准确率,但无法动态适配SLA目标。
核心问题
传统路由系统无法直接接受准确率目标,操作员需通过复杂的参数调优推测结果。这种间接控制在多层级服务场景中效率低下且难以扩展。
核心创新
PROTEUS的核心创新包括:1) 拉格朗日双变量控制机制,用于动态约束反馈;2) τ条件策略网络,实现运行时目标适配;3) 动态路由评分公式,结合质量偏好μ和成本权重。
方法详解
- �� 使用DeBERTa-v3编码器生成查询嵌入。
- �� 策略网络基于嵌入和τ输出质量偏好μ。
- �� 路由评分公式结合预测性能pi、质量偏好μ和成本ci选择最优模型。
- �� 拉格朗日变量λ在训练中动态调整,确保准确率目标达成。
实验设计
实验使用RouterBench和SPROUT数据集,评估在不同准确率目标τ下的性能。基线包括OmniRouter和CARROT,比较准确率、成本和SLA合规性。
结果分析
PROTEUS在RouterBench上实现90.1%准确率,比Oracle低1.3%,成本节省89.8%;在SPROUT上实现94.0%准确率,比Oracle低4.6%,同时保持100%底线合规。
应用场景
适用于多租户SaaS架构、实时查询路由和动态负载管理场景,显著提升服务质量和成本效率。
局限与展望
对极端高准确率目标的成本敏感性较高;对模型池性能预测依赖训练数据分布,可能在分布偏移时表现下降。
通俗解读 非专业人士也能看懂
想象一个餐厅有多个厨师,每个厨师擅长不同的菜肴,但成本和速度各异。PROTEUS就像一个智能经理,根据顾客的需求(例如高质量或低成本)实时分配厨师。它通过学习顾客偏好和菜肴难度,确保每次分配都满足顾客的要求,同时节省资源。
简单解释 像给14岁少年讲一样
想象你在打游戏,有很多角色可以选,每个角色有不同的技能和装备。PROTEUS就像一个超级队长,能根据任务的难度和你的目标(比如赢得比赛或省资源)实时帮你选最合适的角色!是不是很酷?
术语表
拉格朗日变量 (Lagrangian variable)
一种用于约束优化的变量,通过动态调整约束压力来影响决策。
用于训练策略网络以满足准确率目标。
质量偏好 (Quality preference)
表示在质量与成本之间的权衡程度,范围为[0,1]。
在路由评分公式中用于选择模型。
准确率目标 (Accuracy target)
用户指定的最低可接受准确率,用于指导路由决策。
作为τ输入到策略网络。
动态路由评分公式 (Dynamic routing score)
结合模型性能、质量偏好和成本的公式,用于选择最优模型。
在运行时计算模型评分。
RouterBench
一个包含405K查询和11个模型的路由基准数据集,用于评估路由性能。
用于测试PROTEUS的准确率和成本优化能力。
开放问题 这项研究留下的未解疑问
- 1 如何在极端高准确率目标下进一步优化成本?
- 2 如何应对模型池性能预测中的分布偏移问题?
应用场景
近期应用
多租户SaaS服务
根据客户层级动态调整模型选择,提升服务质量和成本效率。
实时负载管理
在查询流量高峰时动态适配,确保服务稳定性。
远期愿景
全自动化AI服务路由
实现完全自主的动态路由系统,适配更多复杂场景。
原文摘要
Production LLM deployments serve diverse workloads where cost and quality requirements vary by customer tier, time of day, and query criticality. Model serving systems accept latency SLOs directly. LLM routers do not. They force operators to tune parameters offline and guess what accuracy might result. The relationship between parameters and outcomes is indirect, non-monotonic, and dataset-dependent. Operators need to specify accuracy targets, not infer them from opaque settings. We present PROTEUS (Polymorphic Router for Operational Target Enforcement with Unified SLA), a router that accepts accuracy targets tau as runtime input. PROTEUS uses Lagrangian dual control. A learned dual variable lambda tracks constraint violations during training and conditions the policy network. This lets the router translate specified tau values into routing decisions that satisfy them. A single trained model serves the full accuracy spectrum without retraining.We evaluate on RouterBench (11 models, 405K queries) and SPROUT (14 models, 45K queries). PROTEUS achieves consistent floor compliance where accuracy meets or exceeds tau. The target-response correlation reaches 0.97 to 0.98. The closest baseline, OmniRouter, meets floors only 22% of the time despite also using Lagrangian optimization. PROTEUS operates across tau in [0.85, 0.95] from a single model. On RouterBench it achieves 90.1% accuracy, within 1.3% of oracle. On SPROUT it achieves 94.0% accuracy, within 4.6% of oracle. Cost savings reach 89.8% versus the best fixed model.