SkillSelect-Serve: QoS-Aware Budgeted Skill Service Recommendation for LLM Agents

TL;DR

SkillSelect-Serve通过QoS感知和预算约束推荐LLM代理技能服务,提升命中率至0.9091。

cs.IR 🔴 高级 2026-05-08 3 次浏览
Jingyuan Zheng Dongjing Wang Xin Zhang Hao Chen Youhuizi Li Xudong Shen Haiping Zhang Butian Huang Dongjin Yu Guandong Xu
LLM代理 技能服务 QoS 预算约束 推荐系统

核心发现

方法论

SkillSelect-Serve框架将原始技能文件转化为结构化的技能服务档案,使用轻量级需求规划器将任务转化为结构化需求对象。通过共享发现主干检索高召回候选集,并在服务级别和捆绑级别进行双粒度建模,最终通过预算和QoS约束投影选择适合的服务捆绑。

关键结果

  • 在35,353个技能的注册表上进行评估,未约束推荐仅适用于9.1%的任务,而约束投影在命中率仅损失1.14点的情况下保证了100%的可交付性。
  • 在相同的三服务预算下,命中率从固定Top-3的0.8864提高到0.9091。
  • 约束投影机制将风险暴露减少了53%,并消除了工具不可用推荐中的44-81%的工具违规率。

研究意义

该研究通过将可重用的代理技能管理为可发现、可比较和约束感知的服务单元,改变了传统的技能检索方式。它解决了小型LLM代理在受限环境中选择技能服务的挑战,显著提高了任务的可交付性和命中率。

技术贡献

该方法将技能视为服务导向的能力单元,提供了新的理论保证和工程可能性。与现有方法不同,它考虑了QoS约束和预算限制,提供了更高效的技能选择策略。

新颖性

这是首次将LLM代理技能选择建模为预算约束的技能服务推荐问题,提供了与传统文档检索方法不同的服务导向视角。

局限性

  • 在某些复杂任务中,可能存在技能服务不足以满足所有需求的情况。
  • 需要进一步研究如何在动态环境中调整QoS约束。

未来方向

未来工作可以探索在动态环境中实时调整QoS约束的方法,以及如何进一步优化技能服务的发现和选择过程。

AI 总览摘要

可重用的代理技能正在成为大型语言模型(LLM)代理的服务导向能力层。SkillSelect-Serve通过将原始技能文件转化为结构化技能服务,并使用轻量级需求规划器将任务转化为结构化需求对象,解决了小型LLM代理在受限环境中选择技能服务的挑战。

在35,353个技能的注册表上进行评估,未约束推荐仅适用于9.1%的任务,而约束投影在命中率仅损失1.14点的情况下保证了100%的可交付性。该机制还将风险暴露减少了53%,并消除了工具不可用推荐中的44-81%的工具违规率。

该研究通过将可重用的代理技能管理为可发现、可比较和约束感知的服务单元,改变了传统的技能检索方式。未来工作可以探索在动态环境中实时调整QoS约束的方法,以及如何进一步优化技能服务的发现和选择过程。

深度分析

研究背景

随着大型语言模型(LLM)代理的发展,代理技能作为自然语言指令、任务工作流、工具使用规范、代码模板、输入输出假设、执行约束和风险警告的打包,成为用户任务与可执行能力之间的重要中间层。随着技能库的扩展,技能的选择变得更加复杂,特别是对于只能加载有限能力单元的小型LLM代理。

核心问题

小型LLM代理在受限环境中选择技能服务面临挑战。现有的固定Top-k方法仅根据文本相关性对技能进行排序,忽略了需求满足、可交付性和操作约束。

核心创新

SkillSelect-Serve通过将技能视为服务导向的能力单元,提供了新的理论保证和工程可能性。它考虑了QoS约束和预算限制,提供了更高效的技能选择策略。

方法详解

  • �� 将原始技能文件转化为结构化技能服务档案
  • �� 使用轻量级需求规划器将任务转化为结构化需求对象
  • �� 共享发现主干检索高召回候选集
  • �� 服务级别和捆绑级别进行双粒度建模
  • �� 通过预算和QoS约束投影选择适合的服务捆绑

实验设计

在35,353个技能的注册表上进行评估,使用多正相关性判断,验证了约束投影在命中率仅损失1.14点的情况下保证了100%的可交付性。

结果分析

约束投影机制将风险暴露减少了53%,并消除了工具不可用推荐中的44-81%的工具违规率。在相同的三服务预算下,命中率从固定Top-3的0.8864提高到0.9091。

应用场景

该方法可用于小型LLM代理在受限环境中选择最合适的技能服务,提升任务的可交付性和命中率。

局限与展望

在某些复杂任务中,可能存在技能服务不足以满足所有需求的情况。需要进一步研究如何在动态环境中调整QoS约束。

通俗解读 非专业人士也能看懂

想象你在一个餐厅里,菜单上有成千上万道菜,但你只能点几道。SkillSelect-Serve就像一个聪明的点菜助手,它不仅考虑你喜欢的口味,还会根据你的预算、健康状况和餐具可用性来推荐最合适的菜肴。它确保你点的菜既美味又符合你的需求,而不是简单地推荐菜单上最受欢迎的菜。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的角色有很多技能,但你只能选择几个来打败敌人。SkillSelect-Serve就像一个超级助手,它会帮你挑选最适合的技能组合,让你在游戏中无往不利!它不仅考虑技能的威力,还会看你当前的装备和环境,确保你能最大化地利用每一个技能。是不是很酷?

术语表

Skill Service (技能服务)

技能服务是将自然语言指令、任务工作流和工具使用规范打包的能力单元。

在论文中,技能服务被用作可发现和比较的服务单元。

QoS (服务质量)

QoS指的是服务在功能、成本和风险方面的质量属性。

论文中使用QoS来评估技能服务的适用性。

Token Budget (令牌预算)

令牌预算是指代理可以加载的最大令牌数量。

在选择技能服务时,令牌预算是一个重要的约束条件。

Risk Exposure (风险暴露)

风险暴露指的是使用某项服务可能带来的风险。

论文中通过减少风险暴露来提高服务的安全性。

Constrained Projection (约束投影)

约束投影是指在满足预算和QoS约束的情况下选择服务捆绑。

用于保证技能服务的可交付性。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态环境中实时调整QoS约束以适应变化的任务需求?
  • 2 在复杂任务中,如何确保技能服务的多样性和互补性?

应用场景

近期应用

小型LLM代理优化

帮助小型LLM代理在受限环境中选择最合适的技能服务,提升任务的可交付性和命中率。

远期愿景

智能技能管理

通过动态调整QoS约束,实现更智能的技能管理和选择,适应不断变化的环境和需求。

原文摘要

Reusable agent skills are emerging as a service-oriented capability layer for Large Language Model (LLM) agents. Unlike plain retrieval items, a skill exposes functional capabilities, input-output assumptions, tool dependencies, context cost, and risk metadata. Selecting skills is particularly challenging for small LLM agents, which can load only a few capability units under restricted context, tool availability, and risk tolerance. Existing fixed Top-k methods rank skills by textual relevance and overlook requirement satisfaction, deliverability, and operational constraints. We present SkillSelect-Serve, a QoS-aware, budget-constrained Skill Service recommendation framework. Raw skills are profiled as structured Skill Services, the task is converted into a structured requirement object, and candidates discovered from a large-scale registry are ranked by a calibrated task-conditioned suitability estimator and packed by a constrained projection enforcing token-budget, aggregated-risk, and tool-availability constraints, using only deployment-observable features. On a registry of 35,353 skills with pooled multi-positive relevance judgments verified by two independent assessors, the unconstrained top-5 recommendation fits a realistic 4,000-token context for only 9.1% of tasks; the constrained projection restores 100% deliverability at a cost of only 1.14 points of hit rate, outperforming retrieve-and-rerank, budget truncation, and diversity-based selection under identical budgets. The same mechanism halves delivered risk exposure and eliminates the 44-81% tool-violation rates of tool-agnostic recommendation. At an identical three-service budget, hit rate improves from 0.8864 to 0.9091 over fixed Top-3 retrieval. The results support managing reusable agent skills as discoverable, comparable, and constraint-aware service units instead of plain retrievable documents.

cs.IR cs.AI cs.SE