Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

TL;DR

Skill-to-LoRA通过LoRA适配器将技能文本转化为行为模块,提高通过率5.2个百分点。

cs.AI 🟡 进阶级 2026-06-15 2 次浏览
Tianyi Zhang Zhonghao Qi
LoRA 技能表示 行为学习 大语言模型 效率提升

核心发现

方法论

Skill-to-LoRA(S2L)通过将技能文本转化为LoRA适配器,减少运行时的文本注入。离线阶段使用完整的SKILL.md生成技能引导的演示,在线阶段动态加载LoRA适配器以激活学习到的技能行为。

关键结果

  • S2L在SWE-Skills-Bench的21种技能中,较无技能和完整技能文本基线分别提高了2.9和5.2个百分点的通过率,同时每步减少了6.6%的token成本。
  • 在18/21种技能上,S2L与完整技能文本相匹配或有所提升。
  • 控制实验显示,技能特定的适配器对性能提升至关重要。

研究意义

S2L通过将技能文本转化为可训练的行为模块,减少了运行时上下文的冗余,降低了token成本。这一方法不仅提高了模型的效率,还可能缓解长技能文档在模型推理时引入的干扰。

技术贡献

S2L提供了一种新的技能表示方法,将技能文本转化为行为偏差的可训练参数。与现有方法相比,S2L不依赖于大规模的人为注释,自动生成技能引导的行为演示。

新颖性

S2L首次将技能文本转化为LoRA适配器,动态加载以激活技能行为。这一创新在于将技能的行为变化建模为可学习的功能偏差。

局限性

  • S2L对技能特定的适配器对齐依赖较大,错误或共享的LoRA适配器会降低性能。
  • 该方法可能不适用于需要多技能组合的复杂任务。

未来方向

未来工作可以探索多技能组合的适配器设计,以及在更大规模的技能库上验证S2L的有效性。

AI 总览摘要

在现代代理系统中,技能通常以可读的SKILL.md文件形式分发。然而,这种设计需要在运行时重复注入相同的程序,导致效率低下。Skill-to-LoRA(S2L)通过将技能文本转化为行为模块,解决了这一问题。

S2L在离线阶段使用完整的技能文档生成技能引导的演示,并在在线阶段动态加载相应的LoRA适配器以激活学习到的技能行为。实验结果表明,S2L在SWE-Skills-Bench的21种技能中提高了通过率,同时减少了token成本。

这一方法的意义在于,它不仅提高了模型的效率,还可能缓解长技能文档在模型推理时引入的干扰。未来的研究可以探索多技能组合的适配器设计,以进一步提升S2L的应用范围。

深度分析

研究背景

随着代理系统的发展,技能库的概念逐渐形成。每个技能结合了自然语言指导、脚本和资源。然而,传统的方法需要在运行时重复注入技能文本,导致效率低下。

核心问题

现有方法在运行时重复注入技能文本,导致token成本增加,并可能引入不匹配的模板或扩大动作空间。

核心创新

S2L通过将技能文本转化为LoRA适配器,减少了运行时的文本注入。此方法将技能引导的行为变化建模为可学习的功能偏差。

方法详解

  • �� 离线阶段:使用完整的技能文档生成技能引导的演示。
  • �� 在线阶段:动态加载相应的LoRA适配器以激活学习到的技能行为。
  • �� 通过LoRA训练将行为模式转化为轻量级参数。

实验设计

在SWE-Skills-Bench的21种技能中进行评估,使用Qwen3.6-27B模型,比较无技能和完整技能文本基线。

结果分析

S2L在提高通过率的同时减少了token成本,显示出技能特定适配器对性能提升的重要性。

应用场景

S2L可用于需要高效技能调用的代理系统,特别是在软件工程任务中。

局限与展望

S2L对技能特定的适配器对齐依赖较大,可能不适用于需要多技能组合的复杂任务。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。传统方法就像每次都要重新阅读食谱,而S2L就像你已经记住了食谱,只需在需要时回忆关键步骤。这样不仅节省时间,还减少了错误的可能性。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次都要重新看攻略是不是很麻烦?S2L就像是你已经掌握了攻略的精髓,只需在关键时刻使用。这让你玩得更快,更顺利!

术语表

LoRA (低秩适配)

一种通过训练小规模低秩更新来适应技能的技术。

用于将技能文本转化为行为模块。

SKILL.md

人类可读的程序文档,描述工作流程和工具。

传统技能表示的基础。

SWE-Skills-Bench

一个用于评估技能注入对任务执行影响的基准。

用于验证S2L的有效性。

Qwen3.6-27B

用于S2L评估的冻结基础模型。

作为实验中的基础模型。

自蒸馏

一种通过模型自身生成数据进行训练的方法。

用于生成技能引导的行为演示。

开放问题 这项研究留下的未解疑问

  • 1 如何在多技能组合的复杂任务中有效应用S2L?
  • 2 S2L在更大规模的技能库上是否仍然有效?

应用场景

近期应用

软件工程代理

S2L可以提高软件工程任务中技能调用的效率,减少运行时的token成本。

远期愿景

通用智能代理

S2L的成功可能推动通用智能代理的发展,使其能够更高效地学习和应用技能。

原文摘要

Agent skills are commonly distributed as SKILL.md files: human-readable procedural documents that describe workflows, tools, resources, and domain conventions. While convenient for inspection and reuse, this design requires the same reusable procedure to be repeatedly injected into the runtime context. We propose Skill-to-LoRA(S2L), a behavior-centric skill representation that replaces runtime skill text with skill-specific LoRA adapters. Rather than compressing the skill document itself, S2L models the behavioral change induced by the skill text: offline, the complete SKILL.md is used to synthesize skill-guided demonstrations; online, the full document is omitted and the corresponding LoRA adapter is dynamically loaded to activate the learned skill behavior. We evaluate S2L with Qwen3.6-27B on a 21-skill subset of SWE-Skills-Bench. Compared with the no-skill and Full Skill Text baselines, S2L improves pass rate by 2.9 and 5.2 percentage points, respectively, while reducing per-step token cost by 6.6% relative to Full Skill Text prompting. S2L matches or improves Full Skill Text on 18/21 skills and the no-skill baseline on 15/21 skills. Control experiments further show that the gains depend on skill-specific adapter alignment: Wrong-LoRA and Shared-LoRA both reduce performance. These results suggest that many procedural agent skills can be converted from runtime instructions into trainable, dynamically loadable behavioral modules. Code will be released upon acceptance.

cs.AI