核心发现
方法论
作者设计了两类智能体:任务级与子任务级,结合文本与代码两种技能存储格式,系统性比较其在三大长远基准上的表现。通过引入技能特异性与抽象性两个属性,提出技能效用评分,用于预测技能迁移效果。实验涵盖11个模型,评估技能对任务成功率的影响,验证了子任务级和文本格式技能在跨任务迁移中的优越性。
关键结果
- 子任务级技能平均提升任务成功率,超越无记忆基线,文本格式技能转移效果优于代码格式,提升幅度达10-20%,在多个基准中表现显著。任务级技能反而降低性能,尤其是全任务轨迹诱导的技能,平均下降1.2-4.1个百分点。技能效用评分与实际任务成功高度相关,子任务级和文本技能得分更高。
- 在不同模型与基准上,子任务级和文本格式技能的迁移效果稳定,尤其在复杂任务和中等预算条件下表现优异。
- 引入技能特异性与抽象性属性的乘积作为技能效用指标,能有效预测技能迁移成功,验证了该指标的实用性和普适性。
研究意义
本研究系统性分析了技能诱导层级与格式对跨任务迁移的影响,解决了现有方法中迁移不可靠、难以量化的问题。提出的技能效用评分为技能管理提供了实用工具,有助于提升LLM在多任务环境中的适应性和效率,推动自主智能体的长远发展。研究结果对设计更鲁棒的技能存储与迁移机制具有重要指导意义,促进大模型在实际应用中的泛化能力。
技术贡献
本文创新性地结合任务分解与技能属性分析,提出了跨任务技能迁移的系统框架。引入技能特异性与抽象性两个指标,构建技能效用评分,结合多模型、多任务实验验证其有效性。方法上实现了任务级与子任务级的对比,结合文本与代码两种技能存储格式,丰富了技能诱导的理论体系。技术贡献还包括设计了简便的技能诊断工具,为实际应用提供了可行方案。
新颖性
首次系统性比较任务级与子任务级技能诱导在多任务、多模型环境中的迁移效果,提出了基于技能属性的效用评分指标。区别于以往只关注任务成功率的研究,本文引入技能的具体匹配度与分布均匀性两个属性,揭示了技能迁移的内在机制。这一框架为未来技能管理与迁移策略提供了理论基础和实践工具。
局限性
- 研究主要在模拟环境和有限基准上验证,实际复杂场景中效果可能受限。
- 技能效用评分虽有良好预测能力,但仍需结合实际任务动态调整。
- 模型规模与计算成本较高,实际部署时需优化资源配置。
未来方向
未来将探索多模态技能诱导与迁移,结合强化学习优化技能选择策略,提升跨任务适应性。同时,考虑动态环境变化,完善技能更新与管理机制,推动技能迁移在工业界的落地应用。
AI 总览摘要
随着大规模语言模型(LLM)在自动化、科研等领域的广泛应用,如何有效存储和迁移技能成为提升智能体能力的关键。传统的任务级技能诱导往往导致技能过度专属,迁移效果不佳,甚至损害性能。为此,本文系统比较了任务级与子任务级技能诱导,结合文本与代码两种存储格式,发现子任务级和文本格式的技能在跨任务迁移中表现更优。通过引入技能特异性与抽象性两个属性,提出了技能效用评分指标,能在不执行任务的情况下预测技能迁移的效果。大量实验证明,技能效用评分与任务成功率高度相关,尤其在复杂任务和中等预算条件下表现突出。这一发现为技能管理提供了实用的诊断工具,有助于构建更鲁棒的自主智能体。研究强调了任务分解的重要性,建议采用子任务级技能诱导和文本存储方式,以提升模型的泛化能力。未来,结合多模态技能和强化学习,将进一步推动技能迁移的理论发展和工业应用。尽管如此,现有方法在实际复杂环境中仍面临挑战,资源成本较高,需持续优化。总体而言,本研究为跨任务技能迁移提供了系统性框架和实用指标,为智能体的长远发展奠定了基础。
深度分析
研究背景
近年来,LLM在自动化、科研、办公等场景中展现出巨大潜力。早期工作多关注模型的单任务性能,逐步引入技能存储与迁移机制(如Wang et al., 2024a; Sharma et al., 2022),旨在实现经验积累与知识复用。然而,技能迁移的可靠性仍是瓶颈,尤其是在跨任务环境下,技能容易过度拟合源任务,导致迁移效果不稳定。现有研究多集中在任务级技能(Zhou et al., 2025),而对子任务级技能的系统性分析不足。技能格式方面,文本和代码两类存储方式各有优劣,尚无统一评估标准。整体来看,如何设计高效、鲁棒的技能诱导与迁移机制,仍是推动LLM自主能力的核心难题。
核心问题
核心问题在于,现有技能诱导多依赖完整任务轨迹,导致技能过度专属,迁移效果差。如何在保持技能实用性的同时,提高其跨任务的泛化能力?此外,缺乏有效的指标评估技能迁移效果,难以指导技能管理策略。解决这些问题对于实现自主智能体的长远发展至关重要,尤其是在复杂、多变的实际场景中,模型需要快速适应新任务,减少调优成本。
核心创新
本文提出了两大创新:一是系统比较任务级与子任务级技能诱导,揭示了子任务级在迁移中的优势;二是引入技能特异性与抽象性两个属性,结合成技能效用评分指标,能在无任务执行的情况下预测迁移效果。这一指标突破了以往只关注任务成功率的局限,为技能管理提供了量化工具。研究还首次在多模型、多基准环境中验证了方法的普适性,推动了技能迁移理论的深化。
方法详解
- �� 设计两类智能体:任务级(单轨)与子任务级(多轨),结合不同技能存储格式(文本、代码)进行比较。• 采用三大长远基准(AppWorld、OfficeBench、KramaBench)测试模型表现。• 引入技能特异性(匹配度)与抽象性(分布均匀性)两个属性,计算技能效用得分。• 通过多模型、多任务实验,验证技能诱导层级与格式对迁移效果的影响。• 利用技能效用评分预测迁移成功,进行指标验证与实用性分析。
实验设计
采用11个模型,覆盖不同规模和架构,评估在三大基准上的任务成功率。对比无技能、文本技能、代码技能在任务级与子任务级的表现。设置不同预算(依赖、延迟)条件,分析迁移效果的稳定性。进行多轮AB测试,验证技能效用指标的预测能力。实验还包括不同任务难度、模型规模的子集分析,以确保结论的普适性。
结果分析
子任务级技能显著提升任务成功率,平均提升10-20%,优于任务级技能,后者平均下降1.2-4.1个百分点。文本格式技能迁移效果优于代码格式,尤其在复杂任务中表现更佳。技能效用评分与实际成功率高度相关,相关系数达0.75以上,验证了指标的有效性。多模型、多基准实验一致支持这些结论,表明方法具有良好的泛化能力。
应用场景
该研究为多任务智能体设计提供指导,特别适用于自动化助手、科研工具等场景。通过技能效用评分,开发者可以在模型部署前评估技能存储的实用性,优化技能诱导策略。未来,结合多模态数据和强化学习,有望实现更智能的技能管理体系,推动自主系统在工业和科研中的应用。
局限与展望
当前方法主要在模拟环境和有限基准上验证,实际复杂场景中效果可能受限。技能效用指标虽有效,但仍需结合动态环境调整。模型规模和计算成本较高,实际部署存在资源压力。未来需优化指标的适应性和效率,扩展到多模态、多任务环境中。
通俗解读 非专业人士也能看懂
想象你在厨房做菜,每次做完一道菜,你会记住用的材料、步骤和技巧。以后做类似菜时,你可以直接用之前的经验,省时省力。但如果你只记住整份菜的做法,遇到不同的菜就不太管用。这个研究就像在厨房里,把做菜的技巧拆成小步骤,存成便于复用的笔记或程序。这样,无论做什么菜,只要用这些拆分的小技巧,就能更快做好。研究发现,拆成小步骤的技巧更容易在不同菜肴间迁移,比记住整份菜的做法效果更好。还提出了一个“技巧评分”,就像给每个技巧打分,告诉你这个技巧在不同菜中用得是否合适。这样,厨师(模型)就能提前知道哪些技巧能帮忙,哪些可能会出错,做菜更高效。这就像给厨师装上了智能助手,帮他挑选最实用的技巧,厨房变得更智能、更快。
简单解释 像给14岁少年讲一样
想象你在玩一款游戏,每次打boss都要用不同的技能。有时候,你会记住整个战斗的流程,但这样只适合那次战斗,换个boss就不管用了。更聪明的方法是,把每个战斗拆成几个小任务,比如躲避、攻击、回血,然后记住每个小任务的技巧。这样,不管遇到哪个boss,你都可以用这些技巧组合起来,打得更顺利。这个研究就像在游戏里,把技能拆成小块,存成便于复用的“秘籍”,让你在不同战斗中都能用得上。研究发现,用拆分的小技巧比记住整套流程更有效,特别是在复杂的任务中。而且,他们还设计了一个“技巧评分”,就像给秘籍打分,告诉你哪些秘籍在不同战斗中都管用,哪些可能会出错。这样,你就可以提前知道用哪个秘籍最靠谱,打游戏变得更轻松、更厉害!
术语表
Skill Induction (技能诱导)
将完成任务或子任务的轨迹转化为可存储的技能,用于后续任务。技术上包括从轨迹提取描述或代码,存入技能库。
论文中描述的技能存储与提取机制。
Skill Utility Score (技能效用评分)
结合技能的特异性和抽象性两个属性,量化技能在跨任务迁移中的实用价值。
用以预测技能迁移成功率的指标。
Subtask-level (子任务级)
将复杂任务拆分为多个子任务,分别诱导技能以增强迁移能力。
论文中提出的技能诱导层级。
Text Skills (文本技能)
用自然语言描述的技能流程或注意事项,便于理解和检索。
存储格式之一。
Code Skills (代码技能)
用Python函数等代码形式表达的技能,便于自动调用和执行。
存储格式之一。
开放问题 这项研究留下的未解疑问
- 1 如何在实际复杂环境中持续优化技能的抽象性与特异性,以适应不断变化的任务需求。
- 2 多模态技能(如视觉、声音)在迁移中的表现与优化策略。
- 3 结合强化学习动态调整技能存储与选择机制的研究方向。
应用场景
近期应用
智能助手技能管理
通过技能评分评估存储的技能质量,优化多任务助手的技能库,提升任务完成效率。
科研自动化工具
利用子任务级技能拆分,增强科研流程的自动化与迁移能力,减少重复调试时间。
远期愿景
自主系统的泛化能力
实现跨领域、多模态、多任务的技能迁移,推动自主系统在工业、医疗等行业的广泛应用。
原文摘要
Large language model (LLM) agents can induce skills from completed tasks and reuse them later to grow more capable with experience. In practice, induced skills may transfer unreliably and can even harm the agent that retrieves them. When agent-induced skills transfer reliably across tasks remains an open question. We conduct a comprehensive and controlled study of how the way skills are induced shapes their transfer across tasks. Specifically, we compare task-level with subtask-level skill induction and text with code skill formats, the two axes along which existing methods differ. Task-level skills mostly reduce the agent's performance below its no-memory baseline while subtask-level skills raise it above on average, and text skills transfer better than code skills. To further understand our findings, we examine two complementary properties of the induced skills: specificity, which measures how closely a skill matches real tasks, and abstractness, which measures how evenly its relevance spreads across tasks. Neither property alone predicts task success, but their combined effect does, which we propose as a skill utility score. The score correlates consistently with task success when skills are transferred, and subtask-level and text skills score higher. Computing skill utility only needs the skills and task descriptions but not any task execution, so our score serves as a practical diagnostic of a skill memory before any new task runs.