MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution

TL;DR

提出MetaSkill-Evolve,通过两级元技能递归自我提升,提升任务技能+23.54点。

cs.AI 🔴 高级 2026-07-07 41 次浏览
Zefeng Wang Minxi Yan Jinhe Bi Sikuan Yan Volker Tresp Yunpu Ma
元学习 自我改进 大规模语言模型 递归优化 多任务学习

核心发现

方法论

该方法引入两级时间尺度的元技能演化框架,任务技能在快速循环中优化,而元技能在慢速循环中演化。每个分支携带任务技能s和局部元技能m=(ψ,σ,α,π,ε),分别对应分析器、检索器、分配器、提议器和演化器。任务技能在每次迭代中快速更新,元技能每H次迭代通过相同的五代理管线自我优化,无需额外模型或目标。所有五个代理共享同一固定骨架,形成闭环自我改进。该机制在OfficeQA、SealQA和ALFWorld三个基准上超越静态技能和单层演化,提升准确率分别为+23.54、+16.09和+1.92点。

关键结果

  • 在OfficeQA任务中,静态技能比无技能提升4.31点,单层演化增加12.85点,加入元技能慢速演化后再提升6.38点。类似趋势在SealQA中表现为+0.24、+7.80和+8.05点提升。在ALFWorld中,基础模型已接近天花板,改进幅度较小,但慢速元技能演化仍带来+1.92点的提升。
  • 对比无技能、静态技能和单层演化,MetaSkill-Evolve在三个任务中均表现出显著优势,特别是在两个问答任务中,整体提升超过16点,验证了递归自我优化的有效性。
  • 消融实验显示,每个元技能组成部分(ψ、σ、α、π、ε)均对性能贡献显著,缺失任何一环都会导致性能下降,验证了多元化管线设计的重要性。

研究意义

该研究突破了传统自我改进的局限,将改进过程本身作为可演化对象,实现递归自我提升。这不仅增强了大模型的适应性和自主性,也为未来自主学习系统提供了理论基础和工程方案,有望推动人工智能向更高层次的自我优化迈进。

技术贡献

创新点在于引入两级时间尺度的元技能演化机制,利用五代理管线实现自我优化,且无需额外模型或目标。该框架实现了递归自我改进,结合知识图谱和贝叶斯优化思想,提升了系统的适应性和泛化能力。通过共享骨架,确保不同分支的参数一致性,增强了系统的稳定性与可扩展性。

新颖性

首次提出将元技能作为可演化对象,嵌入多代理管线中实现递归自我优化,突破了现有方法中改进过程固定的限制。与传统的单层演化或固定规则不同,本方法实现了改进策略的自我演化,为自主学习提供了新范式。

局限性

  • 当前方法依赖大量的计算资源,尤其是在多次迭代和多分支维护中,可能限制实际应用规模。
  • 对元技能的优化仍受限于设计的五代理管线,未来需探索更高效的自我调节机制。
  • 在极端复杂任务或超大规模模型中,递归自我改进的稳定性和收敛性仍需验证。

未来方向

未来将探索多层次递归机制,结合强化学习和元学习理论,提升系统的自主性和鲁棒性。同时,考虑引入动态资源分配策略,优化多任务环境中的效率,推动递归自我改进在实际应用中的落地。

AI 总览摘要

随着大规模语言模型(LLMs)在长远、多任务场景中的应用不断扩大,如何实现模型的自主学习与持续改进成为核心难题。传统方法多依赖手工设计的技能或静态规则,难以适应多样化任务需求。本文提出MetaSkill-Evolve,一种基于两级时间尺度的元技能演化框架,旨在实现递归自我提升。系统通过在快速循环中优化任务技能,同时在慢速循环中演化元技能,形成闭环自我改进机制。每个分支携带任务技能和局部元技能,后者控制分析、检索、分配、提议和演化五个代理的行为。实验在OfficeQA、SealQA和ALFWorld三个基准上验证了其有效性,显著优于静态技能和单层演化方案,提升准确率达23.54点。该方法不仅突破了改进过程固定的限制,还为自主学习系统提供了新思路。未来,递归自我优化有望推动AI向更高层次的自主性迈进,解决复杂任务中的适应性和泛化问题。

深度分析

研究背景

近年来,LLMs在多任务、多步骤推理和工具使用方面取得突破,但其自主学习能力仍受限于预定义技能或规则。早期工作如Few-Shot学习、Chain-of-Thought推理、技能库构建等,虽提升了模型表现,但缺乏持续自我优化机制。近年来,反思、知识蒸馏、强化学习等技术被引入,推动技能自我改进,但多停留在单层或固定策略,难以实现深层次的递归优化。现有研究如EvoSkill、SkillWeaver等,虽实现了技能的迭代更新,但改进过程多为固定规则,缺乏对改进策略的自我演化能力。本文基于此背景,提出引入元技能作为可演化对象,结合多代理管线,实现递归自我提升,填补了自我改进深度不足的空白。

核心问题

核心问题在于现有自我改进机制多为单向、固定流程,难以适应多样化任务和复杂错误类型。改进策略的刚性限制了系统的学习能力,无法突破固定规则的瓶颈。如何将改进过程本身作为可优化对象,形成递归自我提升,成为关键难题。此外,如何在保证系统稳定性的同时,提升其适应性和泛化能力,也是亟待解决的问题。

核心创新

创新点包括:1)引入两级时间尺度的元技能演化机制,使改进策略可自我优化;2)设计五代理管线(分析、检索、分配、提议、演化)共同作用,支持多元化改进;3)将元技能作为与任务技能同等格式的可演化文件,嵌入递归自我改进流程;4)利用知识图谱和贝叶斯优化思想,提升搜索效率和多样性。此框架突破了传统固定规则的限制,实现了改进策略的自我演化,为自主学习提供新范式。

方法详解

  • �� 任务定义:任务T由输入x和目标输出y组成,任务技能s为Markdown格式的LLM程序,定义操作流程。• 任务效用:通过任务奖励U(s)=E_{(x,y)∼T}[r(As(x), y)]衡量技能表现。• 元技能:m=(ψ,σ,α,π,ε),每个为Markdown格式文件,控制分析、检索、分配、提议和演化。• 结构设计:每个分支携带任务技能s和局部元技能m,形成分支状态b=(s,m,h),h为历史。• 递归机制:任务技能在快速循环中优化,元技能每H次在慢速循环中通过相同五代理管线自我优化,形成闭环。• 搜索策略:利用多指标(U, P, N)对分支进行优先级排序,确保探索多样性和效率。• 代理流程:分析器诊断失败,检索器寻找相似案例,分配器设定子任务预算,提议器生成改进方案,演化器执行并验证。• 元技能优化:通过聚合H次结果,构建元故障追踪,反向调节元技能参数,支持递归自我提升。

实验设计

在OfficeQA、SealQA和ALFWorld三个基准上,采用分层采样划分训练、验证和测试集。所有实验均使用Google的Gemma-4 31B模型作为基础骨架,无微调。对比基线包括无技能、静态技能和单层演化。性能指标为测试准确率,评估不同策略的效果。消融实验验证各组成部分贡献,参数设置包括H=50,Kmax=5等。模型在多个迭代中持续优化,观察性能变化,确保统计显著性。

结果分析

MetaSkill-Evolve在OfficeQA中提升准确率23.54点,在SealQA中提升16.09点,在ALFWorld中提升1.92点,显著优于对比方法。问答任务中,逐步演化策略表现出单调增长,验证递归优化效果。消融实验显示,缺失任何元技能组成部分都会导致性能下降,说明多元化设计的必要性。整体结果表明,递归自我优化机制有效增强模型的适应性和泛化能力,尤其在复杂多变的任务环境中表现出优越性。

应用场景

该技术可应用于智能客服、自动化问答、复杂任务规划等场景,特别适合需要持续学习和适应新任务的系统。通过自我改进,减少人工干预,提高系统自主性。未来还可结合强化学习,拓展到机器人控制、自动驾驶等领域,推动自主系统的智能化升级。

局限与展望

当前方法对计算资源需求较高,尤其在多次递归和多分支维护中成本较大。对元技能的设计和优化仍依赖经验,缺乏自动化调节机制。系统在极端复杂或超大规模任务中稳定性和收敛性仍需验证。未来需优化算法效率,增强鲁棒性,降低实际部署门槛。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们每天按照固定流程生产产品。随着时间推移,他们发现一些步骤可以改进,但改进方式是由工厂设计师提前设定的。现在,工厂引入了一套智能系统,不仅能改进生产流程,还能自己学习如何更好地改进。这就像一个工厂里的机器人,不断观察、尝试、调整,甚至还能自己改写改进规则,使整个生产线变得更快、更好。这种系统不用每次都由人来告诉它怎么改,而是自己不断学习、优化,变得越来越聪明。它就像一个自我学习的厨师,能不断改良菜谱,做出更美味的菜肴。这个想法的核心是让机器自己学会改进自己,而不是依赖人类不断干预。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你可以用不同的策略赢得比赛。刚开始,你用的策略很普通,但你发现有些技巧可以让你更容易赢。于是你不断尝试新的技巧,逐渐变得更厉害。现在,假设你有一个超级聪明的助手,它不仅会帮你改进策略,还能自己学习哪些技巧更有效,然后自己调整策略。这个助手会观察你的每次比赛,分析哪里可以做得更好,然后自己试验新的方法。它就像一个不断学习的朋友,越玩越聪明,甚至可以自己发明新策略。这个系统的厉害之处在于,它不需要你每次都告诉它怎么改,而是自己不断试错、学习,变得越来越强。未来,这样的助手可以帮我们解决很多复杂的问题,比如自动驾驶、机器人操作,甚至帮我们写作和设计。它就像一个永远在学习、永远在变得更聪明的伙伴。

原文摘要

Recent LLM agents tackle increasingly long-horizon, open-ended tasks, and external skills, reusable procedural knowledge supplied to the agent, further extend this capability. However, a fixed, hand-authored skill is rarely optimal, and cannot adapt to the diversity of tasks an agent encounters. Self-improving agents address this by rewriting their own skill files from execution traces, yielding meaningful gains on challenging benchmarks. Yet such self-evolution remains non-recursive: it improves only the task skill (what the agent does) while the improvement procedure (how it improves) is authored once and held fixed. We introduce MetaSkill-Evolve, a two-timescale framework that makes agentic skill improvement recursive: every branch carries both a task skill $s$ and a branch-local meta-skill $m=(ψ,σ,α,π,\varepsilon)$ whose five components parameterise the Analyzer, Retriever, Allocator, Proposer, and Evolver agents of the improvement pipeline. Task skills evolve on a fast loop while the meta-skill evolves on a slower one under the same pipeline applied to itself, with no additional model or objective. With all five pipeline agents sharing a single frozen backbone, MetaSkill-Evolve outperforms no-skill, static-skill, and single-level evolution baselines on three agentic benchmarks (OfficeQA, SealQA, ALFWorld), improving held-out test accuracy over the raw backbone by +23.54, +16.09, and +1.92 points respectively.

cs.AI