SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

TL;DR

SkillFlow采用流匹配损失实现多策略多路径优化,推动自主技能演化。

cs.AI 🔴 高级 2026-05-14 34 次浏览
Mingda Zhang Tiesunlong Shen Haoran Luo Wenjin Liu Zikai Xiao Erik Cambria Xiaoying Tang
强化学习 任务调度 技能演化 流模型 深度学习

核心发现

方法论

SkillFlow引入基于流匹配的Tempered Trajectory Balance (TTB)损失,通过采样奖励比例的轨迹,避免策略崩溃,保持多样性。采用可训练的监督器与结构化环境协作,动态管理技能库,利用反向策略实现逐步信用归因。递归技能演化机制根据流诊断信号自动调整技能库,提升自主学习能力。整体框架结合流网络、轨迹匹配和递归优化,显著提升多任务表现。

关键结果

  • 在14个数据集上,SkillFlow在问答、数学推理、代码生成和交互决策任务中均优于基线,提升幅度达20-50%。例如,在WebShop任务中,准确率从54.10%提升至87.96%,增长37.8%。
  • 在OOD(分布外)测试中,SkillFlow保持优异表现,平均F1提升约6%,显示其迁移能力强。对比REINFORCE等方法,策略多样性和任务成功率显著改善。
  • 通过消融实验验证TTB的低方差优势,递归技能演化有效扩展技能库,提升任务适应性与策略多样性。

研究意义

该研究解决了强化学习中策略崩溃、信用归因不透明和技能演化盲目等核心难题,为自主智能体的多任务调度提供了理论基础和实践路径。SkillFlow的流模型设计实现了奖励导向的多路径探索,有助于推动自主系统在复杂环境中的应用,具有重要的学术价值和工业潜力。

技术贡献

提出基于流匹配的TTB损失,结合反向策略实现逐步信用归因,突破传统RL单一策略模式。引入递归技能演化机制,利用流诊断信号自主调整技能库,提升策略多样性和适应性。整体架构实现无额外推理成本的多路径采样,为多任务自主调度提供新思路。

新颖性

首次将流模型引入任务调度中的递归技能演化,结合轨迹奖励比例采样与零成本信用归因,解决策略崩溃和技能盲目演化问题。区别于传统基于奖励的RL和静态技能库,SkillFlow实现动态技能管理和多路径探索,开启自主智能体新范式。

局限性

  • 当前方法依赖大量轨迹采样,训练成本较高,特别在大规模环境中可能面临效率瓶颈。
  • 技能库的自动演化虽有效,但在极端复杂任务中仍可能出现技能冗余或不足的问题。
  • 对环境结构和奖励设计敏感,需精心调参以确保流匹配效果。

未来方向

未来将探索多模态环境中的技能演化,结合元学习优化技能库管理,提升泛化能力。同时,考虑引入更高效的采样策略和多智能体协作机制,推动自主系统在实际复杂场景中的应用落地。

AI 总览摘要

随着人工智能技术的快速发展,基于大规模语言模型(LLM)的自主智能体在复杂任务中的应用日益广泛。传统的任务调度方法多依赖手工设计技能或静态策略,难以应对环境变化和任务多样性。为解决这一难题,SkillFlow提出了一种基于流模型的任务调度框架,通过引入Tempered Trajectory Balance(TTB)损失,有效保持多路径、多策略的探索能力。

SkillFlow的核心在于利用流匹配机制,将轨迹采样概率与奖励成比例,避免策略崩溃,增强多样性。同时,结合反向策略实现逐步信用归因,提供透明的决策责任追踪。这一机制支持递归技能演化,自动识别何时、何地、何种技能需要创建或修剪,从而实现技能库的自主扩展。

在14个公开任务数据集上的实验结果显示,SkillFlow在问答、数学推理、代码生成和交互决策中均优于多种基线方法,提升幅度达20-50%。特别是在分布外任务中,表现出优异的迁移能力,验证了其泛化潜力。这一研究不仅突破了RL在策略多样性和技能演化方面的瓶颈,也为自主智能体的未来发展提供了新思路。

然而,当前方法仍面临训练成本较高和环境依赖性强的问题。未来,研究将聚焦多模态环境、多智能体协作以及更高效的采样策略,以推动自主系统在实际复杂场景中的应用落地。

深度分析

研究背景

近年来,基于大规模语言模型的自主智能体逐步成为研究热点。早期多采用规则或模板驱动的任务调度,难以适应环境变化。随着深度学习和强化学习的发展,出现如ReAct、PALM等方法,强调通过反馈优化策略,但仍存在策略崩溃、信用归因不透明和技能管理困难的问题。近年来,技能库的动态管理和多路径探索成为研究焦点,但缺乏系统的理论支撑。SkillFlow借鉴流模型思想,结合轨迹奖励比例采样,旨在解决这些瓶颈,推动自主系统的智能化和自主演化。

核心问题

传统强化学习在多任务调度中易陷入策略崩溃,难以保持多样性。信用归因困难导致策略优化不透明,技能演化缺乏系统指导,容易盲目扩展或缩减技能库。这些问题限制了自主智能体在复杂环境中的表现和适应能力。现有方法多依赖手工调节或启发式规则,缺乏理论支撑,难以实现真正的自主演化。解决这些难题,成为推动自主智能体发展的关键。

核心创新

本研究提出基于流匹配的TTB损失,确保轨迹采样与奖励成比例,避免策略崩溃,保持多样性。引入反向策略实现逐步信用归因,提供每一步的责任追踪。结合递归技能演化机制,利用流诊断信号自主识别技能库的调整时机和内容,突破静态技能限制。这一创新架构实现了无额外推理成本的多路径探索和自主技能管理,为多任务调度提供了新范式。

方法详解

  • �� 设计结构化环境,维护动态技能库和冻结执行器。• 训练可调节的监督器,生成多路径轨迹。• 引入TTB损失,通过采样奖励比例轨迹,优化轨迹分布。• 利用反向策略实现逐步信用归因,标记关键决策。• 通过流诊断信号,自动识别技能演化的时机和内容。• 采用递归机制,根据流残差和技能贡献,动态调整技能库。• 训练过程中不断优化流匹配,确保多路径探索与技能演化同步进行。

实验设计

在14个任务数据集上,比较SkillFlow与多种基线,包括直接LLM、RL和静态技能库方法。采用准确率、F1、成功率等指标,进行AB测试和消融分析。调节参数β控制多样性与质量的平衡,验证流匹配的稳定性和效率。通过不同任务场景验证模型的迁移能力和技能演化效果,确保在IID和OOD环境中的优越表现。

结果分析

SkillFlow在所有任务中均优于对比方法,平均提升达30%以上。在WebShop任务中,准确率从54.10%提升至87.96%。OOD测试中,平均F1提升6%,表现出良好的迁移能力。消融实验显示TTB低方差优势明显,递归技能演化有效扩展技能库,提升任务适应性。模型在多任务、多场景中保持高效、多样的策略探索能力,验证了其理论和实践价值。

应用场景

该方法适用于需要多路径调度和技能自主演化的复杂系统,如智能客服、自动驾驶、工业自动化等。只需定义任务目标和奖励机制,即可实现自主技能管理和调度优化,提升系统的智能化水平。未来可结合多模态数据和多智能体协作,推动工业界的智能制造和服务机器人应用。

局限与展望

当前模型训练依赖大量轨迹采样,计算成本较高。技能库的自动演化在极端复杂任务中可能出现冗余或不足。对环境的结构和奖励设计敏感,调参复杂。未来需优化采样效率,增强技能库的稳定性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭。每次做菜都需要不同的步骤,比如切菜、炒菜、调味。传统的方法就像提前准备好所有菜谱,固定流程,遇到新菜就很难调整。SkillFlow就像一个聪明的厨师,它能根据食材和味道的反馈,自己调整做菜的步骤,甚至发明新菜。它用一种特殊的“流”机制,确保每个步骤都能得到奖励(比如味道好),而不是只追求最快或最便宜。这样,厨师可以不断学习,做出更好吃的菜,而且还能根据不同的食材和客人偏好,灵活变换菜谱。这个系统还能自己决定什么时候需要加入新菜,什么时候删掉不受欢迎的菜,变得越来越聪明。就像一个会自己学习、不断改进的厨师,能应对各种复杂的厨房挑战。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你要完成很多任务,比如解谜、打怪、收集宝藏。以前的游戏设计师会给你一套固定的攻略,告诉你怎么做,但如果遇到新怪或者新任务,就不知道怎么办了。SkillFlow就像一个聪明的朋友,它能自己学习怎么应对不同的挑战。它会观察你每一步的成功和失败,然后自己总结出哪些策略最有效。它用一种特别的方法,确保它不会只学会一种套路,而是学会很多不同的办法。这样,无论游戏怎么变,它都能找到应对的方法。它还能自己决定什么时候学习新技能,什么时候放弃一些不再需要的技能。就像一个不断变强、越来越聪明的伙伴,帮你在游戏中取得胜利。这个系统让AI变得更聪明、更灵活,能应对各种复杂的任务和环境,就像你在游戏中不断成长一样。

原文摘要

In recent years, a variety of powerful LLM-based agentic systems have been applied to automate complex tasks through task orchestration. However, existing orchestration methods still face key challenges, including strategy collapse under reward maximization, high gradient variance with opaque credit assignment, and unguided skill evolution whose decisions are typically made by directly prompting an LLM to judge rather than derived from principled training signals. To address these challenges, we propose SkillFlow, a flow-based framework that takes a trainable Supervisor as the agent and a structured environment with dynamic skill library and frozen executor, automating task orchestration through multi-turn interaction. SkillFlow employs Tempered Trajectory Balance (TTB), a regression-based flow-matching loss that samples trajectories proportional to reward, preserving diverse orchestration strategies rather than collapsing to a single mode. The same flow objective yields a jointly learned backward policy that provides transparent per-step credit assignment at zero additional inference cost. Building on these flow diagnostics, a recursive skill evolution mechanism determines when to evolve, what skills to create or prune, and where decision gaps lie -- closing the loop from training signal to autonomous capability growth. Experimental results on 14 datasets show that SkillFlow significantly outperforms baselines across question answering, mathematical reasoning, code generation, and real-world interactive decision making tasks. Our code is available at https://anonymous.4open.science/r/SkillFlow-E850.

cs.AI