OpenSkill: Open-World Self-Evolution for LLM Agents

TL;DR

OpenSkill框架在无监督条件下提升LLM代理的技能迁移能力,取得最佳自动化通过率。

cs.AI 🔴 高级 2026-06-05 3 次浏览
Zhiling Yan Dingjie Song Hanrong Zhang Wei Liang Yuxuan Zhang Yutong Dai Lifang He Philip S. Yu Ran Xu Xiang Li Lichao Sun
开放世界 自我进化 LLM代理 技能迁移 无监督学习

核心发现

方法论

OpenSkill框架通过三个阶段实现:从开放世界获取知识,利用自建虚拟任务精炼技能,最终在目标代理上零样本部署。每个阶段都不依赖目标任务监督。

关键结果

  • OpenSkill在SkillsBench上取得43.6%的通过率,比最强基线高出8.9%,在Opus 4.6和GPT 5.2上表现优异。
  • 在SocialMaze和ScienceWorld中,OpenSkill分别达到82.7%和90.0%的通过率,超越所有自动化方法。
  • 虚拟验证器的代理测试覆盖了88.9%的真实测试意图,尽管没有访问真实测试。

研究意义

OpenSkill在无监督条件下实现了技能的跨模型迁移,显著提高了LLM代理在开放世界中的适应能力。这一框架解决了现有方法在开放世界中缺乏可靠学习循环的问题。

技术贡献

OpenSkill通过自建虚拟任务和开放世界知识获取,提供了一个无需目标任务监督的技能进化方法,突破了现有方法的局限,提供了新的工程可能性。

新颖性

OpenSkill首次在无监督条件下实现了LLM代理的开放世界自我进化,区别于以往依赖监督信号的方法。

局限性

  • 在制造业领域,所有自动化方法的通过率均为0%,表明开放世界获取无法解决所有问题。
  • 虚拟验证器的部分测试未能覆盖深层语义质量属性。

未来方向

未来研究可探索如何在更复杂的任务中应用OpenSkill,并改进虚拟验证器以覆盖更广泛的测试意图。

AI 总览摘要

OpenSkill框架旨在解决LLM代理在开放世界中缺乏可靠学习循环的问题。现有方法通常依赖于监督信号,而OpenSkill通过从开放世界中获取知识并自建虚拟任务来实现技能的自我进化。

OpenSkill在三个阶段中运作:首先从开放世界中获取知识,然后利用自建的虚拟任务精炼技能,最后在目标代理上进行零样本部署。实验结果显示,该框架在多个基准测试中取得了最佳的自动化通过率。

尽管OpenSkill在多个领域表现出色,但在制造业领域的表现仍需改进。未来的研究可以进一步优化虚拟验证器,扩展其测试覆盖范围。总体而言,OpenSkill为LLM代理在开放世界中的应用提供了新的可能性。

深度分析

研究背景

随着大语言模型(LLM)的发展,代理在开放世界中执行任务的能力成为研究热点。传统方法依赖于预定义的技能和监督信号,限制了其在动态环境中的适应性。

核心问题

核心问题在于如何在开放世界中实现LLM代理的自我进化,尤其是在没有目标任务监督的情况下构建技能和验证信号。

核心创新

OpenSkill通过开放世界知识获取和自建虚拟任务实现了技能的自我进化。其创新之处在于无需目标任务监督,能够在多个模型间迁移技能。

方法详解

  • �� 开放世界知识获取:从文档、代码库等获取任务相关知识。
  • �� 漏泄自由的技能进化:利用自建虚拟任务精炼技能。
  • �� 零样本目标评估:在目标代理上部署最终技能。

实验设计

实验在SkillsBench、SocialMaze和ScienceWorld三个基准上进行,使用Opus 4.6和GPT 5.2作为目标代理。对比基线包括Self-Gen、CoT等。

结果分析

OpenSkill在SkillsBench上取得了43.6%的通过率,显著高于基线。虚拟验证器覆盖了88.9%的真实测试意图,显示出其有效性。

应用场景

OpenSkill可用于需要动态适应的领域,如自动驾驶和智能客服,减少对人工监督的依赖。

局限与展望

在制造业领域的表现不佳,表明开放世界获取的局限性。未来需改进虚拟验证器的覆盖范围。

通俗解读 非专业人士也能看懂

想象你在一个巨大的图书馆中,寻找一本关于如何修理自行车的书。你没有老师告诉你哪本书是正确的,只能依靠自己的判断。OpenSkill就像是一个聪明的助手,它会帮你找到相关的书籍,并根据这些书籍的信息来练习修理自行车。即使没有人告诉你具体怎么做,你也能通过不断尝试和练习来提高技能。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏规则是你要自己找出怎么过关。没有人告诉你答案,但你可以在网上查找攻略和教程。OpenSkill就像是一个超级助手,它会帮你找到所有相关的信息,然后你可以用这些信息来尝试过关。即使没有人告诉你具体怎么做,你也能通过不断尝试来变得更厉害!

术语表

开放世界 (Open World)

指没有明确边界或限制的环境,代理需要自主探索和学习。

在OpenSkill中,代理从开放世界中获取知识。

自我进化 (Self-Evolution)

代理在没有外部监督的情况下,通过自主学习和适应不断提高自身能力。

OpenSkill框架实现了LLM代理的自我进化。

虚拟验证器 (Virtual Verifier)

一个用于生成代理测试的代理,帮助评估技能质量。

OpenSkill使用虚拟验证器来替代真实测试。

技能迁移 (Skill Transfer)

将一种模型生成的技能应用于其他模型的能力。

OpenSkill实现了跨模型的技能迁移。

零样本 (Zero-Shot)

在没有见过具体任务示例的情况下,直接应用技能。

OpenSkill在目标代理上进行零样本评估。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务中应用OpenSkill?
  • 2 虚拟验证器如何覆盖更深层次的语义测试?

应用场景

近期应用

智能客服

通过OpenSkill,客服系统可以在没有预定义答案的情况下,自动适应客户需求。

远期愿景

自动驾驶

OpenSkill可以帮助自动驾驶系统在动态环境中自主学习和适应,减少对人工监督的依赖。

原文摘要

Self-evolving agents requires adaptation after deployment, but existing approaches assume a usable learning loop, such as curated skills, successful trajectories, or verifier signals. Real open-world deployments may provide none of these, offering only a task prompt. In this work, we study open-world self-evolution, where an agent must build both its skills and its own verification signals from scratch, using open-world resources but no target-task supervision. We propose OpenSkill, a framework that bootstraps this loop: it acquires grounded knowledge and verification anchors from documentation, repositories, and the web, synthesizes them into transferable skills, and refines those skills against self-built virtual tasks grounded in the anchors rather than in target answers. The open world thus supplies both the knowledge to be learned and a supervision-independent practice environment, with target-task supervision reserved for final evaluation. Across three benchmarks and two target agents, OpenSkill attains the best automated pass rate while satisfying the no-supervision constraint. Analysis shows its skills transfer across models without model-specific adaptation, and its self-built verifier aligns with ground-truth outcomes despite never accessing them.

cs.AI cs.CL cs.LG