核心发现
方法论
OpenSkill框架通过三个阶段实现:从开放世界获取知识,利用自建虚拟任务精炼技能,最终在目标代理上零样本部署。每个阶段都不依赖目标任务监督。
关键结果
- OpenSkill在SkillsBench上取得43.6%的通过率,比最强基线高出8.9%,在Opus 4.6和GPT 5.2上表现优异。
- 在SocialMaze和ScienceWorld中,OpenSkill分别达到82.7%和90.0%的通过率,超越所有自动化方法。
- 虚拟验证器的代理测试覆盖了88.9%的真实测试意图,尽管没有访问真实测试。
研究意义
OpenSkill在无监督条件下实现了技能的跨模型迁移,显著提高了LLM代理在开放世界中的适应能力。这一框架解决了现有方法在开放世界中缺乏可靠学习循环的问题。
技术贡献
OpenSkill通过自建虚拟任务和开放世界知识获取,提供了一个无需目标任务监督的技能进化方法,突破了现有方法的局限,提供了新的工程可能性。
新颖性
OpenSkill首次在无监督条件下实现了LLM代理的开放世界自我进化,区别于以往依赖监督信号的方法。
局限性
- 在制造业领域,所有自动化方法的通过率均为0%,表明开放世界获取无法解决所有问题。
- 虚拟验证器的部分测试未能覆盖深层语义质量属性。
未来方向
未来研究可探索如何在更复杂的任务中应用OpenSkill,并改进虚拟验证器以覆盖更广泛的测试意图。
AI 总览摘要
OpenSkill框架旨在解决LLM代理在开放世界中缺乏可靠学习循环的问题。现有方法通常依赖于监督信号,而OpenSkill通过从开放世界中获取知识并自建虚拟任务来实现技能的自我进化。
OpenSkill在三个阶段中运作:首先从开放世界中获取知识,然后利用自建的虚拟任务精炼技能,最后在目标代理上进行零样本部署。实验结果显示,该框架在多个基准测试中取得了最佳的自动化通过率。
尽管OpenSkill在多个领域表现出色,但在制造业领域的表现仍需改进。未来的研究可以进一步优化虚拟验证器,扩展其测试覆盖范围。总体而言,OpenSkill为LLM代理在开放世界中的应用提供了新的可能性。
深度分析
研究背景
随着大语言模型(LLM)的发展,代理在开放世界中执行任务的能力成为研究热点。传统方法依赖于预定义的技能和监督信号,限制了其在动态环境中的适应性。
核心问题
核心问题在于如何在开放世界中实现LLM代理的自我进化,尤其是在没有目标任务监督的情况下构建技能和验证信号。
核心创新
OpenSkill通过开放世界知识获取和自建虚拟任务实现了技能的自我进化。其创新之处在于无需目标任务监督,能够在多个模型间迁移技能。
方法详解
- �� 开放世界知识获取:从文档、代码库等获取任务相关知识。
- �� 漏泄自由的技能进化:利用自建虚拟任务精炼技能。
- �� 零样本目标评估:在目标代理上部署最终技能。
实验设计
实验在SkillsBench、SocialMaze和ScienceWorld三个基准上进行,使用Opus 4.6和GPT 5.2作为目标代理。对比基线包括Self-Gen、CoT等。
结果分析
OpenSkill在SkillsBench上取得了43.6%的通过率,显著高于基线。虚拟验证器覆盖了88.9%的真实测试意图,显示出其有效性。
应用场景
OpenSkill可用于需要动态适应的领域,如自动驾驶和智能客服,减少对人工监督的依赖。
局限与展望
在制造业领域的表现不佳,表明开放世界获取的局限性。未来需改进虚拟验证器的覆盖范围。
通俗解读 非专业人士也能看懂
想象你在一个巨大的图书馆中,寻找一本关于如何修理自行车的书。你没有老师告诉你哪本书是正确的,只能依靠自己的判断。OpenSkill就像是一个聪明的助手,它会帮你找到相关的书籍,并根据这些书籍的信息来练习修理自行车。即使没有人告诉你具体怎么做,你也能通过不断尝试和练习来提高技能。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,游戏规则是你要自己找出怎么过关。没有人告诉你答案,但你可以在网上查找攻略和教程。OpenSkill就像是一个超级助手,它会帮你找到所有相关的信息,然后你可以用这些信息来尝试过关。即使没有人告诉你具体怎么做,你也能通过不断尝试来变得更厉害!
术语表
开放世界 (Open World)
指没有明确边界或限制的环境,代理需要自主探索和学习。
在OpenSkill中,代理从开放世界中获取知识。
自我进化 (Self-Evolution)
代理在没有外部监督的情况下,通过自主学习和适应不断提高自身能力。
OpenSkill框架实现了LLM代理的自我进化。
虚拟验证器 (Virtual Verifier)
一个用于生成代理测试的代理,帮助评估技能质量。
OpenSkill使用虚拟验证器来替代真实测试。
技能迁移 (Skill Transfer)
将一种模型生成的技能应用于其他模型的能力。
OpenSkill实现了跨模型的技能迁移。
零样本 (Zero-Shot)
在没有见过具体任务示例的情况下,直接应用技能。
OpenSkill在目标代理上进行零样本评估。
开放问题 这项研究留下的未解疑问
- 1 如何在更复杂的任务中应用OpenSkill?
- 2 虚拟验证器如何覆盖更深层次的语义测试?
应用场景
近期应用
智能客服
通过OpenSkill,客服系统可以在没有预定义答案的情况下,自动适应客户需求。
远期愿景
自动驾驶
OpenSkill可以帮助自动驾驶系统在动态环境中自主学习和适应,减少对人工监督的依赖。
原文摘要
Self-evolving agents requires adaptation after deployment, but existing approaches assume a usable learning loop, such as curated skills, successful trajectories, or verifier signals. Real open-world deployments may provide none of these, offering only a task prompt. In this work, we study open-world self-evolution, where an agent must build both its skills and its own verification signals from scratch, using open-world resources but no target-task supervision. We propose OpenSkill, a framework that bootstraps this loop: it acquires grounded knowledge and verification anchors from documentation, repositories, and the web, synthesizes them into transferable skills, and refines those skills against self-built virtual tasks grounded in the anchors rather than in target answers. The open world thus supplies both the knowledge to be learned and a supervision-independent practice environment, with target-task supervision reserved for final evaluation. Across three benchmarks and two target agents, OpenSkill attains the best automated pass rate while satisfying the no-supervision constraint. Analysis shows its skills transfer across models without model-specific adaptation, and its self-built verifier aligns with ground-truth outcomes despite never accessing them.