核心发现
方法论
本文提出SpeedRunner框架,通过分析轨迹数据,利用代码执行环境自动提取和重构技能。采用双阶段学习机制:唤醒阶段由LLM生成轨迹,睡眠阶段由代码代理分析轨迹并优化技能库。核心算法包括轨迹分析、技能重构和调用图构建,强调程序的层次性和重用性。实验中,SpeedRunner在ScienceWorld、Crafter和BabyAI环境中,未依赖回放或验证,便实现了持续的成本降低和性能提升。该方法利用轨迹中的错误信息、行为模式和成功指标,避免了长轨迹上下文限制,支持长时序任务的高效学习。
关键结果
- 在三个环境中,SpeedRunner在学习效率和成本控制方面均优于基线方法,成本降低幅度达60%以上,且性能提升明显。例如,在BabyAI中,性能由67%提升至接近100%,成本降低至原有的八分之一。
- 实验显示,程序化技能的引入使得长时序任务中的技能重用成为可能,显著减少了重复劳动和探索成本。与ASI和OPO等方法相比,SpeedRunner在轨迹分析深度和调用图复杂度方面表现出更优的结构化能力。
- 消融实验验证了代码解释器和轨迹分析的关键作用,缺失这些组件会导致性能和成本的明显下降,证明程序化分析在实际应用中的重要性。
研究意义
该研究突破了传统基于自然语言描述技能的局限,提出程序化技能的在线学习策略,有效解决了长轨迹上下文限制和环境随机性带来的挑战。其成本效益和鲁棒性提升,为机器人自主学习、智能体持续适应复杂环境提供了新思路。此方法不仅推动了技能学习理论的发展,也为工业自动化、智能制造等领域的智能体部署提供了实用方案,具有广泛的应用前景。
技术贡献
本文的核心技术创新在于将技能表示为可执行代码,通过轨迹分析实现无回放的在线技能学习。引入代码分析器和调用图结构,增强了技能的层次性和重用性,突破了传统基于提示或手工工具的局限。算法设计结合了轨迹数据挖掘与程序重构,提出了高效的技能优化机制。实验验证了该方法在多环境中的普适性和成本优势,展示了程序化技能在长时序任务中的潜力。
新颖性
本研究首次系统性提出利用轨迹分析引导程序化技能学习,避免了长轨迹上下文限制和环境重置的假设。与现有的自然语言技能描述或纯代码技能方法不同,SpeedRunner通过自动分析轨迹中的错误和行为模式,实现了无需回放的持续学习。其将技能表示为层次化调用图,增强了技能的结构化和重用能力,开创了在线、无回放的程序化技能学习新路径。
局限性
- 该方法在极端随机性环境中可能面临鲁棒性不足的问题,程序化技能的确定性会影响适应性。
- 轨迹分析依赖丰富的错误信号和行为模式,环境噪声或稀疏反馈可能降低效果。
- 高复杂度调用图可能带来计算负担,未来需优化分析效率和模型规模。
未来方向
未来将探索多模态轨迹分析,结合视觉和传感信息增强技能重构能力。同时,计划引入自适应调用图结构,提升在高复杂度环境中的表现。此外,将考虑多智能体协作和迁移学习,推动程序化技能在实际机器人和工业场景中的应用落地。
AI 总览摘要
随着大规模语言模型(LLM)在智能体中的广泛应用,技能增强成为提升任务适应性和效率的关键路径。传统方法多关注性能提升,忽视了成本控制,导致在实际部署中面临高昂的计算和交互成本。本文提出了SpeedRunner框架,通过轨迹分析实现程序化技能的在线学习与重构,有效降低了长时序任务中的成本。
SpeedRunner采用双阶段机制:唤醒阶段由LLM生成轨迹,睡眠阶段由代码代理分析轨迹中的错误、行为模式和成功指标,自动提取和优化技能库。核心在于利用轨迹中的丰富信号,无需回放或验证,即时调整技能结构。这一方法突破了长轨迹上下文限制,支持复杂环境中的持续学习。
在ScienceWorld、Crafter和BabyAI三大环境中,SpeedRunner展现出优异的性能和成本优势。实验结果显示,成本降低幅度超过60%,性能提升明显,尤其在长时序任务中表现出强大的技能重用能力。消融实验验证了代码解释器和轨迹分析的重要性,证明程序化技能的结构化优势。
该研究推动了技能学习的理论与实践边界,为自主机器人、工业自动化等应用提供了新思路。未来,将结合多模态信息和多智能体协作,进一步提升程序化技能的适应性和普适性,推动智能体在复杂环境中的自主学习与持续优化。
深度分析
研究背景
近年来,随着深度学习和强化学习的发展,智能体自主学习已成为研究热点。早期方法如深度强化学习(DQN、A3C)解决了部分任务,但在长时序、多任务环境中效率不足。技能学习逐渐成为突破口,代表性工作包括自然语言描述技能(Zhong et al., 2026)、可执行函数(Stengel-Eskin et al., 2024)等。这些方法多依赖手工设计或离线验证,难以实现持续在线适应。近年来,程序化技能逐渐受到关注,试图用代码表达复杂行为,但多依赖环境重置或回放,限制了实际应用。
核心问题
核心问题在于如何在无需环境回放的条件下,利用轨迹数据实现高效、持续的技能学习。传统方法受限于轨迹长度、环境随机性和环境重置假设,难以在真实复杂环境中部署。长轨迹带来的上下文限制使得技能提取变得低效,而环境的随机性和噪声又削弱了纯自然语言描述的表达能力。解决这一瓶颈,成为实现自主、持续学习智能体的关键。
核心创新
本研究的创新点包括:1)提出基于轨迹分析的程序化技能学习框架,避免了环境回放和验证的依赖;2)引入代码解释器,支持调用图结构的技能重用和层次化组织,增强技能的结构性和可维护性;3)设计双阶段学习机制,结合轨迹数据与代码分析,实现无回放的在线持续学习;4)在多环境中验证了其成本效益和鲁棒性,展示了长时序任务中的潜力。这些创新突破了现有方法在效率和适应性上的局限。
方法详解
- �� 采用双阶段机制:唤醒阶段由LLM生成轨迹,睡眠阶段由代码代理分析和重构技能库。• 轨迹分析包括错误检测、行为模式识别和成功指标提取,利用调用图结构实现技能的层次化组织。• 代码解释器支持调用链追踪和静态分析,提升技能的重用性和可解释性。• 轨迹存储和版本管理确保技能演化的追踪,支持多轮优化。• 通过连续的任务采样和轨迹分析,逐步优化技能库,提升任务完成效率。
实验设计
在ScienceWorld、Crafter和BabyAI三大环境中,采用gpt-4o作为基础模型,进行200轮在线滚动训练,每10轮进行一次技能库优化。对比基线包括ReAct、OPO、ASI和Voyager,评估指标涵盖任务成功率和每轮输出Token数。实验设计确保无环境回放,强调轨迹分析的实时性和成本效益。通过不同随机种子验证结果的稳健性,采用统计检验确保显著性。
结果分析
SpeedRunner在所有环境中均实现了性能和成本的双重提升,成本降低超过60%,在BabyAI中性能由67%提升至接近100%。在Crafter中,任务完成率虽低于其他环境,但仍领先。消融实验显示,代码解释器和轨迹分析是性能提升的关键因素。结构分析表明,SpeedRunner学习了更深、更密集的调用图,表现出良好的技能重用和层次化能力。这些结果验证了程序化技能在长时序、多任务环境中的优越性。
应用场景
该方法适用于自主机器人、工业自动化、智能制造等场景,特别是在复杂环境中需要持续适应和技能重用的任务。通过轨迹分析实现的程序化技能,可以降低部署成本,提高系统的自主性和鲁棒性。未来,结合多模态信息和多智能体协作,将推动智能体在实际工业和服务场景中的广泛应用。
局限与展望
当前方法依赖丰富的轨迹信号,环境噪声或稀疏反馈可能影响效果。程序化技能的确定性在高随机性环境中可能变得脆弱,需引入鲁棒性机制。调用图复杂度增加时,计算成本上升,需优化分析效率。未来应结合学习和推理机制,提升在极端环境中的适应能力。
通俗解读 非专业人士也能看懂
想象你在厨房做饭。传统的方法就像每次都从头开始,按照食谱一步步操作,不管之前做过多少次,都得重新准备材料、洗菜、切菜。这样既慢又费力。现在,有了程序化技能,就像你提前写好一份菜单和操作流程,遇到相似的菜肴时,只需调用这些“菜谱”就能快速完成。轨迹分析就像厨师回顾自己做菜的录像,从中总结出哪些步骤可以重复使用,哪些需要改进。这样一来,不仅节省时间,还能做出更好吃的菜。这个方法让机器人也能像厨师一样,学会用“菜单”快速应对各种复杂任务,省时省力,还能不断优化自己的“厨艺”。
简单解释 像给14岁少年讲一样
想象你在玩一款超级复杂的游戏,每次玩都要从头开始,试错、失败,然后再重新尝试。这样既浪费时间,又容易卡壳。现在,假如你能记住自己之前成功的操作步骤,把它们写成一份攻略,下次遇到类似情况时就可以直接用这个攻略,节省很多时间。这就是程序化技能的核心思想。研究人员用电脑分析机器人之前的操作轨迹,找出重复的行为和错误,然后用代码把这些行为变成“技能”,让机器人可以在以后遇到类似任务时,直接调用这些技能,而不用每次都重新试错。这就像你用攻略打游戏,不仅快,还能更厉害。这个方法让机器人变得更聪明、更省钱,也更能适应复杂的环境,就像你变成了游戏高手一样!
原文摘要
Recently, the practice of augmenting LLM agent capability with skills has gained prevalence. We explore the cost effective adaptation of agents to novel domains by means of learning skills. Existing works focus on performance gain over cost effectiveness. As a result, little is known about what skill learning strategies save cost. We argue that among all the different skill learning methods, those that view skills as programs can achieve the best cost reduction. By executing sequences of actions deterministically, a program-augmented agent can reliably and cheaply achieve goals that would otherwise require trial and error and risk degenerate behavior over long horizons. An agent can learn at inference time by incrementally discovering these programs and equipping them for future tasks. We hypothesize that past trajectories contain enough signal to guide skill learning, even without replay or validation, provided the agent can learn to analyze them. To test our claims, we propose SpeedRunner, a coding agent that analyzes trajectories and refactors skills for better performance on future tasks. Across three different embodied environments, we show that SpeedRunner consistently achieves the frontier in learning and cost reduction while remaining robust against distribution shifts and environmental randomness.