Prime Agent: A Self-Improving RLM Harness

TL;DR

Prime Agent通过递归语言模型和持续性工具整合,实现长时程自主评估,提升ARC-AGI-3得分至95.5%。

cs.AI 🔴 高级 2026-08-25 89 次浏览
Seth Karten Alex L. Zhang Kevin Thomas Sebastian Müller Elie Bakouch Daniel Auras Mika Senghaas Fares Obeid Konstantin Dunas Johannes Hagemann Sami Jaghouar
多智能体系统 长时程评估 递归语言模型 信息管理 自主学习

核心发现

方法论

Prime Agent采用递归语言模型(RLM)抽象,结合持久IPython REPL实现程序化上下文处理与测试计算。系统通过持续性工具(Continual Harness)维护历史、记忆、技能和子代理配置,支持多层次信息管理。递归子代理通过点对点通信协作,形成动态多智能体网络。核心机制包括:• 基于RLM的程序调用与调度;• 多层次状态组织(模型权重、活动上下文、磁盘存储);• 持续性会话与子代理递归通信;• Trajectory的持续性改进与版本控制。系统实现了标准化执行、恢复、验证与资源核算,最大化模型潜能。

关键结果

  • 在ARC-AGI-3任务中,Prime Agent将RHAE得分从30%提升至95.5%,显著优于传统封装和其他工具。长上下文编码、GPU核生成、模拟器构建及NanoGPT自主跑分均达到或超越行业领先水平。
  • 在Factorio环境中,系统实现连续技术进步,子代理支持并行任务,达成71%技术研发完成率,持续多日自主实验,表现出强大长时程自主能力。
  • 在EmulatorBench等长时任务中,Prime Agent成功构建多个模拟器(如SEGA Genesis、Game Boy Color),验证了其在复杂软件重建中的优越性,平均解决率超过60%。

研究意义

该研究突破了传统语言模型在长时程自主任务中的局限,通过信息与计算的深度整合,极大提升模型的任务执行能力。系统实现了多智能体协作、持续学习与自我改进,为未来自主系统的研发提供了新范式。其在复杂任务中的表现,标志着AI自主能力迈入新阶段,推动智能系统向更高的自主性与适应性发展。

技术贡献

提出结合递归语言模型与持续性工具的统一框架,标准化长时程评估流程。创新点包括:• 多层次状态组织架构(模型权重、上下文、持久存储);•递归子代理与点对点通信机制;• Trajectory的版本化与持续改进策略。系统实现了模型自主构建策略、资源管理与故障恢复的高效协同,为多智能体系统设计提供了工程基础。

新颖性

首次将递归语言模型与持续性会话深度融合,形成可扩展的多智能体协作平台。不同于现有封装或单一任务导向的系统,Prime Agent强调信息管理与计算调度的解耦,支持复杂长时任务的自主执行与优化,代表了长时程自主AI的技术突破。

局限性

  • 系统对高复杂度任务的资源消耗较大,尤其在多子代理协作时,计算与存储成本显著上升,限制了大规模部署。
  • 在某些安全敏感环境中,持续性存储与子代理通信可能引发信息泄露或滥用风险,需加强安全机制。
  • 模型自主策略仍受训练数据与预设策略限制,面对未知环境或极端场景时表现尚待验证。

未来方向

未来将探索更高效的资源调度策略,降低系统复杂度;增强安全机制,确保信息安全;扩展多模态输入输出能力,支持更复杂的自主任务;同时推动硬件优化,提升系统的实时性与规模化能力。

AI 总览摘要

Prime Agent引入了一种基于递归语言模型(RLM)与持续性工具的创新架构,旨在突破传统语言模型在长时程自主任务中的局限。通过结合持久存储、多层次信息管理和递归子代理,系统实现了动态多智能体协作,支持复杂任务的连续执行与自我优化。在评估中,Prime Agent将ARC-AGI-3得分从30%提升至95.5%,在长上下文编码、GPU核生成、模拟器重建及NanoGPT自主跑分中表现优异,验证了其在长时程自主能力上的突破。该系统不仅提升了模型的任务执行效率,还为多智能体系统设计提供了工程基础。其创新点在于将递归语言模型与持续性存储深度融合,支持信息与计算的解耦,推动自主系统向更高的智能水平迈进。未来,系统将继续优化资源调度、安全机制,并扩展多模态能力,助力自主AI的广泛应用。

深度分析

研究背景

近年来,深度学习与大规模语言模型(如GPT、Claude、PaLM)在自然语言处理、代码生成等领域取得突破。然而,模型在长时程任务中的表现仍受限于上下文长度、信息管理与多智能体协作能力。传统方法多依赖封装式封装或单一任务优化,难以实现持续学习与动态调度。近年来,递归语言模型(RLM)与持续性工具的结合逐渐成为研究热点,旨在突破模型单一推理能力的瓶颈。相关工作包括OpenAI的Codex、DeepMind的Gato,以及多智能体系统中的多层次信息管理方案,但仍缺乏统一的长时程自主评估平台。Prime Agent正是在此背景下提出,旨在整合信息管理、计算调度与多智能体协作,推动自主系统的长时程能力发展。

核心问题

现有语言模型在长时程任务中表现受限,主要原因包括:上下文长度有限、信息管理碎片化、缺乏持续性记忆与多智能体协作机制。这导致模型难以在复杂环境中保持任务连续性、优化策略,影响自主能力的提升。尤其是在多阶段、多任务的长周期任务中,模型容易失去上下文、资源难以持续调度,限制了其应用范围。解决这一瓶颈,需构建支持持续信息存储、递归调度与多智能体协作的系统架构,以实现模型的自主学习与持续改进。

核心创新

Prime Agent的核心创新在于:1)将递归语言模型(RLM)作为上下文调度的基础架构,实现程序化调用与递归激活;2)引入多层次状态组织,将模型权重、活动上下文、持久存储(磁盘)有机结合,支持信息的持续性管理;3)设计持续性会话(Continual Harness),实现轨迹的版本化与自我改进;4)支持多智能体的点对点通信,构建动态协作网络。这些创新使得模型不仅能在单一任务中表现优异,还能在长周期、多任务环境中自主调度、优化策略,极大扩展了模型的应用场景。

方法详解

  • �� 采用递归语言模型(RLM)实现程序调用与调度,支持多层次状态管理;
  • �� 设计持久性存储(L3)保存历史、记忆、技能与子代理配置,支持轨迹版本化;
  • �� 利用持续性会话(Continual Harness)动态维护上下文与策略,支持轨迹改进;
  • �� 通过点对点异步通信实现多智能体协作,支持动态任务分配;
  • �� 结合资源核算与恢复机制,确保系统稳定性与效率;
  • �� 提供可视化界面(Agents View)便于人机交互与监控。

实验设计

系统在ARC-AGI-3、Factorio、EmulatorBench等长时任务中进行评估,使用标准数据集和任务指标。对比基线包括传统封装系统和其他开源工具。关键指标包括得分提升、任务完成率、资源消耗和轨迹质量。通过多轮实验验证系统在长时任务中的持续性、信息管理能力和多智能体协作效果。还进行了多日自主实验,验证系统的稳定性与自我改进能力。参数设置包括模型规模、子代理数量、会话深度等,确保公平性。

结果分析

Prime Agent在ARC-AGI-3中的得分由30%提升至95.5%,远超传统封装。在Factorio中,达成71%技术研发完成率,持续多日自主实验,表现出强大长时自主能力。模拟器重建任务中,成功重建SEGA Genesis和Game Boy Color,解决率超过60%。在GPU核生成和NanoGPT训练中,系统实现了显著的效率提升,减少了资源消耗,验证了其在复杂软件重建和长周期自主任务中的优越性。

应用场景

该系统适用于自动化软件重建、复杂环境中的自主探索、长周期科研实验等场景。企业可利用其进行自动化代码生成、系统调试与优化,科研机构可用以持续学习与策略改进。未来还可扩展到多模态任务、机器人自主控制等领域,推动智能系统的自主性与适应性提升。

局限与展望

系统对硬件资源要求较高,尤其在多子代理协作时,计算与存储成本显著增加。安全性方面,持续存储与通信可能引发信息泄露风险。模型自主策略受训练数据限制,面对极端或未知环境表现尚待验证。此外,系统在极端复杂任务中的效率和稳定性仍需优化。未来需在资源优化、安全机制和泛化能力方面持续改进。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,这个工厂每天都在生产不同的产品。工厂里的工人(模型)只知道自己手头的工作,不能看到整个工厂的全局。为了让工厂更高效,管理者(系统)设计了一个智能助手(Prime Agent),它可以记住每天的生产情况、存储重要信息,还能安排不同的工人协作。这个助手会不断学习,优化流程,甚至可以自己提出改进方案。它还能在不同的部门之间传递信息,让整个工厂变得越来越智能和高效。这个系统就像一个聪明的工厂管理者,既能记忆过去,又能自主安排未来的工作,帮助工厂不断进步。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的学伴(Prime Agent),它不仅能帮你记住所有课程内容,还能自己想办法解决难题。比如,你在做数学题时,它会记住之前学过的知识,然后帮你找到最好的解题方法。它还能和其他学伴合作,共同完成复杂的任务,比如准备演讲或者做科学实验。这个学伴会不断学习,变得越来越聪明,甚至可以自己提出改进方案。就像你有个超级助手一样,它让学习变得更轻松、更有趣,也让你变得更聪明!

原文摘要

Language models are sequential processors, but long-horizon agency requires external information and computation beyond model weights and active context. Prime Agent is an open-source harness for long-horizon evaluation and coding-agent workflows. A persistent IPython REPL follows the Recursive Language Model abstraction for programmatic context processing and test-time compute, while Continual Harness preserves histories, memories, skills, prompts, and subagent specifications across trajectories. Recursive subagents coordinate through direct agent-to-agent communication, and the Agents View lets humans inspect and manage daemon-backed sessions. Prime Agent standardizes execution, recovery, verification, and resource accounting while leaving strategy construction to the model. This low-friction, expressive membrane prevents harness failures from becoming model failures and pushes measurement toward the model's true maximal underlying capability. Prime Agent raises ARC-AGI-3 RHAE Best@1 from 30% to 95.5% and matches or exceeds native and popular harnesses across long-context coding, GPU-kernel generation, emulator construction, and autonomous nanoGPT speedruns. On Factorio, we find refinement allows for continuous technology progression and dedicated subagents enable parallelized work. Code is available at https://github.com/PrimeIntellect-ai/prime-agent.

cs.AI cs.CL cs.SE