Prime Agent: A Self-Improving RLM Harness
Prime Agent通过递归语言模型和持续性工具整合,实现长时程自主评估,提升ARC-AGI-3得分至95.5%。
核心发现
方法论
Prime Agent采用递归语言模型(RLM)抽象,结合持久IPython REPL实现程序化上下文处理与测试计算。系统通过持续性工具(Continual Harness)维护历史、记忆、技能和子代理配置,支持多层次信息管理。递归子代理通过点对点通信协作,形成动态多智能体网络。核心机制包括:• 基于RLM的程序调用与调度;• 多层次状态组织(模型权重、活动上下文、磁盘存储);• 持续性会话与子代理递归通信;• Trajectory的持续性改进与版本控制。系统实现了标准化执行、恢复、验证与资源核算,最大化模型潜能。
关键结果
- 在ARC-AGI-3任务中,Prime Agent将RHAE得分从30%提升至95.5%,显著优于传统封装和其他工具。长上下文编码、GPU核生成、模拟器构建及NanoGPT自主跑分均达到或超越行业领先水平。
- 在Factorio环境中,系统实现连续技术进步,子代理支持并行任务,达成71%技术研发完成率,持续多日自主实验,表现出强大长时程自主能力。
- 在EmulatorBench等长时任务中,Prime Agent成功构建多个模拟器(如SEGA Genesis、Game Boy Color),验证了其在复杂软件重建中的优越性,平均解决率超过60%。
研究意义
该研究突破了传统语言模型在长时程自主任务中的局限,通过信息与计算的深度整合,极大提升模型的任务执行能力。系统实现了多智能体协作、持续学习与自我改进,为未来自主系统的研发提供了新范式。其在复杂任务中的表现,标志着AI自主能力迈入新阶段,推动智能系统向更高的自主性与适应性发展。
技术贡献
提出结合递归语言模型与持续性工具的统一框架,标准化长时程评估流程。创新点包括:• 多层次状态组织架构(模型权重、上下文、持久存储);•递归子代理与点对点通信机制;• Trajectory的版本化与持续改进策略。系统实现了模型自主构建策略、资源管理与故障恢复的高效协同,为多智能体系统设计提供了工程基础。
新颖性
首次将递归语言模型与持续性会话深度融合,形成可扩展的多智能体协作平台。不同于现有封装或单一任务导向的系统,Prime Agent强调信息管理与计算调度的解耦,支持复杂长时任务的自主执行与优化,代表了长时程自主AI的技术突破。
局限性
- 系统对高复杂度任务的资源消耗较大,尤其在多子代理协作时,计算与存储成本显著上升,限制了大规模部署。
- 在某些安全敏感环境中,持续性存储与子代理通信可能引发信息泄露或滥用风险,需加强安全机制。
- 模型自主策略仍受训练数据与预设策略限制,面对未知环境或极端场景时表现尚待验证。
未来方向
未来将探索更高效的资源调度策略,降低系统复杂度;增强安全机制,确保信息安全;扩展多模态输入输出能力,支持更复杂的自主任务;同时推动硬件优化,提升系统的实时性与规模化能力。
AI 总览摘要
Prime Agent引入了一种基于递归语言模型(RLM)与持续性工具的创新架构,旨在突破传统语言模型在长时程自主任务中的局限。通过结合持久存储、多层次信息管理和递归子代理,系统实现了动态多智能体协作,支持复杂任务的连续执行与自我优化。在评估中,Prime Agent将ARC-AGI-3得分从30%提升至95.5%,在长上下文编码、GPU核生成、模拟器重建及NanoGPT自主跑分中表现优异,验证了其在长时程自主能力上的突破。该系统不仅提升了模型的任务执行效率,还为多智能体系统设计提供了工程基础。其创新点在于将递归语言模型与持续性存储深度融合,支持信息与计算的解耦,推动自主系统向更高的智能水平迈进。未来,系统将继续优化资源调度、安全机制,并扩展多模态能力,助力自主AI的广泛应用。
深度分析
研究背景
近年来,深度学习与大规模语言模型(如GPT、Claude、PaLM)在自然语言处理、代码生成等领域取得突破。然而,模型在长时程任务中的表现仍受限于上下文长度、信息管理与多智能体协作能力。传统方法多依赖封装式封装或单一任务优化,难以实现持续学习与动态调度。近年来,递归语言模型(RLM)与持续性工具的结合逐渐成为研究热点,旨在突破模型单一推理能力的瓶颈。相关工作包括OpenAI的Codex、DeepMind的Gato,以及多智能体系统中的多层次信息管理方案,但仍缺乏统一的长时程自主评估平台。Prime Agent正是在此背景下提出,旨在整合信息管理、计算调度与多智能体协作,推动自主系统的长时程能力发展。
核心问题
现有语言模型在长时程任务中表现受限,主要原因包括:上下文长度有限、信息管理碎片化、缺乏持续性记忆与多智能体协作机制。这导致模型难以在复杂环境中保持任务连续性、优化策略,影响自主能力的提升。尤其是在多阶段、多任务的长周期任务中,模型容易失去上下文、资源难以持续调度,限制了其应用范围。解决这一瓶颈,需构建支持持续信息存储、递归调度与多智能体协作的系统架构,以实现模型的自主学习与持续改进。
核心创新
Prime Agent的核心创新在于:1)将递归语言模型(RLM)作为上下文调度的基础架构,实现程序化调用与递归激活;2)引入多层次状态组织,将模型权重、活动上下文、持久存储(磁盘)有机结合,支持信息的持续性管理;3)设计持续性会话(Continual Harness),实现轨迹的版本化与自我改进;4)支持多智能体的点对点通信,构建动态协作网络。这些创新使得模型不仅能在单一任务中表现优异,还能在长周期、多任务环境中自主调度、优化策略,极大扩展了模型的应用场景。
方法详解
- �� 采用递归语言模型(RLM)实现程序调用与调度,支持多层次状态管理;
- �� 设计持久性存储(L3)保存历史、记忆、技能与子代理配置,支持轨迹版本化;
- �� 利用持续性会话(Continual Harness)动态维护上下文与策略,支持轨迹改进;
- �� 通过点对点异步通信实现多智能体协作,支持动态任务分配;
- �� 结合资源核算与恢复机制,确保系统稳定性与效率;
- �� 提供可视化界面(Agents View)便于人机交互与监控。
实验设计
系统在ARC-AGI-3、Factorio、EmulatorBench等长时任务中进行评估,使用标准数据集和任务指标。对比基线包括传统封装系统和其他开源工具。关键指标包括得分提升、任务完成率、资源消耗和轨迹质量。通过多轮实验验证系统在长时任务中的持续性、信息管理能力和多智能体协作效果。还进行了多日自主实验,验证系统的稳定性与自我改进能力。参数设置包括模型规模、子代理数量、会话深度等,确保公平性。
结果分析
Prime Agent在ARC-AGI-3中的得分由30%提升至95.5%,远超传统封装。在Factorio中,达成71%技术研发完成率,持续多日自主实验,表现出强大长时自主能力。模拟器重建任务中,成功重建SEGA Genesis和Game Boy Color,解决率超过60%。在GPU核生成和NanoGPT训练中,系统实现了显著的效率提升,减少了资源消耗,验证了其在复杂软件重建和长周期自主任务中的优越性。
应用场景
该系统适用于自动化软件重建、复杂环境中的自主探索、长周期科研实验等场景。企业可利用其进行自动化代码生成、系统调试与优化,科研机构可用以持续学习与策略改进。未来还可扩展到多模态任务、机器人自主控制等领域,推动智能系统的自主性与适应性提升。
局限与展望
系统对硬件资源要求较高,尤其在多子代理协作时,计算与存储成本显著增加。安全性方面,持续存储与通信可能引发信息泄露风险。模型自主策略受训练数据限制,面对极端或未知环境表现尚待验证。此外,系统在极端复杂任务中的效率和稳定性仍需优化。未来需在资源优化、安全机制和泛化能力方面持续改进。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,这个工厂每天都在生产不同的产品。工厂里的工人(模型)只知道自己手头的工作,不能看到整个工厂的全局。为了让工厂更高效,管理者(系统)设计了一个智能助手(Prime Agent),它可以记住每天的生产情况、存储重要信息,还能安排不同的工人协作。这个助手会不断学习,优化流程,甚至可以自己提出改进方案。它还能在不同的部门之间传递信息,让整个工厂变得越来越智能和高效。这个系统就像一个聪明的工厂管理者,既能记忆过去,又能自主安排未来的工作,帮助工厂不断进步。
简单解释 像给14岁少年讲一样
想象你在学校里,有个超级聪明的学伴(Prime Agent),它不仅能帮你记住所有课程内容,还能自己想办法解决难题。比如,你在做数学题时,它会记住之前学过的知识,然后帮你找到最好的解题方法。它还能和其他学伴合作,共同完成复杂的任务,比如准备演讲或者做科学实验。这个学伴会不断学习,变得越来越聪明,甚至可以自己提出改进方案。就像你有个超级助手一样,它让学习变得更轻松、更有趣,也让你变得更聪明!
原文摘要
Language models are sequential processors, but long-horizon agency requires external information and computation beyond model weights and active context. Prime Agent is an open-source harness for long-horizon evaluation and coding-agent workflows. A persistent IPython REPL follows the Recursive Language Model abstraction for programmatic context processing and test-time compute, while Continual Harness preserves histories, memories, skills, prompts, and subagent specifications across trajectories. Recursive subagents coordinate through direct agent-to-agent communication, and the Agents View lets humans inspect and manage daemon-backed sessions. Prime Agent standardizes execution, recovery, verification, and resource accounting while leaving strategy construction to the model. This low-friction, expressive membrane prevents harness failures from becoming model failures and pushes measurement toward the model's true maximal underlying capability. Prime Agent raises ARC-AGI-3 RHAE Best@1 from 30% to 95.5% and matches or exceeds native and popular harnesses across long-context coding, GPU-kernel generation, emulator construction, and autonomous nanoGPT speedruns. On Factorio, we find refinement allows for continuous technology progression and dedicated subagents enable parallelized work. Code is available at https://github.com/PrimeIntellect-ai/prime-agent.