核心发现
方法论
OPD-Evolver包含快速测试时进化与慢速训练蒸馏。快速环使用轨迹、提示、技能、工具四级记忆,执行检索、选择、行动、写入和维护;慢速环以结果校准的记忆归因V(m),并让带特权回溯信息的教师在学生自身前缀上进行全词表KL蒸馏,联合训练selection、act、write、maint四类能力。
关键结果
- 在LifelongAgentBench、MemoryArena、AMA-Bench和InterCode的10个子集上,OPD-Evolver-9B均优于同骨干记忆基线;例如OS为65.00%对MemEvolve的61.00%,AMA-SA为52.92%对AWM的48.00%,CTF为57.00%对MemEvolve的53.00%。
- OPD-Evolver-9B超过STEP-3.5-FLASH(196B)的9/10项,并在10项中6项超过QWEN3.5-397B-A17B;在SQL上为64.01%对62.74%,显示小模型可借助生命周期进化挑战巨型模型。
- InterCode消融表明,去除记忆归因后平均成绩由38.67%降至32.13%,Bash/CTF/SQL分别下降4.96、7.31和7.36个百分点;去除慢循环后平均为33.10%,写入蒸馏尤其使CTF从34.00%降至29.00%。
研究意义
论文把“拥有记忆”重新定义为“能够管理并利用经验持续改进”。它回应了现有系统只会保存轨迹、检索反思或积累技能,却无法判断经验价值、把经验转成行动、写出可复用知识并长期清理仓库的问题。对学术界而言,四能力生命周期提供统一研究对象;对工业界而言,模型可在不即时改参数的情况下适应用户、工具和环境变化,同时降低对超大模型的依赖。
技术贡献
核心技术是将稀疏任务回报转化为记忆级监督。对实际被检索的候选记忆,论文用组内选择与未选择任务的回报差计算归因,并以ρg、层级先验αℓ和置信因子γ加权得到V(m)。随后,特权教师观察成功轨迹、未来有用记忆和仓库诊断,学生在部署输入及自身采样前缀上接受token-level KL蒸馏,实现选择、执行、写入、维护的统一训练。
新颖性
新颖性不在于单独提出记忆、技能库或OPD,而在于首次将四种记忆生命周期能力纳入同一可部署策略,并用结果校准归因连接延迟回报与记忆决策。相较ReasoningBank等提示增强系统,以及Skill0、SFT、GRPO等主要优化执行的方法,OPD-Evolver训练的是“如何进化”的整体行为。
局限性
- 训练数据来自Agent World Model、Nemotron-Terminal-Corpus和EnvScaler,虽与评测集隔离,但仍未证明在更开放、持续变化的真实环境中稳定有效。
- 归因依赖同组任务、检索日志和后验成功轨迹;稀疏回报、样本不足或任务分组错误会造成V(m)偏差,并可能误删稀有但关键的记忆。
- 方法需要教师特权上下文、周期性维护和多阶段蒸馏,训练成本及仓库规模控制仍缺少系统分析。
未来方向
未来应研究更稳健的因果记忆归因、在线不确定性估计和跨任务自动分组,并评估百万级仓库、长期部署及真实机器人环境。还可结合RL、主动遗忘、隐私保护和多智能体共享记忆,检验模型能否在分布持续漂移时安全进化。
AI 总览摘要
智能体拥有记忆,并不等于真正学会进化。传统系统如ReasoningBank能够保存轨迹、反思和技能,却往往无法同时决定哪些经验值得调用、如何据此行动、哪些新知识应被写入,以及何时合并或删除旧内容。错误选择会引入噪声,错误写入会污染未来,仓库失控则会导致长期退化。
OPD-Evolver提出慢快共进化框架。快速循环在测试时处理轨迹、提示、技能和工具四级记忆:先检索和选择,再执行任务,随后写入新经验,并每30个任务用lookup、merge、delete维护仓库。慢速循环收集结果回报,利用选择与未选择记忆的组内回报差构造V(m),再让特权教师把高价值记忆、成功轨迹和仓库诊断蒸馏给部署策略。教师与学生共享学生自身采样前缀,从而减小训练—推理分布差异。
结果显示,OPD-Evolver-9B在10个评测子集上击败同规模记忆基线,OS达到65.00%,AMA-SA达到52.92%,InterCode-CTF达到57.00%。它超过196B的STEP-3.5-FLASH九项,并在六项超过QWEN3.5-397B-A17B;消融实验也证明记忆归因、慢循环、写入和维护均不可缺。该工作将记忆增强推进为生命周期级的“进化器”,但其真实长期部署成本、归因可靠性和开放环境安全性仍待验证。
深度分析
研究背景
终身智能体通过记忆保存失败、成功轨迹和可复用策略。ExpeL、AWM、Cheatsheet、MemP、ReasoningBank、EvolveR和MemEvolve主要增强检索或提示;Skill0等方法通过训练内化经验。问题是这些系统通常只优化生命周期的一两个环节,尚未形成从选择到维护的闭环。
核心问题
给定任务xt、记忆库Mt和交互轨迹τt,智能体不仅要最大化回报Rt,还要提高更新仓库Mt+1的未来效用U(Mt+1),即优化E[Rt+λU(Mt+1)]。难点在于任务回报通常只监督行动,无法直接告诉模型哪些记忆应选、写入内容是否可复用或何时删除。
核心创新
- ��四级记忆:轨迹保真,提示记录局部警告,技能抽象程序,工具保存可执行模板。•结果校准归因:只在记忆实际进入候选集的任务组内比较选择与未选择回报。•统一OPD:把selection、act、write、maint作为同一策略的四种决策视图。•特权回溯:教师利用未来记忆价值与仓库诊断,学生仅学习部署时可见行为。
方法详解
- ��检索:以[z任务;环境元数据]为查询,在每个层级用QWEN3-EMBEDDING-0.6B按余弦相似度取Top-K,论文设置K=50。•选择:策略从候选Ct压缩为St并格式化为上下文ct。•行动:πθ依据任务、交互历史和ct产生动作,形成τt与总回报Rt。•写入:策略决定各层级是否生成Δℓt及数量。•维护:每Q=30个任务调用lookup、merge、delete。•归因:Â(m)=Σgρg(m)(E[R|选]-E[R|未选]),V(m)=αℓγÂ。•蒸馏:教师看特权h,学生在自身前缀上最小化全词表KL。
实验设计
训练数据为Agent World Model、nvidia/Nemotron-Terminal-Corpus和EnvScaler,骨干为QWEN3-4B-INSTRUCT-2507与QWEN3.5-9B,检索器为QWEN3-EMBEDDING-0.6B。评测包括LifelongAgentBench、MemoryArena、AMA-Bench、InterCode及MiniHack。基线含ReasoningBank、MemEvolve、Skill0、GRPO、MemRL和Complementary RL;所有记忆方法从空仓库开始。
结果分析
OPD-Evolver-4B和9B在同骨干记忆系统中全面领先。9B在OS为65.00%、Math为10.88%、Physics为11.63%、Bash为49.55%、CTF为57.00%、SQL为64.01%。相较GRPO,Maze由23.53%升至27.45%,KeyRoom由3.92%升至9.80%。选择蒸馏使SQL/CTF/Bash选中记忆中位价值由0.66/0.69/0.66升至0.79/0.76/0.76。
应用场景
适用于需要长期积累的终端操作、数据库代理、代码调试、网页自动化和具身导航。部署方需提供可记录反馈的环境、可检索仓库及安全的merge/delete权限;模型可先以外部记忆快速适应,再通过蒸馏逐步减少上下文依赖。
局限与展望
方法假设任务可分组、回报足以比较记忆价值,且候选检索能覆盖相关经验。在低频事件、非平稳任务或多目标安全场景中,回报差可能误判记忆。训练还需特权教师、日志和周期维护;论文未报告大规模仓库成本、隐私泄露、长期灾难性遗忘及真实机器人部署结果。
通俗解读 非专业人士也能看懂
把智能体想成一家会学习的厨房。普通记忆系统像仓库管理员:把旧菜谱、做菜记录和工具放进去,客人来时找几张相似的纸,但不一定知道哪张真正有用。OPD-Evolver让厨师同时学会四件事:挑对菜谱,照着菜谱灵活做菜,把新经验写成清楚的菜谱,还要定期合并重复内容、扔掉过时内容。
每次做菜后,厨房只知道客人是否满意。系统把“选了这张菜谱时是否更成功”与“没选时是否更成功”进行比较,给菜谱打分。训练老师还能事后看到完整过程,告诉学生哪些选择、动作和新菜谱最值得保留;学生则在自己原本会遇到的情况下练习。这样,模型不是只背答案,而是学会管理学习材料。
实验说明,这种方法确实有效:9B模型在InterCode SQL达到64.01%,超过397B模型的62.74%;去掉记忆归因后,InterCode平均成绩明显下降。它像一个越来越会整理厨房的厨师,但真实世界的食材、客人口味和安全要求更复杂,仍需长期测试。
简单解释 像给14岁少年讲一样
想象你在玩一款会不断换地图的游戏。你每次失败或通关后,都可以把经验写进一个背包:完整录像、提醒小贴士、攻略技能,还有能直接使用的工具。普通AI可能只是把东西塞进去,下一关看到相似内容就乱拿;OPD-Evolver要学会先挑最有用的,再照着它行动,打完后写下真正值得留下的经验,还要清理重复或过时的东西。
它怎么知道哪条经验有用?比如你在相似关卡中拿了某条攻略,胜率变高,那么这条攻略的分数会上升;如果拿了它反而失败,模型以后会更小心。训练时还有一个“未来视角”的老师,能看到哪些经验后来真的帮助了任务,然后把这些判断教给学生AI。测试时学生看不到答案,却能自己做出更好的选择。
结果很酷:9B模型在SQL任务拿到64.01%,超过参数多得多的397B模型62.74%;在10个测试项目中超过196B模型9项。删掉“判断记忆价值”的部分后,成绩大幅下降。也就是说,聪明不只是会做题,还要会整理自己的攻略背包!不过,长期运行时它是否会误删关键经验,仍然需要更多实验。
术语表
On-Policy Distillation(在策略蒸馏)
学生先按照自己实际会采取的行为采样,再学习教师在相同前缀上的分布。它减少训练数据与部署状态之间的偏差。
慢循环用特权教师指导选择、行动、写入和维护。
Outcome-Calibrated Attribution(结果校准归因)
通过比较相似任务中选择某记忆与未选择该记忆的回报,估计记忆对结果的贡献。公式包含组权重ρ、层级先验α和置信因子γ。
用于生成V(m),把延迟任务反馈变成记忆监督。
Four-Level Memory Hierarchy(四级记忆层级)
记忆分为trajectory、tip、skill和tool,分别对应原始证据、局部提示、抽象程序和可执行模板。不同层级提供不同复用粒度。
快速循环负责跨层检索、写入和维护。
Experience Lifecycle(经验生命周期)
经验从候选检索、选择和行动,到新知识写入,再到仓库合并、更新和删除的完整过程。论文将其视为智能体进化的基本闭环。
四项蒸馏能力分别对应selection、act、write和maint。
Privileged Hindsight(特权回溯)
训练教师可看到部署时不可见的未来结果、记忆价值和仓库诊断。它提供更密集、更准确的事后监督。
教师将成功轨迹和有价值写入示范给学生。
开放问题 这项研究留下的未解疑问
- 1 记忆归因仍是相关性估计:在稀疏回报、任务分组不准或多个记忆同时作用时,难以识别真正因果贡献。
- 2 论文主要验证离线训练与有限任务流,尚不清楚模型在百万级仓库、持续分布漂移和长时间运行中是否会累积错误。
- 3 安全删除、隐私记忆和多智能体共享仓库缺乏实验,需要可审计的生命周期约束。
应用场景
近期应用
终端与代码代理
开发团队可用OPD-Evolver记录成功的Bash、CTF和SQL操作,把常见修复流程写成技能或工具,并由维护环节合并重复经验。需要可回放日志、任务回报和受控工具权限,预期减少重复试错。
企业知识与流程助手
客服、数据分析或运维助手可将案例、提示和可执行模板分层保存,在新请求中选择高价值经验。企业需配置访问控制、人工审核和删除策略,以避免错误答案被长期传播。
远期愿景
持续学习的具身智能体
机器人可将完整轨迹、局部警告、操作技能和工具程序统一管理,在家庭或工厂中逐步适应新物体与新流程。关键障碍是安全探索、稀有事件归因、实时成本和跨身体迁移。
原文摘要
Memory has become a standard substrate for self-evolving agents, yet retaining experience is not the same as learning how to evolve through it. Existing memory agents can store trajectories, retrieve reflections, or accumulate skills, but often lack the holistic competence to select useful experience, act on it, write reusable knowledge, and maintain a growing repository. We introduce OPD-Evolver, a slow-fast co-evolution framework that cultivates such an agent evolver through on-policy self-distillation. In the fast loop, OPD-Evolver interacts with a four-level memory hierarchy to read, use, write, and maintain experience for rapid test-time evolution. In the slow loop, outcome-calibrated memory attribution and privileged hindsight distill these four abilities into the deployable policy. Across multi-domain benchmarks, OPD-Evolver surpasses memory systems such as ReasoningBank by up to 11.5%, and training-based methods such as Skill0 by ~5.8%. Further analysis shows that OPD-Evolver internalizes high-value experience and memory management, enabling OPD-Evolver-9B to challenge giant counterparts such as Qwen3.5-397B-A17B and Step-3.5-Flash, pointing beyond memory-augmented agents toward genuinely qualified agent evolvers.