Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents

TL;DR

提出基于部署反馈的持续学习方法,利用外部记忆提升模型在τ-bench银行任务中的成功率,单次成功提升1.6倍,修正后达2.6倍。

cs.AI 🔴 高级 2026-07-24 43 次浏览
Valentin Tablan Scott Taylor Kristoffer Bernhem
持续学习 外部记忆 部署反馈 自然语言规则 模型迁移

核心发现

方法论

本文提出一种无需调整模型参数的持续学习机制,将冻结模型与外部记忆结合,通过 episodes 生成自然语言规则。利用后续反馈(成功/失败判定和修正)进行知识蒸馏,存入记忆库。采用Spark系统实现知识存储与检索,基于τ-bench银行任务验证效果。对比静态RAG,经验学习和指令学习显著提升任务成功率,单次成功率分别达1.6倍和2.6倍,解决84个任务中的22个未解决任务。模型间记忆迁移也实现知识转移,提升整体性能。

关键结果

  • 在τ-bench银行任务中,单次成功率由基线的6.4%提升至17.0%(指令学习),修正后达39.7%,解决62/97任务。经验学习提升至10.3%,迁移到其他模型时也表现优异。记忆存储在模型间实现迁移,效果显著,且持续学习在多模型环境中有效。
  • 在两个不同模型(Mistral Large和Claude Sonnet 5)上验证,记忆机制在多轮试验中逐步提升成功率,且迁移实验显示记忆可跨模型传递,提升平均成功率约30%。
  • 实验采用Spark记忆系统,存储规则以自然语言表达,支持多任务、多模型环境,验证了反馈驱动的无梯度持续学习的可行性。

研究意义

该研究突破了模型在部署环境中无法持续学习的瓶颈,利用已有反馈信息实现知识积累,无需模型微调,降低成本。其方法适应多模型、多任务场景,为企业级AI系统提供了可扩展的持续学习方案,有助于提升AI在实际应用中的适应性和效率,推动AI自主学习与知识管理的发展。

技术贡献

提出一种基于自然语言规则的外部记忆蒸馏机制,结合反馈信号实现无梯度持续学习。创新点在于利用后续反馈(成功判定和修正)作为知识蒸馏信号,避免模型参数更新,增强模型的知识持久性。引入跨模型记忆迁移,验证记忆的可移植性,为模型知识管理提供新思路。系统实现和协议设计也为行业实践提供了技术基础。

新颖性

首次将部署反馈(成功/修正)作为持续学习信号,结合外部记忆实现模型无参数更新的知识积累。不同于传统微调或增量学习方法,本研究强调利用已有反馈信息进行知识蒸馏,且支持跨模型迁移,极大扩展了模型的适应性和知识复用能力。

局限性

  • 实验依赖于完美的反馈信号,实际部署中反馈可能存在噪声和误差,影响学习效果。
  • 记忆存储依赖自然语言规则的准确性,规则的表达和维护仍需人工干预。
  • 当前方法未考虑模型参数微调的潜在优势,未来结合微调可能效果更佳。

未来方向

未来将探索引入噪声容错机制,增强反馈的鲁棒性;结合微调策略,提升模型适应性;扩展到更复杂的任务和多模态场景,推动持续学习在实际系统中的应用落地。

AI 总览摘要

在人工智能应用中,模型的持续学习一直是瓶颈。传统方法依赖参数微调,成本高且易遗忘。本文提出一种创新机制,将部署环境中的反馈信息转化为自然语言规则,存入外部记忆,实现无参数更新的持续学习。通过与静态RAG系统对比,实验在τ-bench银行任务中显示,单次成功率由6.4%提升至17.0%,修正后达39.7%,解决了84个任务中的22个未解决任务。该方法还支持模型间记忆迁移,验证记忆的可移植性,提升整体性能。采用Spark记忆系统,存储规则以自然语言表达,支持多任务、多模型环境。结果表明,利用部署反馈进行知识蒸馏,能显著增强模型的适应性和知识持久性,为企业级AI系统提供了低成本、高效的持续学习方案。未来,结合噪声容错和微调策略,将进一步推动该技术在实际场景中的应用。

深度分析

研究背景

随着大规模语言模型的发展,模型参数微调成为主流的持续学习方式,但存在高成本和遗忘问题。近年来,外部记忆和检索增强技术(如RAG)被引入,改善知识存储和调用效率。然而,这些方法多依赖静态知识库,缺乏模型在部署环境中的持续适应能力。此前研究如MemGPT、MemoryBank等,关注长时记忆的构建与检索,但未充分利用部署反馈进行知识更新。本研究旨在突破模型参数不可变的限制,通过外部记忆结合部署反馈,实现持续学习,特别是在知识密集型任务中的应用。

核心问题

现有AI系统在实际部署中难以持续学习,主要因模型权重冻结,无法利用环境反馈进行知识更新。传统微调成本高、风险大,且容易遗忘先前学习内容。如何在不改变模型参数的情况下,利用已有的部署反馈(如成功/失败判定和修正)实现知识积累,成为亟待解决的问题。这不仅关系到模型的适应性,也影响企业的知识管理效率。该问题在实际应用中尤为突出,尤其是在数据敏感或法规限制严格的场景下,微调难以实施。

核心创新

本研究的核心创新在于:1)提出基于自然语言规则的外部记忆蒸馏机制,将部署反馈转化为可存储、可检索的知识单元;2)利用后续反馈(成功/失败判定和修正)作为知识蒸馏信号,无需模型参数更新;3)实现跨模型记忆迁移,通过读取其他模型的记忆库提升性能。这些创新突破了传统微调和增量学习的局限,提供了低成本、可扩展的持续学习方案,特别适合企业部署环境。

方法详解

  • �� 构建Spark记忆系统,存储自然语言规则,每条规则包括标题、内容和检索查询。• 设计四个核心接口:search(检索相关规则)、create_memory(存入新规则)、enrich_memory(丰富已有规则)、share_feedback(反馈规则有效性)。• 训练流程:在每个任务的多轮试验中,模型通过检索相关规则辅助决策,任务结束后,根据反馈(成功/失败、修正)更新记忆库。• 反馈机制:成功判定作为单比特信号,修正作为任务的验证行动序列,存入记忆以指导后续试验。• 记忆存储采用规则化表达,确保一致性和可验证性。• 跨模型迁移:将一个模型的记忆库导入另一个模型,验证知识迁移效果。• 评估指标包括成功率、成功保持率和迁移效果,采用τ-bench银行任务进行验证。

实验设计

实验在τ-bench银行任务上进行,模型包括开源的Mistral Large和商业的Claude Sonnet 5。每个模型在不同条件下进行多轮试验:无记忆(基线)、经验学习(仅成功/失败反馈)、指令学习(成功/失败+修正)。每个任务4轮试验,存储空白或持续更新记忆库。主要指标为任务成功率、成功保持率和迁移效果。采用Bootstrap方法计算置信区间,分析不同条件下的性能差异。还进行了跨模型迁移实验,验证记忆的可移植性。结果显示,记忆机制显著提升成功率,尤其在难题任务中效果突出。

结果分析

在τ-bench银行任务中,指令学习条件下,单次成功率由基线的6.4%提升至17.0%,修正后达39.7%,解决62/97任务。经验学习提升至10.3%,迁移到另一模型时仍表现优异。记忆迁移实验中,模型读取对方的记忆库,成功率提升约30%。成功保持率方面,经验学习达0.88,指令学习为0.65,验证了知识的持久性。实验充分证明了部署反馈作为持续学习信号的有效性,且跨模型迁移增强了知识的复用。

应用场景

该方法适用于企业级AI系统,尤其在数据敏感或法规限制环境中,无需模型微调即可实现知识更新。可应用于客服、金融、医疗等领域,通过部署反馈持续优化模型表现。未来结合微调策略,可进一步提升系统适应性和复杂任务处理能力。

局限与展望

当前方法依赖完美反馈,实际场景中反馈可能存在噪声,影响学习效果。记忆规则的表达和维护仍需人工干预,存在一定的人工成本。未考虑模型参数微调的潜在优势,未来结合微调可能带来更大提升。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂每天都生产不同的产品。有时候,工厂会收到客户的反馈,比如产品好坏的评价。传统上,工厂需要停下来,重新调整机器(相当于微调模型)才能改进生产线,但这很耗时。现在,工厂决定用一种更聪明的方法:把客户的反馈记下来,存到一个外部的记忆库里。每次生产遇到问题时,就可以查阅这个记忆库,快速找到解决方案,而不用重新调整机器。这样,工厂可以不断学习,变得更聪明,效率也提高了。这就像AI模型用部署反馈不断积累知识,而不用每次都重新训练一样。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,每次失败后,你会记下原因,比如“我没有躲开敌人的攻击”。下次遇到类似情况时,你会用这些记忆来避免失败。这个方法不用重新学习所有内容,只是把经验写下来,放在一个记事本里。每次遇到问题,你可以查这个记事本,找到应对策略。这样,你变得越来越厉害,不用每次都从零开始。AI模型也是这样,它用一种特殊的记忆系统,把在部署中得到的反馈写下来,遇到类似问题时就能快速用上。这让它变得更聪明、更会学习,甚至可以和其他模型共享这些“经验”。

术语表

Continual Learning (持续学习)

指模型在部署后,利用新反馈不断积累知识,而不需要重新训练。技术上通过外部记忆和规则蒸馏实现。

本文中,模型通过部署反馈生成自然语言规则,持续提升任务表现。

External Memory (外部记忆)

一种存储模型知识的系统,独立于模型参数,用自然语言规则或其他形式保存信息。

用于存储由反馈生成的规则,供模型检索和应用。

Deployment Feedback (部署反馈)

模型在实际应用中收到的结果评价和修正信息,用于指导知识更新。

作为持续学习的信号,帮助模型积累经验。

Natural-language Rules (自然语言规则)

用自然语言表达的知识单元,如“如果客户说X,则建议Y”。

存入外部记忆,用于指导模型后续决策。

Cross-model Transfer (模型间迁移)

将一个模型的知识或记忆应用到另一个模型,验证知识的可迁移性。

实验中,模型读取对方的记忆库,提升性能。

开放问题 这项研究留下的未解疑问

  • 1 在实际部署中,反馈信号的噪声和不确定性如何影响持续学习效果仍未充分研究。未来需要探索鲁棒的反馈处理机制。
  • 2 如何自动生成高质量的自然语言规则,减少人工干预,是提升系统实用性的关键问题。
  • 3 跨模型迁移的知识保持和适应性问题尚未完全解决,未来需研究迁移策略的优化。

应用场景

近期应用

企业客服系统

利用部署中的客户反馈,自动生成规则,持续优化问答策略,无需频繁微调模型,提升客户满意度。

金融风险管理

通过交易反馈,积累风险规则,增强模型应对新型风险的能力,降低人工干预成本。

远期愿景

自主学习AI助手

未来AI助手能在不断使用中自我总结经验,跨任务迁移知识,逐步实现真正的自主学习和适应。

原文摘要

AI agents encounter learning opportunities in every episode they run, and discard nearly all of them: the underlying models are frozen at deployment, so an agent that resolves a difficult request today starts from zero when it recurs tomorrow. Yet ordinary operation already produces feedback, in the form of outcome verdicts and after-the-fact corrections. We show that this feedback is a sufficient signal for continual learning when the frozen model is paired with an external memory that distils each episode into retrievable natural-language rules. On the banking domain of $τ$-bench, against a static-RAG control retrieving over the complete policy corpus, learning from the one-bit outcome verdict lifts single-trial success to 1.6$\times$ the baseline, and learning from corrections to 2.6$\times$, converting 22 of the 84 tasks the baseline never solves. The result spans the deployment spectrum, measured on Mistral Large, an open-weights model that organisations with data sovereignty requirements can self-host, and replicated on a frontier model, Claude Sonnet 5. The accumulated memory also transfers: each model, reading the store built by the other, rises above its own no-memory baseline. The harness, protocol, and data are released.

cs.AI