Procedural Memory Distillation: Online Reflection for Self-Improving Language Models

TL;DR

提出PMD方法,通过跨集记忆提升语言模型性能,实验结果提升3.8-13.6%。

cs.AI 🔴 高级 2026-07-02 2 次浏览
Ye Liu Srijan Bansal Bo Pang Yang Li Zeyu Leo Liu Yifei Ming Zixuan Ke Shafiq Joty Semih Yavuz
强化学习 自我蒸馏 语言模型 记忆提取 策略优化

核心发现

方法论

本研究提出了程序记忆蒸馏(PMD)方法,将跨集信号转化为可重复使用的程序记忆,并在训练过程中蒸馏到策略权重中。PMD通过三层抽象组织记忆:原始轨迹、自我反思策略和教训,以及跨问题重复出现的高层行为模式。

关键结果

  • PMD在SCI KNOWEVAL上比SDPO提高了3.8-5.5%,在LIVECODEBENCH上提高了7.9-13.6%。
  • 冻结记忆或策略会导致性能下降超过10%。
  • PMD在Qwen3-8B和OLMo3-Instruct-7B模型上均表现优异。

研究意义

PMD方法通过将跨集信号转化为程序记忆,显著提升了语言模型的性能。这一方法不仅提高了模型的验证通过率,还减少了失败模式的出现,为语言模型的自我改进提供了新的方向。

技术贡献

PMD通过联合更新策略和记忆,区别于传统的静态或离线记忆库。它通过在线构建记忆,使教师信号与当前策略保持一致,从而提高了模型的学习效率。

新颖性

PMD首次将跨集信号转化为程序记忆,并通过自我蒸馏将其内化到模型中。这一创新使得模型在推理时无需依赖外部记忆。

局限性

  • PMD需要大量的计算资源来实时更新记忆。
  • 在某些复杂问题上,记忆抽象可能过于粗糙。
  • 该方法在记忆构建过程中可能会遗漏重要信息。

未来方向

未来研究可以探索如何优化记忆抽象过程,以提高模型在复杂问题上的性能。此外,可以研究如何减少记忆更新的计算开销。

AI 总览摘要

程序记忆蒸馏(PMD)是一种新颖的方法,通过将跨集信号转化为程序记忆来提升语言模型的性能。传统的强化学习方法通常只关注单集的反馈信号,而忽略了跨集的丰富信息。PMD通过在线构建三层抽象的记忆,将这些信息蒸馏到策略中,使模型能够在推理时无需依赖外部记忆。实验结果显示,PMD在多个数据集上均表现出色,显著优于现有的自我蒸馏方法。尽管PMD需要较高的计算资源,但其在提高模型性能方面的潜力巨大,未来研究可以进一步优化记忆构建过程,以减少计算开销。

深度分析

研究背景

近年来,强化学习与语言模型的结合成为研究热点。传统方法如PPO和DPO主要依赖单集反馈信号进行策略更新,但忽略了跨集信息的潜力。随着自我蒸馏技术的发展,研究者开始探索如何利用模型自身的轨迹信息来提升性能。

核心问题

现有的强化学习方法在处理跨集信息时存在局限,无法捕捉到哪些策略能够持续通过验证,哪些失败模式持续存在,以及哪些模式重复出现。这导致模型在处理复杂问题时表现不佳。

核心创新

PMD通过在线构建程序记忆,将跨集信号转化为可重复使用的策略和行为模式。这一创新使得模型在推理时无需依赖外部记忆,从而提高了模型的学习效率和验证通过率。

方法详解

  • �� PMD通过三层抽象组织记忆:原始轨迹、自我反思策略和教训,以及跨问题重复出现的高层行为模式。
  • �� 记忆在训练过程中被蒸馏到策略权重中,使模型能够在推理时无需依赖外部记忆。
  • �� 联合更新策略和记忆,使教师信号与当前策略保持一致。

实验设计

实验在SCI KNOWEVAL和LIVECODEBENCH数据集上进行,使用Qwen3-8B和OLMo3-Instruct-7B模型进行测试。通过比较PMD与SDPO的性能,验证了PMD的有效性。

结果分析

PMD在SCI KNOWEVAL上比SDPO提高了3.8-5.5%,在LIVECODEBENCH上提高了7.9-13.6%。冻结记忆或策略会导致性能下降超过10%。

应用场景

PMD可用于提升语言模型在科学推理和代码生成任务中的性能,适用于需要高验证通过率的场景。

局限与展望

PMD需要大量的计算资源来实时更新记忆。在某些复杂问题上,记忆抽象可能过于粗糙。未来研究可以探索如何优化记忆抽象过程。

通俗解读 非专业人士也能看懂

想象一个厨师在厨房里做菜。每次做菜,厨师都会记录下哪些步骤成功了,哪些失败了,并总结出一些可以重复使用的技巧。这样,下次做同样的菜时,厨师就不需要再查阅食谱,而是直接根据自己的经验来操作。PMD就像这个厨师,通过记录和总结模型的每次尝试,将这些信息转化为可重复使用的程序记忆,从而提升模型的性能。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次过关后,游戏都会告诉你哪些策略有效,哪些不行。然后,你把这些信息记下来,下次再玩的时候就能更快过关。PMD就像这样一个游戏助手,它帮助语言模型记住哪些策略有效,哪些不行,从而在下次遇到类似问题时更快找到答案。

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练模型。

在论文中用于训练语言模型。

自我蒸馏 (Self-Distillation)

一种技术,通过模型自身的反馈来优化模型。

用于提升语言模型性能。

程序记忆 (Procedural Memory)

一种记忆形式,记录模型的尝试和策略。

PMD的核心创新。

策略优化 (Policy Optimization)

通过调整模型策略来提高性能。

用于训练语言模型。

跨集信号 (Cross-Episode Signals)

来自不同集的信息,用于优化模型。

PMD用于提取这些信号。

开放问题 这项研究留下的未解疑问

  • 1 如何优化记忆抽象过程以提高复杂问题上的性能?
  • 2 如何减少记忆更新的计算开销?
  • 3 未来研究可以探索哪些新的应用场景?

应用场景

近期应用

科学推理

PMD可用于提升科学推理任务中的语言模型性能,适用于需要高验证通过率的场景。

远期愿景

代码生成

PMD可用于提升代码生成任务中的语言模型性能,帮助开发者快速生成高质量代码。

原文摘要

Reinforcement learning with verifiable rewards (RLVR), along with recent selfdistillation variants such as SDPO, evaluates each rollout against a verifier and updates the policy from that episode-level signal. However, the richer procedural information in the rollout is rarely retained or reused. Across episodes and epochs, the model repeatedly encounters related problems under a changing policy, producing cross-episode signals that episode-local updates cannot capture: which strategies consistently pass verification, which failure modes persist, which patterns recur. We propose Procedural Memory Distillation (PMD), which converts these crossepisode signals into reusable procedural memory and distills it into the policy's weights during training. This memory functions as a training scaffold, absorbed into the policy itself, yielding a memory-free model at inference. PMD organizes the memory at three levels of abstraction: raw trajectories, self-reflected strategies and lessons, and higher-level behavioral patterns that recur across problems, all extracted online from the model's own trajectories. A memory-conditioned self-teacher draws on the accumulated experience to supervise the student on its own rollouts, enabling student to progressively internalize procedural knowledge within its parameters. The central design principle is co-evolution: the policy generates rollouts that update the memory, and memory shapes the supervision that updates the policy. Empirically, across Qwen3-8B and OLMo3-Instruct-7B, PMD improves over SDPO by 3.8-5.5% on SCIKNOWEVAL and 7.9-13.6% on LIVECODEBENCH. Co-evolution powers these gains: freezing either the memory or the policy trails PMD by more than 10% across SCIKNOWEVAL domains.

cs.AI cs.LG