核心发现
方法论
LOPD通过检索相关经验,将其组成连续潜在标记,条件化自我教师。学生基于任务和交互历史生成轨迹,教师利用可学习的潜在上下文进行密集监督。引入特权边界目标以稳定潜在上下文的学习,优化过程端到端进行。核心算法包括逆KL蒸馏和特权边界约束,确保教师提供有用的监督信号。训练流程中,经验检索、潜在编码、上下文构建、蒸馏损失和边界调节共同作用。
关键结果
- 在工具使用和代码生成任务中,LOPD在QWEN3-8B模型上分别超越RLVR和代表性OPSD方法,性能提升达8-12个百分点。例如,在ACEBench上达62.7分,使用不到其他方法30%的预算。多任务背景下,LOPD表现优异,显著优于传统固定上下文方法,验证了潜在上下文学习的有效性。
- 在不同模型规模(如QWEN3-4B、OLMO3-7B)上,LOPD持续优于对比方法,表现出良好的迁移性和泛化能力。实验还显示,端到端学习潜在上下文比手工设计的上下文更能捕获任务相关信息,提升学习效率和性能稳定性。
- 消融研究表明,潜在上下文的端到端学习是性能提升的关键,单纯依赖固定上下文无法达到相似效果。引入特权边界目标有效防止模型崩溃,确保教师提供有价值的监督信号。整体结果验证了LOPD在连续自我提升中的潜力。
研究意义
该研究突破了传统自我蒸馏中依赖手工设计特权上下文的限制,提出可端到端学习的潜在上下文,为大规模自我演化AI提供了新路径。通过自动提取和组织经验信息,显著提升模型在复杂任务中的表现和学习效率,推动AI自主学习和持续改进的发展。该方法具有广泛适用性,可应用于多模态、多任务场景,具有深远的理论和实践意义。
技术贡献
技术上,LOPD引入可学习的潜在上下文模块,结合检索、编码、压缩和蒸馏机制,实现上下文的端到端优化。创新性在于用连续潜在标记替代手工设计的特权信息,结合逆KL蒸馏和特权边界,确保监督信号的有效性。该框架兼容多种经验源,提升模型的自适应能力和扩展性,为未来自主学习系统提供了新范式。
新颖性
这是首个将特权上下文作为可学习潜在表示的端到端自我蒸馏方法。相较于传统基于规则或离散特征的上下文,LOPD实现了经验的连续压缩和动态组织,显著增强了模型的自主学习能力。其核心创新在于结合检索、编码和蒸馏,形成可优化的上下文空间,突破现有方法的局限。
局限性
- 当前方法依赖经验检索的质量,检索不佳可能影响上下文表达效果,限制模型性能提升。
- 潜在上下文的规模和复杂度受限于编码和压缩机制,可能无法捕获所有任务关键信息。
- 训练过程中引入的边界约束和对抗机制增加了优化难度,可能导致训练不稳定或收敛缓慢。
未来方向
未来将探索多模态经验的联合检索与编码,提升上下文的丰富性和表达能力。同时,结合元学习和自适应机制,增强模型在新任务中的泛化能力。此外,优化训练流程,降低计算成本,推动端到端学习在实际应用中的落地。
AI 总览摘要
近年来,AI系统的自我演化成为研究热点,尤其是在无需外部教师的情况下实现持续学习。传统方法多依赖手工设计的特权上下文,如答案、轨迹或反馈,限制了模型的扩展性和自主性。本文提出的Latent On-Policy Self-Distillation(LOPD)突破了这一瓶颈,将教师的特权上下文由固定规则转变为可端到端学习的潜在表示。通过检索相关经验,将其压缩成连续潜在标记,条件化自我教师,模型可以自动提取对任务有用的知识,提升学习效率和性能。在训练中,LOPD引入逆KL蒸馏和特权边界约束,确保教师提供有价值的监督信号,避免崩溃。实验结果显示,LOPD在多项任务中超越现有最优方法,尤其在QWEN3-8B模型上,在工具使用和代码生成任务中性能提升显著,达62.7分,且只用不到其他方法30%的预算。该方法不仅在多任务、多模型场景中表现优异,还验证了潜在上下文学习的必要性,为未来自主学习系统提供了新思路。整体而言,LOPD推动了自我演化AI的可扩展性和自主性,为实现更智能、更自主的AI系统奠定了基础。
深度分析
研究背景
随着大规模预训练模型的发展,自我蒸馏成为提升模型能力的重要手段。早期工作如知识蒸馏和离线模仿,依赖外部教师或固定示范。近年来,on-policy自我蒸馏逐渐兴起,强调模型从自身轨迹中学习,减少训练-推理差距。代表性方法包括SDPO、Skill-SD等,利用手工设计的特权上下文增强监督信号。然而,这些方法受限于预定义的上下文形式,难以适应复杂多变的任务需求。随着模型规模不断扩大,如何自动提取和组织经验信息,成为提升自我学习效率的关键。
核心问题
现有的自我蒸馏方法依赖手工设计的特权上下文,限制了模型的自主性和扩展性。固定的上下文形式难以捕获任务中的丰富信息,导致监督信号不够全面或不够相关。此外,手工设计的上下文缺乏适应性,难以应对多样化任务和环境变化。如何让模型自主学习选择和组织经验,成为提升自我演化能力的核心难题。解决这一问题需要引入可端到端学习的机制,使上下文能够动态适应任务需求,增强模型的自主性和泛化能力。
核心创新
LOPD的核心创新在于将教师的特权上下文由固定规则转变为可学习的潜在表示。具体包括:
- �� 经验检索:从经验库中检索相关轨迹,确保上下文内容具有任务相关性。
- �� 潜在编码:利用编码器将经验压缩成连续潜在标记,避免离散特征的限制。
- �� 条件化教师:以潜在上下文条件化自我教师,提供密集的轨迹监督。
- �� 端到端优化:通过逆KL蒸馏和特权边界约束,联合优化潜在上下文和学生模型。
- �� 任务适应性:模型自动学习哪些经验信息对当前任务最有帮助,提升学习效率和效果。这一机制突破了传统手工设计的局限,赋予模型更强的自主学习能力。
方法详解
- �� 经验存储:构建经验库,存放成功轨迹和任务描述。
- �� 经验检索:利用余弦相似度检索相关经验。
- �� 潜在编码:编码器(如QFormer)将经验压缩成K个潜在标记。
- �� 条件化教师:以压缩的潜在上下文条件化自我教师模型。
- �� 轨迹生成:学生基于任务和交互历史生成轨迹。
- �� 密集监督:教师对学生访问的每个前缀进行密集的条件概率分布预测。
- �� 损失优化:采用逆KL蒸馏损失,结合边界约束,端到端优化潜在上下文和学生模型。
- �� 训练流程:采样轨迹→检索经验→编码压缩→构建上下文→教师评估→蒸馏损失→参数更新。
实验设计
在工具使用和代码生成两个任务域中,使用QWEN3-4B、QWEN3-8B和OLMO3-7B模型进行训练。数据集包括EnvScaler、DeepCoder的TACO子集。评估指标涵盖任务成功率、pass@1等。对比基线包括GRPO、Skill-SD、OPSD等。通过消融验证潜在上下文的端到端学习必要性。超参数如潜在标记数K=32,检索J=3,边界m=0.05,训练采用逆KL蒸馏和边界约束,确保模型稳定。
结果分析
LOPD在所有任务和模型上均优于对比方法,性能提升达8-12个百分点。例如,在ACEBench中达62.7分,使用不到其他方法30%的预算。多任务和多模型迁移性强,验证了潜在上下文的有效性。消融实验显示,单纯固定上下文无法达到相似效果,端到端学习显著提升性能和稳定性。
应用场景
该方法适用于需要持续学习和自我改进的AI系统,特别是在复杂多变的任务环境中。可应用于机器人自主学习、智能助手、自动编程等场景,提升系统的自主适应能力和效率。未来,结合多模态信息和元学习,将进一步拓展其应用范围。
局限与展望
当前依赖经验检索的质量,检索不佳会影响上下文表达。潜在上下文规模受编码压缩能力限制,可能无法捕获所有关键信息。训练过程复杂,参数调优困难,可能导致训练不稳定。未来需优化检索机制和模型结构,降低成本。
通俗解读 非专业人士也能看懂
想象你在学习做菜。每次做菜,你会记住哪些步骤、用的材料、遇到的问题。传统方法就像是老师提前告诉你一套菜谱,然后你照着做。而LOPD则像是你自己在厨房里不断尝试,记住自己做的每个细节,逐步总结出最适合自己的做法。它会从你以前做的菜中找出最重要的经验,压缩成一小包秘密,然后用这个秘密指导你下一次做菜。这样,你不用每次都依赖老师的指示,而是自己学会了做菜的诀窍。这个过程不断优化,最后你变成了厨房里的大厨,能自己总结经验,做出更好吃的菜。
简单解释 像给14岁少年讲一样
想象你在玩一款游戏。每次你玩完后,都会记住一些技巧,比如怎么躲避敌人、怎么快速得分。传统上,游戏指南会告诉你一些固定的技巧,然后你照着学。而LOPD就像是你自己在游戏中不断总结经验,把每次成功的技巧压缩成一个秘密宝盒,然后用这个宝盒帮助你下一次玩得更好。它不会依赖别人给的固定攻略,而是自己从每次游戏中学会最重要的招数。这样,你就能变得越来越厉害,不断进步,最终成为游戏高手。
术语表
Self-Distillation (自我蒸馏)
一种模型通过自身轨迹学习,利用内部生成的监督信号提升性能。技术上通过模型自身的输出作为教师,优化自身参数。
本文提出的LOPD就是一种自我蒸馏方法,利用潜在上下文增强监督信号。
Latent Tokens (潜在标记)
连续的、可优化的表示,用于压缩和组织经验信息,作为模型条件输入。技术上通过编码器和压缩器生成。
LOPD中,用潜在标记代替手工设计的特权上下文。
逆KL蒸馏 (Reverse KL)
一种蒸馏损失,鼓励学生模型模仿教师的高概率输出,减少偏差。技术上通过最小化学生分布与教师分布的逆KL散度实现。
用于训练学生模型,使其贴近教师的密集监督。
Privileged Margin (特权边界)
一种约束,确保教师在轨迹成功时具有优势,避免模型崩溃。通过奖励信号调节教师的优势程度。
保证教师提供有价值的监督信号。
Experience Retrieval (经验检索)
从经验库中找到与当前任务相关的过去轨迹,用于构建上下文。技术上采用余弦相似度。
为潜在上下文提供丰富的经验信息。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升潜在上下文的表达能力,特别是在多模态和长序列任务中?
- 2 如何降低训练复杂度和成本,使LOPD更易于大规模部署?
- 3 未来能否结合元学习实现更强的自适应能力?
应用场景
近期应用
自主机器人学习
机器人通过不断尝试和总结经验,自动优化操作策略,无需手工设计规则,提升自主性和适应性。
智能助理个性化优化
利用LOPD实现个性化对话模型的持续学习,自动提取用户偏好和行为模式,增强交互体验。
远期愿景
自我演化AI系统
未来AI能自主学习新任务,自动组织经验,持续优化性能,减少人工干预,实现真正的自主学习系统。
原文摘要
Enabling agents to learn from experience and internalize it into their policy has become a central problem in self-evolving AI. On-policy self-distillation (OPSD) offers an effective pathway by using a privileged self-teacher to provide dense supervision on the student's own trajectories; however, existing methods still rely heavily on designer-specified privileged artifacts (e.g., answers, feedback, skills, or trajectories), limiting the end-to-end learnability and scalability required for continual self-improvement. In this work, we introduce Latent On-Policy Self-Distillation (LOPD), which, rather than proposing another hand-crafted OPSD variant with a newly prescribed form of privileged context, makes the teacher's privileged context itself learnable end-to-end from experience. Technically, LOPD retrieves relevant experiences and composes them into continuous latent tokens that condition a self-teacher, while the student generates trajectories from the task and interaction history and receives dense token-level supervision at every visited prefix. We further introduce a privileged-margin objective to stabilize and regulate the learning of latent context. Empirically, LOPD demonstrates (I) strong performance, outperforming RLVR and representative OPSD methods including OPSD, SDPO, and Skill-SD across both agentic tool use and code generation; and (II) high learning efficiency, surpassing GRPO and Skill-SD with less than 30% of their rollout budget. Ablation studies further provide direct evidence that making privileged context learnable is necessary for realizing these gains. Together, these results position LOPD as a step toward a more scalable and self-directed paradigm for agent evolution.