dOPSD: On-Policy Self-Distillation for Diffusion Language Models

TL;DR

dOPSD方法通过自我蒸馏提高扩散语言模型的推理能力,在Dream和LLaDA上表现优异。

cs.CL 🔴 高级 2026-07-06 3 次浏览
Phuong Tuan Dat Qi Li Xinchao Wang
扩散模型 自我蒸馏 语言模型 推理 机器学习

核心发现

方法论

dOPSD通过从学生模型自身的去噪轨迹中提取特权信息,替代外部标签,进行自我蒸馏。该方法在去噪过程中利用模型自身的解码步骤,提供密集的、基于策略的监督信号。

关键结果

  • 在Dream上,dOPSD将GSM8K准确率从81.41%提高到83.04%,在MATH500上从38.97%提高到42.20%。
  • 在LLaDA上,dOPSD将MATH500的表现提高了4.76个百分点,从31.24%到36.00%。
  • dOPSD在HumanEval上的表现提升了4.17个百分点,从52.54%到56.71%。

研究意义

dOPSD方法显著提高了扩散语言模型在数学推理和代码生成任务中的表现,克服了传统方法在推理能力上的瓶颈,为语言模型的应用提供了新的可能性。

技术贡献

dOPSD引入了从模型自身解码轨迹中提取特权信息的技术,避免了对外部标签的依赖,提供了一种新的自我蒸馏策略,显著提高了模型的推理能力。

新颖性

dOPSD是首个利用模型自身解码轨迹进行特权信息提取的自我蒸馏方法,与传统的依赖外部标签的方法相比,提供了更为有效的推理能力提升。

局限性

  • dOPSD依赖于模型自身的解码轨迹,可能在某些复杂任务中无法提供足够的特权信息。
  • 该方法需要验证每个解码结果的正确性,增加了计算开销。

未来方向

未来工作可以探索如何在更复杂的任务中有效地提取特权信息,以及如何减少计算开销以提高方法的实用性。

AI 总览摘要

扩散语言模型(dLLMs)作为一种非自回归的文本生成方法,因其并行解码和双向上下文的优势而备受关注。然而,如何在后训练阶段提升其推理能力一直是一个挑战。传统的监督微调和强化学习方法在这一方面存在局限性。

dOPSD方法通过从学生模型自身的去噪轨迹中提取特权信息,替代外部标签,进行自我蒸馏。该方法在去噪过程中利用模型自身的解码步骤,提供密集的、基于策略的监督信号,从而显著提高了模型在数学推理和代码生成任务中的表现。

实验结果表明,dOPSD在Dream和LLaDA上均超越了现有的监督和自我蒸馏基线方法,展示了其在提升推理能力方面的潜力。尽管如此,该方法在计算开销和复杂任务中的适用性仍需进一步研究。

深度分析

研究背景

近年来,扩散语言模型因其在文本生成任务中的优势而受到广泛关注。与传统的自回归模型不同,扩散模型通过去噪过程生成文本,具有并行解码和双向上下文的特点。然而,如何在后训练阶段提升其推理能力一直是一个挑战。传统的监督微调方法容易受到暴露偏差的影响,而强化学习方法则因奖励稀疏而难以应用。

核心问题

扩散语言模型在推理能力上的提升一直是一个难题。传统方法在提供密集的、基于策略的监督信号方面存在不足,导致模型在复杂任务中的表现不佳。如何有效地在后训练阶段提升模型的推理能力是当前研究的重点。

核心创新

dOPSD方法通过从学生模型自身的去噪轨迹中提取特权信息,替代外部标签,进行自我蒸馏。该方法在去噪过程中利用模型自身的解码步骤,提供密集的、基于策略的监督信号,从而显著提高了模型在数学推理和代码生成任务中的表现。

方法详解

  • �� 从学生模型的去噪轨迹中提取特权信息。

  • �� 利用模型自身的解码步骤进行自我蒸馏。

  • �� 验证每个解码结果的正确性,确保蒸馏信号的可靠性。

实验设计

实验在Dream和LLaDA上进行,使用GSM8K和MATH500数据集评估数学推理能力,并在HumanEval和MBPP上评估代码生成能力。基线方法包括监督微调和传统的自我蒸馏方法。

结果分析

dOPSD在Dream上将GSM8K准确率从81.41%提高到83.04%,在MATH500上从38.97%提高到42.20%。在LLaDA上,dOPSD将MATH500的表现提高了4.76个百分点,从31.24%到36.00%。

应用场景

dOPSD方法可直接应用于需要高推理能力的语言模型任务,如数学推理和代码生成。其无需外部标签的特性使其在实际应用中更具灵活性。

局限与展望

dOPSD依赖于模型自身的解码轨迹,可能在某些复杂任务中无法提供足够的特权信息。此外,该方法需要验证每个解码结果的正确性,增加了计算开销。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们在生产线上工作。传统的语言模型就像一个工人,每次只能处理一个零件,而扩散语言模型就像一个团队,可以同时处理多个零件。dOPSD方法就像是给这个团队提供了一种新的工作方式,让他们可以更好地协作,提高生产效率。通过观察团队的工作过程,dOPSD能够找到最有效的工作方法,从而提高整体的生产效率。

简单解释 像给14岁少年讲一样

想象你在玩一个需要解谜的游戏。传统的方法就像是一步一步地解开谜题,而dOPSD就像是给你提供了一种新的策略,让你可以同时考虑多个线索。这样,你就能更快地找到答案!dOPSD通过观察你的解谜过程,帮助你找到最有效的解题方法,提升你的游戏水平。

术语表

扩散语言模型 (Diffusion Language Model)

一种通过去噪过程生成文本的模型,具有并行解码和双向上下文的特点。

用于生成文本并提升推理能力。

自我蒸馏 (Self-Distillation)

一种通过模型自身生成的信号进行训练的方法,避免了对外部标签的依赖。

用于提升模型的推理能力。

特权信息 (Privileged Information)

在训练过程中提供给模型的额外信息,用于提高模型的性能。

dOPSD通过模型自身的解码轨迹提取特权信息。

去噪轨迹 (Denoising Trajectory)

模型在生成文本过程中逐步去除噪声的过程。

用于提取特权信息并进行自我蒸馏。

暴露偏差 (Exposure Bias)

因训练和推理阶段的不一致导致模型性能下降的问题。

传统的监督微调方法容易受到暴露偏差的影响。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务中有效提取特权信息仍需研究。
  • 2 减少计算开销以提高方法的实用性是未来的研究方向。

应用场景

近期应用

数学推理任务

dOPSD可用于提高数学推理任务中的模型性能,特别是在需要高推理能力的场景中。

远期愿景

通用语言模型

dOPSD有潜力成为通用语言模型的核心技术,推动语言模型在更多领域的应用。

原文摘要

Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, offering a parallel alternative to autoregressive models, but eliciting strong reasoning through post-training remains difficult: supervised fine-tuning is off-policy and suffers from exposure bias, while reinforcement learning gives only sparse, sequence-level rewards and is hard to apply without tractable sequence likelihoods. On-policy self-distillation (OPSD) offers a promising alternative, using one model as both student and teacher to provide dense, token-level, on-policy supervision, but its effectiveness hinges on giving the teacher privileged information (PI) - typically an instance-specific ground-truth reference unavailable at inference - so the student ends up distilling a weak PI-free consensus policy that yields little improvement on dLLM reasoning. We introduce dOPSD, which instead derives the teacher's privilege directly from the student's own denoising trajectory, evaluating masked positions using later, more-decoded steps of that same trajectory rather than an external label, so the teacher's advantage emerges from the model's own decoding process; on Dream and LLaDA, dOPSD improves both in-domain math reasoning and out-of-domain code generation, outperforming supervised and on-policy baselines.

cs.CL cs.AI