PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners

TL;DR

PAINT结合部分解决方案遮掩与能量空间插值,提升自蒸馏推理性能。

cs.LG 🔴 高级 2026-04-29 49 次浏览
Zhiquan Tan Yinrong Hong
深度学习 自蒸馏 推理增强 模型训练 数学推理

核心发现

方法论

PAINT通过引入基于rollout-reference重叠度的部分遮掩策略,动态调节模型暴露的验证解信息。同时,采用稀疏能量空间插值技术,对entropy不匹配的关键位置进行微调,平衡推理的多样性与准确性。具体实现包括:• 利用rollout-reference重叠度指标控制遮掩比例;• 在高entropy位置进行能量插值以校准教师目标;• 固定教师模型参数,优化学生参数。该方法结合上下文重评分机制,强化模型在推理任务中的表现。

关键结果

  • 在Qwen3-8B模型上,PAINT在数学竞赛基准中的平均得分提升2.1点(Avg@12),显著优于传统自蒸馏基线和GRPO方法,表现出优越的推理能力。
  • 在Qwen3-4B和1.7B模型上,均实现了0.8至1.1点的提升,验证了方法的尺度适应性。
  • 稀疏能量插值与遮掩策略的结合,有效缓解模型过拟合单一参考轨迹的问题,提升推理多样性和泛化能力。

研究意义

该研究突破了模型推理训练中的信息暴露与多样性平衡难题,为大规模语言模型在数学推理等复杂任务中的应用提供了新思路。通过引入上下文重评分机制,PAINT实现了在不依赖更强教师的情况下,提升模型推理准确率与鲁棒性,具有重要的理论和实践意义。其创新的遮掩与插值策略,为未来模型自适应调节推理信息提供了可行方案,有望推动AI在科学计算、自动推理等领域的广泛应用。

技术贡献

本文提出的PAINT方法在自蒸馏框架中引入动态遮掩与能量空间稀疏插值,创新性地解决了推理任务中信息暴露与多样性之间的矛盾。具体技术贡献包括:• 基于rollout-reference重叠度的自适应遮掩机制;• 利用entropy比值进行关键位置的能量插值校准;• 在保持模型参数不变的前提下,优化学生模型的推理能力。这些技术突破丰富了模型训练中的上下文调节策略,为推理增强提供了新的工具。

新颖性

PAINT首次将上下文重评分与稀疏能量插值相结合,提出动态遮掩策略,有效调节模型暴露信息量,避免过拟合单一参考轨迹。这一创新突破了传统自蒸馏在推理任务中的局限,为模型推理能力的提升提供了新路径。相较于现有方法,它在保持训练效率的同时,实现了显著的性能提升,展现出较强的创新性和实用价值。

局限性

  • 当前方法依赖于参考轨迹的重叠度指标,可能在极端偏离参考的情况下表现不足。
  • 稀疏插值策略在极端噪声或复杂推理场景中可能受限,需进一步优化。
  • 模型训练过程中对超参数敏感,调参复杂,影响推广性。

未来方向

未来研究将探索多模态推理任务中的上下文调节策略,结合强化学习优化遮掩与插值参数。同时,考虑引入自适应学习率与动态遮掩窗口,以提升模型在更复杂推理场景中的表现。此外,扩展到多任务、多模态推理,验证方法的普适性与鲁棒性。

AI 总览摘要

近年来,大型语言模型(LLMs)在推理能力上的提升成为学界关注焦点。传统的监督微调(SFT)和蒸馏方法虽能提供密集的目标,但在推理任务中存在信息暴露不足或过度依赖固定轨迹的问题。强化学习奖励虽能引导模型探索,但稀疏高方差限制了效果。为此,本文提出PAINT(Partial-solution Adaptive Interpolated Training),通过动态遮掩验证解信息,结合稀疏能量空间插值,有效平衡推理多样性与准确性。该方法在Qwen3-8B模型上,显著优于传统自蒸馏和GRPO方法,平均提升2.1分(Avg@12),验证了其在数学推理等复杂任务中的优越表现。实验结果显示,PAINT不仅提升了模型的推理准确率,还增强了泛化能力,为未来大规模模型的推理增强提供了新思路。其核心创新在于上下文重评分机制的引入与稀疏校准策略的结合,解决了信息暴露与模型过拟合的矛盾。未来,结合多模态推理和强化学习,将进一步拓展该技术的应用边界,推动AI在科学计算、自动推理等领域的深度融合。

深度分析

研究背景

推理能力是衡量大规模语言模型性能的重要指标。早期方法主要依赖监督微调(SFT)和蒸馏技术,提供密集的目标,但在推理任务中存在信息暴露不足的问题。近年来,强化学习奖励(RLVR)尝试引导模型探索,但因奖励稀疏,效果有限。自蒸馏(OPSD)利用验证解作为训练信号,改善了这一局限,但仍面临信息暴露与推理多样性之间的矛盾。随着模型规模的扩大,如何在保证推理准确性同时,增强模型的推理多样性,成为研究热点。

核心问题

核心问题在于如何在推理训练中合理调节验证解信息的暴露程度。过度暴露会导致模型过拟合单一轨迹,影响泛化;而信息不足则限制模型推理能力。现有方法难以动态适应不同推理阶段的需求,缺乏有效的调节机制,限制了模型在复杂推理任务中的表现。

核心创新

本文提出PAINT,结合上下文重评分机制与稀疏能量插值,创新性地解决推理中的信息调节问题。具体包括:• 动态遮掩策略,根据rollout-reference重叠度调整验证解暴露比例;• 利用entropy比值在关键位置进行能量空间插值,校准教师目标;• 固定教师模型参数,优化学生推理能力。这些创新实现了推理信息的自适应调节,有效提升模型性能。

方法详解

  • �� 利用rollout-reference重叠度指标(α)动态调节验证解的遮掩比例,低重叠度暴露更多信息,高重叠度隐藏部分内容;• 在高entropy位置应用稀疏能量插值,微调教师目标,减少模型偏差;• 固定教师参数,训练学生模型,结合上下文重评分机制,强化推理能力;• 采用KL散度进行目标校准,确保目标的密集性与多样性平衡;• 通过调节遮掩比例与插值强度,实现推理信息的自适应调控。

实验设计

实验在Qwen3-8B、4B、1.7B模型上进行,数据来自OpenThoughts数学推理子集,包含3个竞赛基准(AIME 2024/2025,HMMT 2025)。采用rollout预算为每题1个1024-token的单次轨迹,训练过程中固定教师模型参数。对比SFT、GRPO、OPSD等方法,评估Avg@12得分提升,验证PAINT在推理准确率和泛化能力上的优势。还进行了消融实验,验证遮掩策略和稀疏插值的贡献。

结果分析

在Qwen3-8B模型上,PAINT在Avg@12指标上平均提升2.1分(从OPSD的64.8提升至66.9),优于GRPO(64.0)。在4B和1.7B模型上也实现了0.8至1.1分的提升。实验显示,遮掩比例与插值策略的调节显著改善模型推理表现,验证了方法的有效性。稀疏能量插值减少了模型对单一参考的依赖,增强了推理多样性。

应用场景

该方法可应用于数学、科学推理、自动证明等领域,特别适合在有限标注或验证解可用的场景。通过调节验证信息的暴露程度,提升模型在复杂推理任务中的准确性和鲁棒性。未来可结合多模态信息,拓展到更广泛的推理场景,推动AI在科研、教育等行业的深度应用。

局限与展望

当前方法依赖于参考轨迹的重叠度指标,可能在极端偏离参考的情况下表现不足。稀疏插值在复杂推理场景中可能受限,调参复杂且对超参数敏感。模型训练成本较高,需进一步优化算法效率和泛化能力。

通俗解读 非专业人士也能看懂

想象你在做一道数学题,就像在厨房里做菜。你有一个完整的食谱(验证解),但每次做菜时,你可以选择只看部分步骤(遮掩部分信息),这样可以训练自己更灵活地应对不同的情况。为了确保菜做得好,你会在关键步骤用少量调料(能量插值)微调味道,避免只依赖某一种做法。这样一来,你既能学会多样的做法,又不容易被单一食谱绑死。PAINT的方法也是这样:它让模型在学习推理时,既看到完整的答案,又学会在不同信息量下调整自己的推理策略,最终变得更聪明、更灵活。

简单解释 像给14岁少年讲一样

想象你在玩一个解谜游戏,你可以看到全部线索,也可以只看部分线索。为了变得更聪明,你会尝试只看一些重要的线索,然后用自己的方法推理出答案。这样做可以让你学会在信息不全的情况下也能找到答案,不会只依赖全部线索。PAINT就像这样,它教模型在推理时,有时候只看部分验证解,然后用微调的方法,让模型学会在不同信息量下都能推理得很好。这样,模型就变得更聪明、更灵活,能应对各种复杂的问题。

原文摘要

Improving large language model (LLM) reasoning requires supervision that is both aligned with the model's own test-time states and informative at the token level. Reinforcement learning with verifiable rewards provides on-policy exploration but offers sparse, high-variance credit; supervised fine-tuning and distillation provide dense targets but often train on fixed trajectories or rely on stronger teachers. Recent privileged on-policy self-distillation explores a middle ground by scoring student rollouts with the same model under verified solution context. We revisit this setting through a contextual re-scoring lens: for reasoning, the important choices are not only whether privileged context is available, but how much of it should be revealed and where its distribution should shape the student. We propose PAINT (Partial-solution Adaptive INterpolated Training), which masks the verified solution according to rollout-reference overlap and applies a small energy-space interpolation on a sparse set of entropy-mismatch token positions. Across competition-level math benchmarks, PAINT consistently improves over a strong prior on-policy self-distillation baseline at all three Qwen3 scales. On Qwen3-8B, it raises macro Avg@12 by 2.1 points over this prior baseline and 2.9 points over GRPO.

cs.LG