Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

TL;DR

本研究分析了偏优似然在自我蒸馏中的价值,提出三项验证指标以确保其作为有效的中间Token信用。

cs.AI 🔴 高级 2026-08-10 56 次浏览
Xuan-Phi Nguyen Shrey Pandit Yiran Zhao Anurag Koul Zeyu Liu Shafiq Joty
机器学习 自我蒸馏 概率评分 模型解释 实验验证

核心发现

方法论

本文提出正式的三问框架,分别检验偏优似然是否反映更优行为、反馈构建是否改变比较对象、训练损失是否强化目标行为。通过数学推导区分自依赖与跨轮依赖,利用AIME 2025上的20B模型进行对比实验,验证偏优似然分数的实际效果。采用对比分析、AB测试和统计指标(如AUC)评估分数的相关性和可靠性,强调在不同反馈和训练策略下的表现差异。

关键结果

  • 在AIME 2025数据集上,偏优似然的加性评分AUC仅为0.505,几乎等于随机,且在长度调整后略偏向错误轨迹。五个Token评分变体的配对比较中,仅结果导向控制达到了64.2%的正确率,而其他变体仅在24.2%至33.9%之间,显示其作为任务成功指标的局限性。
  • 实验表明,使用自己轮次的反馈会引入自依赖,导致分数受内容影响较大,不能稳定反映行为质量。跨轮反馈虽减少自依赖,但未必改善分数的实用性,强调验证分数的任务意义和反馈构建的重要性。
  • 结果强调在实际应用中,需分别验证分数的行为关联、反馈的合理性及训练的引导效果,避免盲目依赖偏优似然作为中间Token的价值指标。

研究意义

本研究揭示偏优似然作为Token信用的局限性,强调在模型训练中对分数的本质、反馈设计和训练目标的系统验证。为未来自我蒸馏和强化学习中的奖励设计提供理论基础,推动模型解释性和可靠性提升。研究对大规模语言模型的训练策略具有指导意义,有助于避免误导性信号带来的模型偏差和性能下降。

技术贡献

提出正式区分偏优似然的三问验证框架,结合信息论和概率推导,明确了分数是否反映任务成功的条件。引入跨轮反馈和自依赖分析,揭示了内容依赖对分数有效性的影响。通过在大模型上进行实证验证,展示了分数在实际训练中的局限性,丰富了模型评估和奖励设计的理论体系。

新颖性

首次系统性地将偏优似然的有效性拆解为三项验证指标,结合数学证明和大规模实证,明确了其作为中间Token信用的适用条件。区别了内容依赖和任务相关性,突破了传统仅关注概率变化的局限,为模型训练中的奖励信号提供更科学的评估标准。

局限性

  • 实验仅在AIME 2025和特定大模型(20B参数)上验证,泛化到其他任务和模型规模仍需验证。
  • 反馈构建方式依赖外部语言模型,可能受到其自身偏差影响,未充分考虑多样化反馈源的影响。
  • 未深入探讨不同训练目标和损失函数对分数行为的影响,未来需结合多样化训练策略进行系统研究。

未来方向

未来将探索更鲁棒的反馈构建方法,结合多模态信息和多轮交互,提升偏优似然的任务相关性。还将研究不同模型架构和训练目标对分数的影响,推动构建更具解释性和稳定性的Token信用指标,为强化学习和自我蒸馏提供更可靠的奖励机制。

AI 总览摘要

本研究深入分析了偏优似然作为模型中间Token信用的有效性,提出了三项关键验证指标:行为关联、反馈一致性和训练引导。通过数学推导区分自依赖与跨轮依赖,揭示内容依赖可能导致分数偏离任务目标。在AIME 2025的实验中,20B模型的偏优似然分数表现接近随机(AUC=0.505),且在长度调整后略偏向错误轨迹。多项Token评分变体的配对实验中,结果导向的控制达64.2%的正确率,而其他变体仅在24.2%至33.9%之间,显示其作为任务成功指标的局限性。研究强调在实际应用中,应分别验证分数的任务意义、反馈构建合理性和训练目标的引导效果,避免盲目信赖偏优似然作为Token信用的唯一依据。这些发现为未来模型训练中的奖励设计提供理论基础,推动模型解释性和鲁棒性提升。研究同时指出,内容依赖和模型偏差可能导致分数误导,强调需要更系统的验证框架和多源反馈策略,以确保模型训练的有效性和公平性。整体而言,本研究为理解和改进偏优似然在大规模语言模型中的应用提供了重要的理论和实证支持,具有深远的学术和工业价值。

深度解读

原文摘要

Outcome verifiers score completed reasoning traces but do not assign credit to intermediate tokens. Privileged self-distillation attempts to fill this gap by rescoring a model's own rollout with training-only information. A token likelihood change, however, is not automatically outcome credit. We separate three questions: whether the score tracks better actions, whether feedback construction changes what is compared, and what behavior the training loss reinforces. We establish these distinctions formally. When a rollout is scored using hindsight feedback written about that same rollout, its content determines both the tokens and the scoring context, creating direct self-dependence. Using feedback from another rollout of the same problem removes this dependence but does not guarantee a useful score. In matched experiments with a 20B model on AIME 2025, the implemented additive score is near chance (AUC=0.505) and slightly favors incorrect traces after length adjustment. In the paired comparison, the outcome-only control records 64.2\%, versus 24.2\%--33.9\% for five token-score variants. The results motivate validating score meaning, feedback construction, and training behavior separately before calling a likelihood signal credit.

cs.AI cs.LG