核心发现
方法论
SOD将多轮TIR轨迹切成若干步骤,以步骤级分歧 d_k 估计学生与教师在当前状态的偏离,并据此动态调整OPD强度。核心是:在对齐良好时保留密集token监督;当错误工具调用导致状态漂移时,按式(7)逐步衰减权重 w_k,抑制误导性教师信号。训练目标为 L = L_GRPO + L_stepOPD,把GRPO的轨迹级探索与步级蒸馏结合起来。
关键结果
- 在4个基准 AIME 2024、AIME 2025、GPQA-Diamond、LiveCodeBench 上,0.6B 学生的 SOD 得到 20.84/26.13/22.19/27.72,平均 24.22;相较第二名 OPD 的 20.04,平均相对提升 20.86%,而且首次让亚10亿参数模型在 AIME 2025 达到 26.13%。
- 1.7B 学生上,SOD 达到 50.83/41.72/38.72/40.63,平均 42.98;OPD 仅 36.27。论文还指出,1.7B 学生可恢复教师 4B 模型 69.8% 的性能,而 OPD 仅 58.9%,说明SOD在更大容量下仍能稳定放大收益。
- 消融实验显示,均匀加权降至 34.70,启发式衰减为 37.14,错误后硬遮蔽仅 31.85,去掉权重裁剪为 38.10;若去掉 GRPO 为 40.78,去掉步级OPD则只剩 25.39。说明自适应权重与密集蒸馏缺一不可。
研究意义
这项工作把“小模型学会用工具”从单纯追求最终答案,推进到“按步骤识别何时该听老师、何时该怀疑老师”。它揭示了TIR中的关键失效模式:一次错误工具调用会让后续状态迅速偏离教师分布,使统一OPD的token监督越来越不可靠。SOD的价值在于把这种失真显式建模并局部抑制,为低算力、低时延、隐私敏感场景中的端侧智能体训练提供了更稳的范式。
技术贡献
技术上,SOD提出了可计算、零额外标注成本的步骤级分歧指标 d_k = mean_t |log π_θ - log π_teacher|,并用相邻步骤分歧比值构造权重 w_k,且设置 1+δ 上界防止放大失稳。理论上,作者证明TIR中错误工具观察会导致分歧超线性累积,并分析OPD在低重叠区域会出现梯度SNR下降;SOD通过对高分歧步骤降权,缓解“错误越积越多、监督越学越坏”的反馈回路。
新颖性
与传统OPD、GRPO或自蒸馏方法不同,SOD不是把所有学生采样步骤一视同仁,而是首次把“步骤级可靠性”作为蒸馏权重的核心变量来处理TIR。它也不同于简单的错误后截断或固定指数衰减,因为它能处理非单调恢复:学生在某一步修正后,后续权重可重新升高。
局限性
- SOD依赖教师与学生在同一轨迹上的log概率差来估计分歧,因此若教师本身在某类工具调用上不稳,或者两者输出风格差异过大,分歧指标可能把“教师错误”也当作“学生偏离”,从而削弱监督。
- 方法主要在Qwen3系列与数学、科学、代码基准上验证,尚未展示对长链网页导航、GUI操控或更复杂多工具生态的全面泛化;这些场景的状态转移更复杂,步级分歧是否仍足够可靠仍待验证。
- 虽然权重裁剪提升稳定性,但SOD仍需同时运行GRPO与OPD两条训练信号,训练设计比单一SFT更复杂,超参数 δ、ϵ 及教师规模变化下的稳健性还可进一步系统研究。
未来方向
未来可把步级分歧扩展到更细的工具子步骤、函数调用级别或多模态环境,并研究如何自动学习权重函数而非手工比值规则。另一个方向是结合不确定性估计、结果验证器或反事实轨迹,进一步区分“学生偏离”与“教师不可靠”,让小模型代理在更长、更开放的任务链中持续稳定学习。
AI 总览摘要
深度解读
原文摘要
Tool-integrated reasoning (TIR) is difficult to scale to small language models due to instability in long-horizon tool interactions and limited model capacity. While reinforcement learning methods like group relative policy optimization provide only sparse outcome-level rewards. Recently, on-policy distillation (OPD) has gained popularity by supplying dense token-level supervision from a teacher on student-generated trajectories. However, our experiments indicate that applying OPD to TIR leads to a critical failure mode: erroneous tool calls tend to cascade across subsequent reasoning steps, progressively amplifying student-teacher divergence and rendering the teacher's token-level supervision increasingly unreliable. To address this, we propose SOD, a step-wise on-policy distillation framework for small language model agents, which adaptively reweights distillation strength at each step based on step-level divergence. Therefore, SOD can attenuate potentially misleading teacher signals in high-divergence regions while preserving dense guidance in well-aligned states. Experiments on challenging math, science, and code benchmarks show that SOD achieves up to 20.86% improvement over the second-best baseline. Notably, our 0.6B student achieves 26.13% on AIME 2025, demonstrating effective transfer of agentic reasoning to lightweight models. Our code is available at https://github.com/YoungZ365/SOD.