Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

TL;DR

提出一种难度感知的SFT-then-RL框架,提升小型语言模型推理能力。

cs.CL 🔴 高级 2026-06-03 34 次浏览
Chongyang He Rui Zhang Zixuan Wang Xin Li
小型语言模型 推理 监督微调 强化学习 数据策略

核心发现

方法论

本文提出了一种难度感知的SFT-then-RL框架,通过将训练数据分成特定阶段的数据集,提升小型语言模型的推理能力。在SFT阶段引入桥接机制,将复杂的推理轨迹转化为更易学习的监督信号。在RL阶段,对未解决的难题应用批判性微调,将失败转化为诊断、修复和新的推理轨迹监督。

关键结果

  • 在五个推理基准上进行实验,结果显示该方法在两个小型语言模型上均优于代表性的SFT、蒸馏和RL基线。
  • 在GSM8K-Platinum上,Qwen2.5-0.5B-Instruct模型的准确率提高到53.10%。
  • 在Llama3.2-1B-Instruct模型上,使用桥接机制后,pass@8指标提升至84.29%。

研究意义

该研究强调了在SFT和RL阶段协调数据难度的重要性,展示了通过合理的数据策略可以显著提升小型语言模型的推理能力。这一方法不仅在学术界具有重要意义,也为工业界在资源受限的环境中应用小型语言模型提供了新的思路。

技术贡献

本文的技术贡献在于提出了一种新的数据分配策略,结合桥接机制和批判性微调,将复杂的推理样本转化为可学习的监督信号,显著提高了小型语言模型的推理能力。

新颖性

这是首次在SFT-then-RL框架中引入难度感知的数据分配策略,通过桥接机制和批判性微调,解决了以往方法中难以处理复杂推理样本的问题。

局限性

  • 该方法依赖于教师生成的监督信号,可能引入额外的计算成本和偏差。
  • 在非数学领域和更大规模的语言模型上的效果尚待验证。

未来方向

未来的研究可以探索该框架在更大规模语言模型和非数学领域的应用,开发更高效的自动评分方法,以减少计算成本。

AI 总览摘要

小型语言模型因其高效性和成本优势在资源受限的应用中备受关注。然而,现有的推理能力提升方法在数据选择上缺乏针对性,导致模型难以有效学习复杂推理技能。本文提出了一种难度感知的SFT-then-RL框架,通过在SFT阶段引入桥接机制,将复杂的推理轨迹转化为更易学习的监督信号,并在RL阶段应用批判性微调,将失败转化为诊断、修复和新的推理轨迹监督。

实验结果表明,该方法在五个推理基准上均优于代表性的SFT、蒸馏和RL基线,尤其在GSM8K-Platinum和Llama3.2-1B-Instruct模型上取得了显著的性能提升。这一研究不仅在学术界具有重要意义,也为工业界在资源受限的环境中应用小型语言模型提供了新的思路。

尽管该方法在数学和逻辑推理领域表现出色,但在非数学领域和更大规模的语言模型上的效果尚待验证。未来的研究可以探索该框架在更广泛领域的应用,并开发更高效的自动评分方法,以减少计算成本。

深度分析

研究背景

近年来,随着大规模语言模型(LLM)的发展,推理能力得到了显著提升。然而,小型语言模型(SLM)由于其参数较少,推理能力相对较弱。现有的研究主要集中在通过蒸馏和后训练来提升SLM的推理能力,但在数据选择上缺乏针对性。

核心问题

核心问题在于如何在SFT和RL阶段合理分配不同难度的数据,以最大化小型语言模型的推理能力。现有方法在处理复杂推理样本时常常力不从心,导致模型难以有效学习。

核心创新

本文的核心创新在于提出了一种难度感知的SFT-then-RL框架,通过桥接机制和批判性微调,将复杂的推理样本转化为可学习的监督信号。桥接机制通过调整推理轨迹的复杂性,使其更适合SLM学习。

方法详解

  • �� 数据分配:将训练数据分为简单、中等和困难三类。
  • �� 桥接机制:在SFT阶段,将困难样本转化为更易学习的监督信号。
  • �� 批判性微调:在RL阶段,将失败样本转化为诊断、修复和新的推理轨迹监督。

实验设计

实验在GSM8K-Platinum、MAWPS等五个基准上进行,使用Qwen2.5-0.5B-Instruct和Llama3.2-1B-Instruct两个模型。主要评估指标为准确率和pass@8。

结果分析

实验结果显示,使用难度感知框架后,两个模型在所有基准上的表现均优于基线方法,尤其在GSM8K-Platinum上,准确率提升显著。

应用场景

该方法适用于需要在资源受限环境中部署小型语言模型的场景,如移动设备上的智能助手和实时翻译应用。

局限与展望

该方法依赖于教师生成的监督信号,可能引入额外的计算成本和偏差。此外,在非数学领域和更大规模的语言模型上的效果尚待验证。

通俗解读 非专业人士也能看懂

想象一下你在学习一门新技能,比如骑自行车。最初,你需要有人在旁边扶着你,这就像SFT阶段,帮助你掌握基本技能。当你能保持平衡时,你就可以开始自己骑了,这就像RL阶段,巩固你已经掌握的技能。如果你摔倒了,不用担心,这只是学习过程的一部分。我们的方法就像一个聪明的教练,知道什么时候该扶着你,什么时候该让你自己尝试,并在你摔倒时告诉你哪里出了问题,帮助你下次做得更好。

简单解释 像给14岁少年讲一样

想象一下你在打一个超级难的电子游戏。最开始,你需要一些提示和帮助,这就像我们的SFT阶段,帮助你了解游戏规则。当你熟悉了之后,你就可以自己去挑战更难的关卡,这就像RL阶段,巩固你已经学会的技巧。如果你失败了,不用担心,我们的方法会告诉你哪里出了问题,就像游戏中的提示,帮助你下次过关。是不是很酷?

术语表

SFT (监督微调)

一种通过提供标注数据来微调模型的技术,用于学习新的技能。

在本文中用于提升小型语言模型的推理能力。

RL (强化学习)

一种通过奖励信号来优化模型决策的技术,主要用于巩固已掌握的技能。

在本文中用于巩固小型语言模型已掌握的推理技能。

桥接机制

一种将复杂推理轨迹转化为更易学习的监督信号的方法。

在SFT阶段用于处理困难样本。

批判性微调

一种将RL阶段失败样本转化为诊断、修复和新的推理轨迹监督的方法。

用于提升RL阶段的学习效果。

pass@8

一种评估模型在推理任务中表现的指标,表示模型在8次尝试中至少一次成功的概率。

用于评估SFT阶段的效果。

开放问题 这项研究留下的未解疑问

  • 1 如何在非数学领域应用该框架?现有方法在数学推理上表现良好,但在其他领域的效果尚不明确。
  • 2 如何减少教师生成监督信号的计算成本?目前的方法可能引入额外的计算负担。

应用场景

近期应用

移动设备上的智能助手

通过提升小型语言模型的推理能力,使智能助手在资源受限的移动设备上更高效地运行。

远期愿景

实时翻译应用

在实时翻译应用中使用小型语言模型,提升翻译准确性和速度。

原文摘要

Post-training Small Language Models (SLMs) for reasoning typically follows an SFT-then-RL pipeline, yet existing work rarely considers what data should be learned at each stage. We argue that data strategy should be aligned with the distinct roles of SFT and RL: SFT is better suited for acquiring not-yet-mastered reasoning skills, while RL is better suited for consolidating skills that the model can already partially access. Based on this principle, we propose a difficulty-aware SFT-then-RL framework that organizes training data into stage-specific sets. For hard samples in the SFT stage, we introduce a Bridge mechanism that transforms raw teacher-generated reasoning traces into more learnable supervision for SLMs. For hard samples that remain unsolved during RL, we apply Critique Fine-Tuning by converting all-zero-reward failures into diagnostic, repair, and new reasoning trace supervision for the next SFT stage. Experiments on two SLMs across five reasoning benchmarks show that our method consistently improves over representative SFT, distillation, and RL baselines. Our results highlight the importance of coordinating data difficulty across SFT and RL for effective SLM reasoning post-training.

cs.CL