核心发现
方法论
本文通过剖析现有多奖励优化框架中的KL正则和分组归一化机制,提出去除这两项后,简化为基于长度截断的奖励,转而采用监督微调(SFT)策略。利用自生成数据过滤正确性和简洁性,实现高效优化。实验在五个数学基准上验证,显示该方法在保持准确率的同时,大幅降低推理长度(最高80%),并提升训练效率(GPU内存减半,收敛速度提升70%)。
关键结果
- 在DeepSeek-R1-1.5B模型上,采用on-policy SFT将推理长度缩减80%,同时保持或略优于原始模型的准确率(59.9%对比59.0%),效率指标超越复杂RL方法(Eff=2.74%对比2.55%),在五个基准上均优于其他方法。
- 训练过程中GPU内存使用降低50%,训练收敛时间缩短70%,显著提升训练效率。模型在不同长度预算下,始终处于准确率与效率的Pareto最优边界。
- 去除KL正则和分组归一化机制,简化奖励设计,验证其在多任务、多奖励场景中的适用性和鲁棒性,证明了简单策略的有效性。
研究意义
该研究挑战了复杂奖励设计在大规模推理模型中的必要性,提出更简洁高效的微调策略,解决训练不稳定和效率瓶颈问题。为未来大模型推理提供了低成本、高性能的解决方案,推动模型在实际应用中的普及和优化。
技术贡献
核心贡献在于系统性分析多奖励优化中的机制失配,提出去除KL正则和分组归一化,转而采用基于长度截断的奖励,结合监督微调实现高效推理。该方法在保持模型性能的同时,大幅降低训练成本,提供了理论和实践上的新思路。
新颖性
首次系统性将多奖励强化学习框架简化为基于长度截断的监督微调策略,验证其在大规模推理任务中的优越表现。突破了以往依赖复杂奖励设计的局限,强调简洁原则在模型优化中的价值。
局限性
- 该方法依赖于答案的可验证性,可能在某些任务中难以应用,如模糊或主观评价场景。
- 对长度阈值的选择敏感,过短可能影响模型性能,过长则影响效率。
- 在极端复杂或多样化任务中,仍需结合其他机制以保证泛化能力。
未来方向
未来将探索自适应长度阈值策略,结合多任务学习扩展到更复杂场景,研究多奖励机制的理论基础,以及在实际工业场景中的部署优化。
AI 总览摘要
当前大规模推理模型在探索长链推理能力方面取得了显著进展,但其训练成本高昂,限制了实际应用的普及。传统强化学习方法虽能优化推理路径,但复杂的奖励设计带来训练不稳定和效率瓶颈。本文提出一种简洁的on-policy监督微调(SFT)策略,通过去除KL正则和分组归一化机制,采用基于长度截断的奖励,转而利用自生成数据过滤正确性与简洁性,实现高效优化。
该方法在五个数学推理基准上表现优异,推理长度最多缩减80%,同时保持或提升模型准确率。训练效率方面,GPU内存降低50%,收敛速度提升70%,显著降低了训练成本。实验结果显示,简化的策略在多任务、多奖励场景中依然具备鲁棒性和优越性,挑战了复杂奖励设计的必要性,为未来大模型的高效训练提供了新思路。
这项研究强调了原则性简洁在深度学习中的价值,推动模型在实际应用中的普及,特别是在资源有限的环境下实现高性能推理。未来工作将聚焦于自适应长度调节、多任务泛化及工业部署优化,期待为大规模推理模型的可持续发展提供理论和实践基础。
深度分析
研究背景
近年来,大规模推理模型(LRMs)通过强化学习(RL)实现长链推理能力,代表性方法如Group1的GRPO在数学推理任务中表现优异。然而,RL训练成本高、稳定性差,限制了模型的实际应用。为提高效率,研究者尝试引入多奖励机制,优化推理路径长度,但复杂奖励设计带来训练不稳定和性能波动。传统监督微调(SFT)虽简单但效果有限,难以兼顾推理速度与准确性。本文在此背景下,重新审视奖励设计的合理性,探索更简洁高效的训练策略。
核心问题
现有多奖励强化学习方法在推理效率提升方面虽取得一定成果,但因奖励机制复杂、训练不稳定,难以广泛应用。特别是在多奖励场景中,奖励冲突和归一化机制引入了优化偏差,限制了模型性能的提升。如何在保证推理准确率的同时,显著缩短推理路径,降低训练成本,成为亟待解决的问题。本文旨在通过简化奖励设计,提升训练稳定性和效率,推动大规模推理模型的实用化。
核心创新
核心创新包括:1) 彻底剥离KL正则和分组归一化机制,简化优化目标;2) 引入基于长度截断的二元奖励,直接过滤超长或错误响应;3) 利用自生成数据进行监督微调,保持模型性能同时提升效率。这些创新突破了传统多奖励框架的复杂性,强调原则性简洁,提升训练稳定性和泛化能力。
方法详解
- �� 构建基于自生成数据的过滤机制,筛选正确且简洁的推理路径;• 移除KL正则,简化为纯监督微调目标;• 采用长度截断奖励,定义响应长度阈值,超长响应获得零奖励;• 利用 on-policy 策略,动态采样响应进行训练,确保数据分布一致;• 设计训练流程,包括数据采样、过滤、梯度计算和模型更新,确保训练稳定高效。
实验设计
在DeepScaleR数据集上,使用DeepSeek-R1-1.5B和7B模型,比较RL、SFT和本文方法。指标包括准确率、推理长度、效率(Eff)等。采用五个数学基准(GSM8K、MATH-500、AMC23、AIME24、AIME25),多样化任务难度和数据规模。超参数设置包括长度阈值、采样温度、训练轮次等,进行消融验证。实验还分析了不同长度阈值和采样策略对性能的影响。
结果分析
实验显示,on-policy SFT在五个基准上均优于复杂RL方法,推理长度缩短最高80%,准确率保持或略优(如59.9%对比59.0%)。效率指标显著提升,GPU内存减半,收敛时间缩短70%。在不同长度预算下,模型始终处于效率-准确的Pareto边界,验证了其鲁棒性。消融实验确认去除复杂奖励机制的有效性,简洁策略即能达成优异性能。
应用场景
该方法适用于需要高效推理的工业场景,如自动问答、智能客服和教育辅导。只需保证答案的可验证性,模型即可在资源有限环境中快速部署。未来,结合多任务学习和自适应长度调节,有望实现更广泛的应用场景,包括多模态推理和复杂决策支持。
局限与展望
该策略依赖于答案的可验证性,难以应用于主观或模糊任务。长度阈值的选择影响性能,过短可能限制模型能力,过长影响效率。在极端复杂任务中,仍需结合其他机制以保证泛化能力。未来需研究自适应阈值和多奖励机制的理论基础,提升模型的泛用性和鲁棒性。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,目标是做出既好吃又快的菜。传统方法就像用很多调料和步骤,虽然味道好但很耗时。现在,我们用一种简单的办法:只关注菜是否够香(正确)和做得快(简洁)。只要菜符合这两个条件,就算成功。这样一来,厨师(模型)不用复杂的调料(奖励机制),只需要用最基本的原则,快速做出满意的菜。这就像用一个简单的计时器和味道检测器,直接筛选出最优的菜肴,节省时间又保证质量。这个方法让厨房效率大大提升,菜也变得更快、更好吃了。
简单解释 像给14岁少年讲一样
想象你在学校里写作业,有时候题目很难,老师会告诉你:只要写对了就行,不用写太长。以前,老师会给你很多提示,比如写了多少字、用了哪些词,确保你没有跑题。可是,这样反而让你写作业变得很复杂,还可能出错。现在,老师只关心你答对了没有,写得是不是简洁明了。你只要答对题,又不写太长,就算完成了。这就像用一个简单的评分标准,只看答案对不对和字数是否合适,不需要复杂的评分规则。这样一来,你写作业就更快、更轻松,还能保证质量。这个方法就像用最简单的规则,让你专注在最重要的事情上,效率变高,压力变小。
原文摘要
Large reasoning models (LRMs) are commonly trained with reinforcement learning (RL) to explore long chain-of-thought reasoning, achieving strong performance at high computational cost. Recent methods add multi-reward objectives to jointly optimize correctness and brevity, but these complex extensions often destabilize training and yield suboptimal trade-offs. We revisit this objective and challenge the necessity of such complexity. Through principled analysis, we identify fundamental misalignments in this paradigm: KL regularization loses its intended role when correctness and length are directly verifiable, and group-wise normalization becomes ambiguous under multiple reward signals. By removing these two items and simplifying the reward to a truncation-based length penalty, we show that the optimization problem reduces to supervised fine-tuning on self-generated data filtered for both correctness and conciseness. We term this simplified training strategy on-policy SFT. Despite its simplicity, on-policy SFT consistently defines the accuracy-efficiency Pareto frontier. It reduces CoT length by up to 80 while maintaining original accuracy, surpassing more complex RL-based methods across five benchmarks. Furthermore, it significantly enhances training efficiency, reducing GPU memory usage by 50% and accelerating convergence by 70%. Our code is available at https://github.com/EIT-NLP/On-Policy-SFT.