Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

TL;DR

NRT模型通过自生成推理路径提升推理能力,无需外部验证器,显著提升复杂推理任务表现。

cs.LG 🔴 高级 2026-02-12 39 次浏览
Yuanfu Wang Zhixuan Liu Xiangtian Li Chaochao Lu Chao Yang
自然语言处理 推理 强化学习 机器学习 算法创新

核心发现

方法论

NRT(Native Reasoning Training)通过将推理过程视为潜变量,利用标准问答对生成推理路径,优化模型生成正确答案的概率。该方法不依赖外部验证器,采用统一的训练目标,分析先前方法的失败模式如策略崩溃,设计更稳健的奖励聚合函数,形成自我强化反馈回路。

关键结果

  • NRT在Llama和Mistral模型上实现了无验证器方法中的最先进性能,显著超越标准SFT基线和之前的无验证器RL方法。在复杂推理领域表现尤为突出,展示了对策略崩溃的高鲁棒性。
  • 在GSM8K数据集上,NRT-WS(-log p)将8B模型的分数从29.0提升到76.0,远超RLPR的65.0。
  • NRT-GM在BBH数据集上的得分提高到54.3,比RLPR高出13.1分,展示了其在多步骤问题上的潜在推理技能。

研究意义

NRT方法在无需外部验证器的情况下显著提升了复杂推理任务的性能,降低了数据成本,扩展了推理训练的适用范围。通过自我生成推理路径,NRT克服了传统方法中依赖高质量人工标注数据和外部验证器的局限性,为构建更强大、更广泛适用的推理系统提供了一条通用、可扩展的路径。

技术贡献

NRT通过将推理过程视为潜变量,提出了新的奖励聚合函数和训练目标,克服了策略崩溃等问题。与现有的SFT和RLVR方法相比,NRT不依赖外部验证器,能够在更广泛的任务中应用,尤其是在无法验证的领域中展现出强大的推理能力。

新颖性

NRT首次将推理过程视为潜变量进行优化,区别于传统的依赖外部验证器的方法。其创新在于通过自生成推理路径解决模型不确定性,形成自我强化的学习机制。

局限性

  • NRT在缺乏外部验证器的情况下,可能在某些需要明确验证的任务中表现不佳。
  • 由于依赖模型自生成的推理路径,初始模型能力可能影响最终表现。

未来方向

未来研究可以探索NRT在更多领域的应用,如开放性问题解答和创造性写作。此外,进一步优化奖励聚合函数和训练目标,以提升模型的推理能力和稳定性。

AI 总览摘要

当前大型推理模型的训练方法依赖于高质量的人工标注数据和外部验证器,这不仅增加了数据收集成本,还可能嵌入人类认知偏见。为了克服这些限制,本文提出了NRT(Native Reasoning Training)框架,通过仅使用标准问答对生成推理路径,培养复杂推理能力。NRT将推理过程视为潜变量,采用统一的训练目标,奖励增加模型生成正确答案概率的路径。

实验结果表明,NRT在Llama和Mistral模型上实现了无验证器方法中的最先进性能,显著超越标准SFT基线和之前的无验证器RL方法。在复杂推理领域表现尤为突出,展示了对策略崩溃的高鲁棒性。特别是在GSM8K数据集上,NRT-WS(-log p)将8B模型的分数从29.0提升到76.0,远超RLPR的65.0。

NRT的成功在于其奖励聚合函数的设计,指导模型生成解决自身不确定性的推理路径。通过优先处理模型认为困难的标记,NRT-WS(-log p)成为整体表现最佳的方法。尽管如此,NRT在缺乏外部验证器的情况下,可能在某些需要明确验证的任务中表现不佳。未来研究可以探索NRT在更多领域的应用,如开放性问题解答和创造性写作。

深度分析

研究背景

近年来,大型语言模型(LLM)在复杂任务中展现出卓越能力,如数学、编程和多步骤问题解决。当前的主流方法是结合监督微调(SFT)和带验证奖励的强化学习(RLVR),但这些方法依赖于高质量的人工标注数据和外部验证器,限制了其在无法验证任务中的应用。

核心问题

传统方法的局限在于对高质量人工标注数据和外部验证器的依赖,导致数据收集成本高昂,并可能嵌入人类认知偏见。此外,RLVR阶段仅限于可客观评估的领域,如数学和编程,无法覆盖广泛的无法验证的任务。

核心创新

NRT通过将推理过程视为潜变量,提出了一种无需外部验证器的新框架。其核心创新在于通过自生成推理路径解决模型不确定性,形成自我强化的学习机制。与传统方法不同,NRT不依赖于外部验证器,能够在更广泛的任务中应用。

方法详解

  • �� NRT将推理过程视为潜变量,使用标准问答对生成推理路径。
  • �� 采用统一的训练目标,奖励增加模型生成正确答案概率的路径。
  • �� 通过分析先前方法的失败模式如策略崩溃,设计更稳健的奖励聚合函数。
  • �� 形成自我强化反馈回路,模型学会生成解决自身不确定性的推理路径。

实验设计

实验在Llama和Mistral模型上进行,使用tulu-3-sft-mixture数据集的200K样本。所有方法均从相同的未调优检查点开始,确保公平比较。评估基准包括BBH、MMLU、GSM8K等,使用GRPO算法进行训练,学习率为1e-5,批量大小为256。

结果分析

NRT在Llama和Mistral模型上实现了无验证器方法中的最先进性能,显著超越标准SFT基线和之前的无验证器RL方法。在GSM8K数据集上,NRT-WS(-log p)将8B模型的分数从29.0提升到76.0,远超RLPR的65.0。

应用场景

NRT适用于无法验证的任务,如开放性问题解答和创造性写作。其无需外部验证器的特性降低了数据成本,扩展了推理训练的适用范围。

局限与展望

NRT在缺乏外部验证器的情况下,可能在某些需要明确验证的任务中表现不佳。由于依赖模型自生成的推理路径,初始模型能力可能影响最终表现。未来研究可以探索NRT在更多领域的应用。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。传统方法就像需要详细的食谱和厨师指导才能做出美味的菜肴,而NRT就像是一个聪明的厨师,只需知道食材和想要的味道,就能自己摸索出最佳的烹饪方法。NRT通过自我尝试和调整,逐步提高自己的烹饪技巧,不需要外部的详细指导。

简单解释 像给14岁少年讲一样

想象你在玩一个解谜游戏。传统方法就像需要找攻略才能过关,而NRT就像是一个聪明的玩家,只需知道游戏目标,就能自己摸索出最佳的通关策略。NRT通过不断尝试和调整,逐步提高自己的游戏技巧,不需要外部的详细指导。是不是很酷?

术语表

Native Reasoning Training (NRT)

一种通过自生成推理路径提升推理能力的方法,无需外部验证器。

本文提出的核心方法,用于解决无法验证的推理任务。

Supervised Fine-Tuning (SFT)

一种通过模仿专家演示来微调预训练模型的方法。

传统推理模型训练的第一阶段。

Reinforcement Learning with Verifiable Rewards (RLVR)

一种通过外部验证器确认模型输出正确性的强化学习方法。

传统推理模型训练的第二阶段。

Policy Collapse

一种策略收敛到简单、低熵输出的现象,导致探索减少。

NRT通过设计更稳健的奖励聚合函数来避免这种现象。

Weighted Sum (WS)

一种奖励聚合策略,优先处理模型认为困难的标记。

NRT中用于提升推理路径质量的奖励机制。

开放问题 这项研究留下的未解疑问

  • 1 如何在缺乏外部验证器的情况下,进一步提升NRT在需要明确验证的任务中的表现?
  • 2 如何优化NRT的奖励聚合函数,以更好地解决模型的不确定性?

应用场景

近期应用

开放性问题解答

NRT可以用于开放性问题解答,降低数据成本,提高推理能力。

远期愿景

创造性写作

NRT在创造性写作中有潜力,通过自生成推理路径提升创作质量。

原文摘要

The prevailing paradigm for training large reasoning models--combining Supervised Fine-Tuning (SFT) with Reinforcement Learning with Verifiable Rewards (RLVR)--is fundamentally constrained by its reliance on high-quality, human-annotated reasoning data and external verifiers. This dependency incurs significant data-collection costs, risks embedding human cognitive biases, and confines the reinforcement learning stage to objectively assessable domains like mathematics and coding, leaving a wide range of unverifiable tasks beyond its scope. To overcome these limitations, we introduce NRT (Native Reasoning Training), a novel framework that cultivates complex reasoning by having the model generate its own reasoning traces using only standard question-answer pairs, thereby obviating the need for expert-written demonstrations. NRT reframes the training problem by treating the reasoning process as a latent variable. It employs a unified training objective that models reasoning as an optimization problem, intrinsically rewarding paths that increase the model's likelihood of producing the ground-truth answer. This unified perspective allows us to analyze intrinsic failure modes of prior methods, such as policy collapse, and systematically design more robust reward aggregation functions, creating a self-reinforcing feedback loop where the model learns to think in ways that resolve its own uncertainty. Empirical evaluation on Llama and Mistral model families demonstrates that NRT achieves state-of-the-art performance among verifier-free methods, significantly outperforming standard SFT baselines and prior verifier-free RL methods. Our approach yields particularly strong performance gains in complex reasoning domains and exhibits high robustness to policy collapse, offering a general, scalable path toward building more powerful and broadly applicable reasoning systems.

cs.LG cs.AI