Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning

TL;DR

提出R-AIRL通过逆强化学习从专家示范中学习推理奖励,提升模型推理能力。

cs.AI 🔴 高级 2025-10-02 44 次浏览
Claudio Fanconi Nicolás Astorga Mihaela van der Schaar
逆强化学习 大语言模型 推理奖励 专家示范 模型微调

核心发现

方法论

本文提出R-AIRL框架,基于对抗IRL思想,从专家链式推理示范中学习过程级奖励。通过构建专家与策略轨迹的正负样本集,训练一个批判器模型,输出每个推理步骤的奖励信号。该奖励模型可用于三大场景:一是作为后训练的训练信号,优于传统的SFT;二是推理时的轨迹重排序,显著提升pass@1性能;三是过程级故障定位,达86.1%的准确率。算法核心包括多粒度奖励(稀疏、区间、密集)设计、基于对抗IRL的奖励学习机制,以及基于GRPO的策略优化。实验在GSM8K、MMLU-Pro和MedReason上验证了其有效性,显示出在训练、推理和迁移中的优越表现。

关键结果

  • 在GSM8K数据集上,R-AIRL的奖励模型在后训练中超越SFT,pass@1提升至85.8%,比SFT最高提升15.7个百分点;在推理重排序中,pass@1提升最多17.4个百分点;在故障定位中,准确率达86.1%。
  • 在MMLU-Pro和MedReason任务中,R-AIRL同样表现优异,特别是在推理重排序任务中,显著优于随机和传统方法,验证了奖励模型的迁移能力。
  • 多粒度奖励设计(稀疏、区间、密集)在不同任务中表现不同,稀疏奖励在训练稳定性方面更优,而密集奖励提供更细粒度的过程反馈。

研究意义

该研究突破了传统模仿学习的局限,首次实现从专家推理轨迹中自动学习过程奖励,兼具训练指导、推理重排序和故障诊断功能。极大丰富了大模型推理训练的工具箱,为复杂任务的自主学习提供新路径,有望推动AI在医疗、科学研究等领域的应用落地。

技术贡献

技术创新包括引入对抗IRL机制,避免外部验证器依赖,提出多粒度奖励策略,结合GRPO优化策略,有效提升学习稳定性和泛化能力。奖励模型的单一性支持多场景复用,简化了训练流程,增强了模型的解释性和调试能力。

新颖性

首次将对抗IRL应用于大语言模型推理奖励学习,突破了传统基于外部验证器的限制,实现无验证器的端到端奖励学习。提出多粒度奖励设计,为推理过程提供细粒度反馈,显著优于现有模仿或偏好学习方法。

局限性

  • 当前方法对专家示范的质量敏感,示范中的潜在错误可能影响奖励学习效果。
  • 奖励模型训练依赖大量示范轨迹,计算成本较高,难以在极大规模场景中直接应用。
  • 在某些复杂推理任务中,奖励信号仍不足以完全覆盖所有推理错误,需结合外部验证器或增强学习策略。

未来方向

未来将探索结合外部验证器的混合训练策略,提升奖励的鲁棒性;同时研究多模态示范的奖励迁移,扩展到视觉或多模态推理场景;还计划优化奖励模型的结构,提高训练效率和泛化能力。

AI 总览摘要

随着大规模语言模型(LLMs)在复杂推理任务中的广泛应用,如何有效引导其学习推理能力成为研究热点。传统方法多依赖强化学习(RL)结合外部验证器或逐步监督,但在实际场景中,设计高质量奖励函数或获取标注成本高昂,限制了其应用范围。本文提出的R-AIRL框架,基于逆强化学习(IRL)思想,从专家链式推理示范中自动学习过程级奖励,突破了外部验证器的依赖。

通过构建专家与策略轨迹的正负样本集,训练一个批判器模型,输出每个推理步骤的奖励信号。该奖励模型在多个粒度(稀疏、区间、密集)上进行优化,支持在训练、推理和故障诊断中复用。实验在GSM8K、MMLU-Pro和MedReason数据集上验证了其优越性能,显著提升了模型的推理准确率和重排序效果。

具体而言,R-AIRL在GSM8K中,后训练的pass@1提升至85.8%,比传统SFT最高提升15.7个百分点。在推理重排序中,pass@1最多提升17.4个百分点,验证了奖励模型的迁移能力和实用性。此外,奖励模型还能有效定位推理中的错误步骤,达86.1%的准确率,为模型调试提供了有力工具。

该方法的核心创新在于引入对抗IRL机制,避免外部验证器依赖,结合多粒度奖励设计,增强了奖励的稳定性和细粒度反馈能力。这一突破为大模型自主学习推理能力提供了新思路,有望推动AI在医疗、科研等领域的应用发展。未来,作者计划结合外部验证器,扩展多模态示范,并优化奖励模型结构,提升训练效率和泛化能力。

深度分析

研究背景

近年来,大规模语言模型(LLMs)在自然语言理解和生成方面取得突破,但其推理能力仍受限。传统训练多采用监督微调(SFT)或强化学习(RL),但缺乏有效的推理奖励信号。已有研究如ReAct、PAL等尝试结合链式推理,但依赖外部验证器或逐步监督,成本高且不易迁移。逆强化学习(IRL)提供了从示范中自动学习奖励的可能性,但在大模型中的应用尚未充分探索。本文旨在弥补这一空白,提出无需外部验证器的奖励学习框架,增强模型推理的自主性和鲁棒性。

核心问题

现有方法在引导模型推理方面存在瓶颈:一是奖励函数设计困难,二是缺乏细粒度的过程反馈,三是推理轨迹易偏离示范路径,影响性能。尤其在复杂任务中,模型难以从示范中泛化,导致推理错误频发。如何从专家示范中自动学习既稳定又实用的奖励信号,成为关键问题。这不仅关系到模型性能提升,也影响到推理过程的可解释性和调试能力。

核心创新

本研究的创新点主要包括:1)引入对抗IRL机制,避免外部验证器依赖,直接从示范中学习奖励;2)设计多粒度奖励(稀疏、区间、密集),兼顾训练稳定性和过程细粒度反馈;3)将奖励模型复用于训练、推理重排序和故障定位,提升模型的多场景适应能力。这些创新共同推动了奖励学习在大模型推理中的应用边界。

方法详解

  • �� 构建专家与策略轨迹的正负样本集,利用答案一致性作为弱监督信号;
  • �� 训练一个批判器模型Dϕ,输出每个推理步骤的概率,转化为奖励信号;
  • �� 设计多粒度奖励(稀疏、区间、密集),通过掩码控制奖励粒度;
  • �� 使用对抗IRL目标,优化奖励模型和策略,提升推理质量;
  • �� 在训练中结合GRPO策略优化算法,交替更新奖励模型和策略;
  • �� 在推理阶段利用奖励模型进行轨迹重排序和故障定位。

实验设计

采用GSM8K、MMLU-Pro和MedReason三大数据集,验证奖励模型的训练效果、推理重排序能力和故障定位准确率。比较SFT和R-AIRL在不同粒度下的性能差异,分析奖励模型的迁移能力和稳定性。设置不同的超参数如奖励粒度、样本规模,进行消融分析以验证设计合理性。评估指标包括pass@1、重排序提升、故障定位准确率等。

结果分析

在GSM8K中,R-AIRL的奖励模型在后训练中,pass@1最高达85.8%,比SFT提升15.7个百分点。在推理重排序中,pass@1最多提升17.4个百分点,验证奖励模型的实用性。多粒度奖励在不同任务中表现不同,稀疏奖励稳定性更好,密集奖励提供更细粒度反馈。奖励模型还能有效定位推理错误,达到86.1%的准确率,验证其过程级诊断能力。

应用场景

该方法适用于需要高推理能力的应用场景,如医疗诊断、科学研究和法律分析。模型可在无外部验证器的情况下自主学习推理奖励,降低成本,提高鲁棒性。未来还可结合多模态示范,扩展到视觉推理和跨领域任务,为行业提供智能推理解决方案。

局限与展望

当前方法对示范质量敏感,示范中的潜在错误会影响奖励学习效果。训练过程计算成本较高,难以在超大规模场景中直接部署。此外,奖励信号在某些复杂推理任务中仍不足以覆盖所有错误,需结合外部验证器或强化学习策略进行补充。未来需优化模型结构和训练流程,提升效率和泛化能力。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,老师(专家)示范了一道菜的做法,你模仿着做,但有时候会偏离步骤。传统的方法就是让你尽量模仿老师的每个步骤,但如果你偏离了,厨师就没有办法判断哪里出错。本文提出一种新方法,就像让厨师自己学会判断哪些步骤是关键的,哪些偏差会导致菜失败。通过观察老师的示范,系统学会了判断每个步骤的重要性和正确性,不仅能帮你更好地模仿,还能在你做菜时帮你挑出错误,甚至在未来自己改进菜谱。这就像让厨师自己学会了“菜谱评分”,不用外部专家随时指导,自己就能找到问题所在,改进厨艺。

简单解释 像给14岁少年讲一样

想象你在学校学做手工艺品,老师教你怎么折纸。你模仿老师的动作,但有时候会折错。以前的方法就是让你反复练习,尽量模仿老师的每一步,但如果你偏离了,老师就不知道哪里出错。现在,有个聪明的机器人老师,它能自己学会判断你的折纸是不是正确。它看你折的每一步,给你打分,告诉你哪里折错了,还能帮你改正。这个机器人不用每次都看老师的示范,就能自己学会判断折纸的好坏。它通过观察老师的示范,学会了哪些步骤最重要,哪些错误会让折纸变形。这样,你就可以自己改进折纸技巧,不再完全依赖老师的指导。这就像这篇论文里的方法,让电脑自己学会判断推理的好坏,不用外部验证器,自己就能找到问题所在,变得更聪明。

原文摘要

Teaching large language models (LLMs) to reason during post-training typically relies on reinforcement learning with explicit outcome- or process-based reward functions. However, in many real-world settings, obtaining or defining such reward functions is difficult, especially for complex tasks, making learning from expert demonstrations an attractive alternative. The dominant approach, supervised fine-tuning (SFT), trains models to imitate expert reasoning traces directly, but suffers from the general limitations of off-policy learning: performance can be fragile to inference-time deviations from states explicitly covered by the demonstrations. To address this, we propose Reasoning Adversarial Inverse Reinforcement Learning (R-AIRL). Rather than imitating the expert's reasoning, R-AIRL infers the underlying process-level reward from the expert Chain-of-Thoughts. Through experiments on GSM8K, MMLU-Pro and MedReason we show that the reasoning reward function learned with R-AIRL can be effectively used throughout the training and inference pipeline: (1) to provide a training signal for post-training, outperforming SFT in most of the considered settings, (2) for inference-time reranking, improving pass@1 by up to 17.4 points, and (3) for process-level evaluation, localising reasoning failures with up to 86.1% accuracy. Overall, R-AIRL bridges imitation learning and reward-based optimisation, enabling the extraction of meaningful reasoning signals from expert thinking traces.

cs.AI