On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
CHORD框架通过动态加权结合SFT和RL,提升LLMs性能。
核心发现
方法论
CHORD框架通过动态加权将监督微调(SFT)整合为强化学习(RL)过程中的辅助目标。它采用全局系数μ和逐字权重函数ϕ(·)来控制离策略专家数据的影响,促进在策略探索的同时减少离策略数据的干扰。
关键结果
- CHORD在数学推理任务中超越了基线模型,AMC提高了2.4%,AIME24提高了1.0%。
- 在工具使用任务中,CHORD-ϕ的整体性能优于其他方法,BFCL总分达到78.5。
- 通过逐字权重控制,CHORD-ϕ有效避免了过拟合,提升了模型的泛化能力。
研究意义
CHORD框架通过将离策略专家数据与在策略探索有效结合,解决了传统SFT-then-RL方法中存在的性能不稳定问题。它不仅在学术界为大语言模型的训练提供了新的视角,还在工业界为复杂任务的解决方案提供了更高效的方法。
技术贡献
CHORD引入了动态加权机制,使得SFT不再是独立阶段,而是强化学习过程中的一部分。通过全局系数和逐字权重函数,CHORD实现了对离策略数据影响的精细控制,提供了新的工程实现可能性。
新颖性
CHORD首次将SFT作为RL过程中的动态辅助目标,通过创新的双重控制机制,显著改善了模型的训练稳定性和性能。
局限性
- CHORD在处理与模型既有模式显著不同的专家数据时,可能仍会出现性能波动。
- 需要针对不同任务调整μ的衰减策略,增加了调参复杂度。
未来方向
未来研究可以探索CHORD在更多任务上的适用性,并优化其动态加权策略以适应不同类型的专家数据。
AI 总览摘要
在大语言模型(LLMs)的训练中,监督微调(SFT)和强化学习(RL)是两种常用的后训练范式。然而,传统的SFT-then-RL方法常面临性能不稳定的问题。为解决这一挑战,本文提出了CHORD框架,通过动态加权将SFT整合为RL过程中的辅助目标。
CHORD框架采用全局系数μ和逐字权重函数ϕ(·),实现了对离策略专家数据影响的精细控制。实验结果表明,CHORD在数学推理和工具使用任务中均表现出色,显著超越了基线模型。
CHORD的创新在于其双重控制机制,有效结合了离策略专家数据与在策略探索,解决了传统方法中的性能不稳定问题。未来研究可进一步优化其动态加权策略,以适应不同类型的任务和数据。
深度分析
研究背景
近年来,大语言模型(LLMs)在自然语言处理领域取得了显著进展。监督微调(SFT)和强化学习(RL)是提升LLMs性能的两种关键后训练技术。SFT通过高质量的专家数据进行模式模仿,而RL则通过在策略生成的直接反馈中进行探索。
核心问题
尽管SFT和RL各有优劣,传统的SFT-then-RL方法在结合两者时常面临性能不稳定的问题。专家数据可能与模型既有模式显著不同,导致训练过程中的性能波动和过拟合。
核心创新
CHORD框架通过动态加权机制,将SFT整合为RL过程中的辅助目标。它采用全局系数μ和逐字权重函数ϕ(·),实现了对离策略专家数据影响的精细控制,促进了在策略探索的同时减少离策略数据的干扰。
方法详解
- �� 引入全局系数μ,动态调整SFT和RL的损失函数权重。
- �� 设计逐字权重函数ϕ(·),控制每个token的学习信号强度。
- �� 通过动态加权机制,实现从离策略模仿到在策略优化的平滑过渡。
实验设计
实验在数学推理和工具使用任务上进行,使用OpenR1-Math-220k和ToolAce数据集。基线包括原始模型、SFT-only、RL-only及SFT+RL等。关键指标包括AMC、AIME24、BFCL等。
结果分析
CHORD在数学推理任务中超越了基线模型,AMC提高了2.4%,AIME24提高了1.0%。在工具使用任务中,CHORD-ϕ的整体性能优于其他方法,BFCL总分达到78.5。
应用场景
CHORD可用于需要结合专家知识和策略探索的复杂任务,如自动驾驶、智能客服等。其动态加权机制使其在处理多样化数据时具有更高的灵活性。
局限与展望
CHORD在处理与模型既有模式显著不同的专家数据时,可能仍会出现性能波动。需要针对不同任务调整μ的衰减策略,增加了调参复杂度。
通俗解读 非专业人士也能看懂
想象一个厨师在厨房里做菜。传统的SFT-then-RL方法就像先学习一个菜谱,然后尝试各种调料来改进味道。然而,这种方法可能导致味道不稳定。CHORD就像一个智能助手,能够根据食材的变化动态调整调料的比例,确保每道菜都能达到最佳味道。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,你有两个任务:一个是模仿高手的动作,另一个是自己探索新技能。传统方法是先学会模仿,再去探索。CHORD就像一个智能教练,它能同时帮你模仿和探索,还能根据你的表现动态调整训练计划,让你更快变强!
术语表
监督微调 (Supervised Fine-Tuning)
通过高质量专家数据对模型进行微调,以模仿专家的响应模式。
在CHORD中作为离策略数据的来源。
强化学习 (Reinforcement Learning)
通过在策略生成的直接反馈中进行探索,以优化模型的策略。
在CHORD中作为在策略探索的核心机制。
动态加权 (Dynamic Weighting)
根据训练过程中的需求动态调整损失函数的权重。
CHORD中用于平衡SFT和RL的影响。
全局系数μ (Global Coefficient μ)
控制SFT和RL损失函数权重的全局参数。
CHORD中用于动态调整离策略数据的影响。
逐字权重函数ϕ(·) (Token-wise Weighting Function ϕ(·))
根据每个token的生成概率调整其学习信号的强度。
CHORD中用于增强训练稳定性。
开放问题 这项研究留下的未解疑问
- 1 如何在更多任务中优化CHORD的动态加权策略?
- 2 CHORD在处理极端离策略数据时的性能如何?
应用场景
近期应用
自动驾驶
通过结合专家驾驶数据和实时反馈,提升自动驾驶系统的决策能力。
远期愿景
智能客服
通过动态加权机制,智能客服系统可以更好地结合专家知识和实时用户反馈,提供更优质的服务。
原文摘要
Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL) are two prominent post-training paradigms for refining the capabilities and aligning the behavior of Large Language Models (LLMs). Existing approaches that integrate SFT and RL often face the risk of disrupting established response patterns and inducing overfitting to expert data. To address this, we present a novel investigation into the unified view of SFT and RL through an off-policy versus on-policy lens. We propose CHORD, a framework for Controllable Harmonization of On- and Off-Policy Reinforcement Learning via Dynamic Weighting, which reframes SFT not as a separate stage but as a dynamically weighted auxiliary objective within the on-policy RL process. Based on an analysis of off-policy expert data's influence at both holistic and granular levels, we incorporate a dual-control mechanism in CHORD. Specifically, the framework first employs a global coefficient to holistically guide the transition from off-policy imitation to on-policy exploration, and then applies a token-wise weighting function that enables granular learning from the expert, which promotes on-policy exploration and mitigates disruption from off-policy data. We conduct extensive experiments across various practical tasks, providing empirical evidence that CHORD achieves a stable and efficient learning process. By effectively harmonizing off-policy expert data with on-policy exploration, CHORD demonstrates significant improvements over baselines. We release the implementation at https://github.com/modelscope/Trinity-RFT/tree/main/examples/mix_chord to inspire further research.