Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
提出RTT框架,将响应级评分与Token级奖励结合,利用Token相关判别器实现细粒度奖励,显著提升指令跟随性能。
核心发现
方法论
RTT框架通过引入Token相关判别器,将响应级别的结构化评分映射到Token级奖励,结合RTT-GRPO优化策略,解决奖励稀疏和模糊问题。核心包括:训练Token相关判别器、设计Intra-sample Token Group Normalization,以及多维奖励空间的相对优势归一化。实验中采用多模型、多任务数据集验证效果,显示其在指令级和规则级准确率上优于基线方法。
关键结果
- 在多项指令遵循基准上,RTT-CSR和RTT-AON平均提升指令准确率2.5%以上,Rubric级别提升1.6%以上,显著优于RL-AON和RL-CSR。在Out-of-Domain任务中,RTT保持或略优于未调优模型,验证其泛化能力。 Ablation研究表明,Intra-sample归一化策略优于Inter-sample,提升性能约1.2%。
- 在不同模型(Qwen3-4B、Llama3.2-3B)上均取得优异表现,验证方法的普适性。
- 引入Token相关判别器和多维归一化机制,有效缓解奖励稀疏和模糊问题,提升细粒度奖励的准确性和训练效率。
研究意义
该研究突破了传统响应级奖励的局限,通过Token级奖励实现更细粒度的行为指导,为大模型复杂指令遵循提供了新思路。其方法不仅提升了模型的准确性和鲁棒性,也为结构化奖励设计和多维奖励空间的归一化提供了理论基础,有望推动AI在开放域、多任务环境中的应用落地。未来,结合更复杂的结构化评价体系,有望实现更高水平的自主学习和任务适应能力。
技术贡献
提出RTT框架,创新性引入Token相关判别器,将响应级评分映射到Token层面,结合RTT-GRPO优化策略,解决奖励稀疏和模糊问题。设计Intra-sample Token Group Normalization,有效应对多维奖励空间的归一化难题。该方法在多个基准测试中均表现优异,验证了其在指令遵循和规则满足方面的优越性。技术上实现了多维奖励的高效归一化和细粒度奖励分配,为大模型RL训练提供了新工具。
新颖性
首次将结构化评价体系中的多维奖励空间引入RL训练,通过Token相关判别器实现细粒度奖励映射,并提出Intra-sample归一化策略,有效解决奖励稀疏和模糊问题。这在现有基于响应级奖励的RL方法中尚属首创,极大丰富了奖励设计的理论体系和实践手段。
局限性
- 当前方法依赖于高质量的Token相关判别器训练,判别器性能直接影响奖励质量,存在泛化和鲁棒性不足的问题。
- 在极端复杂或模糊的任务中,结构化评分和Token判别可能难以准确反映实际行为,影响训练效果。
- 模型训练和推理过程中的计算成本较高,限制了大规模应用的可行性。
未来方向
未来将探索多模态奖励体系,结合视觉、语音等多模态信息,提升奖励的丰富性和表达能力。同时,优化判别器训练策略,增强其鲁棒性和泛化能力,推动多维奖励在更复杂任务中的应用。还将研究更高效的归一化机制,以降低计算成本,拓展到更大规模模型和实际场景中。
AI 总览摘要
随着大规模语言模型在开放域任务中的广泛应用,如何有效引导模型遵循复杂、多维的指令成为研究热点。传统的奖励机制多依赖响应级的二元或聚合评分,存在奖励稀疏和模糊的问题,限制了模型的学习效率和行为细粒度控制。为此,本文提出了Rubrics to Tokens(RTT)框架,创新性地将结构化评价体系中的多维评分映射到Token层面,利用Token相关判别器实现细粒度奖励分配。
RTT的核心在于引入Token-Level Relevance Discriminator,用于预测每个Token是否满足特定约束,从而生成Token级奖励信号。结合改进的RTT-GRPO优化策略,模型在响应生成过程中同时考虑响应级和Token级优势,实现更精细的行为引导。面对多维奖励空间的归一化难题,提出Intra-sample Token Group Normalization,有效解决长度偏差和归一化边界定义问题。
大量实验验证了RTT在多个指令遵循基准上的优越性。结果显示,RTT-CSR和RTT-AON在指令级和规则级准确率上均优于传统RL方法,平均提升2.5%以上。特别是在复杂、多约束任务中,细粒度奖励显著提升模型的准确性和鲁棒性。同时,RTT在Out-of-Domain任务中表现稳定,验证了其良好的泛化能力。这一研究为大模型的结构化奖励设计提供了新思路,推动了RL在复杂任务中的应用前沿。未来,结合多模态信息和更高效的归一化机制,RTT有望在更大规模和更复杂场景中实现广泛应用。
深度分析
研究背景
近年来,随着大规模语言模型(如GPT、LLaMA等)在自然语言处理中的广泛应用,指令遵循能力成为衡量模型智能水平的重要指标。早期方法主要依赖监督微调(SFT),通过高质量标注数据引导模型学习行为。随后,RLHF(Reinforcement Learning from Human Feedback)逐渐成为主流,结合人类偏好优化模型表现。近年来,结构化评价体系(rubrics)被引入,用于多维度评价模型输出,提升模型的行为细粒度控制能力。代表性工作包括基于硬约束的二值奖励、聚合式奖励以及多任务、多场景的评价体系。这些方法在一定程度上解决了模型泛化和复杂任务适应的问题,但仍面临奖励稀疏、模糊和归一化难题,限制了其进一步提升。
核心问题
当前的Rubric-based RL方法多依赖响应级别的单一评分,导致奖励信号稀疏且模糊,难以提供细粒度的行为指导。尤其在多约束、多目标场景中,响应评分的模糊性使得模型难以明确哪些Token贡献了成功或失败,影响训练效率和效果。此外,奖励空间的多维结构未被充分利用,归一化策略难以适应不同维度的尺度差异,导致训练不稳定。这些问题限制了模型在复杂任务中的表现和泛化能力,亟需一种更细粒度、更结构化的奖励机制。
核心创新
本研究提出RTT框架,核心创新在于:
- �� 引入Token-Level Relevance Discriminator,将响应级评分映射到Token层面,实现细粒度奖励分配。
- �� 设计Intra-sample Token Group Normalization,有效解决多维奖励空间中的归一化边界定义和长度偏差问题。
- �� 将多维奖励空间与RTT-GRPO结合,优化模型行为,提升指令遵循和规则满足能力。
- �� 实现多模型、多任务验证,展示其在复杂指令场景中的优越性。这些创新突破了传统奖励稀疏、模糊的限制,为大模型RL训练提供了新工具。
方法详解
- �� 训练Token相关判别器:利用高质量数据集(如HiR-16K)和负样本策略(最小修改、约束遗漏)训练判别器,预测每个Token的约束相关性。
- �� 构建多维奖励空间:将响应评分映射到Token级别,结合判别器输出,生成Token奖励。
- �� 归一化策略设计:采用Intra-sample Token Group Normalization,按单个响应内的Token集合进行标准化,避免长度偏差。
- �� 优化策略:结合响应级和Token级优势,利用RTT-GRPO进行联合优化,调整模型参数。
- �� 训练流程:采样多响应组,计算奖励,归一化优势,更新模型,反复迭代,确保多维奖励的有效利用。
实验设计
采用HiR-16K等多源数据集进行训练,评估在多项指令遵循和Out-of-Domain任务上的表现。比较基线包括SFT、DPO、RL-AON和RL-CSR。指标涵盖指令级准确率、Rubric级别满足率。超参数设置包括α=1、β=0.5,模型包括Qwen和Llama系列。进行消融实验验证归一化策略效果,分析不同模型和任务的性能差异。实验结果显示,RTT在多个指标上均优于对比方法,验证其有效性和普适性。
结果分析
在指令遵循基准(如IFEval、IFBench)上,RTT-CSR和RTT-AON平均提升指令级准确率2.5%,Rubric级别提升1.6%。在复杂多约束任务中,模型表现显著改善,尤其在多任务、多场景环境中展现出优越的泛化能力。 Ablation研究表明,Intra-sample归一化策略比Inter-sample更稳定、更有效,提升约1.2%。此外,RTT在Out-of-Domain任务中表现稳定,验证其鲁棒性。整体来看,细粒度Token奖励显著缓解了奖励稀疏和模糊问题,提升了训练效率和模型性能。
应用场景
该方法适用于需要多维结构化评价的开放域任务,如智能问答、内容生成、自动摘要等。通过引入Token级奖励,模型能更准确理解和遵循复杂指令,提升用户体验。未来可结合多模态信息,扩展到视觉、语音等多模态场景,推动AI在多任务、多场景中的自主学习能力。
局限与展望
模型依赖高质量判别器训练,判别器性能不足会影响奖励质量。复杂任务中,结构化评分和Token判别难以准确反映行为,可能导致训练偏差。计算成本较高,限制大规模应用。未来需优化判别器泛化能力和归一化机制,降低成本,提升实用性。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,食谱上写着各种要求,比如“不要放太咸”、“用新鲜的蔬菜”。传统做法是只看最后的菜好不好,评分要么全对,要么全错,很难知道哪一步出了问题。现在,RTT就像在每个步骤都贴标签,告诉你哪些动作让菜变得更好,哪些需要改进。这样,你就可以逐步调整每个环节,而不是只靠最后的结果判断。它把复杂的菜谱拆成很多小部分,让厨师(模型)知道每个动作的好坏,做得更精细、更合理。这个方法让厨师学得更快,也做出更符合要求的菜肴。
简单解释 像给14岁少年讲一样
想象你在学校做科学实验,老师给你一个复杂的任务,比如“做一个环保的火箭”。以前,老师只会给你一个最终评分,要么你成功了,要么失败了。这样你不知道哪一步出了问题,也难以改进。现在,这个新方法就像老师在每个步骤都打分,告诉你哪些部分做得好,哪些需要改进。比如,火箭的设计、材料选择、点火方式,每个都被单独评价。这样,你可以针对每个部分改进,而不是只看最后的成败。它就像给你一份详细的反馈,让你变成更厉害的科学家。这个方法让学习变得更有方向,也能做出更环保、更安全的火箭!
原文摘要
Rubric-based Reinforcement Learning (RL) has emerged as a promising approach for aligning Large Language Models (LLMs) with complex, open-domain instruction following tasks. However, existing methods predominantly rely on response-level rewards, introducing severe reward sparsity and reward ambiguity problems. To address these issues, we propose Rubrics to Tokens (RTT), a novel rubric-based RL framework that bridges coarse response-level scores and fine-grained token-level credit assignment. RTT introduces a Token-Level Relevance Discriminator to predict which tokens in the response are responsible for a specific constraint, and optimizes the policy model via RTT-GRPO, which integrates response-level and token-level advantages within a unified framework. Furthermore, when transitioning from one-dimensional, outcome-level reward to three-dimensional reward space in the token-level rubric-based RL, we propose a novel group normalization method, called Intra-sample Token Group Normalization, to accommodate this shift. Extensive experiments and benchmarks demonstrate that RTT consistently outperforms other baselines in both instruction- and rubric-level accuracy across different models.