Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks

TL;DR

提出RTT框架,将响应级评分与Token级奖励结合,利用Token相关判别器实现细粒度奖励,显著提升指令跟随性能。

cs.CL 🔴 高级 2026-04-03 45 次浏览
Tianze Xu Yanzhao Zheng Pengrui Lu Lyumanshan Ye Yong Wu Zhentao Zhang Yuanqiang Yu Chao Ma Jihuai Zhu Pengfei Liu Baohua Dong Hangcheng Zhu Ruohui Huang Gang Yu
强化学习 大模型 Token奖励 结构化评价 指令遵循

核心发现

方法论

RTT框架通过引入Token相关判别器,将响应级别的结构化评分映射到Token级奖励,结合RTT-GRPO优化策略,解决奖励稀疏和模糊问题。核心包括:训练Token相关判别器、设计Intra-sample Token Group Normalization,以及多维奖励空间的相对优势归一化。实验中采用多模型、多任务数据集验证效果,显示其在指令级和规则级准确率上优于基线方法。

关键结果

  • 在多项指令遵循基准上,RTT-CSR和RTT-AON平均提升指令准确率2.5%以上,Rubric级别提升1.6%以上,显著优于RL-AON和RL-CSR。在Out-of-Domain任务中,RTT保持或略优于未调优模型,验证其泛化能力。 Ablation研究表明,Intra-sample归一化策略优于Inter-sample,提升性能约1.2%。
  • 在不同模型(Qwen3-4B、Llama3.2-3B)上均取得优异表现,验证方法的普适性。
  • 引入Token相关判别器和多维归一化机制,有效缓解奖励稀疏和模糊问题,提升细粒度奖励的准确性和训练效率。

研究意义

该研究突破了传统响应级奖励的局限,通过Token级奖励实现更细粒度的行为指导,为大模型复杂指令遵循提供了新思路。其方法不仅提升了模型的准确性和鲁棒性,也为结构化奖励设计和多维奖励空间的归一化提供了理论基础,有望推动AI在开放域、多任务环境中的应用落地。未来,结合更复杂的结构化评价体系,有望实现更高水平的自主学习和任务适应能力。

技术贡献

提出RTT框架,创新性引入Token相关判别器,将响应级评分映射到Token层面,结合RTT-GRPO优化策略,解决奖励稀疏和模糊问题。设计Intra-sample Token Group Normalization,有效应对多维奖励空间的归一化难题。该方法在多个基准测试中均表现优异,验证了其在指令遵循和规则满足方面的优越性。技术上实现了多维奖励的高效归一化和细粒度奖励分配,为大模型RL训练提供了新工具。

新颖性

首次将结构化评价体系中的多维奖励空间引入RL训练,通过Token相关判别器实现细粒度奖励映射,并提出Intra-sample归一化策略,有效解决奖励稀疏和模糊问题。这在现有基于响应级奖励的RL方法中尚属首创,极大丰富了奖励设计的理论体系和实践手段。

局限性

  • 当前方法依赖于高质量的Token相关判别器训练,判别器性能直接影响奖励质量,存在泛化和鲁棒性不足的问题。
  • 在极端复杂或模糊的任务中,结构化评分和Token判别可能难以准确反映实际行为,影响训练效果。
  • 模型训练和推理过程中的计算成本较高,限制了大规模应用的可行性。

未来方向

未来将探索多模态奖励体系,结合视觉、语音等多模态信息,提升奖励的丰富性和表达能力。同时,优化判别器训练策略,增强其鲁棒性和泛化能力,推动多维奖励在更复杂任务中的应用。还将研究更高效的归一化机制,以降低计算成本,拓展到更大规模模型和实际场景中。

AI 总览摘要

随着大规模语言模型在开放域任务中的广泛应用,如何有效引导模型遵循复杂、多维的指令成为研究热点。传统的奖励机制多依赖响应级的二元或聚合评分,存在奖励稀疏和模糊的问题,限制了模型的学习效率和行为细粒度控制。为此,本文提出了Rubrics to Tokens(RTT)框架,创新性地将结构化评价体系中的多维评分映射到Token层面,利用Token相关判别器实现细粒度奖励分配。

RTT的核心在于引入Token-Level Relevance Discriminator,用于预测每个Token是否满足特定约束,从而生成Token级奖励信号。结合改进的RTT-GRPO优化策略,模型在响应生成过程中同时考虑响应级和Token级优势,实现更精细的行为引导。面对多维奖励空间的归一化难题,提出Intra-sample Token Group Normalization,有效解决长度偏差和归一化边界定义问题。

大量实验验证了RTT在多个指令遵循基准上的优越性。结果显示,RTT-CSR和RTT-AON在指令级和规则级准确率上均优于传统RL方法,平均提升2.5%以上。特别是在复杂、多约束任务中,细粒度奖励显著提升模型的准确性和鲁棒性。同时,RTT在Out-of-Domain任务中表现稳定,验证了其良好的泛化能力。这一研究为大模型的结构化奖励设计提供了新思路,推动了RL在复杂任务中的应用前沿。未来,结合多模态信息和更高效的归一化机制,RTT有望在更大规模和更复杂场景中实现广泛应用。

深度分析

研究背景

近年来,随着大规模语言模型(如GPT、LLaMA等)在自然语言处理中的广泛应用,指令遵循能力成为衡量模型智能水平的重要指标。早期方法主要依赖监督微调(SFT),通过高质量标注数据引导模型学习行为。随后,RLHF(Reinforcement Learning from Human Feedback)逐渐成为主流,结合人类偏好优化模型表现。近年来,结构化评价体系(rubrics)被引入,用于多维度评价模型输出,提升模型的行为细粒度控制能力。代表性工作包括基于硬约束的二值奖励、聚合式奖励以及多任务、多场景的评价体系。这些方法在一定程度上解决了模型泛化和复杂任务适应的问题,但仍面临奖励稀疏、模糊和归一化难题,限制了其进一步提升。

核心问题

当前的Rubric-based RL方法多依赖响应级别的单一评分,导致奖励信号稀疏且模糊,难以提供细粒度的行为指导。尤其在多约束、多目标场景中,响应评分的模糊性使得模型难以明确哪些Token贡献了成功或失败,影响训练效率和效果。此外,奖励空间的多维结构未被充分利用,归一化策略难以适应不同维度的尺度差异,导致训练不稳定。这些问题限制了模型在复杂任务中的表现和泛化能力,亟需一种更细粒度、更结构化的奖励机制。

核心创新

本研究提出RTT框架,核心创新在于:

  • �� 引入Token-Level Relevance Discriminator,将响应级评分映射到Token层面,实现细粒度奖励分配。
  • �� 设计Intra-sample Token Group Normalization,有效解决多维奖励空间中的归一化边界定义和长度偏差问题。
  • �� 将多维奖励空间与RTT-GRPO结合,优化模型行为,提升指令遵循和规则满足能力。
  • �� 实现多模型、多任务验证,展示其在复杂指令场景中的优越性。这些创新突破了传统奖励稀疏、模糊的限制,为大模型RL训练提供了新工具。

方法详解

  • �� 训练Token相关判别器:利用高质量数据集(如HiR-16K)和负样本策略(最小修改、约束遗漏)训练判别器,预测每个Token的约束相关性。
  • �� 构建多维奖励空间:将响应评分映射到Token级别,结合判别器输出,生成Token奖励。
  • �� 归一化策略设计:采用Intra-sample Token Group Normalization,按单个响应内的Token集合进行标准化,避免长度偏差。
  • �� 优化策略:结合响应级和Token级优势,利用RTT-GRPO进行联合优化,调整模型参数。
  • �� 训练流程:采样多响应组,计算奖励,归一化优势,更新模型,反复迭代,确保多维奖励的有效利用。

实验设计

采用HiR-16K等多源数据集进行训练,评估在多项指令遵循和Out-of-Domain任务上的表现。比较基线包括SFT、DPO、RL-AON和RL-CSR。指标涵盖指令级准确率、Rubric级别满足率。超参数设置包括α=1、β=0.5,模型包括Qwen和Llama系列。进行消融实验验证归一化策略效果,分析不同模型和任务的性能差异。实验结果显示,RTT在多个指标上均优于对比方法,验证其有效性和普适性。

结果分析

在指令遵循基准(如IFEval、IFBench)上,RTT-CSR和RTT-AON平均提升指令级准确率2.5%,Rubric级别提升1.6%。在复杂多约束任务中,模型表现显著改善,尤其在多任务、多场景环境中展现出优越的泛化能力。 Ablation研究表明,Intra-sample归一化策略比Inter-sample更稳定、更有效,提升约1.2%。此外,RTT在Out-of-Domain任务中表现稳定,验证其鲁棒性。整体来看,细粒度Token奖励显著缓解了奖励稀疏和模糊问题,提升了训练效率和模型性能。

应用场景

该方法适用于需要多维结构化评价的开放域任务,如智能问答、内容生成、自动摘要等。通过引入Token级奖励,模型能更准确理解和遵循复杂指令,提升用户体验。未来可结合多模态信息,扩展到视觉、语音等多模态场景,推动AI在多任务、多场景中的自主学习能力。

局限与展望

模型依赖高质量判别器训练,判别器性能不足会影响奖励质量。复杂任务中,结构化评分和Token判别难以准确反映行为,可能导致训练偏差。计算成本较高,限制大规模应用。未来需优化判别器泛化能力和归一化机制,降低成本,提升实用性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,食谱上写着各种要求,比如“不要放太咸”、“用新鲜的蔬菜”。传统做法是只看最后的菜好不好,评分要么全对,要么全错,很难知道哪一步出了问题。现在,RTT就像在每个步骤都贴标签,告诉你哪些动作让菜变得更好,哪些需要改进。这样,你就可以逐步调整每个环节,而不是只靠最后的结果判断。它把复杂的菜谱拆成很多小部分,让厨师(模型)知道每个动作的好坏,做得更精细、更合理。这个方法让厨师学得更快,也做出更符合要求的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校做科学实验,老师给你一个复杂的任务,比如“做一个环保的火箭”。以前,老师只会给你一个最终评分,要么你成功了,要么失败了。这样你不知道哪一步出了问题,也难以改进。现在,这个新方法就像老师在每个步骤都打分,告诉你哪些部分做得好,哪些需要改进。比如,火箭的设计、材料选择、点火方式,每个都被单独评价。这样,你可以针对每个部分改进,而不是只看最后的成败。它就像给你一份详细的反馈,让你变成更厉害的科学家。这个方法让学习变得更有方向,也能做出更环保、更安全的火箭!

原文摘要

Rubric-based Reinforcement Learning (RL) has emerged as a promising approach for aligning Large Language Models (LLMs) with complex, open-domain instruction following tasks. However, existing methods predominantly rely on response-level rewards, introducing severe reward sparsity and reward ambiguity problems. To address these issues, we propose Rubrics to Tokens (RTT), a novel rubric-based RL framework that bridges coarse response-level scores and fine-grained token-level credit assignment. RTT introduces a Token-Level Relevance Discriminator to predict which tokens in the response are responsible for a specific constraint, and optimizes the policy model via RTT-GRPO, which integrates response-level and token-level advantages within a unified framework. Furthermore, when transitioning from one-dimensional, outcome-level reward to three-dimensional reward space in the token-level rubric-based RL, we propose a novel group normalization method, called Intra-sample Token Group Normalization, to accommodate this shift. Extensive experiments and benchmarks demonstrate that RTT consistently outperforms other baselines in both instruction- and rubric-level accuracy across different models.

cs.CL cs.AI