Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

TL;DR

SHIFT方法通过推理时隐藏状态动态选择数据,提升RLVR性能。

cs.LG 🔴 高级 2026-05-27 5 次浏览
Jianghao Wu Jianfei Cai Weiqiang Wang Jin Ye Daniel F. Schmidt Yasmeen George
强化学习 数据选择 推理动态 无训练 医学问答

核心发现

方法论

SHIFT通过推理时的隐藏状态动态进行数据选择,无需训练或标签。该方法计算推理引发的表示变化(RIRS)作为实例效用的代理,并通过质量加权的最远优先CoreSet策略确保覆盖。

关键结果

  • 在数学推理和医学问答基准测试中,SHIFT在极低预算下表现优异,提升域内准确率和转移到更难评估设置的能力。例如,在MATH-500上,SHIFT以2%的数据选择达到了62.67的准确率。
  • SHIFT在AMC上的表现超过了全数据RLVR参考,显示出高影响实例选择能提升OOD泛化能力。
  • 消融实验显示,基于RIRS的覆盖和质量加权提供了互补增益,分析表明RIRS不是简单的输入/输出长度统计所能解释的。

研究意义

SHIFT在无标签和无训练信号的情况下进行数据选择,解决了RLVR中数据选择的瓶颈问题。该方法显著减少了监督稀缺情况下的奖励/注释和训练开销,提升了领域内和跨领域的性能。

技术贡献

SHIFT通过推理时隐藏状态动态进行数据选择,与现有方法相比,提供了新的理论保证和工程可能性。它不依赖于训练时间信号或标签,显著降低了计算成本。

新颖性

SHIFT首次提出利用推理时隐藏状态动态进行数据选择,与现有依赖训练信号的方法相比,提供了新的视角和解决方案。

局限性

  • SHIFT在某些复杂领域可能无法捕捉所有影响因素,尤其是需要更复杂的推理动态。
  • 该方法在极低预算下的表现仍需更多实验证实,尤其是在不同领域的数据集上。

未来方向

未来工作可探索SHIFT在更多领域的应用,并研究如何结合其他无监督信号以进一步提升选择效果。

AI 总览摘要

强化学习与可验证奖励(RLVR)是一种增强大语言模型推理能力的强大范式,但其对数据选择的敏感性使得选择成为瓶颈。SHIFT通过推理时隐藏状态动态进行数据选择,无需训练或标签。该方法计算推理引发的表示变化(RIRS)作为实例效用的代理,并通过质量加权的最远优先CoreSet策略确保覆盖。实验表明,SHIFT在数学推理和医学问答基准测试中表现优异,尤其是在极低预算下。SHIFT不仅提升了域内准确率,还改善了跨领域的泛化能力。尽管如此,该方法在某些复杂领域可能无法捕捉所有影响因素,未来工作可探索更多领域的应用。SHIFT为数据选择提供了新的视角,显著减少了监督稀缺情况下的奖励/注释和训练开销。

深度分析

研究背景

强化学习与可验证奖励(RLVR)近年来成为增强大语言模型推理能力的强大范式。现有研究表明,RLVR在某些设置下极为数据高效,但其对选择实例的敏感性使得数据选择成为关键瓶颈。大多数现有选择管道依赖于训练时间优化信号,或需要访问可验证奖励或大规模候选池的真实答案,这在专业领域中通常成本高昂且不可行。

核心问题

如何在无标签或奖励评估的情况下进行有效的数据选择是RLVR面临的核心问题。现有方法通常依赖训练时间信号或标签,限制了其在低资源环境中的应用。

核心创新

SHIFT通过推理时隐藏状态动态进行数据选择,无需训练或标签。该方法计算推理引发的表示变化(RIRS)作为实例效用的代理,并通过质量加权的最远优先CoreSet策略确保覆盖。

方法详解

  • �� SHIFT通过推理时的隐藏状态动态进行数据选择,无需训练或标签。
  • �� 计算推理引发的表示变化(RIRS)作为实例效用的代理。
  • �� 使用质量加权的最远优先CoreSet策略确保覆盖。
  • �� 生成紧凑子集以适应大规模未标记池。

实验设计

在数学推理和医学问答基准测试中进行实验,使用极低预算选择数据。评估SHIFT在域内准确率和跨领域泛化能力上的表现。比较基线包括随机选择、多样性和难度/不确定性启发式。

结果分析

SHIFT在数学推理和医学问答基准测试中表现优异,尤其是在极低预算下。SHIFT不仅提升了域内准确率,还改善了跨领域的泛化能力。消融实验显示,基于RIRS的覆盖和质量加权提供了互补增益。

应用场景

SHIFT可用于需要高效数据选择的领域,如医学问答和数学推理。其无标签和无训练信号的特性使其在低资源环境中具有优势。

局限与展望

SHIFT在某些复杂领域可能无法捕捉所有影响因素,尤其是需要更复杂的推理动态。该方法在极低预算下的表现仍需更多实验证实,尤其是在不同领域的数据集上。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有很多食材,但不知道哪些最能做出美味的菜肴。SHIFT就像一个聪明的厨师,它能在不尝试每种食材的情况下,凭借对食材的了解,选出最有潜力的食材。它通过观察食材的变化来判断哪些食材能做出最好的菜。这种方法不仅节省时间,还能保证做出美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要选择一些角色来组成一个团队。SHIFT就像一个超级助手,它能在不玩每个角色的情况下,告诉你哪些角色最有潜力。它通过观察角色的表现来判断哪些角色能帮助你赢得比赛。这种方法不仅节省时间,还能提高你的胜率!是不是很酷?

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练模型的行为。

在本文中用于提升语言模型的推理能力。

表示变化 (Representation Shift)

推理过程中隐藏状态的变化,用于评估实例效用。

SHIFT方法中用于选择数据的关键指标。

CoreSet

一种选择算法,确保选出的子集具有良好的覆盖性。

用于SHIFT方法中确保数据选择的多样性。

推理动态 (Inference Dynamics)

模型在推理过程中隐藏状态的变化。

SHIFT方法中用于评估数据选择效用。

医学问答 (Medical QA)

一种问答任务,涉及医学领域的问题。

本文中用于评估SHIFT方法的基准测试之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的推理动态中应用SHIFT仍需探索。
  • 2 SHIFT在不同领域的数据集上的表现需要更多验证。

应用场景

近期应用

医学问答

SHIFT可用于医学问答任务,通过高效数据选择提升模型性能。

远期愿景

跨领域数据选择

SHIFT可用于更多领域的数据选择,提升模型的泛化能力。

原文摘要

Reinforcement learning with verifiable rewards (RLVR) can yield large reasoning gains from very few training instances, yet its strong sensitivity to which instances are used makes data selection a central bottleneck. Most existing selection pipelines rely on training-time optimization signals and/or require access to verifiable rewards or ground-truth answers over large candidate pools, which is costly and often infeasible in specialized domains. We study RLVR data selection in a setting where selection must be performed before any RL training and without labels or reward evaluation on the full pool. We propose SHIFT, a one-shot, training-free selector based solely on inference-time hidden-state dynamics. For each candidate instance, SHIFT runs a single deterministic reasoning rollout and computes a reasoning-induced representation shift (RIRS) as the start-to-end hidden-state delta. SHIFT uses the RIRS magnitude as a lightweight proxy for instance utility and enforces coverage via a quality-weighted farthest-first CoreSet procedure in an RIRS-augmented feature space, producing compact subsets that scale to large unlabeled pools. Across mathematical reasoning and medical QA benchmarks under ultra-low budgets, SHIFT consistently outperforms training-free diversity and difficulty/uncertainty baselines, improving both in-domain accuracy and transfer to harder evaluation settings. Ablations show that RIRS-based coverage and quality-weighting contribute complementary gains, and analyses indicate that RIRS is not explained by simple input/output length statistics. Code is available at github.com/JianghaoWu/SHIFT.

cs.LG