Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

TL;DR

通过数据配方和GRPO设置提升长上下文推理能力,平均提升7.2分。

cs.CL 🔴 高级 2026-06-17 4 次浏览
Xiaoyue Xu Sikui Zhang Xiaorong Wang Xu Han Chaojun Xiao
强化学习 长上下文推理 数据集 算法 实验结果

核心发现

方法论

本文提出了一种数据配方,结合最小化的结果导向GRPO设置,显著提升长上下文推理能力。该配方包括三类任务:检索、多证据合成和推理。我们构建了八个数据集,共计约14K个样本,并在三个模型上进行实验。

关键结果

  • 在Qwen3-4B/8B/30B-A3B模型上,平均提升分别为+7.2/+3.2/+6.4分,超越现有RL训练集。
  • 数据配方在agent任务上也表现出色,GAIA提升4.8分,BrowseComp提升7.0分。
  • 与DocQA-RL-1.6K和KeyChain-15K相比,我们的数据配方在所有基准测试中表现最佳。

研究意义

该研究通过数据驱动的方法显著提升了长上下文推理能力,挑战了传统的奖励工程方法。它为未来研究提供了新的方向,并可能影响自动化代理的开发。

技术贡献

技术贡献包括提出了一种无需特殊奖励工程的长上下文数据配方,展示了数据多样性在提升推理能力中的关键作用,并提供了新的实验数据集。

新颖性

这是首次通过数据配方而非奖励工程来提升长上下文推理能力,展示了数据多样性和任务分类在训练中的重要性。

局限性

  • 数据集规模和多样性仍有限,可能影响模型的泛化能力。
  • 未考虑不同模型架构对数据配方的适应性。

未来方向

未来工作可探索更多数据集的构建和不同模型架构的适应性,以及如何进一步提升长上下文推理能力。

AI 总览摘要

长上下文推理能力对于现代大语言模型至关重要,尤其是在自动化代理中。现有研究主要集中于奖励工程,但数据多样性仍然稀缺。本文通过数据配方和GRPO设置,显著提升了长上下文推理能力。我们构建了八个数据集,并在三个模型上进行了实验,结果显示平均提升7.2分。该方法不仅在长上下文基准测试中表现优异,还在agent任务中实现了显著提升。未来研究可继续探索数据驱动的方法,以进一步提升自动化代理的能力。

深度分析

研究背景

长上下文推理能力对于大语言模型在自动化代理中的应用至关重要。现有研究主要集中于奖励工程,但数据多样性仍然稀缺。本文通过数据驱动的方法,提出了一种新的数据配方,以提升长上下文推理能力。

核心问题

长上下文推理能力的提升一直是大语言模型面临的挑战。现有方法主要依赖于奖励工程,但数据多样性不足限制了模型的泛化能力。

核心创新

本文提出了一种数据配方,通过三类任务(检索、多证据合成和推理)来提升长上下文推理能力。与传统奖励工程相比,该方法更关注数据的多样性和任务分类。

方法详解

  • �� 构建八个数据集,总计约14K个样本
  • �� 使用GRPO设置进行训练
  • �� 在三个模型上进行实验,评估数据配方的有效性

实验设计

实验在Qwen3-4B/8B/30B-A3B模型上进行,使用七个长上下文基准测试来评估数据配方的有效性。实验结果显示,数据配方在所有基准测试中均表现优异。

结果分析

实验结果显示,数据配方在三个模型上平均提升分别为+7.2/+3.2/+6.4分,超越现有RL训练集。数据配方在agent任务上也表现出色,GAIA提升4.8分,BrowseComp提升7.0分。

应用场景

该数据配方可用于提升自动化代理的长上下文推理能力,尤其是在需要整合大量信息的复杂任务中。

局限与展望

数据集规模和多样性仍有限,可能影响模型的泛化能力。未来研究可探索更多数据集的构建和不同模型架构的适应性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你需要从不同的柜子里找到所有的食材,然后按照食谱一步步做菜。本文的方法就像是一个聪明的助手,它能帮你快速找到所有食材,并告诉你如何把它们组合在一起做出美味的菜肴。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个超级复杂的游戏,需要从不同的关卡中找到线索来解开谜题。本文的方法就像是一个超级助手,帮你快速找到所有线索,并告诉你如何把它们组合在一起,赢得游戏!是不是很酷?

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练模型进行决策。

用于提升长上下文推理能力。

数据配方 (Data Recipe)

一种通过数据多样性和任务分类来提升模型能力的方法。

用于构建长上下文推理数据集。

长上下文推理 (Long-Context Reasoning)

模型在处理长文本时进行推理的能力。

本文的核心研究对象。

GRPO设置 (Group Relative Policy Optimization)

一种优化策略,通过比较多个样本的优势来更新模型。

用于训练模型。

GAIA

一种评估自动化代理任务的基准测试。

用于评估数据配方的有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升数据集的多样性以增强模型的泛化能力。
  • 2 不同模型架构对数据配方的适应性研究。

应用场景

近期应用

自动化代理

提升自动化代理在复杂任务中的长上下文推理能力。

远期愿景

智能助手

开发更智能的助手,能够在各种复杂场景中进行推理和决策。

原文摘要

Long-context reasoning is an essential capability for large language models, particularly when they are deployed as autonomous agents that must reason over lengthy trajectories. Reinforcement learning (RL) has recently emerged as a dominant paradigm for improving this ability, yet existing work largely focuses on reward engineering while diverse training data remains scarce. We revisit this problem from a data-centric perspective and show that a simple yet effective data recipe alone, paired with a minimal outcome-based GRPO setup, suffices to substantially improve long-context reasoning. Our recipe targets three complementary task families -- retrieval, multi-evidence synthesis, and reasoning -- for which we construct and curate eight datasets totaling ~14K examples. Experiments on three models (Qwen3-4B/8B/30B-A3B) yield average gains of +7.2/+3.2/+6.4 points across seven long-context benchmarks, surpassing prior RL training sets. We further demonstrate that these gains transfer to agentic tasks, where continuing RL training on an agent-tuned model with our data recipe improves GAIA by +4.8 and BrowseComp by +7.0 points. We will release our datasets to facilitate future research.

cs.CL cs.AI