QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning

TL;DR

提出QwenLong-L1,通过渐进式上下文扩展和强化学习实现长文本推理,超越现有模型。

cs.CL 🔴 高级 2025-05-23 46 引用 58 次浏览
Fanqi Wan Weizhou Shen Shengyi Liao Yingcheng Shi Chenliang Li Ziyi Yang Ji Zhang Fei Huang Jingren Zhou Ming Yan
长文本推理 强化学习 模型扩展 渐进式训练 大规模问答

核心发现

方法论

本文提出QwenLong-L1框架,结合短文本预训练、渐进式上下文扩展、基于群相对优势的强化学习算法(GRPO、DAPO),以及难度感知的回溯采样策略。首先通过监督微调(SFT)建立稳健的初始策略,然后采用逐步增加输入长度的课程式RL,确保模型在长文本环境中的稳定性。混合奖励机制结合规则验证和LLM评判,平衡精确性与召回率。实验在七个长文本问答基准上,QwenLong-L1-32B超越OpenAI-o3-mini和Qwen3-235B-A22B,达到与Claude-3.7-Sonnet-Thinking相当的性能。

关键结果

  • QwenLong-L1-32B在长文本问答任务中平均提升5.1分(满分100),显著优于主流模型,表现出优异的长文本推理能力。
  • 渐进式上下文扩展策略提高训练稳定性,KL散度波动减小,训练效率提升20%以上。
  • 结合混合奖励机制,有效平衡答案的准确性和多样性,提升模型在复杂推理场景中的表现。

研究意义

该研究突破了长文本推理模型的训练瓶颈,推动LRMs在信息密集型环境中的应用。通过渐进式训练策略,模型能更好地理解和整合长篇信息,解决传统模型在长文本推理中的不稳定和效率低下问题,为深度研究、知识管理等场景提供技术支撑。

技术贡献

创新点在于提出渐进式上下文扩展的RL训练框架,结合群相对优势算法和混合奖励机制,显著提升长文本推理的训练稳定性和性能。首次系统性地解决长文本环境下的训练不稳定问题,提供了可推广的训练策略和算法设计,为未来大规模长文本模型的开发奠定基础。

新颖性

本研究首次提出针对长文本推理的渐进式RL训练框架,结合群相对优势算法和难度感知采样,突破了现有模型在长文本环境中的性能瓶颈。相较于传统短文本优化方法,显著改善了模型的长文本理解和推理能力,具有开创性。

局限性

  • 模型训练依赖大量计算资源,尤其在长文本输入下,训练成本高昂,限制了大规模应用推广。
  • 在极端长文本(如超出120K字符)场景中仍存在性能下降的问题,需进一步优化模型架构。
  • 奖励机制虽有效,但在某些复杂推理任务中仍可能出现偏差,需结合人类评估进行微调。

未来方向

未来将探索更高效的训练算法,降低长文本训练成本;同时研究多模态长文本推理,结合视觉、声音等信息,增强模型的多维理解能力。此外,优化奖励机制,结合人类反馈,提升模型的推理准确性和解释能力。

AI 总览摘要

长文本推理一直是大规模语言模型(LRMs)面临的核心挑战。传统模型在短文本任务中表现优异,但在处理超长信息时,训练不稳定、效率低下成为瓶颈。本文提出QwenLong-L1框架,结合渐进式上下文扩展、群相对优势算法(GRPO、DAPO)和难度感知采样,有效缓解了长文本训练中的不稳定性问题。通过在七个长文本问答基准上的实验,QwenLong-L1-32B模型超越了多款主流模型,表现出强大的长文本推理能力。该方法不仅提升了训练稳定性,还显著改善了模型的推理性能,为未来长文本智能系统的发展提供了新思路。该研究的突破在于系统性解决了长文本推理中的训练难题,推动了LRMs在知识密集型环境中的应用落地。未来,模型的训练成本和多模态融合将成为研究重点,期待其在深度研究、知识管理等领域发挥更大作用。

深度分析

研究背景

近年来,大规模语言模型(如GPT-3、Claude等)在短文本推理中取得突破,但在长文本环境中的性能仍受限制。传统训练方法难以应对超长输入带来的计算瓶颈和优化不稳定问题。已有研究如Chain-of-Thought、Retrieval-Augmented Generation等尝试增强模型推理能力,但缺乏系统性的长文本训练策略。随着信息密集型应用的兴起,长文本推理的需求日益增长,推动模型在多步推理、信息整合方面的研究成为热点。

核心问题

长文本推理面临两个主要难题:一是训练效率低,模型在长文本中表现出收敛缓慢,奖励提升有限;二是优化不稳定,长输出带来的方差增大导致训练过程震荡。传统RL算法在长文本场景中难以稳定收敛,限制了模型的实际应用。解决这一瓶颈,成为推动长文本智能系统的关键。

核心创新

提出渐进式上下文扩展策略,逐步增加输入长度,确保模型在不同阶段都能稳定学习。引入群相对优势算法(GRPO、DAPO),降低长文本训练中的方差,提高优化稳定性。结合难度感知的回溯采样,优先训练难度较高的样本,增强模型的泛化能力。最后,融合规则验证与LLM评判的混合奖励机制,平衡推理的准确性与多样性。这些创新共同解决了长文本训练中的不稳定和效率问题,推动模型在复杂推理任务中的表现。

方法详解

  • �� 预训练模型通过监督微调(SFT)建立基础能力。
  • �� 采用渐进式课程策略,逐步将输入长度从短到长(如20K到120K字符)扩展。
  • �� 在每个阶段,模型仅训练对应长度范围内的数据,确保训练稳定。
  • �� 引入难度感知的回溯采样,优先选择低奖励(难度高)样本进行训练。
  • �� 利用群相对优势算法(GRPO、DAPO),通过分组归一化奖励估算优势,减少方差。
  • �� 结合规则验证(答案匹配)和LLM判别(语义相似)形成混合奖励,提升推理质量。
  • �� 在多轮训练中不断调整采样策略和奖励参数,优化模型性能。

实验设计

在七个长文本问答基准(如WikiMultihopQA、HotpotQA等)上,采用120K最大输入长度,训练数据包括数学、逻辑、多跳推理任务。对比模型包括OpenAI-o3-mini、Qwen3-235B等,评估指标为准确率(Exact Match)和LLM判定准确率。训练采用A100-80G GPU,批次大小128,学习率2e-6。通过消融实验验证渐进式策略、采样机制和奖励设计的效果。模型在多个场景中表现优异,优于对比模型,验证了方法的有效性。

结果分析

QwenLong-L1-32B在七个基准中平均提升5.1分,最高达9分(HotpotQA)。渐进式训练显著稳定了KL散度波动,训练效率提升20%以上。结合混合奖励机制,模型在复杂推理任务中的表现优于传统RL方法,尤其在多跳和逻辑推理中表现出色。 Ablation研究显示,渐进式策略和难度采样是性能提升的关键因素。

应用场景

该模型适用于深度研究、知识库问答、法律、金融等信息密集场景。通过长文本理解与推理能力,支持多轮对话、文档分析等应用。未来结合多模态信息,将推动智能助理、自动摘要等行业变革。

局限与展望

训练成本高昂,依赖大量GPU资源,限制普及。在极端超长文本(超出120K字符)场景中表现仍有限。奖励机制在某些复杂任务中可能偏离人类判断,需结合人工微调。未来需优化模型架构和训练策略,以降低成本并提升泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里查找信息。普通的模型就像只记住了几本书的内容,能回答一些常见问题,但遇到特别长的书或复杂的问题时就会迷失。这个新方法就像给你准备了一个智能助手,它会先学会基础的查找和理解技巧,然后逐步学习如何处理更长、更复杂的书籍。每次它都只学习一点点,逐步增加难度,直到它能理解整本长书。这样,它就能在面对长篇信息时,像人一样逐步推理、找到答案。通过不断练习和调整,它变得越来越聪明,能应对各种复杂的问题,就像一个经验丰富的研究员一样。

简单解释 像给14岁少年讲一样

想象你在学校图书馆找资料。普通的机器人就像只会记几本书,回答问题还挺快,但如果书太长或者问题很复杂,它就会迷路。现在,这个新方法就像教那个机器人怎么慢慢变得更聪明。它先学会基础的查找和理解,然后逐步学会处理更长的书。每次它都只学一点点,慢慢变得更厉害。就像你逐步学习难题一样,最后它可以看完长长的书,理解里面的内容,帮你找到答案。这种慢慢学习、逐步变强的方法,让机器人变得像个真正的专家一样聪明,能解决更难的问题。

术语表

渐进式上下文扩展 (Progressive Context Scaling)

逐步增加模型输入的文本长度,从短到长,确保训练过程稳定。In this paper, it refers to gradually enlarging the context size during RL training to improve long-text reasoning.

用于模型训练中的上下文扩展策略。

群相对优势算法 (Group-Relative Policy Optimization)

一种基于分组奖励归一化的强化学习算法,降低长文本训练中的方差。It estimates advantage functions通过分组奖励,提升训练稳定性。

用于优化长文本推理模型的策略。

混合奖励机制 (Hybrid Reward Mechanism)

结合规则验证和LLM判别的奖励方式,平衡推理的精确性与多样性。It同时利用规则匹配和语义判别提升奖励的全面性。

用于强化学习中的奖励设计。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低长文本训练的计算成本,尤其是在超长输入(如超出120K字符)场景中,仍是未解难题。当前模型在极端长文本中表现有限,需创新架构或算法突破。
  • 2 模型在多模态信息融合方面仍缺乏系统性研究,未来结合视觉、声音等多模态信息,将极大提升理解能力。

原文摘要

Recent large reasoning models (LRMs) have demonstrated strong reasoning capabilities through reinforcement learning (RL). These improvements have primarily been observed within the short-context reasoning tasks. In contrast, extending LRMs to effectively process and reason on long-context inputs via RL remains a critical unsolved challenge. To bridge this gap, we first formalize the paradigm of long-context reasoning RL, and identify key challenges in suboptimal training efficiency and unstable optimization process. To address these issues, we propose QwenLong-L1, a framework that adapts short-context LRMs to long-context scenarios via progressive context scaling. Specifically, we utilize a warm-up supervised fine-tuning (SFT) stage to establish a robust initial policy, followed by a curriculum-guided phased RL technique to stabilize the policy evolution, and enhanced with a difficulty-aware retrospective sampling strategy to incentivize the policy exploration. Experiments on seven long-context document question-answering benchmarks demonstrate that QwenLong-L1-32B outperforms flagship LRMs like OpenAI-o3-mini and Qwen3-235B-A22B, achieving performance on par with Claude-3.7-Sonnet-Thinking, demonstrating leading performance among state-of-the-art LRMs. This work advances the development of practical long-context LRMs capable of robust reasoning across information-intensive environments.

cs.CL

参考文献 (20)

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Qiying Yu, Zheng Zhang, Ruofei Zhu 等

2025 2546 引用 ⭐ 高影响力 查看解读 →

DeepSeek-V3 Technical Report

DeepSeek-AI, A. Liu, B. Feng 等

2024 4035 引用 ⭐ 高影响力

A Comparative Study on Reasoning Patterns of OpenAI's o1 Model

Siwei Wu, Z. Peng, Xinrun Du 等

2024 87 引用 ⭐ 高影响力 查看解读 →

Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps

Xanh Ho, A. Nguyen, Saku Sugawara 等

2020 1628 引用 查看解读 →

Equivalence Between Policy Gradients and Soft Q-Learning

John Schulman, P. Abbeel, Xi Chen

2017 415 引用 查看解读 →

Verification

Felix Dillenberger

1997 344 引用

OpenAI o1 System Card

Ahmed El-Kishky

2024 2034 引用

Defining and Characterizing Reward Gaming

J. Skalse, Nikolaus H. R. Howe, D. Krasheninnikov 等

2022 428 引用

Claude 3.7 Sonnet System Card

173 引用

OpenAI o3-mini System Card

B. Zhang, Eric Mitchell, Hongyu Ren 等

30 引用

Thinking fast and slow.

N. McGlynn

2014 11834 引用

REALM: Retrieval-Augmented Language Model Pre-Training

Kelvin Guu, Kenton Lee, Zora Tung 等

2020 3402 引用 查看解读 →

The NarrativeQA Reading Comprehension Challenge

Tomás Kociský, Jonathan Schwarz, P. Blunsom 等

2017 1095 引用 查看解读 →

A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers

Pradeep Dasigi, Kyle Lo, Iz Beltagy 等

2021 598 引用 查看解读 →

♫ MuSiQue: Multihop Questions via Single-hop Question Composition

H. Trivedi, Niranjan Balasubramanian, Tushar Khot 等

2021 1117 引用 查看解读 →

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu 等

2022 11196 引用 查看解读 →

In-Context Retrieval-Augmented Language Models

Ori Ram, Yoav Levine, Itay Dalmedigos 等

2023 1133 引用 查看解读 →

Judging LLM-as-a-judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang, Ying Sheng 等

2023 11166 引用 查看解读 →

From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning

Ming Li, Yong Zhang, Zhitao Li 等

2023 397 引用 查看解读 →

LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding

Yushi Bai, Xin Lv, Jiajie Zhang 等

2023 1637 引用 查看解读 →

被引用 (20)

Probing How Scalable Table Data Enhances General Long-Context Reasoning

2026 1 引用 ⭐ 高影响力 查看解读 →

A Decomposition Perspective to Long-context Reasoning for LLMs

2026 1 引用 ⭐ 高影响力 查看解读 →

Evidence-State Rewards for Long-Context Reasoning

2026 ⭐ 高影响力 查看解读 →

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

2026 ⭐ 高影响力 查看解读 →

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

2025 1 引用 ⭐ 高影响力 查看解读 →

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

2026 1 引用 ⭐ 高影响力 查看解读 →

StoryAlign: Evaluating and Training Reward Models for Story Generation

2026 2 引用 ⭐ 高影响力 查看解读 →

MetroRLHF: Enabling Memory-Effective Training for On-Policy RLHF via Adaptive Sequence Streaming

RePainter: Empowering E-commerce Object Removal via Spatial-matting Reinforcement Learning

2025 4 引用 查看解读 →

ControlMed: Adding Reasoning Control to Medical Language Model

An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning

2025 18 引用 查看解读 →

MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent

2025 210 引用 查看解读 →

Combining On-Policy Optimization and Distillation for Long-Context Reasoning in Large Language Models

2026 1 引用

An Effective Multimodal Personality Detection Framework on Social Media

2025

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning

2026 7 引用 查看解读 →

Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping

2026 3 引用 查看解读 →

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

2026 4 引用 查看解读 →

InfMem: Learning System-2 Memory Control for Long-Context Agent

2026 7 引用 查看解读 →

Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning

2026 5 引用 查看解读 →

Document Reconstruction Unlocks Scalable Long-Context RLVR

2026 1 引用 查看解读 →