核心发现
方法论
本文提出CORE-RAG框架,结合知识蒸馏初始化压缩器,并采用基于组相对策略优化(GRPO)的强化学习,直接以任务性能作为反馈信号,优化压缩策略。压缩器设计为比下游大模型小得多的轻量级模型,显著降低计算成本。实验中,压缩比例仅为3%,即仅用原文的3%信息,仍实现EM提升3.3点,优于全文基线。该方法在多数据集上验证了其优越性,兼具高效性与准确性。
关键结果
- 在自然问答(NQ)和TriviaQA数据集上,CORE-RAG在压缩比例为3%的情况下,EM得分分别提升了1.5至6.9点,超越全文基线。相较于传统压缩方法,性能提升显著,且压缩比低至3%,极大降低了计算负担。
- 在多轮问答(HotpotQA和2WikiMultihopQA)中,CORE表现出良好的泛化能力,未经过额外训练即可在更长文档(10篇)场景中保持优异性能,验证了模型的长度扩展能力。
- 通过知识蒸馏初始化,压缩器在训练初期即具备较强的任务相关性,结合性能驱动优化,有效避免了依赖启发式策略带来的性能折中问题。
研究意义
该研究突破了上下文压缩的性能瓶颈,提出以任务性能为导向的优化策略,解决了现有方法中压缩效果与任务性能难以兼得的问题。其创新点在于将强化学习引入上下文压缩,直接以任务指标作为奖励,实现无损或性能提升的高效压缩,为大规模知识问答和信息检索系统提供了新的技术路径。这不仅提升了模型的实用性,也为未来多模态、多任务场景下的上下文管理提供了理论基础和实践方案,有望推动智能系统在复杂环境中的应用落地。
技术贡献
核心技术创新在于引入性能驱动的强化学习框架,结合知识蒸馏进行模型初始化,设计了比下游模型小得多的压缩器,显著降低计算成本。采用组相对策略优化(GRPO)算法,直接以任务性能作为奖励信号,动态调整压缩策略,避免了传统启发式方法的性能折中。该方法实现了压缩与任务性能的端到端优化,提供了理论上的性能保证和实践中的高效性。与现有的基于互信息或启发式选择的压缩方法相比,具有更强的适应性和泛化能力。
新颖性
首次提出以任务性能为导向的上下文压缩策略,结合强化学习与知识蒸馏,优化压缩器参数,实现高压缩比下的性能提升。这一方法打破了传统依赖启发式或静态目标的限制,为上下文压缩提供了全新的优化范式。与现有的软压缩(如xRAG)和硬压缩(如摘要、关键词提取)方法不同,CORE-RAG实现了无性能折中的高效压缩,展现出极强的创新性。
局限性
- 当前方法依赖于预训练大模型的知识蒸馏,可能在特定任务或领域中受限于蒸馏模型的能力,影响压缩效果。
- 强化学习优化过程需要大量的交互样本,训练成本较高,且在极端压缩比例下可能仍存在性能下降的风险。
- 模型在极端长文本场景中的表现仍需验证,未来需考虑多模态、多任务的适应性和鲁棒性。
未来方向
未来将探索多模态信息的压缩策略,结合多任务学习提升模型的泛化能力。同时,优化强化学习的样本效率,降低训练成本,增强模型在极端压缩比例下的性能稳定性。此外,结合自监督学习和元学习技术,进一步提升压缩器的适应性和迁移能力,为大规模知识系统的高效管理提供更全面的解决方案。
AI 总览摘要
随着大规模预训练模型在自然语言处理中的广泛应用,如何在保证任务性能的同时减少输入长度成为关键问题。传统的上下文压缩方法多依赖启发式策略,难以兼顾效率与效果。本文提出CORE-RAG框架,通过性能驱动的强化学习优化压缩器,结合知识蒸馏进行初始化,有效实现了高压缩比下的性能提升。在多个问答任务中,CORE-RAG在压缩比例仅为3%的情况下,EM得分提升3.3点,超越全文基线,验证了其优越性。该方法不仅大幅降低计算成本,还增强了模型的泛化能力,为未来智能问答系统提供了新思路。实验结果显示,CORE-RAG在多数据集上表现出色,具有广泛的应用潜力。未来,结合多模态信息和多任务优化,将进一步推动上下文管理技术的发展,满足复杂场景下的高效信息处理需求。
深度分析
研究背景
近年来,随着大规模预训练语言模型(如GPT、BERT)的崛起,信息检索与生成技术取得了巨大进步。Retrieval-Augmented Generation(RAG)通过结合外部知识库,有效提升了知识密集型任务的表现。然而,随着检索文档数量的增加,输入长度迅速增长,导致计算成本上升,模型在长文本中表现出“中途迷失”的现象。已有研究尝试通过摘要、关键词提取、互信息过滤等方法压缩上下文,但多依赖启发式策略,难以兼顾性能与效率。近年来,强化学习在优化决策策略中的应用逐渐成熟,为上下文压缩提供了新的可能。
核心问题
核心问题在于如何在保证问答或生成任务性能的前提下,有效压缩检索到的文档。现有方法多依赖启发式或静态目标,导致压缩效果与任务性能难以兼得。此外,压缩模型通常体积庞大,增加了计算负担,难以在实际场景中广泛应用。如何设计一种端到端、性能导向的压缩策略,兼具高效性和准确性,是当前亟待解决的难题。
核心创新
本研究的创新点包括:1)引入性能驱动的强化学习框架,将任务性能作为直接奖励,动态优化压缩策略;2)结合知识蒸馏技术,为压缩器提供稳健的初始化,提升训练稳定性;3)设计比下游大模型小得多的轻量级压缩器,显著降低计算成本;4)实现压缩比例仅为3%,仍能提升任务性能,验证了方法的有效性。这些创新共同推动了上下文压缩技术向更高效、更智能的方向发展。
方法详解
- �� 任务定义:给定问题q和检索文档集D,目标是压缩D为s,使信息浓缩且有助于回答。• 预训练蒸馏:利用大模型(DeepSeek-V3)生成摘要,作为压缩器的初始化。• 训练策略:采用组相对策略优化(GRPO),以任务性能(EM/F1)作为奖励,端到端训练压缩器。• 设计压缩器:比下游模型小得多,减少计算开销。• 训练流程:先蒸馏初始化,再通过强化学习不断优化,确保压缩内容对任务有益。• 评估指标:EM、F1、输入长度,验证压缩效果与性能。• 实验设置:在多个问答数据集上对比全文、启发式和其他压缩方法,验证优越性。
实验设计
实验采用NQ、TriviaQA、HotpotQA和2WikiMultihopQA四个数据集,评估压缩比、EM、F1等指标。模型使用Qwen2.5-14B作为基础大模型,压缩器训练在5篇文档上,测试在10篇场景中。对比基线包括全文、BM25、RECOMP、NoiseFilter-IB等。关键超参数包括压缩比例、奖励权重等。通过消融实验验证蒸馏初始化和强化学习的贡献,分析不同压缩比例对性能的影响。
结果分析
CORE-RAG在压缩比例为3%时,EM得分提升3.3点,优于全文基线,且压缩比低至6%。在多个数据集上均表现出色,超越传统启发式方法和大模型蒸馏模型。未训练的长文本场景中,模型仍能保持优异性能,验证了其泛化能力。实验还显示,性能驱动优化避免了性能折中,实现高效压缩与任务性能的双赢。
应用场景
该技术可广泛应用于智能问答、知识检索、对话系统等场景,特别适合资源受限的设备和实时应用。通过压缩检索内容,降低模型推理成本,提高响应速度,增强系统的实用性。未来还可结合多模态信息,支持多任务、多领域的知识管理与推理,推动智能系统的普及。
局限与展望
目前方法依赖大模型蒸馏,可能在特定领域表现有限;强化学习训练成本较高,难以快速适应新任务;极端长文本场景下表现仍需验证,未来需优化模型的鲁棒性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在厨房准备一道菜,原料很多,要用不同的调料和配料。传统做法是把所有原料都放进去,虽然味道丰富,但时间长、麻烦多。现在,有个聪明的厨师设计了一套方法,只挑最重要的调料,用少量就能做出味道一样甚至更好的菜。这就像CORE-RAG用少量信息就能回答问题,既快又准。它通过学习不断调整,只用最关键的内容,避免浪费时间和资源。这样,厨房效率大大提高,菜也更美味。这个比喻说明,信息越少越好,只要挑对了,效果还能更好。
简单解释 像给14岁少年讲一样
想象你在学校里准备演讲,老师给了你很多资料,但你只需要用最重要的部分来讲。以前,你可能会把所有资料都背下来,但那样太累,也容易忘。现在,有个聪明的朋友帮你挑出最关键的内容,只用几句话就能讲清楚。这样既省时间,又能让听众听得懂还记住。CORE-RAG就像这个朋友,用少少的内容帮大模型回答问题,不仅快,还能比用全部资料还准。它通过不断练习,学会挑出最重要的部分,让工作变得更简单、更高效。
原文摘要
Retrieval-Augmented Generation (RAG) has emerged as a promising paradigm for improving the timeliness of knowledge updates and the factual accuracy of large language models. However, incorporating a large volume of retrieved documents significantly increases input length, leading to prohibitive computational costs. Existing compression approaches often compromise task performance, primarily due to their reliance on predefined heuristics. These heuristics fail to ensure that the compressed context is conducive to the generation tasks. To address these limitations, we propose CORE-RAG, a novel framework for context compression in RAG systems. CORE eliminates reliance on proxy heuristics through a performance-driven learning framework, which directy utilizes task performance as a feedback signal to iteratively refine the compressor policy. Prior to this optimization process, we incorporate a knowledge distillation phase to initialize the compressor with a robust policy. Extensive experiments demonstrate the superiority of our approach. At a high compression ratio of 3%, CORE not only avoids performance degradation but also improves the average Exact Match (EM) score by 3.3 points compared to using full documents. Our code is available at https://github.com/ziqiangcui/CORE-RAG-ICML26.