核心发现
方法论
本文提出CoinRAG框架,通过离线提取文本块中的信息碎片(nuggets),并在在线检索阶段利用两阶段筛选机制,识别与查询相关的语义单元。核心在于将预先计算的细粒度KV缓存切片,结合chunk级上下文,动态构建语义相关的缓存,从而避免全文编码的高成本。具体流程包括:离线信息碎片提取、两阶段检索筛选、基于位置偏移的KV缓存拼接,以及引入碎片感知微调以优化模型性能。该方法显著降低推理成本,提升答题准确率,特别在满足100ms P99延迟预算下,平均F1提升5.3%。
关键结果
- 在LongBench多跳问答任务中,CoinRAG在满足100ms延迟条件时,F1得分比标准RAG提升5.3%,且平均上下文长度缩短1.84倍(如HotpotQA中从723 tokens降至387 tokens),显著减少GPU内存占用。多项消融实验验证:碎片化KV切片优于全块编码,离线提取优于在线生成,位置偏移机制有效缓解偏移误差,微调提升整体性能。
- 在不同数据集(HotpotQA、2WikiMQA、MuSiQue)上,CoinRAG在无延迟限制时,平均F1仍优于两大基线(TurboRAG和KVLink),提升幅度达5.2%,表现出良好的鲁棒性和泛化能力。
- 通过在不同延迟和上下文长度预算下的Pareto分析,CoinRAG在准确率与硬件资源消耗之间实现了更优的折中,展现出在工业实际场景中优化长文本问答系统的潜力。
研究意义
该研究突破了长文本检索生成系统中高效性与准确性的瓶颈,提出的细粒度缓存重用机制,极大降低了推理成本,满足了实时交互场景对低延迟的需求。其创新点在于结合离线信息碎片提取与动态语义筛选,有效缓解了长上下文带来的噪声和冗余问题,为大规模知识增强型问答系统的部署提供了新思路。此外,研究还推动了缓存机制在大语言模型中的应用边界,促进了高效、可扩展的知识增强技术发展。
技术贡献
本文提出CoinRAG框架,创新性地将离线提取的细粒度信息碎片(nuggets)与两阶段检索机制结合,利用位置偏移和碎片感知微调优化缓存拼接策略,实现了在低延迟条件下的高效长上下文处理。核心技术包括:离线文本碎片提取算法、基于相似度的两阶段筛选、位置偏移机制的KV缓存拼接,以及碎片感知微调训练流程。这些技术共同实现了缓存的语义相关性增强和存储效率提升,突破了传统chunk级缓存的局限,提供了更细粒度、更语义丰富的缓存重用方案。
新颖性
本研究首次提出将离线提取的语义碎片作为KV缓存切片,结合两阶段检索和位置偏移机制,实现了比传统chunk级缓存更细粒度的缓存重用策略。与现有的缓存增强方法(如TurboRAG、KVLink)主要依赖全块或跨块重建不同,CoinRAG在保证语义一致性的同时,大幅降低了推理延迟和硬件资源消耗。这一创新在长文本问答和多跳推理任务中展现出优越性能,填补了长上下文高效处理的研究空白。
局限性
- 尽管CoinRAG在低延迟场景表现优异,但在极端长文本或知识碎片极为稀疏的情况下,碎片提取和筛选的效果可能下降,导致信息遗漏或噪声引入。
- 离线提取过程依赖预定义的文本块划分和相似度阈值,可能在不同任务或领域中需要调参,影响泛化能力。
- 碎片感知微调虽提升性能,但增加了训练复杂度和时间成本,且在动态变化的知识库中可能需要频繁更新。
未来方向
未来可探索自适应碎片提取策略,结合动态知识更新机制,提升碎片的覆盖率和相关性。同时,结合更先进的检索模型(如基于多模态信息的检索)以增强语义理解能力。此外,研究还可扩展到多模态长文本任务,推动知识图谱和大模型的深度融合,满足更复杂的应用需求。
AI 总览摘要
随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,如何在保证高准确率的同时实现低延迟成为核心挑战。传统的检索增强生成(RAG)系统通过将外部知识整合到模型中,有效提升了事实一致性和问答能力,但在处理长文本或多跳推理任务时,面临着推理成本高、响应延迟长的问题。尤其是在实时交互场景中,满足100毫秒的响应时间(P99延迟)成为行业标杆,推动了对高效推理技术的需求。
本研究提出了CoinRAG框架,旨在突破长文本RAG的效率瓶颈。其核心思想是利用离线预处理,将文本块中的关键信息碎片(nuggets)提取出来,存储为细粒度的KV缓存切片。在在线推理阶段,通过两阶段检索机制,筛选出与查询高度相关的语义碎片,并利用位置偏移机制将这些碎片的KV缓存拼接成一个紧凑的上下文前缀。这种设计避免了全文编码的高昂成本,显著缩短了响应时间,同时保持了丰富的语义信息。
技术上,CoinRAG结合了离线信息碎片提取、相似度筛选、位置偏移拼接和碎片感知微调等多项创新。离线提取算法利用LLM自动识别文本中的连续语义片段,确保碎片的语义完整性。两阶段检索首先筛选出潜在相关的文本块,然后在这些块中根据相似度排序,选出最相关的碎片。位置偏移机制确保碎片拼接后KV缓存的连续性和语义一致性。微调阶段通过模拟推理场景,优化碎片的上下文拼接效果,提升模型的问答准确率。
在LongBench多跳问答任务中的实验结果显示,CoinRAG在满足100ms P99延迟预算时,平均F1得分比标准RAG提升5.3%,同时上下文长度缩短1.84倍,显著节省GPU资源。多项消融实验验证了碎片化KV缓存的优越性,表明该方法在长文本理解和多跳推理中具有广泛应用潜力。通过在不同数据集和不同延迟预算下的Pareto分析,CoinRAG展现出在准确率与硬件资源消耗之间的最佳折中方案,为工业界部署高效长文本问答系统提供了新思路。
未来,研究可结合动态知识更新和多模态信息检索,进一步提升碎片提取的智能化和适应性,推动知识增强型大模型的广泛应用。总之,CoinRAG通过细粒度缓存重用技术,为长文本检索生成系统开启了低成本、高效能的新篇章。
深度解读
原文摘要
Recent optimization studies on Retrieval-Augmented Generation (RAG) have exploited chunk-level KV cache reuse to avoid processing long retrieved contexts for higher efficiency, while significant information redundancy and noise still remain in the coarse-grained chunks. This paper optimizes the Pareto frontier under low prefill latency constraints while maximizing accuracy by proposing CoinRAG (Contextualized Information Nugget KV Cache Reuse for Long-Context RAG). The name metaphorically reflects our core mechanism: much like assembling small tokens (or "coins") to accumulate a larger value, CoinRAG compositionally reuses offline-computed, fine-grained nugget caches to form a learned contextual representation efficiently in a more semantically relevant but compact manner. Specifically, instead of full-chunk encoding, CoinRAG identifies query-relevant semantic units within retrieved chunks through two-stage retrieval and seamlessly assembles their sliced KV representations with a chunk-level context. Extensive evaluations on LongBench multi-hop question answering tasks demonstrate that CoinRAG significantly reduces operational costs and outperforms the other baselines with a new Pareto frontier and an average 5.3% relative improvement in answer quality (F1) under a standard fast prefill latency budget.
参考文献 (20)
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
Yushi Bai, Xin Lv, Jiajie Zhang 等
The Great Nugget Recall: Automating Fact Extraction and RAG Evaluation with Large Language Models
Ronak Pradeep, Nandan Thakur, Shivani Upadhyay 等
RoFormer: Enhanced Transformer with Rotary Position Embedding
Jianlin Su, Yu Lu, Shengfeng Pan 等
Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions
H. Trivedi, Niranjan Balasubramanian, Tushar Khot 等
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
Jingbo Yang, Bairu Hou, Wei Wei 等
Enabling Large Language Models to Generate Text with Citations
Tianyu Gao, Howard Yen, Jiatong Yu 等
Serving DNNs like Clockwork: Performance Predictability from the Bottom Up
A. Gujarati, Reza Karimi, Safya Alzayat 等
Prompt Cache: Modular Attention Reuse for Low-Latency Inference
In Gim, Guojun Chen, Seung-seob Lee 等
CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion
Jiayi Yao, Hanchen Li, Yuhan Liu 等
Retrieval Augmentation Reduces Hallucination in Conversation
Kurt Shuster, Spencer Poff, Moya Chen 等
CoQA: A Conversational Question Answering Challenge
Siva Reddy, Danqi Chen, Christopher D. Manning
Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps
Xanh Ho, A. Nguyen, Saku Sugawara 等
Don't Do RAG: When Cache-Augmented Generation is All You Need for Knowledge Tasks
Brian J. Chan, Chao-Ting Chen, Jui-Hung Cheng 等
Efficient Memory Management for Large Language Model Serving with PagedAttention
Woosuk Kwon, Zhuohan Li, Siyuan Zhuang 等
Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
Kai Greshake, Sahar Abdelnabi, Shailesh Mishra 等
A Survey on Large Language Model Acceleration based on KV Cache Management
Haoyang Li, Yiming Li, Anxin Tian 等
Clipper: A Low-Latency Online Prediction Serving System
D. Crankshaw, Xin Wang, Giulio Zhou 等
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Patrick Lewis, Ethan Perez, Aleksandara Piktus 等
TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text
Songshuo Lu, Hua Wang, Yu Rong 等