MARCH: Scaling Recurrent Memory with Content-Routed State Anchors

TL;DR

MARCH通过内容路由机制扩展长序列记忆,提升长距离依赖捕获能力。

cs.LG 🔴 高级 2026-08-12 41 次浏览
Ming Zhang Kaisen Yang Shu Yu Ermo Hua Ning Ding Xia Hu Bowen Zhou Chaochao Lu Youbang Sun
深度学习 长序列建模 记忆增强 内容路由 变换器优化

核心发现

方法论

本文提出MARCH架构,结合周期性存储的状态锚点与内容条件的路由机制。通过在长序列中定期保存累积状态快照,利用学习的锚点键实现内容路由,增强模型对历史信息的选择性访问。具体包括:• 定期checkpoint存储状态快照,形成状态锚点;• 每个锚点配备内容条件的锚点键,用于路由匹配;• 在每个token时,生成锚点查询,进行注意力式聚合,结合当前状态与历史锚点信息。该机制在不改变基础递归结构的基础上,有效扩大记忆容量,提升长距离依赖捕获能力。

关键结果

  • 在常识推理任务中,MARCH模型在多个基准测试中超越线性注意力变体,平均准确率提升至41.5%,在OpenBookQA任务中提升2.8个百分点,表现优于标准Transformer模型。长距离检索任务中,MARCH在16K到32K上下文长度下保持高准确率,显著优于传统Transformer和Log-Linear Gated-DeltaNet,展现出优异的长序列记忆能力。
  • 在LongBench多任务长文理解中,MARCH在多文档问答、摘要和少样本学习中均优于对比模型,尤其在多文档QA中提升了25%的相对性能。其在长序列推理和多针检索任务中表现出极强的泛化能力,成功实现了超长上下文的零样本外推。
  • 消融实验显示,内容路由机制显著提升了历史信息的利用效率,Sparse Top-K路由在保持性能的同时降低了计算成本。模型在多任务、多场景下的稳健性验证,证明了其在实际应用中的潜力。

研究意义

该研究突破了线性递归模型在长序列记忆上的瓶颈,通过内容路由机制实现可扩展的长距离记忆存储。解决了传统线性模型在长序列中信息遗失和检索效率低下的问题,为长文本理解、长距离推理和大规模知识检索提供了新的技术路径。其创新的存储与检索策略,为未来大规模语言模型的长序列建模奠定了理论基础,具有重要的学术价值和工业应用潜力。

技术贡献

本文提出的MARCH架构引入周期性状态快照与内容条件路由,突破了固定状态空间的限制,实现了动态扩展的记忆容量。结合注意力机制的内容路由与残差融合,有效平衡了记忆容量与计算复杂度。该方法在不改变基础递归路径的前提下,增强了模型对长距离依赖的捕获能力,提供了可训练的端到端方案,显著优于现有线性注意力和递归模型。

新颖性

本研究首次将内容路由机制引入递归记忆模型,通过周期性存储状态锚点并利用内容条件的路由键实现历史信息的选择性检索。与传统固定状态或多版本状态方法不同,MARCH实现了长序列中动态、内容驱动的存储扩展,显著改善了长距离记忆和信息恢复能力,填补了长序列模型中存储与检索的空白。

局限性

  • 模型在极端超长序列中仍面临存储与检索的计算瓶颈,尤其在锚点数量极大时,路由计算成本上升。
  • 锚点的存储频率与模型参数设置影响性能与效率之间的平衡,如何自适应调整仍需优化。

未来方向

未来可探索自适应锚点策略,结合稀疏路由技术进一步降低计算成本。还可结合多模态信息,扩展内容路由机制在多任务、多模态场景中的应用潜力。此外,研究如何与大规模预训练模型结合,实现更高效的长序列理解与推理能力。

AI 总览摘要

在自然语言处理领域,长序列建模一直是核心难题。传统的Transformer模型虽然在短文本任务中表现优异,但在处理超长文本时面临计算复杂度和记忆瓶颈。线性注意力模型通过压缩历史信息,提升了效率,但牺牲了长距离依赖的捕获能力。为突破这一限制,本文提出了MARCH架构,结合周期性存储的状态锚点和内容条件的路由机制,有效扩展了模型的记忆容量。

MARCH在长文本理解、长距离推理和检索任务中表现出色。通过在训练过程中定期保存累积状态,并利用学习的锚点键实现内容驱动的选择性访问,模型能够在不增加基础递归复杂度的情况下,存储和检索更丰富的历史信息。在多个基准测试中,MARCH均优于线性注意力变体,特别是在16K到32K的超长上下文中,保持高准确率,展现出强大的长序列记忆能力。

这项技术不仅为长文本理解提供了新思路,也为未来大规模预训练模型的长距离依赖建模奠定了基础。其创新的存储策略和内容路由机制,有望推动长序列模型在实际应用中的广泛部署,包括长文档分析、知识图谱构建和多模态融合等领域。尽管如此,模型在极端超长序列中仍需优化存储效率,未来的研究将聚焦于自适应锚点策略和稀疏路由技术,以实现更高效、更智能的长序列记忆系统。

深度分析

研究背景

长序列建模是自然语言处理中的关键挑战。早期模型如Transformer引入自注意力机制,极大提升了短文本理解能力,但其复杂度为O(T^2),在处理超长文本时计算成本迅速增加。线性注意力模型如LinFormer、Performer通过压缩历史信息,降低复杂度至O(T),但牺牲了长距离依赖的捕获能力。递归模型如Gated DeltaNet通过状态压缩实现高效解码,但受限于固定状态空间,难以存储长远信息。近年来,研究者尝试引入多版本状态或稀疏路由,试图在效率与记忆之间找到平衡。本文提出的MARCH架构,结合周期性存储和内容路由,旨在突破固定状态空间的限制,提升长距离记忆能力,满足实际长文本处理需求。

核心问题

现有线性递归模型在长序列中表现有限,主要因其状态空间有限,导致早期信息容易被覆盖或遗失。虽然多版本状态和稀疏路由有所改善,但仍存在存储成本高、检索效率低的问题。如何在保证模型效率的同时,增强其对长距离依赖的记忆能力,成为核心难题。特别是在超长文本(如16K、32K)场景下,模型需要有效存储、选择性访问历史信息,避免信息遗失或干扰。这要求设计一种既能扩展记忆容量,又能高效检索的机制,成为研究的重点。

核心创新

本文的创新点在于引入周期性存储的状态锚点与内容条件的路由机制。具体包括:1)定期checkpoint存储累积状态,形成可扩展的状态锚点;2)每个锚点配备学习的锚点键,用于内容匹配;3)在每个token时,生成锚点查询,进行注意力式聚合,结合当前状态与历史锚点信息。该机制实现了长序列中动态、内容驱动的存储扩展,突破了固定状态空间限制,显著增强了长距离记忆能力。不同于传统模型仅依赖单一状态或多版本状态,MARCH通过内容路由实现选择性访问,兼顾效率与效果。

方法详解

  • �� 定期存储状态快照:在每个锚点位置,保存当前累积的递归状态,形成状态锚点。• 内容条件路由:每个锚点配备学习的锚点键,用于内容匹配。• 生成锚点查询:在每个token时,计算内容路由得分,选择相关锚点进行信息聚合。• 注意力式聚合:结合当前状态与历史锚点信息,通过加权平均获得增强的表示。• 残差融合:将历史信息与当前状态相加,保持递归路径的连续性。• 端到端训练:所有参数通过标准语言模型目标联合优化,确保模型学习到有效的存储与检索策略。

实验设计

采用50B tokens的Long-Data-Collections数据集进行预训练,序列长度16K。模型配置包括21层、1536隐藏维度,使用多头注意力和RoPE位置编码。对比基线包括标准Transformer、Gated DeltaNet及其变体。评估指标涵盖零样本推理、长文本理解和检索任务。通过在LongBench、RULER和In-Context Retrieval任务中的表现,验证了MARCH在超长序列中的优越性。消融实验分析了锚点存储频率、路由稀疏性对性能的影响。

结果分析

在零样本推理任务中,MARCH平均准确率达41.5%,优于线性注意力变体和部分Transformer模型。在16K到32K上下文长度的检索任务中,MARCH保持高准确率,显著优于传统模型,尤其在超长序列外推中表现出色。LongBench多任务测试中,MARCH在多文档问答和摘要任务中提升了25%以上的性能。消融分析显示,内容路由和稀疏策略在性能提升和计算效率方面起到关键作用。这些结果验证了MARCH在长序列建模中的有效性和实用性。

应用场景

该技术适用于长文本理解、知识图谱构建、超长文档检索等场景。模型可以部署在需要长距离依赖的行业应用中,如法律、科研、医疗等领域,提升信息检索和推理能力。其内容路由机制也为多模态信息融合提供了基础,有望推动智能问答、自动摘要等应用的发展。

局限与展望

尽管MARCH在超长序列中表现优异,但在极端超长(如数万字)场景仍面临存储与检索的计算瓶颈。锚点存储频率与路由参数需精细调节,否则可能影响效率和效果。未来需研究自适应锚点策略和稀疏路由优化,以进一步降低成本并提升模型泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个大型图书馆里找信息。每次你找到一本重要的书,你会把它放在一个特殊的架子上,方便以后快速找到。随着时间推移,你会不断在不同的架子上放书,但每个架子都标有内容标签,告诉你里面都有什么。当你需要回答一个问题时,你会根据内容标签快速找到相关的架子,然后从中抽取信息。这个过程就像MARCH模型一样,它定期存储长时间的记忆(架子),用内容标签(锚点键)快速找到相关信息,帮助你在海量信息中快速检索所需内容。这样既节省空间,又能快速找到重要信息,特别适合处理超长的文本或数据。

简单解释 像给14岁少年讲一样

想象你在学校图书馆里,有很多书堆在一起。每次你找到一本特别有用的书,你会把它放在一个特殊的架子上,写上标签。每次你想回答问题时,你会先看看标签,找到那些和你问题相关的书,然后从里面抽出信息。这样,不管书堆多大,你都可以很快找到需要的内容。这个方法就像MARCH模型一样,它会定期把重要的记忆存起来,用标签帮忙快速找到以前的知识。这样,即使信息很多,也能很快找到答案,不会忘记之前学过的东西。

术语表

Content-Routing (内容路由)

一种根据内容匹配选择性访问历史信息的机制,确保模型只检索相关的记忆片段。技术上通过学习的锚点键实现内容匹配。

在MARCH中,用于根据输入内容动态选择历史锚点,提高长序列记忆效率。

State Anchor (状态锚点)

定期存储的模型状态快照,作为长序列中重要的记忆节点,用于后续内容检索。

模型在训练过程中周期性存储的状态,用于实现内容驱动的长距离访问。

Content-Conditioned Key (内容条件锚点键)

用于内容匹配的学习参数,结合锚点状态的内容信息,指导检索相关历史状态。

锚点的内容标签,帮助模型在长序列中快速找到相关信息。

Attention-Style Aggregation (注意力式聚合)

通过加权平均方式,将多个历史信息融合到当前表示中,增强记忆能力。

在模型中用来整合历史锚点信息,提升长距离依赖捕获。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步自适应调整锚点存储频率以平衡效率与记忆容量,仍是未解难题。
  • 2 在极端超长文本(如数万字)场景中,模型的存储与检索机制如何优化以降低计算成本。
  • 3 多模态内容路由的实现与优化,未来在多模态信息融合中的应用潜力尚待探索。

应用场景

近期应用

长文本理解与检索

可应用于法律、科研、医疗等行业的长文档分析,提升信息检索和推理效率,满足实际需求。

知识图谱构建

利用长序列记忆增强模型,自动提取和存储大规模知识,推动知识图谱的自动化建设。

远期愿景

智能长文本处理平台

未来可发展为支持超长文档的智能平台,实现自动摘要、问答和推理,改变信息处理方式。

原文摘要

Transformers owe much of their strong long-context retrieval capability to a token-level memory that grows with context length. This flexibility, however, incurs a quadratic computation complexity during training and a key--value cache that grows linearly during autoregressive inference. Recurrent alternatives offer efficient decoding by compressing the entire history into a fixed-size state, but often underperform on recall-intensive tasks since earlier associations usually get overwritten by subsequent updates, and only the most recent contextual information is retained. In this paper, we introduce Memory-Anchor Routing across Context History (MARCH), a network architecture that effectively scales state-space models beyond a fixed-size dimension, while maintaining computational efficiency over long-sequences. MARCH periodically caches cumulative recurrent-state checkpoints as state anchors and associates each anchor with a compact, content-conditioned anchor key. This lets MARCH maintain a memory bank, which can grow as context length increases, providing a controllable trade-off between historical resolution and memory cost. At each token, MARCH produces an anchor query to attend all causally available state anchors, and the output is calculated as an attention-style aggregation over all historical anchors along the current state. We show that after standard pretraining, MARCH consistently outperforms multiple linear attention variants across commonsense reasoning, LongBench, and in-context retrieval. These results demonstrate that content-routed state caching substantially strengthens recurrent long-range memory while preserving its native computation path.

cs.LG