InfMem: Learning System-2 Memory Control for Long-Context Agent

TL;DR

InfMem通过PreThink-Retrieve-Write协议提升长文本推理准确性,平均提高10.17分。

cs.CL 🔴 高级 2026-02-03 6 次浏览
Xinyu Wang Mingze Li Peng Lu Xiao-Wen Chang Lifeng Shang Jinping Li Fei Mi Prasanna Parthasarathi Yufei Cui
长文本推理 记忆控制 系统2 强化学习 问答系统

核心发现

方法论

InfMem采用PreThink-Retrieve-Write协议,主动监控证据充足性,通过目标检索和证据感知压缩更新有限记忆。结合监督微调和强化学习,确保检索、写入和停止决策与最终任务正确性对齐。

关键结果

  • 在Qwen3-1.7B上,InfMem将准确率提高了10.17分,同时推理时间减少3.9倍。
  • 在Qwen3-4B上,准确率提升11.84分,推理效率显著提高。
  • 在Qwen2.5-7B上,准确率提升8.23分,早停机制减少了冗余计算。

研究意义

InfMem在长文本推理中提供了显著的准确性和效率提升,解决了现有方法中低显著性桥接证据丢失的问题。这一方法在学术界和工业界具有广泛的应用潜力,尤其是在需要处理超长文档的场景中。

技术贡献

InfMem通过引入系统2风格的控制循环,区别于传统的流式处理方法,提供了新的理论保证和工程可能性。其创新的训练策略结合了监督微调和强化学习,优化了记忆控制决策。

新颖性

InfMem首次将系统2控制应用于长文本推理,通过主动检索和压缩机制,显著提升了复杂问题的推理能力,与现有的流式处理框架形成鲜明对比。

局限性

  • 在极端复杂的多跳推理任务中,可能仍存在记忆不足的情况。
  • 需要大量计算资源进行训练和优化。

未来方向

未来的研究方向包括优化记忆压缩算法,探索更高效的训练策略,以及在更多实际应用场景中的验证。

AI 总览摘要

在处理超长文档的推理任务中,现有的流式处理方法常常无法保留多跳推理所需的低显著性桥接证据。InfMem通过引入系统2风格的控制机制,提出了PreThink-Retrieve-Write协议,主动监控证据充足性,进行目标检索,并应用证据感知的联合压缩来更新有限记忆。这一创新方法在多个超长问答基准上表现出色,显著提高了准确性和推理效率。

InfMem的核心技术包括结合监督微调和强化学习的训练策略,以确保检索、写入和停止决策与最终任务正确性对齐。实验结果表明,InfMem在Qwen系列模型上均优于现有的MemAgent,特别是在复杂的多跳推理任务中,表现出色。

尽管InfMem在长文本推理中取得了显著进展,但在极端复杂的任务中仍可能面临记忆不足的问题。未来的研究将集中于优化记忆压缩算法和探索更高效的训练策略,以进一步提升推理能力和效率。

深度分析

研究背景

近年来,随着大规模语言模型在各种任务中的卓越表现,长文本推理成为一个重要的研究领域。传统的流式处理方法通过将文档分段处理,保持固定大小的记忆,但在多跳推理任务中常常丢失关键的桥接证据。

核心问题

长文本推理的核心问题是如何在有限的记忆预算下,合成分散在远距离段落中的稀疏证据。这一问题的难点在于需要同时保证推理的准确性和计算效率。

核心创新

InfMem的核心创新在于引入系统2风格的控制机制,通过PreThink-Retrieve-Write协议,主动监控证据充足性,进行目标检索,并应用证据感知的联合压缩来更新有限记忆。

方法详解

  • �� PreThink:评估当前证据是否足够。
  • �� Retrieve:针对性地从全局文档索引中检索证据。
  • �� Write:在固定预算下联合压缩检索到的段落、当前块和现有记忆。

实验设计

实验使用了Qwen系列模型,评估了InfMem在超长问答基准上的表现。通过与MemAgent的对比,验证了InfMem在准确性和推理效率上的优势。

结果分析

实验结果显示,InfMem在多个基准上均优于MemAgent,特别是在复杂的多跳推理任务中,表现出色。通过适应性早停机制,显著减少了推理时间。

应用场景

InfMem可应用于需要处理超长文档的场景,如法律合同分析和大型代码库理解。其高效的推理能力和准确性使其在工业界具有广泛的应用潜力。

局限与展望

尽管InfMem在长文本推理中取得了显著进展,但在极端复杂的任务中仍可能面临记忆不足的问题。未来的研究将集中于优化记忆压缩算法和探索更高效的训练策略。

通俗解读 非专业人士也能看懂

想象你在一个巨大的图书馆中寻找答案。传统的方法就像在每个书架上找一本书,记住每本书的内容,但很容易忘记重要的细节。InfMem就像一个聪明的图书馆员,它会先想一下问题需要哪些书,然后快速找到这些书,并把重要的内容记下来。这样,当你需要答案时,它已经准备好了,不用再翻找整个图书馆。

简单解释 像给14岁少年讲一样

想象你在玩一个超长的冒险游戏,需要找到隐藏在不同关卡中的线索。普通的方法就像一直往前走,记住每个关卡的细节,但很容易忘记重要的线索。InfMem就像一个聪明的助手,它会先想一下问题需要哪些线索,然后快速找到这些线索,并把重要的内容记下来。这样,当你需要答案时,它已经准备好了,不用再回头找线索。

术语表

PreThink (预思考)

评估当前证据是否足够以回答问题的过程。

在InfMem中用于决定是否需要进行检索。

Retrieve (检索)

针对性地从全局文档索引中检索所需证据的过程。

在InfMem中用于获取补充证据。

Write (写入)

在固定预算下联合压缩检索到的段落、当前块和现有记忆的过程。

在InfMem中用于更新记忆。

System-2 (系统2)

一种需要深思熟虑和逻辑推理的思维模式。

在InfMem中用于描述其控制机制。

MemAgent (记忆代理)

一种传统的流式处理方法,使用固定大小的记忆进行推理。

与InfMem进行对比的基准方法。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂的多跳推理任务中进一步提高记忆效率?
  • 2 如何在不增加计算成本的情况下优化记忆压缩算法?

应用场景

近期应用

法律合同分析

InfMem可用于分析超长法律合同,快速提取关键条款,提高法律审查效率。

远期愿景

大型代码库理解

InfMem可用于理解大型代码库,帮助开发者快速定位关键代码段,提高开发效率。

原文摘要

Reasoning over ultra-long documents requires synthesizing sparse evidence scattered across distant segments under strict memory constraints. While streaming agents enable scalable processing, their passive memory update strategy often fails to preserve low-salience bridging evidence required for multi-hop reasoning. We propose InfMem, a control-centric agent that instantiates System-2-style control via a PreThink-Retrieve-Write protocol. InfMem actively monitors evidence sufficiency, performs targeted in-document retrieval, and applies evidence-aware joint compression to update a bounded memory. To ensure reliable control, we introduce a practical SFT-to-RL training recipe that aligns retrieval, writing, and stopping decisions with end-task correctness. On ultra-long QA benchmarks ranging from 32k to 1M tokens, InfMem consistently outperforms MemAgent across backbones. Specifically, InfMem improves average absolute accuracy by 10.17, 11.84, and 8.23 points on Qwen3-1.7B, Qwen3-4B, and Qwen2.5-7B, respectively, while reducing inference time by 3.9x on average and by up to 5.1x through adaptive early stopping. Code is available at https://github.com/UCMP13753/InfMem.

cs.CL