Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents

TL;DR

提出一种将内存引入语言代理推理循环的方法,显著提高任务效率和准确性。

cs.AI 🔴 高级 2026-07-07 24 次浏览
Yusuf Khan Carlo Lipizzi
内存优化 语言模型 推理循环 延展认知 低延迟存储

核心发现

方法论

论文提出“内存在循环中”的概念,将内存存储从外部网络转移到进程内存储,延迟降低至100微秒级别。通过实验验证了这种设计对任务效率和准确性的提升。

关键结果

  • 在GPT-5模型中,使用内存循环的任务召回率从0/5提升至3.6-4.8/5,延迟仅80-165微秒。
  • 与传统网络存储相比,冗余动作减少至0/12,而网络存储延迟110ms时冗余动作为7.2/12。
  • 通过本地嵌入器将嵌入延迟从200-400ms缩短至40微秒,显著提升整体性能。

研究意义

该研究重新定义了语言代理的内存架构,将内存从外部工具转变为推理过程的组成部分。这种方法不仅解决了现有系统中高延迟的瓶颈,还为未来的低延迟认知系统奠定了基础。

技术贡献

提出了内存延迟与推理步长之间的因果关系,证明了低延迟存储可实现实时内存访问。通过实验验证了内存循环对任务准确性和效率的提升,并提出了基于延迟预算的设计准则。

新颖性

首次将延展认知理论中的“平价原则”应用于语言代理设计,提出了以低延迟内存为核心的推理循环架构。

局限性

  • 模型的读取策略限制了内存的充分利用,导致部分任务召回失败。
  • 当前实验仅基于GPT-5模型,可能对其他模型的适用性有限。
  • 未充分探讨大规模分布式环境下的性能表现。

未来方向

未来可探索更复杂的读取策略、扩展至分布式环境,以及优化内存与嵌入器的协同工作机制。

AI 总览摘要

当前的语言代理通常将内存视为推理循环之外的外部工具,仅在每轮对话中查询一次。这种设计受限于网络存储的高延迟,导致任务效率和准确性受限。论文提出了一种新的内存架构,将内存引入推理循环中,作为语言代理的延展工作内存。

通过将内存存储从网络转移至进程内,延迟从110毫秒降低至100微秒级别,使得每步推理都能高效访问内存。实验表明,在GPT-5模型中,任务召回率从0/5提升至3.6-4.8/5,同时冗余动作显著减少。进一步结合本地嵌入器,将嵌入延迟缩短至40微秒,进一步优化了性能。

该研究不仅验证了低延迟内存对推理效率的提升,还首次将延展认知理论应用于语言代理设计,提出了基于延迟预算的内存架构设计准则。尽管存在读取策略和分布式环境适配等局限,该方法为未来低延迟智能系统的开发提供了重要启示。

深度分析

研究背景

语言代理通常采用观察-推理-行动的循环,但内存被视为外部工具,仅在每轮对话中查询一次。这种设计受限于网络存储的高延迟,导致任务效率和准确性受限。近年来,研究集中于优化内存访问频率和隐藏延迟,但未质疑存储位置的根本假设。

核心问题

核心问题在于现有语言代理的内存架构无法支持高频访问,导致推理效率低下。网络存储的高延迟(50-200ms)迫使系统限制内存查询频率,无法满足复杂任务的需求。

核心创新

论文提出将内存从外部网络转移至进程内存储,显著降低访问延迟至100微秒以下。通过结合延展认知理论,作者将这种内存架构重新定义为推理过程的组成部分,而非外部工具。

方法详解

  • �� 提出“内存在循环中”概念,将内存存储从网络转移至进程内。
  • �� 使用本地嵌入器将嵌入延迟从200-400ms缩短至40微秒。
  • �� 设计实验验证低延迟对任务效率和准确性的提升,包括任务召回率和冗余动作的减少。
  • �� 分析内存延迟与推理步长之间的因果关系,提出基于延迟预算的设计准则。

实验设计

实验基于GPT-5系列模型,设计了一个六轮旅行规划任务,用户在早期提供五个约束条件,随后要求代理回忆。设置窗口限制(w=4),使早期信息滚出可见范围。实验对比了无内存、内存循环和基于门控的内存策略。

结果分析

在内存循环条件下,任务召回率从0/5提升至3.6-4.8/5,冗余动作减少至0/12。结合本地嵌入器后,整体延迟缩短至40微秒,显著提升了性能。

应用场景

该方法适用于需要高频内存访问的语言代理任务,如复杂对话系统、实时决策支持系统以及智能搜索引擎。

局限与展望

当前实验主要基于单机环境,未验证分布式场景下的性能。此外,读取策略的优化空间较大,可能进一步提升任务召回率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,每次需要调料时都要跑到隔壁房间取,这就像传统语言代理使用网络存储的情况。而本文提出的方法就像把调料直接放在厨房的柜子里,随手可取,极大提高了效率。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次需要道具时都要暂停游戏去仓库取,这很麻烦吧?现在想象一下,你的角色可以随时从背包里拿道具,这就是这篇论文的核心想法!通过把“记忆”放到角色的背包里,游戏变得更快更好玩了!

术语表

延展认知 (Extended Cognition)

一种理论,认为外部工具可以成为认知过程的一部分。

用于解释低延迟内存如何成为推理的一部分。

内存在循环中 (Memory in the Loop)

将内存存储引入推理循环的设计,使其在每步推理中都可访问。

论文的核心概念,用于提升任务效率。

平价原则 (Parity Principle)

延展认知理论中的标准,要求外部工具必须快速且易用。

用于评估内存是否可作为推理的一部分。

本地嵌入器 (Local Embedder)

一种将嵌入延迟缩短至40微秒的技术。

用于优化内存循环的整体性能。

冗余动作 (Redundant Actions)

指代理重复执行已完成的任务。

用于衡量内存循环对任务效率的提升。

开放问题 这项研究留下的未解疑问

  • 1 如何在分布式环境中实现低延迟内存访问?
  • 2 能否设计更智能的读取策略以进一步提升召回率?
  • 3 低延迟内存对其他模型架构的适用性如何?

应用场景

近期应用

智能对话系统

通过内存循环提升对话系统的上下文理解能力,适用于客服和虚拟助手。

实时决策支持

在医疗、金融等领域支持实时复杂决策,减少延迟对结果的影响。

远期愿景

通用人工智能

为开发具备人类级别认知能力的人工智能系统奠定基础。

原文摘要

Language agents run a loop - observe, reason, act - but the memory they reason over sits outside it: a store queried at most once per turn. We study the regime where memory moves inside the loop, read and written on every step. The obstacle has always been latency: networked stores answer in tens to hundreds of milliseconds, and in-loop retrieval can inflate end-to-end latency by up to 83x when retrieval is expensive. Prior work manages that cost rather than questioning it: serving-layer scheduling hides it, "memory-first" designs ration retrieval to once per turn. We argue latency is a property of where the store lives, not the in-loop pattern: an in-process store answers in ~100us, three orders of magnitude below the network regime, and at that speed the per-step tax collapses. By the extended-mind thesis's parity principle, a store fast enough to be constantly and directly available becomes extended working memory, not a tool the agent merely consults. The premise is causal: holding a fixed per-turn memory-latency budget and varying only the store's answer speed, redundant actions rise monotonically with latency - 0.0 of 12 at in-process speed, 7.2 of 12 at a 110ms cloud round trip (gpt-5-nano, gpt-5-mini; exact permutation p=0.0079). We demonstrate the regime end-to-end: across four GPT-5-class models under a bounded window, recall improves from 0/5 to 3.6-4.8/5 with in-loop memory, store ops at p50 80-165us - though an instructed restate-every-reply baseline also solves it perfectly, at a token cost that grows with the working set. The store never lost a fact in any run (244 of 244 writes kept); every miss traces to the agent's read policy, not the store. Our measurements also relocate the bottleneck: the dominant per-step cost is embedding (~200-400ms over the network); pairing the in-process store with a small local embedder returns the complete operation to a measured ~40us.

cs.AI cs.CL