核心发现
方法论
SAM框架将交互历史划分为页面存储和轻量级提示,利用专家指导和强化学习优化记忆模块。通过页面合成和意图驱动的回忆机制,实现对远距离信息的动态重构。采用基于树的记忆调用树结构,结合oracle锚定的可恢复性奖励,强化记忆的相关性和可用性。模型在多个长远推理任务中(如BrowseComp、HLE)持续超越传统压缩或检索策略,验证其在多样化基础模型上的泛化能力。
关键结果
- 在BrowseComp和BrowseComp-ZH任务中,SAM平均提升上下文管理性能约8-10个百分点,最大提升在长距离记忆需求强烈的场景中达15%。在HLE科学推理任务中,准确率提升至69.2%,优于传统方法的65.4%。在不同基础模型(如Qwen3.5-35B-A3B和GLM-4.7)上均表现出稳定的优势,验证了其跨模型的适应性。
- 通过专家指导微调和OAT-GRPO强化学习,模型在保持记忆相关性的同时,显著提高了长远推理的效率和准确性。消融实验显示,去除树结构或oracle奖励会导致性能下降约4-6个百分点,验证了其设计的有效性。
- 在大规模真实场景中,SAM能有效管理超长交互历史,减少模型负担,提升推理连贯性,为未来多模态和复杂任务的长远推理提供基础。
研究意义
该研究突破了长远推理中信息组织的瓶颈,提出的SAM框架通过显式建模状态相关记忆,极大改善了模型对远距离信息的访问能力。它不仅增强了大模型在复杂任务中的表现,也为外部记忆系统的设计提供了新思路,有望推动智能系统在科学研究、决策支持等领域的应用。该方法强调需求驱动的记忆访问,符合人类认知中主动检索的机制,具有深远的理论和实践意义。
技术贡献
技术上,SAM引入了页面式存储与提示结合的记忆架构,区别于传统的压缩或检索策略。通过专家指导微调结合强化学习,优化记忆的相关性和可恢复性。创新性地设计了树状记忆调用树和oracle奖励机制,有效解决了长远推理中的信息稀疏和相关性问题。该框架实现了记忆的外部化、可重用和状态依赖,显著提升了模型的推理能力和适应性,为未来多模态、多任务的长远推理提供了技术基础。
新颖性
本研究首次提出将长远推理中的记忆管理转化为状态自适应问题,突破了以往依赖 recency 或压缩的限制。引入页面-提示架构和树状调用机制,结合oracle奖励,创新性地实现了需求驱动的动态信息重构。这种设计不同于传统的内存增强方法,为外部记忆的优化提供了新范式,具有较强的创新性和实用价值。
局限性
- 模型在极端长距离记忆需求或信息稀疏场景下仍可能出现回忆不足的问题,尤其在记忆页面划分策略未充分优化时。
- 训练过程依赖大量专家指导和强化学习,计算成本较高,实际部署时需考虑效率优化。
- 目前主要针对文本推理,跨模态信息整合和多模态记忆管理仍是未来挑战。
未来方向
未来将探索多模态记忆融合,提升模型对图像、视频等非文本信息的长远推理能力。同时,优化记忆划分和检索机制,降低训练成本,增强模型的泛化能力。此外,将结合元学习策略,使记忆系统更具自主适应性,推动智能系统在更复杂环境中的应用。
AI 总览摘要
长远推理是智能系统面临的核心挑战之一,传统方法多依赖于压缩或检索机制,但难以应对信息散布和时序跨度大等问题。本文提出的SAM(State-Adaptive Memory)框架,通过将交互历史划分为页面存储和提示,结合专家指导和强化学习,构建了一个需求驱动的外部记忆系统。SAM利用树状调用结构和oracle奖励机制,有效实现远距离信息的动态重构,显著提升模型在长距离任务中的表现。
在多个真实长远推理任务(如BrowseComp、HLE)上,SAM均优于传统基线,平均提升8-10个百分点,最大达15%。其跨模型适应性强,验证了其在多样化基础模型上的通用性。该研究不仅突破了长远推理中信息组织的瓶颈,也为未来多模态、多任务的智能系统提供了坚实基础。未来,结合多模态信息和自主学习,将进一步推动智能系统在科学研究、决策支持等领域的应用发展。
深度分析
研究背景
长远推理在人工智能中的地位不断提升,早期工作如Memory Networks、Transformer增强机制解决了部分短期记忆问题,但面对超长交互历史时仍显不足。近年来,检索增强模型(如Retrieval-Augmented Generation)通过外部知识库改善信息访问,但多依赖静态索引,缺乏动态需求驱动的记忆管理。传统压缩策略(如Summarization)虽能减轻模型负担,但难以保证关键信息的完整性。随着大模型的发展,如何高效组织和利用长远信息成为研究焦点。
核心问题
长远推理中的核心难点在于信息的散布和时序跨度大,导致模型难以在有限上下文中找到关键线索。现有方法多依赖固定策略,忽视信息的动态需求匹配,导致推理准确率下降。尤其在复杂任务中,早期信息可能在后续决策中变得至关重要,但传统机制难以有效检索和重构这些信息,限制了模型的推理深度和连贯性。
核心创新
本研究创新性地提出将长远推理转化为状态自适应记忆问题,区别于以往单纯压缩或检索的方法。引入页面-提示架构,将交互历史划分为多页面存储和轻量提示,结合专家微调和强化学习优化记忆质量。设计树状调用结构,使模型能根据当前需求动态选择和重构信息,显著提升远距离信息的可用性。此机制突破了传统记忆管理的局限,为长远推理提供了新思路。
方法详解
- �� 将交互历史划分为连续页面,利用信息预算限制页面大小,确保局部连贯性。 • 每个页面通过Msum函数生成轻量提示,反映关键信息。 • 页面存储在外部存储器中,提示存入记忆库,保持在线上下文轻量。 • 通过专家指导微调记忆模型,确保提示与页面内容一致。 • 采用树状调用机制,模型根据意图选择提示,重构相关信息。 • 引入oracle锚定的奖励,强化记忆的相关性和恢复能力。 • 训练过程中结合强化学习(OAT-GRPO),优化记忆调用策略,提升整体推理性能。
实验设计
使用公开的长远推理任务数据集(如BrowseComp、HLE),对比多种基线(如压缩、检索、无管理策略)。评估指标包括任务成功率、推理准确性和记忆相关性。模型在不同基础模型(Qwen3.5-35B、GLM-4.7)上进行微调和强化训练,采用固定上下文窗口(如128K)进行推理。通过消融实验验证树结构和oracle奖励的贡献,确保设计的有效性。实验结果显示,SAM在所有任务中均优于传统方法,特别是在长距离记忆需求强烈的场景。
结果分析
在长远推理任务中,SAM平均提升性能约8-10个百分点,最大提升在长距离记忆场景中达15%。在HLE科学推理中,准确率达69.2%,优于65.4%的基线。模型在不同基础模型上表现一致,验证了其泛化能力。消融实验表明,去除树状调用或oracle奖励会导致性能下降4-6个百分点,强调设计的重要性。整体来看,SAM显著改善了远距离信息的访问和重构能力,为长远推理提供了新范式。
应用场景
该方法适用于需要长时间交互和复杂推理的场景,如科学研究、法律分析、技术支持等。通过外部记忆管理,模型能更好地组织和利用历史信息,减少模型负担,提升推理连贯性。未来可结合多模态信息,实现跨模态长远推理,推动智能系统在实际应用中的广泛部署。
局限与展望
目前模型在极端长距离或信息稀疏场景下仍存在回忆不足的问题,尤其在页面划分策略未充分优化时。此外,训练过程依赖大量专家微调和强化学习,计算成本较高,实际部署时需考虑效率优化。未来需解决多模态信息融合和自主记忆调节等挑战,以实现更广泛的应用。
通俗解读 非专业人士也能看懂
想象你在一个大厨房里做饭,厨房里有很多食材和工具。每次你用到某个食材或工具,都把它放到一个特别的架子上。这个架子可以记住你用过的东西,但不会把所有东西都堆在一起,而是用标签标记每个食材或工具。等你需要用某个食材时,你可以根据标签找到它。这样,即使你忘记了某个食材放在哪里,也可以通过标签快速找到。这个系统让你在做大餐时,不会被乱糟糟的东西搞糊涂,也能随时找到需要的材料。它就像一个聪明的记忆助手,帮你整理和检索所有用过的东西,让做饭变得更轻松、更高效。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,你需要记住很多事情,比如任务目标、敌人位置和你之前的行动。每次你完成一部分任务,你会把重要的线索写在一张卡片上,放在一个特别的抽屉里。每次你需要做新任务时,你可以根据当前的情况,从抽屉里抽出几张卡片,快速找到之前的线索,帮你做出正确的决定。这就像有个聪明的助手帮你整理记忆,只在你需要时帮你找到重要的线索,而不是一直把所有事情都装在脑袋里。这样,你就能更快、更聪明地完成游戏中的挑战!
原文摘要
Long-horizon agentic reasoning requires large language models to act over long interaction histories containing thoughts, tool calls, observations, and partial conclusions. The challenge is not merely that these histories grow long, but that information needed for the current decision may be scattered across distant steps and only become relevant later. Existing approaches address this difficulty by truncating the interaction history, compressing it into shorter surrogates, or retrieving selected parts of it for reuse, but they do not explicitly model how access to past interaction should adapt to the agent's evolving state. We instead cast long-horizon reasoning as a problem of state-adaptive memory. To this end, we propose State-Adaptive Memory~(SAM), a standalone framework that consolidates ongoing interaction into compact memory cues while preserving raw trajectory pages for intent-driven recall. These cues are not treated as replacements for history; rather, they serve as lightweight handles that allow the agent to reconstruct temporally distant information according to its current needs, without retraining the underlying backbone. We further optimize the memory module through expert-guided supervision and reinforcement learning, aligning it with trajectory-level utility. Across BrowseComp, BrowseComp-ZH, WideSearch, and HLE, SAM consistently outperforms strong baselines over diverse agent backbones. Our results suggest that explicit memory modeling provides a simple and effective foundation for long-horizon agentic reasoning.