Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

TL;DR

GAMER通过动作中心图模型结合TD学习,提升推理效率20.81%。

cs.AI 🔴 高级 2026-07-30 55 次浏览
Xu Zheng Chaohao Lin Zhuomin Chen Weijieying Ren Haifeng Chen Wei Cheng Dongsheng Luo
推理扩展 记忆机制 图结构 强化学习 LLM优化

核心发现

方法论

GAMER框架将历史推理转化为动态动作中心图,利用双流TD学习估算动作节点的正负价值,分离记忆与推理。通过构建有向图,节点代表动作,边代表时间依赖关系。采用TD更新机制,正向Q+估算成功概率,Q−追踪失败风险,优化搜索路径。推理时,利用图中的高价值动作引导LLM,低价值动作作为软屏障,有效减少冗余搜索,节省token和计算成本。

关键结果

  • 在多个基准测试中,GAMER在成功率和进展率上分别比基线提升20.81%和6.17%,在AlfWorld任务中成功率提升53.17%。在不同LLM模型(Qwen、Llama、GPT-4)上均表现优越,平均成功率达40.30%。相较于传统无记忆方法,显著提高推理效率和资源利用率。
  • 通过双流TD机制,模型能同时学习高成功概率和避免高风险动作,有效引导搜索,减少无效路径,提升推理速度。在多任务环境中,GAMER展现出良好的泛化能力和鲁棒性。

研究意义

该研究突破了推理时刻扩展的瓶颈,将记忆机制从被动存储转变为主动引导,极大提升大规模语言模型在复杂任务中的推理能力。通过图结构和强化学习的结合,为智能代理提供了高效的决策支持方案,有望推动自动化推理、规划和决策系统的发展,降低计算成本,增强模型的持续学习能力。

技术贡献

提出动作中心图(Action-Centric Graph)模型,结合双流TD学习估算动作价值,实现在推理过程中动态引导搜索。将记忆从传统的存储转为结构化图,解耦推理与记忆机制,提供低成本、细粒度的知识表示。理论上证明了该方法的第一阶随机优势,显著提升推理效率。技术创新在于将强化学习与图结构结合,优化推理路径,突破传统推理的stateless限制。

新颖性

首次将动态动作图与双流TD学习结合应用于推理扩展,突破了现有LLM推理的stateless局限,实现记忆的主动引导。不同于仅依赖LLM推理能力的记忆机制,GAMER通过强化学习动态调整动作价值,提供结构化的搜索引导,具有较强创新性。

局限性

  • 当前模型依赖于历史轨迹的质量,若历史数据不足或偏差,可能影响推理效果。对复杂环境中的长序列依赖处理仍有限,需进一步优化图的扩展与更新机制。
  • 在极端动态或高风险任务中,低价值动作的误判可能导致偏差,影响搜索效率。模型训练和推理过程中的计算成本仍较高,需平衡效率与效果。
  • 对多模态信息融合和实时更新的支持有限,未来需结合多源数据增强图的表达能力。

未来方向

未来将结合多模态信息,扩展图的表达能力,提升复杂环境中的推理效果。探索自适应图结构更新机制,增强模型对动态环境的适应性。同时,结合元学习和迁移学习,提升模型在新任务中的快速适应能力,推动智能代理的自主学习与持续优化。

AI 总览摘要

随着大规模语言模型(LLMs)在推理和决策中的突破,推理时刻扩展(Inference-Time Scaling)成为提升复杂任务表现的关键技术。然而,现有方法多依赖于stateless的推理机制,导致重复搜索和资源浪费,难以应对持续环境中的长序列任务。本文提出GAMER(基于动作中心图的记忆与推理框架),通过构建动态动作图,将历史推理经验结构化,结合双流TD学习估算动作的成功和失败价值,从而引导搜索路径。该机制实现了记忆的主动引导,显著减少冗余搜索,提高推理效率。实验证明,在多个基准任务中,GAMER在成功率和进展率上分别超越传统方法20.81%和6.17%,在AlfWorld任务中成功率提升超过50%。该方法不仅增强了模型的推理能力,也为智能代理提供了高效的决策支持。未来,结合多模态信息和动态图结构,GAMER有望在更复杂、多变的环境中实现自主学习和持续优化,推动人工智能向更高层次发展。

深度分析

研究背景

近年来,LLMs在自然语言理解、推理和规划方面取得巨大突破,代表模型如GPT-4、Llama、Gemma等在多任务环境中展现出强大能力。Chain-of-Thought(CoT)和Tree-of-Thoughts(ToT)等推理扩展技术,通过显式路径构建提升推理深度。然而,这些方法多依赖于stateless的推理机制,每次任务都从零开始,导致大量重复搜索,资源消耗巨大。为解决这一问题,记忆增强和知识图谱等机制被提出,但大多仍作为被动存储手段,未能有效引导推理路径。本文的创新在于将历史推理经验结构化为动态动作图,结合强化学习实现主动引导,极大改善了推理效率和资源利用。

核心问题

现有推理扩展技术在多步骤复杂任务中表现有限,主要原因是缺乏持续记忆机制,导致每次推理都从头开始,重复探索已知路径。尤其在动态环境中,静态存储的知识无法实时指导决策,造成时间和计算资源的浪费。如何在保持模型推理能力的同时,动态利用历史经验,减少冗余搜索,成为核心难题。这不仅关系到模型的效率,也影响其在实际应用中的可扩展性和鲁棒性。

核心创新

本研究提出动作中心图(Action-Centric Graph),将历史推理轨迹抽象为有向图,节点代表动作,边代表时间依赖关系。结合双流TD学习,分别估算动作的成功价值Q+和风险价值Q−,实现对动作的细粒度评估。推理时,利用高价值动作引导搜索,低价值动作作为软屏障,有效缩小搜索空间。该机制突破了传统stateless推理的限制,实现记忆的主动引导,提升推理效率。理论上,证明了该方法在概率分布上的第一阶随机优势,确保更高的成功概率和资源利用效率。

方法详解

  • �� 构建历史轨迹图:将多条推理轨迹中的动作抽象为节点,边表示时间顺序关系,形成有向图。• 价值估算:利用双流TD学习,Q+追踪成功概率,Q−追踪失败风险,动态更新节点价值。• 推理引导:在新任务中,利用图中的高价值动作作为建议,低价值动作作为避免项,通过提示引导LLM生成动作。• 图的动态更新:根据新轨迹不断调整节点价值,增强模型适应性。• 结合历史最优轨迹,作为少样本参考,提升推理质量。• 采用软屏障机制,提前剪枝潜在失败路径,节省计算资源。

实验设计

在AlfWorld、SciWorld、PDDL和Tool等多任务基准上评估,比较GAMER与Vanilla、SFS、A-Mem等多种方法。指标包括成功率、进展率和token消耗。采用不同LLM(Qwen、Llama、GPT-4)进行测试,最大推理步数设为10,样本数为64。结果显示,GAMER在所有任务中均优于对比方法,成功率平均提升20.81%,进展率提升6.17%。此外,分析不同推理轮次的性能变化,验证了方法的良好扩展性和稳定性。

结果分析

GAMER在多项任务中实现显著性能提升,成功率最高达40.30%,比传统无记忆方法提升20%以上。在AlfWorld任务中,成功率从26.31%提升至40.30%。通过引入动作价值引导,有效减少无效搜索路径,显著降低token消耗,提升推理速度。多模型、多任务环境下,表现稳定,验证了其泛化能力。实验还展示了不同推理轮次下的性能逐步提升,证明了方法的可扩展性。

应用场景

该技术适用于需要复杂推理和规划的自动化系统,如智能助手、机器人导航和自动编程。通过结构化记忆和主动引导,系统能更高效地解决长序列、多步骤任务,降低计算成本,增强自主学习能力。未来可结合多模态信息,应用于动态环境中的实时决策和持续学习场景,推动智能代理的广泛应用。

局限与展望

模型依赖于历史轨迹的质量,若数据偏差或不足,可能影响推理效果。复杂环境中的长依赖关系处理仍有限,图的扩展和更新机制需优化。高风险任务中,误判低价值动作可能导致偏差。计算成本仍较高,需平衡效率与效果。未来需增强多模态融合和动态更新能力,以应对更复杂的场景。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做菜,每次你都根据之前的经验选择食材和步骤。传统的方法是每次都从头开始,查资料、试错,浪费时间。而GAMER就像有一本厨房经验图,记录了你以前用过的食材和做法,知道哪些组合成功率高,哪些容易出错。每次你准备做菜时,先看这本图,优先选择成功的步骤,避免那些失败的组合。这样一来,你做菜的速度更快,成功率也更高。这就像给你的厨艺加了个聪明的导航系统,让你不用每次都重新摸索。它通过学习过去的经验,不断优化未来的选择,变得越来越厉害。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每次你都要自己探索路线,有时候会走冤枉路,浪费时间。传统的方法就像每次都从头开始,没有记忆,只能靠自己试错。而GAMER就像有个聪明的助手,记住你以前走过的路,知道哪些路线成功,哪些会让你失败。每次你要走新路时,它会告诉你哪些是好路线,哪些要避开。这样你就不用浪费时间试错,可以更快找到胜利的方法。这个助手不断学习你的经验,帮你变得更厉害。它就像一个聪明的导航系统,让你在游戏中变得更快、更聪明!

原文摘要

Recent advancements in inference-time scaling have significantly unlocked the complex reasoning capabilities of Large Language Models~(LLMs). However, for agents, these approaches suffer from a critical inefficiency, operating in a stateless manner and engaging in redundant search processes. Existing memory mechanisms largely rely on the reasoning capabilities of LLMs, leading to prohibitive computational costs. In this paper, we propose a novel framework, \textit{GAMER}~(Graph-based Action-centric Memory with Episodic Reasoning), that bridges the gap between inference scaling and episodic memory. Our approach models historical reasoning as a dynamic \textit{Action-Centric Graph}. By decoupling the memory mechanism from LLMs, our method can save token/money usage by providing less memory context than memory mechanism baselines. To extract knowledge from the graph effectively, we use a dual-stream Temporal Difference learning mechanism to estimate the positive~(suggestion) and negative~(avoidance) value of action nodes based on past successes and failures. During the inference phase, this learned value function optimizes decision-making bi-directionally, so that positive values provide action suggestions, while negative values indicate high-risk actions. By performing efficient searches on the graph, our method significantly improves the efficiency of inference scaling. Experiments on multiple benchmarks demonstrate that \textit{GAMER} achieves superior performance by \textbf{20.81\%/6.17\%} for success/progress rate compared to vanilla baselines.

cs.AI