MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory
MESA按查询选择并融合记忆结构,在AMA-Bench达65.1%,少用41%证据词。
核心发现
方法论
MESA将每条轨迹τ构建为五种独立视图:摘要、时间存储、知识图谱、向量数据库和原始情节轨迹。选择器Sρ(q,c)输出非空二进制子集z∈{0,1}5,共31种组合;系统调用对应接口Γk检索证据并Compose,再交给冻结的答案模型F。训练不依赖子集标签,而采用先验引导的Harness优化与UCB调度,从答案级反馈学习选择策略。
关键结果
- 在AMA-Bench的2,496个问题上,Qwen3-32B作为答案模型时,MESA总体准确率65.1±0.8%,较AMA-Agent的56.6%高8.5个百分点,较长上下文基线52.6%高12.5个百分点。
- MESA在Recall、State Updating、State Abstraction上分别达69.2%、65.8%、57.8%;在Causal Inference上为63.6%,略低于AMA-Agent的65.0%,显示收益并非所有能力均匀。
- MESA每查询约11.0k证据词,All-structure约18.7k,减少41%,同时准确率为65.1%对63.7%。Gemma-4-31B上总体69.4%,高于最强基线6.4个百分点;LoCoMo F1为49.0%。
研究意义
论文将智能体记忆读取从“读全部”或“选一个”推进为查询自适应的组合式访问。它回应了长轨迹中的证据埋藏、结构互补、上下文噪声与成本控制问题,并表明记忆结构的最佳组合随领域和问题能力变化。对研究而言,这建立了结构级动态选择的明确问题定义;对工业系统而言,它提供了在冻结答案模型下改善准确率并降低上下文费用的工程路径。
技术贡献
核心技术是将记忆表示与专用访问接口共同定义为结构,并在31个非空组合上进行策略决策。目标函数为J_D(ρ)-λC_D(ρ),显式平衡答案质量与证据词成本。优化器以全结构策略ρall初始化,使用LLM proposer生成利用、探索和错误修复候选;UCB(a)=Ĵval(a)+β√(log(N+2)/(na+1))调度先验方向,从稀疏答案反馈中进行可执行策略搜索。
新颖性
相较Hindsight的固定多路融合、StructRAG和Learning-to-Route的单结构选择,以及S3Mem在统一表示内选择证据,MESA保留异构结构及其访问方式,学习查询相关的互补子集。其新意不只是多索引,而是用端到端答案反馈优化“结构组合”这一离散动作空间。
局限性
- 选择器依赖先验方向、LLM提案和30轮搜索;答案级评价信号稀疏,难以精确归因某一结构的贡献。
- 实验主要在AMA-Bench真实子集和LoCoMo上进行,记忆构建、检索器及答案模型大多固定,跨模型、跨语言和动态在线轨迹的泛化仍待验证。
- 准确率与成本中的λ、探索系数β及提示词细节置于附录,复现实验对实现配置可能较敏感。
未来方向
未来可研究可微或因果归因式结构选择、在线增量记忆与不确定性估计,并让选择器同时决定检索深度、证据排序和融合方式。还应扩展到更多轨迹环境、语言和开放模型,报告延迟、GPU成本、隐私风险及长期记忆污染,以验证其生产可靠性。
AI 总览摘要
长时程智能体会积累数百步交错的思考、行动、观察和工具调用。关键证据可能埋在很久以前;直接输入完整轨迹昂贵且噪声大,压缩又可能删除细节。现有多记忆系统通常固定读取全部结构,或把查询路由到单一结构,分别造成冗余和证据无法组合。
MESA提出结构级动态选择:为同一轨迹建立摘要、时间存储、知识图谱、向量数据库和原始情节五种视图,选择器根据查询输出31种非空组合之一,检索并融合所选证据,再交给冻结答案模型。它通过先验引导的Harness优化产生可执行选择策略,并用UCB在有效方向与未探索方向间平衡搜索;目标同时考虑准确率和证据词成本。
在AMA-Bench的2,496个问题上,Qwen3-32B下MESA达到65.1%,比AMA-Agent高8.5个百分点,比长上下文方案高12.5个百分点;证据词从18.7k降至11.0k,减少41%。Gemma-4-31B下为69.4%,LoCoMo上F1为49.0%。结果支持一个重要结论:最佳记忆通常不是一个结构,也不是全部结构,而是随任务变化的互补组合。局限在于弱监督、固定组件和有限数据集,未来需验证在线、跨域及成本鲁棒性。
深度分析
研究背景
MemGPT通过分页管理工作上下文,Generative Agents和Reflexion通过反思形成长期记忆,HippoRAG2、Hindsight等进一步使用图、向量或多路索引。然而智能体轨迹不同于普通文档:推理、动作、观察和工具输出具有时间与因果关系。摘要保留全局语境但丢失步骤,向量检索可能命中语义相近的错误片段,图缺少步骤顺序,原始轨迹又充满噪声。
核心问题
给定轨迹τ、查询q和上下文c,系统需从五个结构中选择非空子集z,而非固定读全或只选一个。共有31种组合。难点是互补证据提升召回,冗余证据增加干扰和成本;同时没有真实子集标签,只能依据最终答案的稀疏反馈进行信用分配。
核心创新
第一,提出结构级动态选择的正式问题。第二,保留五种异构表示及其专用接口,而非压成统一格式。第三,用答案级反馈优化可执行选择器,并以J−λC评价质量—成本折中。第四,引入先验方向和UCB调度,分别提供搜索偏置与探索机制,突破固定融合和单路由的表达限制。
方法详解
- �� 构建:对轨迹τi应用Bk,得到Mi={Mᵢ(k)},包括Summary、Temporal、Graph、Vector、Raw。
- �� 决策:Sρ(qi,ci)输出z∈{0,1}5且||z||0≥1。
- �� 访问:调用所选Γk并通过Compose形成Ei(z)。
- �� 回答:冻结模型F输出ŷ=F(q,E)。
- �� 学习:以ρall初始化,LLM proposer按先验方向生成利用、探索和修复候选;Fit训练集后在验证集评分。
- �� 调度:UCB(a)=Ĵval(a)+β√[log(N+2)/(na+1)],最终选择最高Jval−λC策略。
实验设计
AMA-Bench使用208条轨迹、2,496问,覆盖Web、Open-World QA、Text2SQL、Software、Gaming、Embodied AI及四类记忆能力;LoCoMo使用1,540个非对抗问题。基线包括Long-context、BM25、Qwen3-Emb-4B、MemGPT、HippoRAG2、Mem0、MemoRAG、A-Mem、EMem、Hindsight和AMA-Agent。AMA采用LLM judge,LoCoMo采用F1;AMA按2:2:6分割,五次重复,搜索30轮。
结果分析
Qwen3-32B下MESA为65.1%,AMA-Agent为56.6%,长上下文为52.6%。四类能力中三类最佳:Recall 69.2%、State Updating 65.8%、State Abstraction 57.8%;因果推理63.6%。Gemma-4-31B下MESA为69.4%,AMA-Agent为63.0%。领域提升在Software达15.5%、Text2SQL达8.9%。LoCoMo中MESA F1为49.0,高于MemGPT 46.8和EMem 47.2。
应用场景
适用于软件工程代理的错误定位、Text2SQL的状态与精确字段核验、网页操作的步骤追踪、工具型问答及具身任务。部署前需离线构建五类记忆、固定检索接口和答案模型,并用代表性轨迹优化选择器。其直接价值是降低上下文token、延迟与推理费用,同时减少无关证据干扰。
局限与展望
方法假设五类结构和访问器已预先设计,无法自动发现新结构;LLM proposer与UCB搜索需要验证集、GPU和多轮评估。因果推理仍落后AMA-Agent,说明组合选择未必能解决跨步骤因果链。论文未充分报告延迟、构建成本、λ/β敏感性、隐私和记忆污染;未来应加入在线学习、可解释归因、动态预算和更多真实环境。
通俗解读 非专业人士也能看懂
把智能体想成一名调查员,手边有五个不同的档案柜:摘要柜告诉你案件大意,时间柜按日期排列,关系柜连接人物和物品,搜索柜寻找相似片段,原始记录柜保存每个动作。只查一个柜,可能漏掉关键线索;五个全查,又会拿来大量重复资料。
MESA像一位会看问题的档案管理员。面对“哪个步骤最先发现问题无法重现?”它可能先查时间柜和原始记录柜;面对“这个错误与谁有关?”则加入关系柜。管理员不是凭固定规则工作,而是根据过去回答是否正确,逐渐学会什么问题该组合哪些柜子。
论文在AMA-Bench上测试了2,496个问题。MESA准确率为65.1%,高于强基线AMA-Agent的56.6%,同时证据文字减少41%。这说明聪明地挑资料,往往比把所有资料塞给回答者更有效。
简单解释 像给14岁少年讲一样
想象你在游戏里玩了几百步,突然有人问:“你第一次发现这个Bug不能稳定复现,是哪一步?”答案可能藏在很久以前。把整段游戏录像全部重看很慢,而且会被大量无关画面淹没;只看最后一幕,又可能错过真正的线索。
MESA给智能体准备了五种“记忆工具”:剧情简介、按时间排列的记录、人物和物品关系图、相似内容搜索,以及完整操作日志。它不会每次都全部打开,也不会永远只用一个,而是先看问题,再挑几个最有用的工具拼起来。
它还会像做题后订正一样学习:如果某种工具组合答对了,就更愿意尝试类似组合;如果答错,就修改策略。UCB方法帮助它既利用好经验,也尝试没怎么用过的办法。
结果很亮眼:在AMA-Bench上,MESA达到65.1%,AMA-Agent是56.6%;证据文字还少了41%。不过它仍可能在复杂因果问题上失误,而且学习过程需要很多测试。
术语表
Long-horizon agent memory(长时程智能体记忆)
保存跨越大量交互步骤的信息,使智能体能回答历史相关问题。它必须同时处理时间、因果和工具输出。
论文研究如何从长轨迹中选择证据。
Memory structure(记忆结构)
一种记忆表示及其专用访问接口的统一组合。不同结构保留和暴露的信息不同。
MESA使用Summary、Temporal、Graph、Vector、Raw五类结构。
Structure-level selection(结构级选择)
在查询层面选择一个或多个记忆结构,而非仅选择单条记忆。其动作空间包含31个非空子集。
这是MESA的核心问题定义。
Harness optimization(Harness优化)
直接搜索可执行的系统策略或程序,而不只优化文字提示。它适合组合组件和控制流程。
MESA用LLM proposer生成选择器候选。
UCB(上置信界)
一种平衡利用与探索的决策规则,既偏好历史表现好的方向,也奖励尝试次数少的方向。
UCB调度不同先验搜索方向。
AMA-Bench
包含长时程智能体轨迹及专家问题答案的数据集。论文使用208条轨迹和2,496个问题。
主要实验与消融分析平台。
开放问题 这项研究留下的未解疑问
- 1 如何从答案级奖励准确判断某个结构的边际贡献仍未解决;需要更细粒度的反事实评价或可解释信用分配。
- 2 固定五结构是否适用于不同语言、模型和环境尚不清楚;需要跨域、在线和长期分布漂移实验。
- 3 论文强调准确率与token成本,但延迟、GPU能耗、隐私及记忆污染的综合代价仍缺少系统测量。
应用场景
近期应用
软件工程代理
为调试代理离线建立摘要、时间、图和原始日志索引。查询Bug首次出现位置时动态组合时间与原始记录,查询依赖关系时加入知识图谱,可减少上下文并提高定位可靠性。
企业知识与工具问答
将操作日志、实体关系、时间事件和语义片段分别存储。面对审计、状态更新或流程追踪问题,MESA按任务挑选结构,降低检索噪声和大模型输入费用。
远期愿景
自适应长期记忆操作系统
未来智能体可在线学习不同任务的记忆访问策略,联合决定存储格式、检索深度、证据排序和预算分配。主要障碍是安全、隐私、稳定性及跨任务迁移。
原文摘要
Long-horizon agents accumulate trajectories spanning hundreds of interleaved reasoning, action, and observation steps, where answering a query may depend on evidence buried far back in the history. External memory stores such trajectories as structured representations, yet each structure provides a distinct and incomplete view. Existing multi-memory systems either read a fixed set of structures for every query, inflating context and introducing noise, or route each query to a single structure, preventing the composition of complementary evidence. A controlled analysis on AMA-Bench shows that the optimal memory configuration is typically neither a single structure nor the full union, but a tailored composition of multiple structural memories that varies with query and task demands. Motivated by these findings, we formulate structure-level dynamic selection: selecting and fusing a query-adaptive subset from a library of specialized memory structures. We propose MESA (a Multi-structure Evidence Selection framework for long-horizon Agent), which builds five complementary structure views of each trajectory and learns from end-to-end answer-level feedback to select and fuse a query-specific subset for a frozen answer model. To learn under this weak supervision, MESA employs harness optimization with prior-guided search and UCB-guided scheduling to balance exploration and exploitation. On AMA-Bench, MESA outperforms the strongest baseline by 8.5% while using 41% fewer evidence tokens than the all-structure alternative.