MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games

TL;DR

MEMO通过记忆增强模型上下文优化,提升多轮多智能体LLM游戏的胜率从25.1%到49.5%,显著降低方差。

cs.AI 🔴 高级 2026-03-10 36 次浏览
Yunfei Xie Kevin Wang Bobby Cheng Jianzhu Yao Zhizhou Sha Alexander Duffy Yihan Xi Hongyuan Mei Cheston Tan Chen Wei Pramod Viswanath Zhangyang Wang
多智能体 大模型 自我对弈 上下文优化 鲁棒性

核心发现

方法论

本文提出MEMO框架,结合持续记忆库和探索机制,通过自我对弈优化推理上下文。记忆库存储结构化洞察,作为先验引导后续轮次。探索采用Tournament式提示演化,利用TrueSkill进行不确定性选择,并通过优先重放重访关键状态。实验证明在五个文本游戏中,MEMO显著提升模型胜率,GPT-4o-mini从25.1%提升至49.5%,Qwen-2.5-7B-Instruct从20.9%提升至44.3%,且方差降低7倍。

关键结果

  • 在五个文本游戏中,MEMO提升GPT-4o-mini的平均胜率从25.1%到49.5%,在Qwen-2.5-7B-Instruct中从20.9%到44.3%,每任务使用2000自我对弈游戏,远少于RL方法所需的38,000次。
  • 方差显著下降,模型排名更稳定,特别在谈判和不完美信息游戏中表现优异。MEMO在鲁棒性和样本效率方面优于传统prompt优化方法。
  • 在完美信息游戏中,强化学习仍表现优越,但MEMO在复杂、多轮互动中展现出更强的适应性和稳定性。

研究意义

该研究揭示多智能体LLM游戏性能受上下文敏感性影响巨大,强调通过记忆增强的上下文优化可显著改善模型的鲁棒性和效率。这为未来多轮、多智能体交互系统设计提供新思路,推动模型在复杂环境中的应用落地。特别是在对话、谈判等任务中,MEMO的策略可实现更稳定、更高效的表现,有助于解决模型泛化和可重复性难题。

技术贡献

技术创新在于引入持续记忆库与探索机制的结合,突破传统prompt静态优化的局限。MEMO通过反思和结构化洞察,构建持久知识库,结合TrueSkill不确定性采样和优先重放,有效提升样本利用率和策略稳定性。其无需模型参数更新,便实现多轮优化,提供理论保证和工程实现的双重突破。

新颖性

本研究首次系统性结合记忆增强与探索机制,用于多轮多智能体LLM游戏的上下文优化。相较于单纯prompt优化或RL,MEMO实现跨轮次知识积累,显著降低方差,提升样本效率,展现出全新的多轮交互优化范式。

局限性

  • 当前方法依赖于结构化洞察的质量,若反思生成偏差,可能影响效果。
  • 在极端复杂或长时序任务中,记忆库可能膨胀,需设计更高效的压缩策略。
  • 模型在某些策略变化极大的游戏中仍存在适应性不足的问题。

未来方向

未来将探索多模态记忆机制,结合视觉或声音信息,扩展到更复杂的交互场景。同时,优化记忆管理策略,提升大规模应用的效率和鲁棒性,推动多智能体系统的实际部署。

AI 总览摘要

多轮多智能体大模型(LLM)在游戏评估中表现出高度不稳定性,早期微小偏差在多轮交互中不断放大,导致胜率估计偏差和排名不可靠。传统prompt设计和自动优化技术难以应对路径依赖和稀有状态的反复出现。本文提出MEMO(Memory-augmented MOdel context optimization)框架,通过结合持续记忆库和探索机制,有效缓解了这一问题。

MEMO利用反思机制,从自我对弈轨迹中提取结构化洞察,存储于持久记忆库中,作为后续轮次的先验信息。同时,采用Tournament式提示演化,结合TrueSkill的不确定性采样和优先重放,动态优化推理上下文。实验在五个文本游戏中验证,结果显示MEMO将GPT-4o-mini的平均胜率从25.1%提升至49.5%,Qwen-2.5-7B-Instruct从20.9%提升至44.3%,且模型表现更稳定,方差降低7倍。

这些成果表明,通过上下文优化,模型在复杂多轮、多智能体环境中的鲁棒性和效率得到了显著提升。特别是在谈判和不完美信息游戏中,MEMO展现出优越性能。未来,结合多模态信息和更高效的记忆管理,有望推动多智能体系统在实际应用中的广泛部署。

深度分析

研究背景

近年来,大型语言模型(LLMs)在静态基准测试中表现优异,但在多轮、多智能体交互环境中表现出明显不稳定性。早期偏差在多轮中不断放大,导致胜率估计偏差,模型排名不稳定。传统prompt设计多为静态或手工调优,难以适应路径依赖和稀有状态。自动prompt优化方法虽能动态调整,但缺乏跨轮次记忆,效果受限。强化学习(RL)虽能优化策略,但样本成本高,且在多智能体环境中表现不稳定。本文旨在通过引入记忆增强机制,改善多轮交互中的鲁棒性和效率。

核心问题

核心问题在于多轮、多智能体环境中模型输出的偏差会逐轮累积,导致评估不稳定。现有方法难以在长时序中保持策略一致性,且缺乏有效的知识积累机制。如何在不更新模型参数的前提下,通过优化推理上下文实现策略改进,成为亟待解决的问题。特别是在稀有状态和关键决策点,缺乏机制确保模型能反复访问和利用关键经验,限制了模型的表现和稳定性。

核心创新

本研究提出MEMO框架,创新点包括:1)引入持续记忆库,存储结构化洞察,作为跨轮次的知识积累机制;2)结合反思机制,从自我对弈轨迹中提取策略洞察,提升上下文质量;3)采用Tournament式提示演化,结合TrueSkill不确定性采样,动态优化推理上下文;4)引入优先重放,重访稀有或关键状态,增强探索能力。这些创新共同实现了在无需模型参数更新的情况下,提升多轮多智能体游戏中的表现和稳定性。

方法详解

  • �� 反思与记忆:在每轮自我对弈后,模型分析轨迹,提取策略洞察,存入持久记忆库。• 上下文优化:维护候选上下文池,通过自我对弈评价性能,采用TrueSkill模型评估策略技能,选择低不确定性高胜率的上下文。• 探索机制:利用Tournament式提示演化,结合随机提案和记忆增强的提示更新,探索多样策略。• 优先重放:存储关键状态轨迹,偏向稀有状态,重访以丰富经验。• 迭代优化:多轮生成候选上下文,逐步提升模型表现,直至收敛。• 评估指标:在五个文本游戏中,使用2000次自我对弈,衡量胜率提升和方差降低。

实验设计

采用五个文本游戏(如谈判、Kuhn扑克、不完美信息和完美信息游戏)进行评估。对比静态prompt、prompt优化和RL方法,使用GPT-4o-mini和Qwen-2.5-7B-Instruct模型。每个任务进行多轮自我对弈,统计胜率和方差,分析不同方法的样本效率和稳定性。参数设置包括候选池大小、优化轮次、TrueSkill参数和重放策略。通过ablation验证记忆库和探索机制的贡献。

结果分析

MEMO在五个文本游戏中均优于对比方法,胜率提升显著,平均从25.1%到49.5%,在Qwen模型中从20.9%到44.3%。方差降低7倍,模型排名更稳定。在样本效率方面,MEMO只用2000次自我对弈,效果优于RL方法所需的38000次。记忆库中的结构化洞察帮助模型学习到通用策略,提升复杂环境中的适应性。 Ablation研究显示,记忆增强和探索机制缺一不可,缺少任何一环都影响性能。

应用场景

该方法适用于多轮对话系统、自动谈判、策略游戏等场景,尤其在需要长时记忆和策略稳定性的应用中。通过优化推理上下文,减少模型调优成本,提升交互质量。未来可结合多模态信息,扩展到机器人控制、虚拟助手等领域,推动智能系统的自主学习和适应能力。

局限与展望

当前方法依赖于反思生成的质量,若反思偏差会影响效果。记忆库可能膨胀,需设计高效压缩策略。对极端复杂或长时序任务,记忆管理和探索效率仍有待提升。此外,模型在某些策略变化剧烈的游戏中表现有限,未来需结合更强的探索机制和多模态信息增强。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,准备一道复杂的菜肴。每次尝试后,你会记下哪些调料搭配得好,哪些步骤容易出错。这些记忆帮助你下一次做得更好。MEMO就像这个厨师,利用过去的经验(记忆库)不断优化做菜策略。它在每次“试菜”后总结经验,存入记忆库,然后用这些经验指导下一次的调味和步骤选择。通过不断反思和积累,厨师变得越来越擅长做出美味佳肴。类似地,MEMO在多轮游戏中不断学习,优化策略,使模型表现更稳定、更强大。它不仅记住了关键的经验,还能在不同场景中灵活应用,就像厨师根据不同食材调整菜谱一样。

简单解释 像给14岁少年讲一样

想象你在玩一款需要多次决策的游戏,比如象棋。每次走棋后,你会记下哪些走法赢得多快,哪些走法会让你输。慢慢地,你学会了哪些策略最有效。MEMO就像一个聪明的朋友,它会在每次游戏后帮你总结经验,把重要的走法记下来,然后在下一次游戏中用这些经验帮你做出更好的决定。它还会不断尝试不同的策略,看看哪些效果最好,就像你试着用不同的招数一样。这样一来,你的游戏水平就会越来越高,而且每次玩得都更稳,不会轻易输掉。这种方法可以让电脑在复杂的对战中变得更聪明、更可靠,就像你变成了象棋高手一样。

术语表

Memory Bank (记忆库)

存储结构化洞察的持久存储,用于跨轮次积累经验,指导模型策略。In this paper, it stores insights from self-play trajectories.

用于存放反思生成的策略洞察,支持跨轮次优化。

TrueSkill (真实技能评分)

一种贝叶斯模型,用于评估策略或模型的技能水平和不确定性。In MEMO,用于选择稳定高胜率的上下文。

评估不同上下文的策略效果,指导优化选择。

Prioritized Replay (优先重放)

根据状态稀有度或重要性,偏向重访关键状态的经验重放机制。In MEMO,用以增强探索和学习。

重访稀有状态,丰富模型经验,提升策略多样性。

Prompt Optimization (提示优化)

通过自动或手工调整模型输入提示,以改善模型输出质量。In this work,结合反思和探索持续优化上下文。

提升模型在多轮交互中的表现和稳定性。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或长时序任务中高效管理记忆库,避免膨胀和信息冗余。
  • 2 在多模态环境中,结合视觉、声音等多源信息提升记忆和策略优化的效果。

原文摘要

Multi-turn, multi-agent LLM game evaluations often exhibit substantial run-to-run variance. In long-horizon interactions, small early deviations compound across turns and are amplified by multi-agent coupling. This biases win rate estimates and makes rankings unreliable across repeated tournaments. Prompt choice worsens this further by producing different effective policies. We address both instability and underperformance with MEMO (Memory-augmented MOdel context optimization), a self-play framework that optimizes inference-time context by coupling retention and exploration. Retention maintains a persistent memory bank that stores structured insights from self-play trajectories and injects them as priors during later play. Exploration runs tournament-style prompt evolution with uncertainty-aware selection via TrueSkill, and uses prioritized replay to revisit rare and decisive states. Across five text-based games, MEMO raises mean win rate from 25.1% to 49.5% for GPT-4o-mini and from 20.9% to 44.3% for Qwen-2.5-7B-Instruct, using $2,000$ self-play games per task. Run-to-run variance also drops, giving more stable rankings across prompt variations. These results suggest that multi-agent LLM game performance and robustness have substantial room for improvement through context optimization. MEMO achieves the largest gains in negotiation and imperfect-information games, while RL remains more effective in perfect-information settings. All code is open-source and available here: https://github.com/openverse-ai/MEMO

cs.AI