DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

TL;DR

DMV-Bench通过视觉记忆测试多模态智能体,DualMem方法在长链任务中表现优异。

cs.CV 🔴 高级 2026-06-26 7 次浏览
Yujin Tang Chenming Shang Ruize Xu Nikhil Singh
视觉记忆 多模态智能体 长时记忆 双编码理论 基准测试

核心发现

方法论

研究采用DMV-Bench基准测试,模拟真实电商环境,包含1,000种产品变体。每个产品图像中嵌入独特的视觉提示,智能体需在多次购物会话后回忆这些提示。通过双编码理论,提出DualMem架构,结合视觉和语言编码。

关键结果

  • DualMem在DMV-Bench上表现优异,成功率达到81.2%,显著优于仅使用文字的基线模型。
  • 在不同模型和会话链长度上,DualMem均优于其他多模态记忆系统。
  • 即使调整记忆库大小和编码位置偏差,DualMem的优势依然存在。

研究意义

该研究首次系统性地分析了多模态智能体的视觉记忆能力,填补了视觉记忆在长时任务中的研究空白。通过DMV-Bench,研究者可以更好地理解智能体在复杂环境中的记忆表现,推动智能体设计的进步。

技术贡献

提出了DualMem架构,利用双编码理论结合视觉和语言信息,显著提升了智能体的记忆能力。与现有的多模态记忆系统相比,DualMem在信息保留和检索方面表现出色。

新颖性

DMV-Bench是首个专注于视觉记忆的交互式基准测试,DualMem架构首次将双编码理论应用于智能体记忆系统,提供了新的研究视角。

局限性

  • DMV-Bench目前仅限于电商环境,可能不适用于其他复杂场景。
  • DualMem在处理极长会话链时,性能下降明显。

未来方向

未来研究可以扩展DMV-Bench的应用场景,并优化DualMem在不同环境下的适应性。

AI 总览摘要

在多模态智能体的研究中,视觉记忆一直是一个被忽视的领域。现有的基准测试主要关注文本记忆,而DMV-Bench通过在电商环境中嵌入视觉提示,首次系统性地分析了视觉记忆的表现。

研究提出了DualMem架构,结合视觉和语言编码,通过双编码理论提升智能体的记忆能力。在DMV-Bench的测试中,DualMem在长链任务中表现优异,成功率显著高于基线模型。

这一研究不仅填补了视觉记忆研究的空白,还为未来智能体的设计提供了新的方向。尽管目前的测试环境有限,但DMV-Bench为多模态智能体的研究提供了一个重要的工具。

深度分析

研究背景

智能体记忆研究多集中于文本记忆,忽视了视觉记忆的重要性。现有的基准测试如VisualWebArena和MemoryArena主要评估文本记忆,而视觉记忆的长时保留能力未被充分研究。

核心问题

多模态智能体在复杂环境中需要记住视觉细节,但现有系统多依赖文本编码,难以处理纯视觉提示。这一问题限制了智能体在实际应用中的表现。

核心创新

DMV-Bench通过在电商环境中嵌入视觉提示,首次系统性地评估了智能体的视觉记忆能力。DualMem架构结合视觉和语言编码,显著提升了记忆性能。

方法详解

  • �� 在电商环境中嵌入视觉提示。
  • �� 使用DualMem架构结合视觉和语言编码。
  • �� 通过多次购物会话测试智能体的记忆能力。

实验设计

实验在DMV-Bench上进行,包含1,000种产品变体。测试不同模型和会话链长度下的记忆表现,比较DualMem与其他多模态记忆系统的效果。

结果分析

DualMem在长链任务中的成功率达到81.2%,显著优于基线模型。即使在不同模型和会话链长度下,DualMem的优势依然明显。

应用场景

DMV-Bench可用于评估智能体在复杂环境中的记忆能力,DualMem架构可应用于需要长时记忆的智能体设计。

局限与展望

DMV-Bench目前仅限于电商环境,DualMem在极长会话链下性能下降明显。未来研究需扩展应用场景,优化架构性能。

通俗解读 非专业人士也能看懂

想象你在一个大型商场购物,每个商品都有一个独特的标记,比如一个特别颜色的小物件。你需要在购物结束后记住这些标记,以便再次找到这些商品。DMV-Bench就像这个商场,而DualMem就像你的记忆助手,帮助你记住这些标记,即使你没有刻意去记忆它们。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中每个关卡都有一些隐藏的线索,这些线索帮助你找到通往下一关的钥匙。DMV-Bench就像这个游戏,而DualMem就像你的超级记忆力,帮助你记住这些线索,即使你没有刻意去记住它们。是不是很酷?

术语表

DMV-Bench (视觉记忆基准)

一个用于测试多模态智能体视觉记忆的交互式基准测试,模拟真实电商环境。

用于评估智能体在长时任务中的视觉记忆表现。

DualMem (双编码记忆)

结合视觉和语言编码的记忆架构,基于双编码理论提升记忆性能。

在DMV-Bench中用于增强智能体的视觉记忆能力。

视觉提示

嵌入在产品图像中的独特视觉标记,用于测试智能体的记忆能力。

DMV-Bench中的核心测试元素。

多模态智能体

能够处理多种信息形式(如视觉和文本)的智能体。

研究的主要对象,评估其在复杂环境中的记忆能力。

双编码理论

一种记忆理论,认为信息通过视觉和语言两种编码方式存储,能提升记忆效果。

DualMem架构的理论基础。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的环境中测试视觉记忆?现有方法多局限于电商场景,需扩展至其他领域。
  • 2 如何提升DualMem在极长会话链下的性能?目前性能下降明显,需进一步优化。

应用场景

近期应用

电商智能助手

帮助用户在购物时记住商品细节,提高购物体验。需要强大的视觉记忆能力。

远期愿景

智能导航系统

在复杂环境中提供导航支持,帮助用户记住重要地标和路径。需要优化记忆性能。

原文摘要

Agent benchmarks for measuring memory largely study textual cases, in which information is deliberately extracted from the environment, written down, and then later retrieved. In other words, they assess what agents elected to record, not what they happened to see. We introduce DMV-Bench (code: https://github.com/yyyujintang/DMV-Bench), the first interactive benchmark for visual memory in multimodal agents, to study this often-neglected property. DMV-Bench is built on (1) a controlled home-furnishing e-commerce environment, supported by a catalog of 1,000 product variants, and (2) a text-leakage contract which ensures that the primary discriminative signal of each task is solely in the pixels. In DMV-Bench, agents undergo chains of autonomous shopping sessions in which every visited product image carries a unique, pre-rendered incidental cue that the agent is later asked to recall. We show that conventional solutions struggle with this task. Inspired by dual-coding theory, we propose a memory architecture that uses parallel visual and verbal codes, which we call DualMem. On DMV-Bench, DualMem outperforms a caption-only baseline and three recent multimodal agent-memory systems across multi-session chain lengths on multiple models. These gains persist even adjusting for memory-bank size and encoding-position bias. Further experiments also reveal an asymmetric division of labor between the two codes; a weighted coding scheme is often strongest. We view this as a step towards memory systems that preserve a richer record of agents' observations.

cs.CV cs.AI cs.CL