M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

TL;DR

提出M³Eval,基于认知心理学设计的视频多模态记忆评估框架,涵盖四个关键维度。

cs.CV 🔴 高级 2026-06-03 24 次浏览
Jie Huang Ruixun Liu Sirui Sun Xinyi Yang Yin Li Yixin Zhu Yiwu Zhong
多模态学习 记忆机制 视频理解 认知心理学 基准测试

核心发现

方法论

本研究基于认知心理学的经典记忆范式,设计了四个视频任务:分散注意、干扰鲁棒性、事件交错和符号记忆。每个任务通过精心构建的控制视频场景,利用多模态问答(QA)形式,评估模型在信息保持、干扰抵抗、时间组织和符号抽象等方面的能力。采用多种代表性模型(如GPT-5、Gemini-3.1-Pro、Qwen系列)进行大规模实验,通过指标如准确率、干扰率等量化模型表现,揭示模型在多任务、多模态环境下的记忆弱点。

关键结果

  • 模型在处理平行视频流时难以保持解缠表示,表现出注意力混淆(如在split-screen任务中,模型注意力分散,准确率低于人类89.58%的水平,模型普遍在50%左右)。
  • 在干扰实验中,模型对后行干扰的抵抗能力明显弱于人类,干扰率高达40%以上,且重复视频能显著提升记忆表现(提升幅度达15%),显示重复策略的潜力。
  • 时间组织方面,模型在交错事件任务中的表现远逊于人类(准确率约为30-45%),尤其在符号抽象任务(N-Back)中,模型的符号记忆有限,准确率低于70%。

研究意义

该研究首次系统性地从认知心理学角度出发,构建多模态视频记忆评估基准,为理解和提升模型的长期记忆能力提供了理论基础和实验平台。揭示了当前模型在多任务、多模态环境中的记忆限制,为未来设计更具鲁棒性和解缠能力的记忆机制提供了重要方向,有助于推动长视频理解、连续交互和符号推理等关键应用的发展。

技术贡献

提出基于认知心理学的多模态记忆评估框架,结合四个关键维度(分散注意、干扰鲁棒性、事件交错、符号记忆),设计了多样化的控制视频任务。创新在于引入任务隔离机制,利用问答指标量化模型在信息保持、时间组织和符号抽象的能力,突破传统评测的局限。实验验证了模型在多任务环境中的表现差异,为模型设计提供了定量分析依据。

新颖性

首次将认知心理学中的经典记忆范式系统性引入多模态视频理解评估,提出多维度、任务隔离的基准体系,区别于以往只关注感知和推理的单一指标。该方法强调任务的可控性和理论基础,为多模态记忆机制的研究提供了全新视角。

局限性

  • 当前评估主要集中在静态视频场景,尚未充分考虑动态环境和复杂交互场景中的记忆表现。
  • 模型在符号抽象和时间组织方面仍表现有限,未来需结合更复杂的符号推理机制进行优化。
  • 实验依赖于特定数据集和问答设计,泛化到其他多模态任务仍需验证。

未来方向

未来将扩展多模态记忆评估的场景,结合动态交互和多模态推理任务,探索更深层次的记忆机制。同时,结合神经符号网络和强化学习等技术,提升模型的符号抽象和长时记忆能力,推动多模态系统的智能化发展。

AI 总览摘要

随着多模态模型在长视频理解中的应用不断扩大,记忆能力成为核心瓶颈之一。传统评估多偏重于感知和推理,缺乏系统性对模型记忆的深入分析。本文提出了M³Eval,一套基于认知心理学原理设计的多模态视频记忆评估框架,涵盖四个关键维度:分散注意、干扰鲁棒性、事件交错和符号记忆。通过精心设计的控制视频任务,结合问答指标,系统量化模型在信息保持、时间组织和符号抽象方面的能力。实验结果显示,现有模型在处理平行视频流时表现出明显的注意力混淆,干扰抵抗能力不足,时间组织能力有限,符号记忆较弱。模型在多任务、多模态环境中的表现远不及人类,尤其在符号抽象和时间重组方面存在明显差距。这些发现揭示了当前模型在长视频理解中的关键短板,为未来设计更鲁棒、更具解缠能力的记忆机制提供了理论基础。该研究不仅丰富了多模态学习的理论体系,也为实际应用中的长视频分析、连续交互和符号推理提供了重要参考。未来,结合动态场景和强化学习等技术,有望推动多模态系统迈向更高的智能水平。

深度分析

研究背景

多模态学习近年来快速发展,尤其在视频理解领域,代表性工作如VideoBERT、Video-Language Models等推动了视觉与语言的深度融合。然而,这些模型多关注感知和推理能力,缺乏对长时记忆机制的系统评估。传统基准如TVQA、ActivityNet等主要测试模型的理解能力,未能深入探究其在信息存储、干扰抵抗和符号抽象等方面的表现。认知心理学提供了丰富的记忆范式,为模型评估提供理论支撑,但在多模态视频场景中的应用尚属首次。

核心问题

当前多模态模型在长视频理解中面临记忆能力不足的问题,表现为难以保持解缠的表示、抗干扰能力弱、时间组织混乱和符号抽象有限。这些限制严重影响模型在多任务、多模态环境中的应用效果,尤其在连续交互、长时推理和符号推理场景中表现不佳。缺乏系统的评估工具使得模型的记忆机制难以被量化和优化,成为制约长视频理解发展的关键瓶颈。

核心创新

本研究的核心创新在于:1)引入认知心理学中的经典记忆范式,设计四个任务(分散注意、干扰鲁棒性、事件交错、符号记忆)实现任务隔离;2)结合多模态问答机制,量化模型在信息保持、时间组织和符号抽象的能力;3)提出一套基于控制视频场景的评估平台,兼具理论基础和实验可操作性。这一体系突破了传统单一指标的局限,为多模态记忆机制的研究提供了全新视角。

方法详解

  • �� 任务设计:基于认知心理学,构建四个视频任务,分别测试模型的不同记忆维度。• 视频素材:采集五个公开数据集(HourVideo、LVBench等),生成对应问答。• 控制场景:采用split-screen、视频拼接、交错片段和符号抽象等方式,确保任务的可控性。• 评估指标:准确率、干扰率、错误识别率等,量化模型在不同任务中的表现。• 实验流程:对多模态模型(如GPT-5、Gemini-3.1-Pro、Qwen系列)进行大规模测试,分析模型在不同任务中的优势与不足。

实验设计

实验包括对比多种模型在四个任务中的表现,采用自动生成和人工审查的问题,确保任务的科学性和多样性。通过指标如准确率(最高达92%的人类水平,模型多在50-70%之间)、干扰率(模型普遍高于40%)、以及重复视频对性能的提升,验证模型的记忆能力。还进行了模型注意力可视化和误差分析,揭示模型在多任务环境中的注意力混淆和时间组织缺陷。多任务交叉验证确保结果的稳健性。

结果分析

模型在平行视频流中的表现明显不如人类,准确率低于89.58%,干扰抵抗能力不足,干扰率超过40%。重复视频能提升模型表现,最高提升达15%。在事件交错任务中,模型准确率仅为30-45%,符号抽象(N-Back)任务中准确率低于70%。这些结果表明,当前模型在多任务、多模态环境中的记忆机制仍需改进,尤其在时间组织和符号推理方面存在明显差距。

应用场景

该评估框架可用于推动长视频理解模型的优化,助力自动驾驶、智能监控、视频检索等场景中的长时记忆和推理能力提升。未来结合强化学习和符号推理,有望实现更智能的多模态交互系统,推动人工智能向更高层次发展。

局限与展望

目前评估主要集中在静态视频场景,动态复杂环境中的表现尚未充分验证。模型在符号抽象和时间重组方面仍存在明显不足,且实验依赖特定数据集,泛化能力有待提升。未来需结合更复杂的场景和多模态推理机制,增强模型的适应性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个厨房里准备做饭。你需要记住每个步骤,比如切菜、煮汤、调味。每次你做菜时,都要记住之前的步骤,还要应对突然出现的干扰,比如有人打断你,或者你需要同时准备两个菜。这就像模型在处理多个视频和信息时,要记住每个细节,还要抵抗干扰,保持正确的顺序和内容。研究者设计了一些“测试”,就像问你“你还记得第几步了吗?”或者“哪个菜先放?”这些测试帮助了解你记忆的强弱。同样的,模型也要接受这样的考验,看看它们是否能像人一样记住长时间、多任务的信息,或者在被干扰时还能保持清醒。这个研究就是在用科学的方法,测试和改善模型的“记忆力”,让它们变得更聪明、更可靠。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你要记住很多事情,比如你在哪个房间,做了什么,遇到了谁。游戏中会突然出现干扰,比如有人打断你,或者你同时要做两个任务。这就像模型在看视频时,要记住每个场景、事件,还要应对干扰。科学家们设计了一些特别的“考验”,就像问你“你还记得上次在哪个房间吗?”或者“哪个动作先发生?”这些考验帮助他们知道你的记忆有多厉害。模型也要接受类似的考验,看它们能不能像人一样,长时间记住信息,不被干扰影响。这个研究就是用科学的方法,测试和提升模型的“记忆力”,让它们变得更聪明、更可靠,就像你变得更厉害一样!

原文摘要

As multi-modal models advance towards long-form video understanding, memory emerges as a critical capability. Despite substantial efforts in developing video datasets and benchmarks, existing works primarily focus on perception and reasoning, without systematically evaluating memory: what models retain, how faithfully information is preserved, and how robust memory remains under interference. To address this gap, we introduce M$^3$Eval, the first comprehensive evaluation framework and benchmark for probing different memory dimensions in multi-modal models. Grounded in cognitive psychology, our design features carefully constructed tasks that isolate key aspects of memory. Leveraging M$^3$Eval, we conduct extensive experiments across representative multi-modal models, revealing consistent weaknesses and distinctive behaviors. We find that models struggle to maintain disentangled representations when processing parallel video streams, exhibit interference patterns differing substantially from those observed in human memory, ground memory sources more reliably in the spatial domain than the temporal domain, and demonstrate limited symbolic memory. Collectively, our benchmark provides a valuable resource for future research, while our findings highlight memory as a fundamental yet underexplored capability and offer insights for designing more effective memory mechanisms in multi-modal models. Our code and dataset are available at https://pku-value-lab.github.io/m3eval-homepage.

cs.CV cs.AI cs.CL