MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

TL;DR

提出MultivationBench,基于Maslow层级和Reiss欲望模型,评估多模态连续动机推理,模型表现不足。

cs.AI 🔴 高级 2026-07-29 45 次浏览
Kawai Chung Chunkit Chan Yauwai Yim Yuxuan Liu Haochen Shi Weiqi Wang Qing Zong Tianshi Zheng Yixuan Fu Kai Chung Wong Hao Liang Yifan Gao Xi Yang Janet Hui-wen Hsiao Yangqiu Song
多模态大模型 动机推理 心理学框架 基准测试 连续性评估

核心发现

方法论

本研究构建了基于Maslow层级和Reiss欲望模型的多模态连续动机推理基准——MultivationBench。通过整合视觉和文本信息,设计了行为识别、动机分类及连续性评估等任务。采用多阶段自动生成候选动机方案,结合人类校验,确保标签的心理学合理性。数据涵盖1000个故事、4023个行为实例和16092个问答,分短中长故事段落。实验采用最新多模态大模型(如Gemini-3-Flash、Grok-4.1-Fast)进行零样本评估,指标包括Exact Match(EM)和F1,验证模型在动态情境中的推理能力。

关键结果

  • 所有模型在连续动机推理中表现均较差,平均EM不足20%,F1在50%左右。模型在中等长度故事表现略优,但长故事的连续性和一致性显著下降,EM最低仅6%。多模态输入优于单一模态,视觉信息对动机修正尤为关键。模型在细粒度Reiss模型上的表现明显低于Maslow层级,反映出模型在复杂心理状态推理上的局限。
  • 模型在短故事中表现较好,随着故事长度增加,性能逐步下降,表明长序列中持续追踪和修正动机是当前模型的难点。不同模型在定义任务和实际推理任务间存在差异,部分模型在理论类别识别上表现较强,但在实际场景中的应用效果有限。
  • 人类标注准确率明显优于模型,Reiss模型的细粒度分类难度更大。模型在多模态融合、长序列推理和心理状态连续性方面仍有巨大提升空间。整体结果显示,当前多模态大模型仍难以实现类似人类的连续动机推理能力。

研究意义

本研究首次系统性评估多模态大模型在连续心理动机推理中的能力,揭示模型在动态情境理解和心理状态追踪上的不足,为未来多模态社会智能研究提供了重要基准。通过引入心理学理论,增强模型对人类行为背后动机的理解,有助于推动人机交互、社会机器人等应用的发展,解决静态识别与动态推理的断层问题,促进模型更贴近人类社会认知。

技术贡献

提出结合Maslow层级和Reiss欲望模型的多模态连续动机推理基准,填补现有静态评估的空白。设计多阶段候选方案生成与人类校验机制,确保标签心理学合理性。引入长序列一致性评估指标,系统性测试模型在复杂情境中的推理能力。实验验证多模态信息在动机修正中的关键作用,揭示模型在细粒度和长序列任务中的局限,为未来模型优化提供方向。

新颖性

首次将心理学的Maslow和Reiss模型结合应用于多模态连续动机推理,构建大规模、真实场景的评估基准。区别于以往静态文本或短序列任务,强调模型在动态、多模态、长序列中的推理能力,推动多模态社会认知研究向更复杂、更真实的场景拓展。

局限性

  • 模型在长序列中的连续性和心理状态追踪仍表现不足,未能完全模拟人类的动态推理过程,部分原因在于模型对多模态信息整合和记忆能力有限。
  • 数据集虽覆盖多样故事,但仍偏向特定文化背景,泛化能力有待验证,且对复杂心理状态的细粒度区分仍不足。
  • 实验主要基于零样本评估,未充分探索模型微调和增强学习的潜力,未来需结合多任务训练提升性能。

未来方向

未来将结合强化学习和多任务训练,提升模型在长序列中的连续推理能力。探索更丰富的心理学模型和多模态融合机制,增强模型对复杂社会情境的理解。此外,扩展数据多样性,涵盖不同文化和情境,提升模型的泛化能力。最终目标是实现更接近人类的社会认知和情感理解,为人机交互提供更自然、更智能的基础。

AI 总览摘要

随着多模态大模型的快速发展,研究者们逐渐关注其在社会认知中的潜能。尽管在静态文本和短序列任务中取得一定成果,但模型在理解和推理复杂、连续的心理动机方面仍面临巨大挑战。为此,Kawai等人提出了MultivationBench,这是一个基于心理学理论的多模态连续动机推理基准,旨在评估模型在真实场景中的表现。

该基准结合了Maslow的需求层级和Reiss的16欲望模型,设计了行为识别、动机分类及连续性评估等任务,涵盖1000个故事、4023个行为实例和16092个问答。通过自动候选方案生成和人类校验,确保标签的心理学合理性。实验显示,现有最先进模型在长序列中的连续推理能力不足,平均Exact Match仅20%,F1约50%。模型在多模态信息融合、长序列追踪和细粒度心理状态识别方面仍有较大差距。

这一研究不仅揭示了多模态模型在社会认知中的瓶颈,也为未来研究提供了系统性评估工具。通过引入心理学框架,推动模型更好理解人类行为背后的深层动机,有望促进人机交互、社会机器人等领域的突破。未来,结合强化学习、多任务训练和多样化数据,将进一步提升模型的连续推理能力,实现更具人类水平的社会认知。

深度分析

研究背景

多模态大模型近年来在视觉、语言理解方面取得突破,但在社会认知和心理状态推理方面仍有限。早期研究如SocialIQA、MotiveBench关注静态文本,缺乏动态、多模态的连续性评估。近年来,视频理解和多模态推理逐步发展,但多聚焦短时、事件导向,难以模拟人类在长时间、多场景中的心理状态变化。心理学理论如Maslow层级和Reiss欲望模型,为理解复杂行为提供理论基础,但在多模态场景中的应用尚未系统化。现有基准多偏重静态或短序列,难以评估模型在真实社会场景中的连续推理能力。

核心问题

当前多模态大模型在连续心理动机推理方面表现不足,主要原因在于模型难以整合多模态信息、追踪长序列中的心理状态变化。静态评估无法反映模型在动态场景中的推理能力,长序列中信息的不断更新和修正对模型提出更高要求。缺乏系统性评估工具限制了对模型能力的全面理解,也阻碍了模型在社会智能中的实际应用。解决这一问题需要设计更贴近人类认知的评估框架,结合心理学理论,强化模型的连续推理能力。

核心创新

本研究创新性地结合Maslow层级和Reiss欲望模型,构建了多模态连续动机推理基准——MultivationBench。区别于以往静态或短序列评估,强调模型在长时间、多模态情境中的心理状态追踪。引入多阶段候选方案生成与人类校验机制,确保标签的心理学合理性。设计了长序列一致性指标,系统性测试模型在复杂场景中的推理能力。实验验证视觉信息在修正动机中的关键作用,推动多模态社会认知研究向更真实、更复杂的场景发展。

方法详解

  • �� 数据采集:结合SSID、StoryReasoning、MovieBench,覆盖多样故事和情境。
  • �� 行为识别:利用多模态模型自动提取角色行为链,标注行为对应的潜在动机。
  • �� 动机方案生成:基于Maslow和Reiss模型,自动生成候选动机,结合人类校验确保合理性。
  • �� 任务设计:包括定义任务(识别行为动机类别)和实际推理任务(在具体情境中选择合适动机),多标签预测。
  • �� 长序列评估:引入连续性指标,衡量模型在整个故事中的动机追踪能力。
  • �� 实验评估:采用零样本评估,比较不同模型(如Gemini-3-Flash、Grok-4.1-Fast)在不同故事长度和模态下的表现。

实验设计

采用1000个故事、4023行为实例,分短中长故事段落。模型包括闭源(如Gemini-3-Flash)和开源(如Llama-4系列),指标为EM和F1。通过不同模态输入(多模态、文本、图像)评估性能。还设计长序列连续性和理论类别识别的专项测试。实验验证多模态信息对动机推理的提升作用,分析模型在细粒度和长序列中的表现差异。

结果分析

所有模型在连续动机推理中表现有限,EM平均不足20%,F1在50%左右。长故事中性能显著下降,模型难以持续追踪角色心理状态。多模态输入优于单一模态,视觉信息对修正动机尤为关键。模型在细粒度Reiss模型上的表现远低于Maslow层级,反映出复杂心理状态推理的难度。人类标注准确率明显优越,模型仍需在多模态融合和长序列推理方面突破。

应用场景

该基准可用于评估和提升多模态模型在社会认知、情感理解、虚拟助手等场景中的能力。未来,结合此评估框架,开发更具连续性和细粒度的模型,有望实现更自然的人机交互、社会机器人等应用,推动智能系统更贴近人类认知。

局限与展望

模型在长序列中的连续性和心理状态追踪仍不足,未充分解决多模态信息整合和记忆问题。数据集偏向特定文化背景,泛化能力有限。实验主要基于零样本评估,未来需结合微调和强化学习提升性能。模型在细粒度心理状态识别和复杂场景理解方面仍有较大差距。

通俗解读 非专业人士也能看懂

想象你在看一部连续的电影,每一幕都在揭示人物的内心想法。刚开始你可能只知道他们在做什么,但随着剧情发展,你会逐渐理解他们为什么这么做。比如,一个人在餐厅里伸手拿手机,刚开始你可能觉得他只是想找东西,但看完后发现他是在寻找家人的照片,想联系他们。这就像我们在理解别人一样,不能只看一眼,要看整个故事,结合各种线索,才能真正理解他们的动机。模型也是一样,它需要不断地“看”故事,逐步理解人物的心理变化,而不是只看一瞬间。

简单解释 像给14岁少年讲一样

想象你在看一部连续剧,一集接着一集,你会慢慢知道每个角色的秘密和想法。比如,一个人在餐厅里伸手拿手机,刚开始你可能觉得他只是在找东西,但后来发现他是在找家人的照片,想打电话联系他们。这就像我们理解朋友一样,要看很多细节,才能知道他们真正的心思。模型也是这样,它要不断“看”故事,理解每个人的心情变化,而不是只看一眼就知道答案。这样,它才能变得更聪明、更像人一样懂得社会和情感。

术语表

Multimodal Large Language Model (多模态大模型)

结合视觉和文本信息的深度学习模型,能理解多种数据类型,进行复杂推理。

本文中的模型用于整合视觉和文本信息,进行连续动机推理。

Maslow Hierarchy (马斯洛需求层级)

描述人类需求从生理、安全到自我实现的层次结构,用于理解行为动机。

用作心理学基础,指导行为动机标签设计。

Reiss Basic Desires (Reiss基本欲望)

涵盖16种基本欲望,反映个体差异,细粒度描述行为动机。

补充Maslow模型,用于细化动机类别。

Exact Match (EM) 精确匹配

评估模型预测是否完全匹配标注的指标,反映准确率。

用于衡量模型在动机推理任务中的表现。

F1 Score (F1分数)

考虑精确率和召回率的调和平均,用于多标签任务的性能衡量。

评估模型在多标签动机集合中的部分正确性。

开放问题 这项研究留下的未解疑问

  • 1 模型在复杂长序列中保持心理状态连续性的机制尚未充分理解,如何有效整合多模态信息以提升推理能力仍是未来研究重点。
  • 2 现有数据集偏向特定文化背景,泛化到多样化社会场景仍面临挑战。

应用场景

近期应用

社会智能系统评估

可用于评估虚拟助手、社交机器人在理解人类行为背后动机的能力,提升交互自然度。

心理状态监测

帮助心理健康应用识别用户潜在需求变化,提供更个性化的建议。

远期愿景

人机社会认知融合

推动AI更深入理解人类复杂心理,实现更自然、更具情感的交互体验。

原文摘要

Multimodal Large Language Models have sparked significant interest due to their potential for social intelligence; however, their ability to perform sequential motivation reasoning remains insufficiently studied. Existing evaluations predominantly examine static text or isolated visual snapshots, which do not reflect the cumulative nature of real-world behavioral drivers. To address this gap, we introduce MultivationBench, a benchmark designed to rigorously evaluate multimodal motivation reasoning within story-driven visual narratives. The benchmark builds upon established psychological frameworks - Maslow's hierarchy and Reiss's basic desires - and requires models to integrate accumulated multimodal context to infer evolving motivations. Results indicate that MultivationBench presents a significant challenge: all tested models struggle to maintain consistent motivation reasoning across sequential contexts, revealing a critical disconnect between static recognition capabilities and the dynamic reasoning essential for human-like social understanding.

cs.AI