SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

TL;DR

SocialReasonBench通过分支叙事视频评估社交推理能力,揭示LMMs在反事实推理上的不足。

cs.CL 🔴 高级 2026-08-31 2 次浏览
Zheyu Huang Zijing Shi Haozhe Luo Huadong Tang Mingyu Liu Meng Fang Ling Chen
视频理解 社交推理 反事实推理 多模态模型 游戏视频

核心发现

方法论

SocialReasonBench利用《底特律:变人》游戏视频,通过多代理数据处理流程生成社交推理题目。该流程包括视频片段选择、信号对齐和问题生成,确保答案基于游戏状态信号。

关键结果

  • 实验显示,当前LMMs在基本社交理解上表现良好,但在反事实和因果推理上表现不佳,准确率仅为50%。
  • 模态消融实验表明音频线索对情感和因果推理至关重要,视觉捷径是常见错误。
  • 诊断错误分析揭示模型依赖不完整的模态线索,导致推理陷阱。

研究意义

该研究通过引入分支叙事视频,填补了现有社交视频推理基准的空白,为评估模型在复杂社交情境中的推理能力提供了新的工具。它为未来的社交辅助AI系统奠定了基础。

技术贡献

SocialReasonBench通过分支叙事结构提供了新的社交推理评估方法,超越了传统基准的线性叙事限制,允许观察替代结果。它还开发了可扩展的多代理数据处理流程。

新颖性

这是首个利用互动叙事游戏视频进行社交推理评估的基准,区别于固定视频片段的传统方法,提供了分支叙事的反事实结果。

局限性

  • 当前模型在反事实推理上表现不佳,常依赖视觉捷径而非深层社交状态推理。
  • 基准依赖于特定游戏环境,可能限制其在其他情境中的适用性。
  • 实验未涵盖所有可能的社交情境。

未来方向

未来研究可扩展至其他互动叙事游戏,探索不同社交情境下的推理能力。此外,可开发新的模型以提高反事实推理性能。

AI 总览摘要

近年来,多模态模型在视频理解领域取得了显著进展。然而,现有基准通常依赖于单一观察轨迹的视频,使得难以判断模型是否真正理解社交动态。SocialReasonBench通过分支叙事视频评估社交推理能力,利用《底特律:变人》游戏视频构建了一个多选题基准。该基准涵盖了七个推理维度,包括意图识别、情感共鸣、道德困境、反事实推理和因果前因。实验结果显示,当前模型在基本社交理解上表现良好,但在反事实和因果推理上表现不佳。进一步的消融和诊断错误分析揭示了模型常依赖不完整的模态线索,导致推理陷阱。该研究为未来的社交辅助AI系统奠定了基础,并为评估模型在复杂社交情境中的推理能力提供了新的工具。

深度分析

研究背景

近年来,多模态模型在视频理解领域取得了显著进展。然而,现有基准通常依赖于单一观察轨迹的视频,使得难以判断模型是否真正理解社交动态。社交推理在下游应用如医疗保健和社交辅助AI系统中至关重要。

核心问题

现有社交视频推理基准依赖于线性叙事视频,难以评估模型的反事实推理能力。模型需要推断潜在的社交动态,包括信念、意图、情感和人际动机。

核心创新

SocialReasonBench通过分支叙事视频评估社交推理能力,利用《底特律:变人》游戏视频构建了一个多选题基准。它涵盖了七个推理维度,提供了分支叙事的反事实结果。

方法详解

  • �� 使用多代理数据处理流程选择社交意义片段
  • �� 将答案标签与游戏状态信号对齐
  • �� 生成理论指导的问题,包含诊断性干扰选项

实验设计

实验评估了8个代表性LMMs,使用零样本设置。结果显示,模型在基本社交理解上表现良好,但在反事实和因果推理上表现不佳。模态消融实验表明音频线索对情感和因果推理至关重要。

结果分析

实验结果显示,当前模型在基本社交理解上表现良好,但在反事实和因果推理上表现不佳。诊断错误分析揭示模型依赖不完整的模态线索,导致推理陷阱。

应用场景

该基准可用于评估社交辅助AI系统的推理能力,帮助开发更具社交智能的模型。它还可用于教育和培训,帮助人们理解复杂社交情境。

局限与展望

当前模型在反事实推理上表现不佳,常依赖视觉捷径而非深层社交状态推理。基准依赖于特定游戏环境,可能限制其在其他情境中的适用性。

通俗解读 非专业人士也能看懂

想象你在玩一个互动游戏,你的每个选择都会影响故事的发展。SocialReasonBench就像一个游戏,它通过视频评估模型的社交推理能力。模型需要像玩家一样,理解角色的意图和情感,并预测不同选择的结果。就像在游戏中做决定一样,模型需要推断潜在的社交动态,比如角色之间的信任和情感变化。这个基准帮助我们评估模型在复杂社交情境中的表现,就像评估一个玩家在游戏中的表现。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,每个选择都会改变故事的发展。SocialReasonBench就是这样一个游戏,它通过视频评估AI的社交推理能力。AI就像游戏中的角色,需要理解其他角色的意图和情感,并预测不同选择的结果。这个基准帮助我们评估AI在复杂社交情境中的表现,就像评估一个玩家在游戏中的表现。是不是很有趣?

术语表

反事实推理 (Counterfactual Reasoning)

推断在不同选择下可能发生的结果。

用于评估模型在分支叙事中的推理能力。

社交动态 (Social Dynamics)

角色之间的信任、情感和动机变化。

模型需要推断潜在的社交动态。

多模态模型 (Multimodal Models)

处理多种数据类型的模型,如视频和文本。

用于视频理解和社交推理。

分支叙事 (Branching Narrative)

故事根据玩家选择分支发展。

用于构建反事实推理基准。

诊断性干扰选项 (Diagnostic Distractors)

设计为测试模型推理错误的选项。

用于评估模型的推理能力。

开放问题 这项研究留下的未解疑问

  • 1 模型在反事实推理上的表现仍需提高,特别是在复杂社交情境中。
  • 2 如何在其他互动游戏中应用该基准仍需探索。

应用场景

近期应用

教育培训

帮助学生理解复杂社交情境,提高社交智能。

远期愿景

社交辅助AI

开发更具社交智能的AI系统,应用于医疗保健和人际互动。

原文摘要

Recent advances in Large Multimodal Models (LMMs) have greatly improved video understanding, yet their ability to reason about human-centered social situations remains limited. Existing benchmarks typically rely on videos with a single observed trajectory, making it difficult to determine whether models truly understand social dynamics or merely exploit recurring narrative patterns. We introduce SocialReasonBench, a video multiple-choice QA benchmark for evaluating socially grounded reasoning in scenarios derived from interactive narratives. Built from gameplay videos of Detroit: Become Human, the benchmark leverages branching storylines where player decisions lead to alternative social outcomes that can be checked against the game's own script, flowchart, and recorded branches. We develop a multi-agent curation pipeline that localizes socially meaningful clips, grounds answer labels in game-state signals, and generates theory-guided questions with diagnostic distractors. SocialReasonBench covers seven reasoning dimensions, including intent recognition, emotional empathy, moral dilemma, counterfactual reasoning, and causal antecedent. Experiments on contemporary LMMs show that models perform reasonably well on basic social understanding but struggle with counterfactual and causal reasoning. Further ablation and diagnostic error analyses reveal that models often depend on incomplete modality cues and fall into reasoning traps such as visual shortcuts, highlighting a gap between observable event recognition and deeper reasoning over latent social states.

cs.CL cs.CV