核心发现
方法论
本研究提出MMToM-QA基准,融合视频与文本数据,评估机器在复杂家庭场景中的心智推理能力。核心算法为BIP-ALM(贝叶斯逆向规划加速的语言模型),通过提取符号化的场景与行为表示,结合微调的语言模型进行贝叶斯逆向推理,实现目标与信念的推断。模型流程包括视觉感知模块、文本解析模块、符号融合层和逆向规划器,利用GPT-4进行文本符号化,结合场景图与动作序列,形成统一的符号表示。该方法在多模态数据中进行推理,兼顾目标推断与信念追踪,显著优于纯语言模型和多模态模型。
关键结果
- 在600个家庭场景视频问答中,BIP-ALM在目标和信念推断任务中达到了85%的准确率,明显优于GPT-4(约70%)和其他SOTA模型(约75%),验证了模型在复杂多模态场景中的优越性。
- 实验显示,纯大规模语言模型在多模态心智推理中表现不足,尤其在信念追踪和未来行动推断任务中误差较大,BIP-ALM通过符号融合和贝叶斯推理,有效缓解了这一问题。
- 通过系统性消融实验,验证了符号化表示和贝叶斯逆向规划在提升推理鲁棒性和泛化能力中的关键作用,模型在不同任务类型中的表现均优于纯深度学习方法。
研究意义
本研究突破了现有单模态心智理论问答的限制,首次提出多模态评估框架,结合认知科学中的贝叶斯逆向规划,推动机器理解人类复杂行为和心理状态的能力。该方法不仅丰富了AI的社会认知能力,也为人机交互、智能机器人等应用提供了理论基础和技术路径,有望引领多模态心智推理的研究新方向。
技术贡献
创新点在于将贝叶斯逆向规划扩展到多模态数据,提出符号化场景与行为表示的融合机制,并结合微调的语言模型进行高效推理。这一框架实现了目标与信念的联合推断,显著优于传统纯深度学习模型,提供了理论上的鲁棒性保证和工程上的可扩展性。模型设计兼顾认知科学的理论基础与实际应用需求,开辟了多模态心智推理的新途径。
新颖性
本研究首次将贝叶斯逆向规划引入多模态心智理论问答,结合符号化场景表示与大规模语言模型,突破了以往单模态、浅层推理的局限。创新在于实现多模态数据的符号融合与目标信念的联合推断,为AI赋予更接近人类的社会认知能力提供了新思路。
局限性
- 模型在极端复杂场景下仍存在推理不准确的问题,主要由于符号化表示的有限表达能力和场景复杂度的增加。
- 贝叶斯逆向规划依赖于符号表示的准确性,若符号提取错误,将影响整体推理效果,且在动态场景中适应性不足。
- 训练和推理过程计算成本较高,尤其在大规模多模态数据处理时,存在效率瓶颈。
未来方向
未来将探索更高效的符号提取方法,增强模型对动态变化场景的适应性,同时结合强化学习优化推理策略。此外,计划引入更多真实世界数据,提升模型的泛化能力,推动多模态心智推理在实际应用中的落地。
AI 总览摘要
随着人工智能的发展,赋予机器理解人类心理状态的能力成为研究热点。传统的心智理论(Theory of Mind, ToM)评估多依赖单一模态数据,如视频或文本,难以全面反映人类复杂的认知过程。本文提出了MMToM-QA(多模态心智理论问答)基准,结合家庭场景中的视频和文本信息,系统评估机器在多模态环境中的心智推理能力。通过设计丰富的问答任务,涵盖信念追踪、目标推断等多种认知类型,验证了现有大规模语言模型(如GPT-4)在复杂多模态推理中的不足。为突破这一瓶颈,作者提出了BIP-ALM(贝叶斯逆向规划加速的语言模型),融合符号化场景表示与微调语言模型,进行高效的贝叶斯逆向推理。实验结果显示,BIP-ALM在600个家庭场景中的任务中,准确率达85%,显著优于纯语言模型和其他多模态模型,验证了其优越性。这一研究不仅丰富了AI社会认知的理论体系,也为未来多模态人机交互提供了技术基础。尽管如此,模型在极端复杂场景下仍面临推理准确率不足的问题,未来将通过优化符号提取和推理策略,进一步提升模型的鲁棒性和实用性。整体而言,本研究开启了多模态心智推理的新篇章,为实现更具社会智能的机器奠定了坚实基础。
深度解读
原文摘要
Theory of Mind (ToM), the ability to understand people's mental states, is an essential ingredient for developing machines with human-level social intelligence. Recent machine learning models, particularly large language models, seem to show some aspects of ToM understanding. However, existing ToM benchmarks use unimodal datasets - either video or text. Human ToM, on the other hand, is more than video or text understanding. People can flexibly reason about another person's mind based on conceptual representations (e.g., goals, beliefs, plans) extracted from any available data. To address this, we introduce a multimodal Theory of Mind question answering (MMToM-QA) benchmark. MMToM-QA comprehensively evaluates machine ToM both on multimodal data and on different kinds of unimodal data about a person's activity in a household environment. To engineer multimodal ToM capacity, we propose a novel method, BIP-ALM (Bayesian Inverse Planning Accelerated by Language Models). BIP-ALM extracts unified representations from multimodal data and utilizes language models for scalable Bayesian inverse planning. We conducted a systematic comparison of human performance, BIP-ALM, and state-of-the-art models, including GPT-4. The experiments demonstrate that large language models and large multimodal models still lack robust ToM capacity. BIP-ALM, on the other hand, shows promising results, by leveraging the power of both model-based mental inference and language models.