PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

TL;DR

PerceptionBench评估多模态大语言模型的视觉感知能力,16个模型最高准确率仅59.7%。

cs.CV 🔴 高级 2026-07-28 36 次浏览
Zichao Lin Yifeng Xie Bowen Qu Haiming Wang Jia Li Haoning Wu Yuhao Dong Zuhao Yang Jinguo Zhu Haoyu Lu Zijia Zhao Tongtian Yue Zhangyang Qi Junwei Yang Mengfan Dong Peizhou Cao Chenzhuang Du Zaida Zhou Haotian Yao Hao Yang Hongcheng Gao Lin Sui Weihong Li Xinxing Zu Jia Chen Yao Wang Xiaoxue Wu Yalin Wang Y. Charles Yiping Bao Yangyang Liu Zhiqi Huang Xinyu Zhou
视觉感知 多模态模型 基准测试 人工智能 模型评估

核心发现

方法论

通过42个现有基准测试的失败点分析,构建了一个错误分类法,并基于此设计了包含3000个经过验证的问题的PerceptionBench,专注于10种原子视觉感知能力。

关键结果

  • 16个模型中最高准确率为59.7%,由GPT-5.6-Sol实现,表明原子视觉感知仍未解决。
  • 感知相关的幻觉能力表现最差,平均准确率最低。
  • 模型整体分数相似,但能力表现差异显著,揭示了模型的具体弱点。

研究意义

该研究为多模态大语言模型的视觉感知能力提供了细粒度的评估标准,填补了现有基准测试无法隔离感知错误与推理或知识失败的空白。

技术贡献

提出了一种基于失败点的错误分类法,定义了10种原子视觉感知能力,并设计了一个全面覆盖这些能力的基准测试,提供了模型能力的详细诊断。

新颖性

首次从模型失败中归纳出视觉感知能力的分类,并构建了专注于感知能力的基准测试,避免了现有基准测试的片面性。

局限性

  • 未能覆盖所有可能的感知能力,仍需扩展数据集。
  • 模型评估依赖于当前的前沿模型,可能无法适用于未来的模型。

未来方向

未来可扩展基准测试的范围,增加更多视觉场景和能力类型,并探索改进模型感知能力的方法。

AI 总览摘要

多模态大语言模型(MLLMs)在视觉感知能力上的表现仍存在显著不足。尽管这些模型在推理和知识整合方面表现出色,但其视觉感知能力的局限性限制了其在复杂任务中的应用。

为了解决这一问题,研究团队提出了PerceptionBench,一个专注于评估原子视觉感知能力的基准测试。通过分析42个现有基准测试的失败点,研究者构建了一个错误分类法,并定义了10种原子视觉感知能力,包括视觉定位、属性识别、计数、关系理解等。基于此分类法,设计了3000个经过验证的问题,确保每个问题仅测试单一能力。

实验结果显示,16个前沿模型的表现均未超过60%的准确率,且感知相关的幻觉能力表现最差。这表明视觉感知仍是多模态模型的主要瓶颈。PerceptionBench为模型能力的细粒度诊断提供了新标准,并为未来的模型改进指明了方向。

深度分析

研究背景

多模态大语言模型近年来取得了显著进展,但其视觉感知能力仍存在不足。现有基准测试通常无法有效隔离感知错误与推理或知识失败,导致模型能力评估片面。

核心问题

视觉感知能力是多模态模型执行复杂任务的基础,但现有模型在属性识别、计数、关系理解等方面表现不佳,限制了其实际应用。

核心创新

PerceptionBench通过失败点分析构建了一个错误分类法,定义了10种原子视觉感知能力,并设计了一个全面覆盖这些能力的基准测试,避免了现有基准测试的片面性。

方法详解

  • �� 分析42个基准测试的失败点,归纳错误类型。
  • �� 定义10种原子视觉感知能力。
  • �� 设计3000个问题,确保每个问题仅测试单一能力。
  • �� 通过多阶段验证确保问题的准确性和难度。

实验设计

实验使用16个前沿模型,统一评估协议,包括GPT-5.6-Sol、Claude-Fable-5等。采用自动评估和人工验证结合的方法,确保结果可靠。

结果分析

实验结果显示,最高准确率为59.7%,感知相关的幻觉能力表现最差,模型整体分数相似但能力表现差异显著。

应用场景

该基准测试可用于评估多模态模型的视觉感知能力,帮助研究者发现模型的具体弱点并指导改进。

局限与展望

基准测试未覆盖所有可能的感知能力,模型评估依赖于当前的前沿模型,未来需要扩展数据集和能力类型。

通俗解读 非专业人士也能看懂

可以将PerceptionBench比作一个考试系统,它专门测试模型的“视觉感知”能力。就像一个学生在考试中需要回答单选题,每道题目只考察一个知识点,PerceptionBench的每个问题也只测试模型的一种视觉能力,比如“数一数图片中有多少个物体”或“识别物体的颜色”。通过这些问题,我们可以发现模型在哪些能力上表现较弱,就像老师通过考试发现学生的薄弱环节一样。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超级酷的游戏,里面有一个机器人助手,它可以帮你识别图片中的东西,比如告诉你有多少只猫或者哪个颜色的帽子更漂亮。但问题是,这个机器人有点“近视”,它经常看错东西!科学家们设计了一个叫PerceptionBench的“考试”,专门测试这些机器人助手的视觉能力。结果发现,机器人们的表现还不够好,最高分只有59.7%。这就像你考试只考了60分,说明还有很多需要努力的地方!

术语表

原子视觉能力

指视觉感知中的基本能力,如计数、定位、属性识别等。

用于定义PerceptionBench中的评估能力。

感知相关幻觉

模型在视觉感知中产生的错误信息或虚假内容。

在实验中表现为最低准确率的能力。

错误分类法

通过分析模型失败点归纳出的错误类型分类。

用于构建PerceptionBench的能力分类。

多模态模型

能够处理多种数据类型(如图像和文本)的人工智能模型。

研究对象为多模态大语言模型。

基准测试

用于评估模型性能的标准化测试集。

PerceptionBench是一个专注于视觉感知的基准测试。

开放问题 这项研究留下的未解疑问

  • 1 如何提升模型的感知相关幻觉能力?
  • 2 如何扩展基准测试以覆盖更多视觉场景?

应用场景

近期应用

模型性能评估

帮助研究者发现模型的具体弱点,指导改进方向。

视觉任务优化

为多模态模型在复杂视觉任务中的应用提供参考。

远期愿景

通用视觉感知模型

开发能够全面掌握原子视觉能力的多模态模型,推动人工智能的发展。

原文摘要

We introduce PerceptionBench, a benchmark specifically designed to evaluate the atomic visual perception capabilities of Multimodal Large Language Models (MLLMs). Existing benchmarks often fail to isolate perception: holistic evaluations conflate perceptual errors with failures in reasoning or domain knowledge, while application-driven benchmarks only cover narrow, fragmented domains shaped by heuristic designs. To address these limitations, PerceptionBench adopts a bottom-up approach: by diagnosing the earliest failure points in the responses of frontier MLLMs across 42 existing benchmarks, we construct an error taxonomy whose perception branch defines ten atomic perceptual capabilities. Guided by this taxonomy, we construct 3,000 verified questions with short, unambiguous answers, each isolating a single capability, with difficulty stemming from perception rather than reasoning or knowledge. Benchmark results across sixteen frontier MLLMs reveal that atomic perception remains largely unsolved---no model reaches 60\% accuracy, perception-related hallucination is the weakest capability on average, and similar overall scores conceal sharply divergent capability profiles. PerceptionBench thus provides a capability-level standard for measuring and diagnosing the visual perception boundaries of MLLMs.

cs.CV