核心发现
方法论
DiCoBench采用高达2K分辨率的图像,设计8个细粒度感知任务,分为差异线索和共性线索两大类。通过多项选择题形式,避免文本引导偏差,全面评估模型捕获微尺度视觉线索的能力。数据集由765个精心筛选样本组成,结合自动化图像编辑和人类验证,确保微观细节的真实性。评估18个不同架构的多模态大模型,结果显示模型在微细节捕获方面远低于人类(98.3%),最高模型Gemini-3-Pro仅达58.1%。
关键结果
- 模型在微尺度细节识别上表现显著不足,最高58.1%,远低于人类的98.3%。模型在差异任务中表现尤为薄弱,逻辑推理能力不足,表现出极大的性能波动。多模型性能差距揭示当前模型在高分辨率、多图细粒度感知方面的巨大挑战。
- 在8个任务类别中,模型平均准确率仅为58.1%,比人类低40%以上。模型在捕获微观属性变化、空间关系和复杂推理方面表现不佳,显示出对高分辨率细节的理解能力不足。
- 实验还揭示模型在共性线索任务中表现较差,尤其在空间对应和关系推理方面,表明模型缺乏对微观视觉线索的主动感知能力。整体而言,模型在高分辨率、多图环境中的自主感知能力仍待突破。
研究意义
本研究通过构建高分辨率、多图、多任务的细粒度感知基准,揭示了现有多模态大模型在微尺度视觉线索捕获方面的巨大差距。该基准突破了传统低分辨率、依赖文本提示的评估限制,推动模型自主感知能力的研究,有助于未来实现更接近人类视觉认知的自动化系统,具有重要的学术和应用价值。
技术贡献
提出DiCoBench,创新性地将高分辨率、多图、多任务结合,系统评估模型捕获微尺度视觉线索的能力。采用多项选择题形式,避免文本偏差,全面衡量差异与共性线索的感知。数据集结合自动化微调和人类验证,确保样本质量。对18个模型的评估显示,显著揭示模型在微观细节捕获上的不足,为未来模型设计提供明确方向。
新颖性
首次提出基于高分辨率、多图、多任务的细粒度感知基准,强调差异与共性线索的系统评估,突破传统低分辨率和文本引导的限制。采用多项选择题形式,减少评估偏差,推动自主视觉感知研究的深入。该方法在多模态感知领域具有开创性,为模型自主理解复杂视觉场景提供新思路。
局限性
- 当前基准主要集中在静态高分辨率图像,尚未涵盖动态场景或视频感知能力,未来需扩展到时序信息。
- 模型评估受限于现有模型架构和训练数据,尚未充分探索多模态融合和推理能力的提升空间。
- 样本虽多样但仍有限,未来应扩大数据规模,涵盖更多复杂背景和微观细节场景。
未来方向
未来将拓展动态场景和视频感知能力,结合多模态推理和因果关系建模,提升模型自主感知微尺度线索的能力。同时,优化数据生成流程,增强样本多样性,推动模型在实际复杂环境中的应用落地。
AI 总览摘要
随着高分辨率视觉编码器的发展,近年来多模态大模型在单图细粒度感知方面取得了显著突破。现有评测如V*、HR-Bench等主要依赖显式文本提示,评估模型被动的文本到图像的对齐能力,难以反映模型自主捕获隐性视觉线索的能力。实际上,在复杂环境中,人类感知主动捕捉微妙差异和共性线索,推动模型自主感知能力成为研究热点。
为此,本文提出DiCoBench,一项针对高分辨率、多图、多任务的细粒度感知基准,涵盖差异线索和共性线索两大类,共8个任务类别。该基准利用高达2K的图像,采用多项选择题形式,避免文本偏差,系统评估模型捕获微尺度视觉线索的能力。实验结果显示,18个不同架构的模型平均准确率仅为58.1%,远低于人类的98.3%,揭示了模型在高分辨率、多图环境中自主感知的巨大挑战。
该研究突破了传统低分辨率、依赖文本提示的评估限制,为未来模型自主理解复杂视觉场景提供了新方向。通过系统性评估,明确了当前模型在微尺度细节捕获方面的不足,为推动高分辨率、多图、多任务视觉感知技术的发展提供了基础。未来,研究将扩展动态场景感知,结合推理和因果建模,推动模型向更接近人类的视觉认知迈进。
深度分析
研究背景
近年来,随着高分辨率视觉编码器和大规模视觉-语言对齐数据的出现,多模态大模型在单图细粒度感知方面取得了突破。代表性工作包括Qwen-VL、InternVL-1.5等,能识别图像中的微小细节。现有基准如V*、HR-Bench主要依赖显式文本提示,评估模型的被动对齐能力,未能衡量模型主动捕获隐性线索的能力。尽管如此,模型在复杂环境中的自主感知仍存在巨大空白,尤其在高分辨率、多图场景下的微尺度细节识别。
核心问题
当前多模态感知评估多集中于低分辨率、单图或显式文本引导,难以反映模型在真实复杂场景中的自主感知能力。模型在微尺度细节、空间关系和推理任务中的表现不足,限制了其在自动驾驶、机器人等应用中的潜力。评估偏差和样本局限也阻碍了技术的进一步突破。因此,亟需一种高分辨率、多图、多任务的系统性评估工具,以推动模型自主感知能力的提升。
核心创新
本研究的核心创新包括:1)提出DiCoBench,结合高分辨率、多图、多任务,系统评估模型捕获微尺度线索的能力;2)采用多项选择题形式,避免文本偏差,全面衡量差异与共性线索;3)结合自动化图像编辑和人类验证,确保样本质量;4)多任务设计涵盖属性、实体、空间关系和推理,全面测试模型感知能力。这些创新突破了传统低分辨率、单任务评估的局限,为模型自主感知提供了新思路。
方法详解
- �� 采集高达2K分辨率的基础图像,确保细节丰富。
- �� 设计8个细粒度任务,分为差异线索和共性线索两大类。
- �� 利用自动化微调和人类验证,生成765个高质量样本。
- �� 采用微目标掩码和指令生成,结合GPT-5.1和FLUX.2 Klein模型进行微调编辑。
- �� 构建多项选择题,随机选取4个正确样本作为选项,增加“无差异”选项,减少偏差。
- �� 评估18个不同架构模型,统计准确率和性能波动。
- �� 分析模型在微尺度属性、空间关系和推理任务中的表现差异。
实验设计
实验使用由V*等高分辨率图像组成的数据集,评估包括Gemini-3-Pro、GPT-4、Qwen2.5-VL等模型。指标为多项选择题的准确率,覆盖差异和共性任务。通过对比人类(98.3%)与模型(最高58.1%)的表现,分析模型在微尺度细节捕获、空间关系理解和推理能力上的不足。还进行了任务类别的细分和模型架构的对比,验证了基准的有效性和挑战性。
结果分析
模型在微尺度属性变化、空间关系和推理任务中表现不佳,最高模型仅达58.1%,远低于人类水平。性能波动明显,表明模型缺乏主动感知微观线索的能力。多模型间存在巨大差距,揭示了高分辨率、多图细粒度感知的巨大技术难题。结果强调了模型在复杂环境下自主感知的瓶颈,为未来研究指明方向。
应用场景
该基准可用于评估自动驾驶、机器人导航、视觉搜索等场景中模型的微尺度感知能力。未来可结合多模态推理和因果推断,提升模型在复杂环境中的自主感知和决策能力,推动智能系统的自主认知发展。
局限与展望
目前基准主要集中在静态高分辨率图像,未覆盖动态场景和视频感知。模型评估受限于现有架构,未来需结合时序信息和推理能力。样本虽丰富,但仍需扩大多样性,涵盖更多复杂背景和微观细节场景。
通俗解读 非专业人士也能看懂
想象你在一个非常复杂的工厂里工作,工厂里有许多不同的机器、工具和材料。每个场景都非常细致,有很多微小的差别,比如一台机器的颜色、一个工具的形状,或者一块材料的材质。你需要通过观察两张图片,主动发现这些微小的变化或共同点,而不是依赖说明或标签。这就像你在工厂里找不同或相似的零件,靠的是直觉和细心观察。传统的检测方法就像用放大镜看一张图片,告诉你哪里不同,但没有教你自己主动去发现这些微妙的线索。本文提出的基准就像给你一份特别的“工厂观察任务”,让你在高分辨率的图片中,自己找出微小的差异和共同点,测试你的观察力和理解力。这种方式更接近人类在真实生活中的感知方式,也推动机器学习模型变得更聪明、更像人类。
简单解释 像给14岁少年讲一样
想象你在学校的科学实验室里,有两张超级详细的照片,里面有很多微小的细节,比如一只小虫子、一块特殊的石头,或者一个微微变色的液体。你的任务是不用老师告诉你具体差别在哪里,而是自己仔细观察,找出两张照片的不同之处,或者它们有什么共同点。这就像你在玩“找不同”的游戏,但难度更大,因为细节非常微小,甚至肉眼难以察觉。传统的电脑程序就像用放大镜逐个比对像素,但它们很难主动发现这些微妙的线索。本文提出的研究就像设计了一种超级聪明的“眼睛”,可以在高分辨率的图片中,主动找到这些微小的差异和共同点。通过这个方法,机器也能变得更像人一样,能主动观察、理解复杂场景中的微细变化。这对未来让机器人更聪明、更懂事有很大帮助,就像你变成了一个超级侦探一样!
原文摘要
Recent advancements in Multimodal Large Language Models (MLLMs) have demonstrated impressive fine-grained perception capabilities. However, existing benchmarks predominantly rely on explicit textual cues or low-resolution inputs, failing to evaluate a model's ability to autonomously perceive implicit visual cues in high-resolution. To bridge this gap, we introduce DiCoBench, a comprehensive, multi-image high-resolution benchmark designed for cross-image fine-grained perception. DiCoBench consists of 765 meticulously curated samples categorized into two progressive tracks: Differential Visual Cues and Commonality Visual Cues, covering 8 distinct perception tasks. By formulating the benchmark as a multiple-choice question task and utilizing high-resolution imagery (approaching 2K), we eliminate evaluation metric bias and pose a substantial challenge to current state-of-the-art MLLMs. Our extensive evaluation of 18 diverse MLLMs reveals a striking performance gap compared to human accuracy (98.3\%), with top-performing models struggling significantly with micro-scale detail capture. We believe DiCoBench will serve as a challenging testbed to drive future research in autonomous, high-resolution multi-image perception.