核心发现
方法论
本文提出OddGridBench基准测试,通过1400多张网格图像评估MLLMs的视觉差异敏感性。每张图像包含一个与其他元素在颜色、大小、旋转或位置上不同的元素。还引入了OddGrid-GRPO强化学习框架,通过课程学习和距离感知奖励来提高模型的视觉辨别能力。
关键结果
- 实验结果显示,所有评估的MLLMs在视觉差异检测上远低于人类水平。Qwen3-VL-32B在所有模型中表现最好,总体准确率为68.07%。
- 通过OddGrid-GRPO,模型在视觉差异检测上取得显著提升,准确率达到70.86%。
- 人类参与者在所有类别上的总准确率为87.47%,显著高于模型。
研究意义
研究揭示了当前MLLMs在低级视觉感知上的不足,特别是在检测细微视觉差异方面。通过引入新的基准测试和强化学习框架,本文为多模态智能的感知基础奠定了基础,有助于提高模型在复杂视觉任务中的表现。
技术贡献
本文提出了一个可控的基准测试OddGridBench,能够系统评估MLLMs的视觉差异敏感性。通过OddGrid-GRPO框架,结合课程学习和距离感知奖励,显著提高了模型的细粒度视觉辨别能力。
新颖性
OddGridBench是首个专注于评估MLLMs视觉差异敏感性的基准测试。OddGrid-GRPO通过课程学习和距离感知奖励的结合,为增强视觉感知提供了新的解决方案。
局限性
- 当前模型在旋转和位置差异检测上表现较差,可能由于这些属性的复杂性和模型的感知能力不足。
- 模型的训练需要大量计算资源,可能限制其在资源有限环境中的应用。
- 在多属性组合情况下,模型的表现仍有提升空间。
未来方向
未来可以探索更复杂的视觉场景和多模态任务中的视觉差异检测。此外,结合其他机器学习方法,如自监督学习,可能进一步提高模型的感知能力。
AI 总览摘要
多模态大语言模型(MLLMs)在视觉语言任务中表现出色,但在低级视觉感知,尤其是检测细微视觉差异方面仍存在不足。OddGridBench基准测试通过1400多张网格图像系统评估MLLMs的视觉差异敏感性。每张图像包含一个与其他元素在颜色、大小、旋转或位置上不同的元素。实验结果显示,所有评估的MLLMs在视觉差异检测上远低于人类水平。为此,本文提出OddGrid-GRPO强化学习框架,通过课程学习和距离感知奖励来提高模型的视觉辨别能力。OddGrid-GRPO显著提升了模型的细粒度视觉辨别能力,准确率达到70.86%。研究揭示了当前MLLMs在低级视觉感知上的不足,特别是在检测细微视觉差异方面。通过引入新的基准测试和强化学习框架,本文为多模态智能的感知基础奠定了基础,有助于提高模型在复杂视觉任务中的表现。
深度分析
研究背景
近年来,多模态大语言模型(MLLMs)在视觉语言任务中取得了显著进展,主要集中在高层次的视觉理解和推理。然而,现有的评估标准往往忽视了人类视觉系统的一个重要方面,即在视觉场景中检测细微差异的能力。这种感知敏感性是稳健的空间推理、对象理解和视觉问答的前提。
核心问题
尽管MLLMs在高层次视觉任务中表现出色,但在低级视觉感知,尤其是检测细微视觉差异方面仍存在不足。现有的评估标准往往忽视了这一重要方面,导致模型在复杂视觉任务中的表现不够稳健。
核心创新
本文提出OddGridBench,一个可控且可扩展的基准测试,旨在系统评估MLLMs的视觉感知差异敏感性。通过生成基于网格的图像,OddGridBench能够在多个感知维度上进行定量和系统分析。此外,提出了OddGrid-GRPO,一个结合课程学习和距离感知奖励的强化学习框架,显著提高了模型的细粒度视觉辨别能力。
方法详解
- �� OddGridBench生成超过1400张网格图像,每张图像包含一个与其他元素在颜色、大小、旋转或位置上不同的元素。
- �� OddGrid-GRPO通过课程学习逐步控制训练样本的难度,并在奖励设计中加入空间邻近约束。
- �� 通过距离感知奖励,模型能够获得连续的感知反馈,从而提高视觉差异检测能力。
实验设计
实验在OddGridBench基准测试上进行,评估了19个代表性MLLMs,包括开源和专有系统。使用AdamW优化器,学习率为1×10−6,权重衰减为1×10−2,梯度裁剪为1.0。所有实验使用相同配置以确保公平比较。
结果分析
实验结果显示,所有评估的MLLMs在视觉差异检测上远低于人类水平。Qwen3-VL-32B在所有模型中表现最好,总体准确率为68.07%。通过OddGrid-GRPO,模型在视觉差异检测上取得显著提升,准确率达到70.86%。
应用场景
OddGridBench和OddGrid-GRPO为多模态智能的感知基础奠定了基础,有助于提高模型在复杂视觉任务中的表现。可应用于自动驾驶、机器人视觉和增强现实等领域。
局限与展望
当前模型在旋转和位置差异检测上表现较差,可能由于这些属性的复杂性和模型的感知能力不足。模型的训练需要大量计算资源,可能限制其在资源有限环境中的应用。在多属性组合情况下,模型的表现仍有提升空间。
通俗解读 非专业人士也能看懂
想象你在一个大型超市购物,货架上摆满了各种商品。你需要找到一个与其他商品略有不同的商品,比如颜色稍微不同或位置稍微偏移的商品。OddGridBench就像这个超市,它通过生成网格图像来评估模型的视觉差异敏感性。OddGrid-GRPO则是一个聪明的购物助手,它通过不断学习和调整来帮助你更快地找到不同的商品。
简单解释 像给14岁少年讲一样
嘿,小朋友们!想象一下你在玩一个找不同的游戏,屏幕上有很多相似的图案,但其中一个有点不一样。这个游戏就像OddGridBench,它帮助我们评估计算机模型在找不同上的能力。OddGrid-GRPO就像一个超级助手,它通过不断练习来提高模型的找不同能力,让它变得更聪明。是不是很酷?
术语表
多模态大语言模型 (Multimodal Large Language Models)
结合视觉和语言信息的模型,用于处理复杂的视觉语言任务。
用于评估视觉差异敏感性。
视觉差异 (Visual Discrepancy)
视觉场景中元素之间的细微差异,如颜色、大小、旋转或位置。
OddGridBench用于评估模型检测视觉差异的能力。
强化学习 (Reinforcement Learning)
通过奖励机制来训练模型,使其在特定任务中表现更好。
OddGrid-GRPO使用强化学习来提高视觉辨别能力。
课程学习 (Curriculum Learning)
逐步增加训练样本难度,以稳定学习过程。
OddGrid-GRPO通过课程学习提高模型的视觉敏感性。
距离感知奖励 (Distance-aware Reward)
根据预测与真实位置的空间距离提供连续反馈。
OddGrid-GRPO使用距离感知奖励来增强视觉差异检测。
开放问题 这项研究留下的未解疑问
- 1 如何在复杂视觉场景中提高MLLMs的细粒度差异检测能力仍是一个开放问题。
- 2 现有方法在多属性组合情况下的表现仍有提升空间,需要进一步研究。
应用场景
近期应用
自动驾驶
OddGridBench和OddGrid-GRPO可用于提高自动驾驶系统的视觉感知能力,帮助识别道路上的细微变化。
远期愿景
增强现实
通过提高视觉差异检测能力,增强现实应用可以更好地与真实世界进行交互,实现更自然的用户体验。
原文摘要
Multimodal large language models (MLLMs) have achieved remarkable performance across a wide range of vision language tasks. However, their ability in low-level visual perception, particularly in detecting fine-grained visual discrepancies, remains underexplored and lacks systematic analysis. In this work, we introduce OddGridBench, a controllable benchmark for evaluating the visual discrepancy sensitivity of MLLMs. OddGridBench comprises over 1,400 grid-based images, where a single element differs from all others by one or multiple visual attributes such as color, size, rotation, or position. Experiments reveal that all evaluated MLLMs, including open-source families such as Qwen3-VL and InternVL3.5, and proprietary systems like Gemini-2.5-Pro and GPT-5, perform far below human levels in visual discrepancy detection. We further propose OddGrid-GRPO, a reinforcement learning framework that integrates curriculum learning and distance-aware reward. By progressively controlling the difficulty of training samples and incorporating spatial proximity constraints into the reward design, OddGrid-GRPO significantly enhances the model's fine-grained visual discrimination ability. We hope OddGridBench and OddGrid-GRPO will lay the groundwork for advancing perceptual grounding and visual discrepancy sensitivity in multimodal intelligence. Code and dataset are available at https://wwwtttjjj.github.io/OddGridBench/.