核心发现
方法论
采用经典视觉搜索范式(特征与结合搜索、空间配置、枚举与搜索不对称),通过模型推理tokens数量作为搜索努力的代理指标。将模型多次调用(API调用)中的推理token数与人类反应时间进行对比,基于大规模人类基准数据(Wolfe et al., 2010)。实验设计包括六个模型配置,涵盖中端与前沿模型,分析模型在不同搜索任务中的表现。通过控制变量(如模糊处理)验证搜索努力的真实性,确保模型努力反映搜索过程而非简单的识别难度。
关键结果
- 模型在特征搜索中表现出平坦的努力成本,符合人类反应时间的平缓趋势;在结合搜索中,努力随着目标集大小增加而上升,尤其在最强模型(GPT-5.5)中表现明显,努力增长率达4.98 tokens/item。模型在准确率方面,前沿模型保持接近人类水平(98%),而中端模型在大规模集合中崩溃至随机水平(50%),验证模型能力的差异。
- 模型在搜索不对称任务中表现出与人类相反的努力梯度:目标存在时,努力较低;目标缺失时,努力反而更大,反转了人类的反应模式(人类在确认目标不存在时更费力)。在枚举任务中,模型保持高准确率(接近100%),但其推理tokens数量显著增加,表明模型通过增加计算量而非减少努力来应对负载。
- 在空间配置搜索中,模型(GPT-5.5)表现出逐渐上升的努力曲线,验证其搜索的串行特性;而Claude模型几乎无努力变化,表现出不同的认知策略。搜索不对称实验显示,模型在难度较高的反向任务中付出更多努力,但在某些任务中表现出与人类不同的策略偏差。
研究意义
本研究首次系统性地将经典视觉搜索范式应用于视觉语言模型,揭示其认知机制的相似性与差异性。通过模拟反应时间的努力指标,提供了一种无需内部机制访问的评估途径,为理解机器视觉认知提供了新视角。这不仅丰富了模型的行为表征,也为未来模型的认知能力提升提供了理论基础。研究强调行为学范式在AI模型评估中的价值,推动机器认知与人类认知的对比研究,具有重要的学术和应用意义。
技术贡献
提出利用推理tokens数量作为搜索努力的代理指标,创新性地将心理物理学中的反应时间模型迁移到机器学习模型中。设计了多项经典视觉搜索任务(特征/结合搜索、空间配置、枚举、搜索不对称),实现无需内部机制信息即可评估模型认知策略。通过对比不同模型(中端与前沿)在多任务中的表现,揭示模型在搜索策略、认知负荷与准确率上的行为特征,为模型行为解释提供了新的量化工具。
新颖性
首次将经典视觉搜索范式引入VLM评估,利用推理tokens作为反应时间的模拟指标,突破传统只用准确率和反应时间的限制。提出模型努力的量化方法,揭示模型在不同任务中的搜索策略差异。与以往仅关注表面性能不同,本研究深入探讨模型认知机制的行为特征,提供了系统性行为学分析框架,具有开创性。
局限性
- 模型推理tokens作为努力指标虽有启发性,但不能完全等同于人类反应时间,受到模型内部机制和训练偏差影响,存在一定解释偏差。
- 实验主要集中在特定范式和模型(GPT-4、GPT-5.5、Claude),未来需扩展到更多模型和任务,验证普适性。
- 对模糊处理和视觉干扰的控制有限,未能全面模拟复杂视觉环境中的搜索行为,未来需引入更丰富的场景和动态任务。
未来方向
未来将结合多模态数据和动态场景,丰富模型搜索行为的行为学分析。探索不同模型架构(如视觉Transformer、融合模型)在搜索策略上的差异。引入更复杂的干扰和噪声环境,验证模型在真实场景中的认知机制。进一步完善努力指标的理论基础,结合神经机制模型,推动模型认知的深层理解。
AI 总览摘要
本研究将经典视觉搜索范式引入视觉语言模型(VLM)的行为分析中,提出以推理tokens数量模拟反应时间,评估模型的搜索策略。通过设计特征与结合搜索、空间配置、枚举和搜索不对称等多项任务,分析模型在不同任务中的努力变化。结果显示,前沿模型(如GPT-5.5)在特征搜索中表现出平坦的努力成本,符合人类的反应时间特征;在结合搜索中,努力随目标集大小增加,表现出串行搜索的行为。模型在准确率方面,表现出明显差异:前沿模型保持高准确率,而中端模型在大规模集合中崩溃,验证了能力差异。值得注意的是,模型在搜索不对称任务中表现出与人类相反的努力梯度:在确认目标不存在时,模型付出更大努力,反转了人类的反应模式。这一发现揭示了模型在认知策略上的不同。研究强调,心理物理学范式在评估机器认知中的价值,为理解和改进VLM提供了新工具。未来工作将结合更复杂的场景和模型架构,深化对机器认知机制的理解,推动AI在视觉认知领域的应用发展。
深度分析
研究背景
视觉搜索作为研究视觉注意的经典范式,已发展出丰富的理论体系。Treisman与Gelade(1980)提出特征预注意和结合搜索的区分,Wolfe(2021)扩展了引导搜索模型,强调预注意特征图的作用。反应时间的搜索坡度成为判断机制的关键指标。近年来,视觉语言模型(VLM)在图像理解中表现出色,但其认知机制仍不清晰,特别是在视觉搜索方面的表现。已有研究发现,VLM在基础感知任务上表现欠佳(Rahmanzadehgervi et al., 2024),存在绑定问题(Campbell et al., 2024),这些都提示其认知过程与人类不同。
核心问题
核心问题是,VLM在视觉搜索任务中的行为是否与人类相似。反应时间作为人类认知的关键指标,无法直接应用于模型,因为模型没有时间维度。如何量化模型的搜索努力,成为评估其认知机制的难题。现有方法多依赖准确率或反应时间,缺乏行为学的深层分析。解决这一问题,有助于理解模型的认知策略,推动模型更接近人类的认知方式。
核心创新
本研究的创新在于:1)引入推理tokens数量作为搜索努力的代理指标,模拟反应时间的变化趋势;2)系统性地将经典视觉搜索范式(特征/结合搜索、空间配置、枚举、搜索不对称)应用于VLM,验证其搜索行为的串行或并行特征;3)通过控制变量(如模糊处理)验证搜索努力的真实性,避免误判努力来源。此方法突破了传统只用反应时间和准确率的限制,为模型认知机制提供了量化分析工具。
方法详解
- �� 设计多项经典视觉搜索任务(特征、结合、空间配置、枚举、搜索不对称),每项任务包括不同目标集大小和目标存在状态。• 利用API调用,输入图像和文本提示,模型输出答案,同时记录推理tokens数。• 将推理tokens数作为搜索努力的指标,分析其随任务难度变化的趋势。• 比较不同模型(中端与前沿)在任务中的表现,验证模型搜索策略。• 通过模糊处理验证努力是否反映搜索过程而非识别难度。• 统计模型努力与人类反应时间的相关性,评估模型认知的模拟程度。
实验设计
采用Wolfe等(2010)公开数据集作为人类基准,设计六个模型配置(包括GPT-4、GPT-5.5、Claude等)进行多项任务测试。每项任务包括不同集大小(4、8、16、32)和目标存在/缺失状态,采集模型输出和推理tokens数。通过对比模型努力曲线与人类反应时间坡度,分析模型搜索策略的串行或并行特征。引入模糊处理验证努力的真实性。实验还包括搜索不对称、枚举和空间配置任务,全面评估模型认知行为。
结果分析
模型在特征搜索中表现出平坦努力,符合人类反应时间特征;结合搜索努力随集大小线性上升,尤其在GPT-5.5中表现明显,努力增长率达4.98 tokens/item。前沿模型保持高准确率(接近98%),中端模型在大规模集合中崩溃(50%),验证模型能力差异。搜索不对称实验中,GPT-5.5在难度较高的反向任务中付出更多努力,表现出串行搜索特征,而Claude模型则表现出不同策略偏差。枚举任务中,模型保持高准确,但推理tokens显著增加,表明通过计算量应对负载。
应用场景
该方法可用于评估各种视觉语言模型的认知策略,帮助设计更符合人类认知的模型架构。可应用于自动驾驶、机器人视觉、智能监控等场景,提升模型在复杂环境中的搜索效率和理解能力。未来还可结合多模态信息,优化模型的搜索策略,实现更自然的人机交互。
局限与展望
当前方法主要依赖推理tokens作为努力指标,不能完全等同于人类反应时间,存在模型内部机制差异。实验范围有限,主要集中在特定模型和任务,未来需拓展到更多模型和复杂场景。模糊处理验证虽有效,但未能完全模拟真实视觉干扰环境,未来应引入动态和多样化的视觉干扰因素。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,你需要准备各种食材。有些食材很容易找到,比如盐和胡椒,只需一眼就能找到,像特征搜索;而有些食材,比如不同颜色的蔬菜,需要你仔细看每个角落,逐个确认,像结合搜索。你还可能需要数一数盘子里的苹果有几个,像枚举任务。如果你在找一根倾斜的胡萝卜,和找一根直的,难度不同。这个过程就像大脑在找目标一样,越复杂越费力。研究用模型模拟这个找目标的过程,看看它们是不是像人一样,花费的“努力”是否随着任务难度增加。
简单解释 像给14岁少年讲一样
想象你在玩“找不同”的游戏,你要在一堆图片里找到特定的小物件。有时候,这个物件很明显,比如颜色不同,几秒就能找到,就像人类用快速的“特征搜索”;但有时候,物件很相似,比如两个字母只差一个角度,就得你一个个仔细看,像“结合搜索”。如果你还要数一数有多少个目标,就像在用眼睛数苹果一样。科学家用电脑里的模型模拟这个“找目标”的过程,看看它们是不是像人一样,花费的时间和努力会随着目标变多变复杂而变化。这个研究帮助我们理解,机器是不是在用和人类一样的“脑袋”在找东西。
原文摘要
Visual search has been one of the most productive paradigms in the study of visual attention: the way reaction time scales with the number of items distinguishes parallel, "pop-out" search from serial, attention-demanding search. I ask whether vision-language models (VLMs) exhibit the same behavioral signatures. I adapt four classic paradigms: feature versus conjunction search, spatial-configuration (T-vs-L) search, enumeration, and the tilted/vertical search asymmetry; and present them to current frontier and mid-tier models. Because a single model call has no reaction time, I use the number of reasoning ("thinking") tokens a model spends per trial as a within-model analog of search effort, and I compare against a large public human benchmark (Wolfe et al., 2010). The models reproduce several human signatures: feature search costs flat effort while conjunction effort climbs with set size; frontier models hold accuracy where mid-tier models collapse to chance; and a resolution control shows the conjunction cost is genuine search rather than difficulty resolving small shapes. They also diverge from humans in informative ways. The target-present effort slope exceeds the target-absent slope, reversing the human ordering; enumeration remains accurate where humans would lose count; and a reasoning model with adaptive deliberation declines to deliberate on detection tasks altogether, so that a single search expresses itself as an effort gradient in one model and as an accuracy cliff in another. I argue that psychophysical paradigms, applied behaviorally, are a sharp and inexpensive probe of machine visual cognition, and that the points of divergence are as informative as the points of agreement.