SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

TL;DR

SEER以查询特定证据提升空间分类,GQA冻结测试较Full提升3.94个百分点。

cs.CV 🟡 进阶级 2026-08-04 17 次浏览
Feixiang Liu Likun Wang Qiang Qiu Hui Xu Huawei Shen Xueqi Cheng
视觉语言模型 空间关系分类 视觉证据 无训练推理 实体定位

核心发现

方法论

SEER是面向冻结视觉语言模型(VLM)的无训练推理接口。它先在隐藏候选关系的条件下,用同一VLM定位查询主语和宾语;随后构造Full原图、带S/O角色标记的局部视图和阈值筛选的Geometry证据。模型分别给出选项对数概率,按公式(2)以几何证据或更大间隔选择前向结果;若协议支持精确逆关系,再用交换主客体的互反一致性按公式(3)进行有限修正。

关键结果

  • 在图像不重叠、评分前冻结的GQA-Train900九关系测试集上,Qwen3-Instruct与Qwen3-Thinking相对Full分别提升3.11和4.78个百分点,合并提升3.94个百分点,95%区间为[2.17,5.72]。
  • 在2,434个EmbSpatial成对关系问题上,Qwen3-Instruct、Qwen3-Thinking和InternVL3.5分别较Full提升4.35、5.09和11.79个百分点,说明方法可跨模型迁移。
  • 机制控制显示Marker带来主要收益:开发集初始提升约2.18点;互反修正额外贡献约1.36点。GQA冻结测试中修正触发10.61%,纠正40例、造成18例错误。

研究意义

论文将空间推理失败重新定义为证据接口和实体绑定问题,而不仅是模型缺乏空间知识。它说明模型可能认出两个物体,却因选错实例、忽略角色顺序或依赖模糊全局视图而答错。SEER在不训练、不改权重、不使用外部检测器的条件下改善这些环节,为VQA、具身交互、图表理解和视觉辅助安全系统提供了低成本干预。

技术贡献

技术上,SEER把查询对转化为显式、互补的证据状态,并通过target-relation-hidden self-grounding避免定位过程读取答案标签。其固定阈值τ=0.5、无学习选择器、无效框回退Full,保证了统一分母和可审计性。Geometry仅处理left/right与inside/contains等可由二维框支持的关系;精确逆映射下的主客体交换提供了受协议约束的等变性检查。

新颖性

与Set-of-Mark、Graph-of-Mark或外部检测器不同,SEER由冻结VLM为当前查询自定位,仅标记相关实体并显式赋予S/O角色;与训练空间模型不同,它不引入新参数。核心新意不是裁剪或框本身,而是将关系隐藏定位、角色证据、完整上下文和确定性决策组合成可控接口。

局限性

  • 自定位错误会污染Marker和Geometry;尽管无效框回退Full,错误但形式有效的框仍可能诱导模型关注错误实例。
  • 二维框无法可靠表达front/behind,也不能仅凭垂直位移区分above/below/on,因此Geometry必须弃权,收益依赖视觉模型本身。
  • 互反修正只适用于具有精确逆关系且含逆候选的选择协议,不能普遍用于开放式回答或near/far等关系。

未来方向

后续可研究更可靠的多实例定位、分割和深度证据,并将Geometry扩展为具有不确定性估计的三维布局表示。还应在VSR、SpatialSense及真实机器人场景中进行更大规模、跨语言和跨视角测试,探索轻量学习型证据选择器,同时保持答案关系不泄漏和可审计的实验协议。

AI 总览摘要

视觉语言模型常能识别“红杯子”和“蓝书”,却仍可能回答错它们之间的左右关系。原因往往不是词汇不足,而是模型从多个相似实例中选错对象,或只依赖模糊的全图印象。SEER把问题转化为“先准备正确证据,再判断关系”:它在定位时隐藏候选关系,避免模型反向迎合答案。

SEER使用冻结VLM构造三类互补输入:保留语境的Full原图、在局部区域用红色S框和蓝色O框明确主客体的Marker视图,以及从框中心和覆盖率计算的稀疏Geometry证据。模型通过选项对数概率间隔选择证据状态;在支持left/right、inside/contains等精确逆关系时,还交换S/O检查互反一致性。整个流程不训练模型,阈值τ固定为0.5,定位失败回退原图。

结果显示,图像不重叠的GQA-Train900上,SEER较Full提升3.94个百分点;EmbSpatial的2,434题上,三种模型提升4.35至11.79点。控制实验表明,局部重聚焦和角色显式化是主要来源,互反修正是较小的补充。其价值在于证明:改善VLM的视觉证据接口,有时比增加更长的推理链更有效。

深度分析

研究背景

VSR、What’sUp、GQA、ARO和SpatialSense表明,VLM在物体识别之外仍难稳定绑定空间关系。已有方法包括Set-of-Mark、Graph-of-Mark、SpatialVLM和Spatial-RGPT,但它们通常依赖外部标记、额外训练或更强模型。SEER关注冻结模型的推理时证据构造。

核心问题

给定图像I、主语s、宾语o和选项集A,目标是判断r(s,o)。困难在于多实例指代、主客体顺序和全局视图歧义。若定位阶段看到候选关系,框可能被答案泄漏污染;若只看局部,又可能丢失上下文。

核心创新

第一,使用target-relation-hidden self-grounding,仅输入图像与实体名称。第二,将查询对转为带S/O角色的局部Marker证据。第三,保留Full并选择性加入Geometry,形成互补而非单一裁剪。第四,在精确逆关系协议中使用主客体交换,进行确定性的互反冲突消解。

方法详解

  • �� Grounding:冻结grounder G输出归一化框bs、bo;框需有效、非退化且位于图像内。
  • �� Marker:裁剪带padding的框联合区域,主语绘红框S,宾语绘蓝框O。
  • �� Geometry:用框中心位移或覆盖率产生候选;阈值τ=0.5,无法支持的关系弃权。
  • �� Scoring:对Full和Marker计算长度归一化选项对数概率ℓ(a),间隔m为最佳与次佳分数差。
  • �� Decision:Geometry合格时优先,否则选择间隔更大的视觉状态;无效定位回退Full。
  • �� Refinement:若Full与Marker冲突且Geometry弃权,交换S/O;仅当恰有一个状态满足精确逆关系时改写结果。

实验设计

研究使用GQA 11,070例、VG 9,702例开发池和900张独立图像的GQA-Train900冻结测试;另测2,434题、276场景的EmbSpatial。模型包括Qwen3-VL-8B-Instruct/Thinking、Qwen2.5-VL-7B-Instruct、R1-Onevision-7B和InternVL3.5-8B-HF。比较Full、Crop、Marker、Forward与SEER,并采用配对McNemar检验和20,000次按图像或场景聚类bootstrap。

结果分析

GQA-Train900中,Qwen3-I从75.33升至78.44,Qwen3-T从70.56升至75.33,合并增益3.94点。开发池Qwen3-I和T分别提升3.03和4.95点;平衡跨模型池提升4.26点。EmbSpatial三模型增益为4.35、5.09和11.79点。Marker贡献最大,互反修正带来较小但正向的增益。

应用场景

SEER可直接用于无需再训练的VQA系统、视觉搜索和辅助阅读:系统先定位用户指定实体,再向模型展示角色明确的证据。机器人导航和工业巡检可利用Full保留上下文、Geometry提供粗粒度布局,但部署前需验证定位质量、关系集合和模型的框输出接口。

局限与展望

方法依赖VLM自定位,形式有效的错误框仍会造成证据偏置;二维框缺乏深度,Geometry不能覆盖front/behind等关系。结果主要来自受控关系分类,不能直接代表开放世界空间推理。未来应引入分割、深度和不确定性估计,并在真实多实例、动态和跨语言环境中测试。

通俗解读 非专业人士也能看懂

把VLM想成一个仓库管理员。有人问:“红杯子在蓝书的哪边?”管理员可能看见两只杯子和两本书,于是拿错物品,或者站在仓库门口凭整体印象猜答案。SEER先把“左边、右边、上面”等选项藏起来,只告诉管理员要找哪一个杯子和哪一本书,这样他不能为了迎合答案而挑位置。

找到后,系统准备三张工作单:第一张是整个仓库,防止丢失背景;第二张只放相关区域,并用S和O标签写明谁是主角、谁是参照物;第三张是简单平面图,显示两个箱子的中心位置。系统通常相信信息更清楚的工作单;如果平面图足够可靠,就直接使用。

如果“杯子在书左边”和交换询问后的结果不能互相对应,系统只在一个工作单符合相反关系时修正答案。实验证明,这种“先找对东西,再比较位置”的安排,比单纯让管理员反复思考更有效。

简单解释 像给14岁少年讲一样

想象你在玩找物品游戏:题目问“红色角色在蓝色宝箱的左边还是右边?”地图上可能有好几个红色角色和宝箱。普通AI虽然认得颜色,却可能盯错目标。SEER像一个聪明的队友,先把答案选项藏起来,只圈出题目指定的两个东西。

它会给AI三种视角:整张地图、只放两个目标并标上“S”和“O”的放大图,还有显示两个目标位置的简易小地图。S代表题目中的主角,O代表被比较的对象。这样AI不但看得近,还知道谁要和谁比较。

如果两种视角给出不同答案,SEER会把两个人物的位置交换,再检查答案是否应该反过来。例如左边和右边必须成对出现。只有一个视角符合这个规则时,它才改答案,不会随便投票。

在GQA-Train900上,它比只看原图高3.94个百分点;在EmbSpatial上,三个模型提高4.35到11.79点。它没有重新训练AI,像是给同一个玩家更好的地图和标记。可是它仍可能圈错对象,也看不出真正的前后深度,所以不是万能外挂!

术语表

Self-grounding(自定位)

模型根据实体名称在图像中寻找对应区域。SEER要求定位时不能看到候选关系。

生成主语框bs与宾语框bo。

Full Image Evidence(全图证据)

未经修改的图像与原问题,保留完整场景语境。它也是定位失败时的回退状态。

作为基线和安全证据。

S/O Marker(主客体标记)

在局部视图中用S标记主语、O标记宾语。它同时提供局部重聚焦和角色显式化。

SEER的主要视觉干预。

Geometry Evidence(几何证据)

由边界框中心、范围或覆盖率计算的确定性布局提示。它只在关系和置信度合适时启用。

阈值τ固定为0.5。

Reciprocal consistency(互反一致性)

交换主客体后,关系应映射为精确逆关系,例如left-of与right-of。SEER仅在单一状态符合时修正。

公式(3)的可选步骤。

开放问题 这项研究留下的未解疑问

  • 1 错误框但非退化的定位如何被可靠识别?现有回退机制只能处理格式无效,不能识别语义错配。
  • 2 二维框无法表达深度和遮挡。需要融合分割、深度或视频时序证据,才能覆盖更广泛的空间关系。
  • 3 SEER在开放式生成、真实机器人和跨语言指代中的稳定性仍未知,需更大规模外部验证。

应用场景

近期应用

视觉问答增强

VQA系统可在不修改模型参数的情况下,对用户指定的两个实体自动生成S/O标记视图,再与原图共同评分。前提是模型支持框输出和选项概率,预期可减少多实例指代与角色混淆错误。

辅助阅读与检索

图像检索、无障碍描述和文档问答系统可用SEER突出问题相关对象,例如图表中的两条曲线或照片中的人物。Full视图保留上下文,Marker视图帮助模型精确比较空间关系。

远期愿景

具身智能空间接口

机器人可把“拿起桌上盒子左侧的杯子”转化为角色明确的视觉证据,再交给冻结或轻量更新的VLM决策。长期障碍包括深度、动态遮挡、定位安全性和实时计算成本。

原文摘要

Spatial relation questions require a model to identify the queried subject and object before comparing their layout. Yet a VLM can recognize both entities and still answer from the wrong instance or an ambiguous global view. We ask whether making query-specific evidence explicit can mitigate this failure and propose SEER (Self-grounded Evidence for Entity-Relation Reasoning), a training-free inference-time evidence interface for frozen VLMs. SEER hides candidate relations during pair localization, constructs a query-specific view with explicit subject/object roles, and retains the full image and sparse box geometry as complementary evidence. For relation-choice protocols with exact inverse support, an optional refinement swaps the entity roles and changes the forward decision only when exactly one visual state obeys the corresponding inverse relation. On an image-disjoint GQA-Train900 test frozen before model scoring, SEER pools to +3.94 [2.17,5.72] over Full; the gain remains positive under label-independent grounding-order counterbalancing and on the 535 rows whose entity names are unique. The unchanged protocol yields +4.35 to +11.79 on all 2,434 filtered EmbSpatial pair-relation questions across three models. Matched controls separate local refocus from role-explicit conditioning. These results establish query-specific evidence construction as the principal intervention, with reciprocal consistency as a smaller protocol-specific refinement.

cs.CV