What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs

TL;DR

提出Re-Prefill方法,通过二次注意引导改善VLM GUI定位,提升最大4.3%。

cs.CV 🔴 高级 2026-05-10 70 次浏览
Jiaping Lin Fei Shen Junzhe Li Ping Nie Fei Yu Ming Li Haizhou Li
视觉-语言模型 GUI定位 推理优化 注意力机制 无训练微调

核心发现

方法论

本文分析VLM在GUI定位中的推理过程,发现prefill阶段决定候选元素,错误难以修正。提出基于注意力引导的二次prefill策略,利用模型层间高注意力视觉标记,重评候选区域,增强目标选择。该方法无需额外训练,结合输入指令和候选视觉信息,优化推理流程。通过多模型、多基准验证,展现出在ScreenSpot-Pro、OSWorld-G等五个数据集上提升最大4.3%的性能。核心在于利用层间注意力一致性筛选关键视觉标记,进行第二次prefill,强化目标识别。

关键结果

  • 在四个VLM模型上,Re-Prefill在五个GUI基准上均显著提升性能,ScreenSpot-Pro最高提升4.3%,从65.8%到70.1%;OSWorld-G提升2.7%,从63.0%到70.1%。模型表现普遍优于现有训练-free方法如ZoomClick、UI-Zoomer,验证了其有效性和泛化能力。
  • 在复杂交互场景中,Re-Prefill依然有效,提升多平台、多指令场景的定位准确率。对比单次prefill,二次引导显著减少偏差,错误识别率降低,验证其在目标候选筛选中的关键作用。
  • 通过层间注意力一致性筛选关键视觉标记,结合层次prefix策略,模型在保持语义一致的同时,增强了候选区域的定位精度。该机制可推广至其他视觉-语言任务,具有较强的扩展潜力。

研究意义

该研究揭示GUI定位中prefill阶段的决定性作用,突破了传统多轮推理无法修正偏差的局限,为无训练微调的推理优化提供新思路。其创新的注意力引导机制,显著提升模型在复杂UI环境中的表现,有望推动自主交互系统、智能界面设计等应用的发展。该方法简洁高效,兼容多模型架构,为未来GUI理解提供理论基础和工程方案。

技术贡献

提出基于层间注意力一致性的二次prefill策略,突破了现有单阶段prefill的局限,实现目标候选区域的深度重评。该方法无需额外训练,利用模型内部注意力信息进行动态筛选,增强推理的鲁棒性。通过引入多层次注意力机制和prefix策略,有效提升了目标定位的准确性。实验验证其在多个模型和基准上的普适性,展示出在无监督场景下的优越性能,为视觉-语言交互提供新技术路径。

新颖性

本研究首次系统分析GUI定位中prefill阶段的关键作用,提出利用层间注意力一致性进行候选区域筛选的无训练优化策略。区别于传统多轮推理或后处理方法,Re-Prefill在推理过程中动态重评目标,显著改善偏差不可逆问题。这一机制为模型内部信息利用提供新思路,具有较强创新性和实用价值。

局限性

  • 该方法依赖模型层间注意力的稳定性,对于极端模糊或遮挡场景,候选区域筛选可能失效,影响整体性能。
  • 在超大规模模型或低资源环境中,二次prefill可能带来额外计算开销,影响实时性。
  • 目前未结合多模态信息或交互反馈,未来需探索多源信息融合以进一步提升效果。

未来方向

未来将结合多模态信息和交互式反馈,增强候选区域筛选的鲁棒性。还计划引入动态阈值和多层次注意力机制,优化不同场景下的适应性。探索模型内部可解释性,理解prefill偏差的根源,为自主系统提供更可靠的目标识别方案。此外,将扩展至更复杂的交互任务和多模态场景,推动智能界面与人机交互技术的发展。

AI 总览摘要

本研究聚焦于视觉-语言模型(VLM)在GUI定位任务中的推理流程,揭示prefill阶段在候选元素筛选中的关键作用。传统方法多依赖多轮推理或候选聚合,计算成本高且难以修正偏差。作者通过细致分析attention动态,发现prefill阶段的目标选择一旦偏差,难以在后续解码中修正。为此,提出Re-Prefill策略,利用模型层间注意力一致性筛选出关键视觉标记,进行第二次prefill,强化目标候选的准确性。该方法无需额外训练,结合输入指令和候选视觉信息,显著提升多模型、多基准的性能,最高提升4.3%。实验结果在高分辨率界面、复杂交互、多平台环境中均验证了其有效性。该技术为GUI理解提供新思路,推动自主交互系统的发展。未来,将结合多模态信息和交互反馈,进一步优化推理流程,拓展应用场景,助力智能界面与人机交互的创新。

深度解读

原文摘要

Existing training-free approaches for GUI grounding often rely on multiple inference runs, such as iterative cropping or candidate aggregation, to identify target elements. Despite this additional computation, each forward pass still independently interprets the instruction and parses the visual layout, without enabling progressive interaction among visual tokens. In this paper, we study what happens during GUI grounding in Vision-Language Models (VLMs) and identify a previously overlooked bottleneck. We show that grounding follows a two-stage paradigm: the prefill stage determines candidate UI elements, while the decoding stage subsequently refines the final coordinates. This asymmetry establishes prefill as the critical step, as errors in candidate selection cannot be effectively corrected during decoding. Based on this observation, we propose Re-Prefill, a training-free method that revisits inference by introducing an attention-guided second prefill stage to refine target selection. Specifically, visual tokens that consistently receive high attention from the query position, i.e., the final token, across layers are extracted as a preliminary target hypothesis and appended to the input, together with the instruction hidden states, enabling the model to deeply re-think its decision before coordinate generation. Experiments across four VLMs and five benchmarks, including ScreenSpot-Pro, ScreenSpot-V2, OSWorld-G, UI-Vision, and MMBench-GUI, demonstrate consistent improvements without additional training, with gains of up to 4.3% on ScreenSpot-Pro. Code will be available at https://github.com/linjiaping1/Re-Prefill.

cs.CV