UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning

TL;DR

UI-Ins通过多视角指令推理提升GUI定位,UI-I2E-Bench上达87.3%。

cs.CV 🔴 高级 2025-10-23 5 次浏览
Liangyu Chen Hanzhang Zhou Chenglin Cai Jianan Zhang Panrong Tong Quyu Kong Xu Zhang Chen Liu Yuqi Liu Wenxuan Wang Yue Wang Qin Jin Steven Hoi
GUI定位 多视角推理 指令多样性 强化学习 深度学习

核心发现

方法论

该研究提出了“指令即推理”范式,通过监督微调和强化学习两阶段训练框架,利用多样化指令进行推理路径选择。首先,在合成的多样化指令上进行监督微调,接着通过强化学习优化路径选择和组合。

关键结果

  • UI-Ins-32B在UI-I2E-Bench上取得87.3%的准确率,在ScreenSpot-Pro上为57.0%,在MMBench-GUI L2上为84.9%。
  • UI-Ins-7B在AndroidWorld中作为执行器,成功率达到74.1%。
  • 通过多视角指令推理,模型在推理过程中能够选择最有效的路径,显著提升了性能。

研究意义

该研究通过引入多视角指令推理,显著提升了GUI定位的准确性,解决了传统方法中指令多样性和质量对性能影响被忽视的问题,为GUI代理的智能化发展提供了新的思路。

技术贡献

提出了“指令即推理”新范式,结合监督微调和强化学习,突破了现有方法中指令处理的局限性,提供了新的理论保证和工程可能性。

新颖性

首次将指令视为动态推理路径,而非静态输入,显著提升了模型在多样化指令下的适应能力。

局限性

  • 在某些复杂场景中,模型可能无法选择最优推理路径,导致性能下降。
  • 数据集的指令质量问题仍需进一步改善。

未来方向

未来可探索更复杂的推理路径选择机制,以及在更多实际应用场景中的验证。

AI 总览摘要

在GUI定位领域,传统方法往往忽视了指令多样性和质量对性能的影响。UI-Ins通过引入“指令即推理”范式,利用多视角指令作为动态推理路径,显著提升了定位准确性。该方法采用两阶段训练框架,首先在合成的多样化指令上进行监督微调,然后通过强化学习优化路径选择。实验结果表明,UI-Ins在多个基准测试中取得了领先的性能,尤其是在UI-I2E-Bench上达到了87.3%的准确率。这一研究不仅在学术界具有重要意义,也为工业界的GUI代理开发提供了新的思路。然而,模型在复杂场景中的表现仍需进一步优化,未来的研究可以探索更复杂的推理机制和更多实际应用。

深度分析

研究背景

GUI定位是人工智能领域的重要研究方向,旨在将自然语言指令映射到可操作的UI元素。传统方法通常将指令视为静态输入,忽视了指令多样性和质量对定位性能的影响。

核心问题

现有方法在处理多样化指令时表现不佳,无法有效利用不同指令视角进行推理,导致定位准确性不足。

核心创新

UI-Ins通过“指令即推理”范式,将指令视为动态推理路径,利用多视角指令进行推理路径选择,显著提升了模型在多样化指令下的适应能力。

方法详解

  • �� 监督微调:在合成的多样化指令上进行训练,增强模型的多视角推理能力。
  • �� 强化学习:通过GRPO优化推理路径选择,提升模型在不同场景下的性能。

实验设计

实验使用了多个公开数据集,包括OS-Atlas、AMEX等,采用UI-Ins-7B和UI-Ins-32B模型进行测试,评估了模型在不同基准测试中的表现。

结果分析

UI-Ins-32B在UI-I2E-Bench上取得了87.3%的准确率,显著优于现有方法。此外,模型在其他基准测试中也表现出色。

应用场景

该方法可用于智能GUI代理的开发,提升人机交互的效率和准确性,特别是在复杂应用场景中。

局限与展望

模型在处理复杂场景时可能存在推理路径选择不当的问题,未来需进一步优化推理机制。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,菜谱就像是指令,而食材就是UI元素。传统方法就像只看菜谱标题做菜,而UI-Ins则是详细阅读每个步骤,选择最合适的做法。这样一来,即使菜谱有多种描述方式,UI-Ins也能找到最佳的烹饪路径,做出美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要根据提示找到隐藏的宝藏。以前的方法就像只看提示的第一句话,而UI-Ins就像是一个聪明的朋友,会仔细分析每个提示,找出最有效的线索,帮助你快速找到宝藏。是不是很酷?

术语表

GUI定位

将自然语言指令映射到图形用户界面中的可操作元素的过程。

研究的核心任务。

指令即推理

将指令视为动态推理路径的范式,提升模型在多样化指令下的适应能力。

研究提出的新范式。

监督微调

在合成数据上进行的训练,以增强模型的特定能力。

训练框架的第一阶段。

强化学习

通过奖励机制优化模型决策的学习方法。

训练框架的第二阶段。

GRPO

一种用于强化学习的策略优化方法。

用于优化推理路径选择。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂场景中选择最优推理路径?现有方法在这方面的表现仍需提升。
  • 2 如何进一步提高数据集的指令质量,以减少训练噪声?

应用场景

近期应用

智能助手

可用于开发更智能的GUI助手,提高人机交互效率。

远期愿景

自动化办公

在未来,可能彻底改变办公自动化的方式,提升生产力。

原文摘要

GUI grounding, which maps natural-language instructions to actionable UI elements, is a core capability of GUI agents. Prior works largely treats instructions as a static proxy for user intent, overlooking the impact of instruction diversity and quality on grounding performance. Through a careful investigation of existing grounding datasets, we find a 23.3% flaw rate in their instructions and show that inference-time exploitation of instruction diversity yields up to a substantial 76% relative performance improvement. In this paper, we introduce the Instruction-as-Reasoning paradigm, treating instructions as dynamic analytical pathways that offer distinct perspectives and enabling the model to select the most effective pathway during reasoning. To achieve this, we propose a two-stage training framework: supervised fine-tuning (SFT) on synthesized, diverse instructions to instill multi-perspective reasoning, followed by reinforcement learning (RL) to optimize pathway selection and composition. Our resulting models, UI-Ins-7B and UI-Ins-32B, achieve state-of-the-art results on five challenging grounding benchmarks and exhibit emergent reasoning, selectively composing and synthesizing novel instruction pathways at inference. In particular, UI-Ins-32B attains the best grounding accuracy, scoring 87.3% on UI-I2E-Bench, 57.0% on ScreenSpot-Pro, and 84.9% on MMBench-GUI L2. Furthermore, our model demonstrates strong agentic potential, achieving a 74.1% success rate on AndroidWorld using UI-Ins-7B as the executor. Our in-depth analysis reveals additional insights such as how reasoning can be formulated to enhance rather than hinder grounding performance, and how our method mitigates policy collapse in the SFT+RL framework. All code and model checkpoints will be publicly released in https://github.com/alibaba/UI-Ins.

cs.CV cs.AI