UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
UI-Ins通过多视角指令推理提升GUI定位,UI-I2E-Bench上达87.3%。
核心发现
方法论
该研究提出了“指令即推理”范式,通过监督微调和强化学习两阶段训练框架,利用多样化指令进行推理路径选择。首先,在合成的多样化指令上进行监督微调,接着通过强化学习优化路径选择和组合。
关键结果
- UI-Ins-32B在UI-I2E-Bench上取得87.3%的准确率,在ScreenSpot-Pro上为57.0%,在MMBench-GUI L2上为84.9%。
- UI-Ins-7B在AndroidWorld中作为执行器,成功率达到74.1%。
- 通过多视角指令推理,模型在推理过程中能够选择最有效的路径,显著提升了性能。
研究意义
该研究通过引入多视角指令推理,显著提升了GUI定位的准确性,解决了传统方法中指令多样性和质量对性能影响被忽视的问题,为GUI代理的智能化发展提供了新的思路。
技术贡献
提出了“指令即推理”新范式,结合监督微调和强化学习,突破了现有方法中指令处理的局限性,提供了新的理论保证和工程可能性。
新颖性
首次将指令视为动态推理路径,而非静态输入,显著提升了模型在多样化指令下的适应能力。
局限性
- 在某些复杂场景中,模型可能无法选择最优推理路径,导致性能下降。
- 数据集的指令质量问题仍需进一步改善。
未来方向
未来可探索更复杂的推理路径选择机制,以及在更多实际应用场景中的验证。
AI 总览摘要
在GUI定位领域,传统方法往往忽视了指令多样性和质量对性能的影响。UI-Ins通过引入“指令即推理”范式,利用多视角指令作为动态推理路径,显著提升了定位准确性。该方法采用两阶段训练框架,首先在合成的多样化指令上进行监督微调,然后通过强化学习优化路径选择。实验结果表明,UI-Ins在多个基准测试中取得了领先的性能,尤其是在UI-I2E-Bench上达到了87.3%的准确率。这一研究不仅在学术界具有重要意义,也为工业界的GUI代理开发提供了新的思路。然而,模型在复杂场景中的表现仍需进一步优化,未来的研究可以探索更复杂的推理机制和更多实际应用。
深度分析
研究背景
GUI定位是人工智能领域的重要研究方向,旨在将自然语言指令映射到可操作的UI元素。传统方法通常将指令视为静态输入,忽视了指令多样性和质量对定位性能的影响。
核心问题
现有方法在处理多样化指令时表现不佳,无法有效利用不同指令视角进行推理,导致定位准确性不足。
核心创新
UI-Ins通过“指令即推理”范式,将指令视为动态推理路径,利用多视角指令进行推理路径选择,显著提升了模型在多样化指令下的适应能力。
方法详解
- �� 监督微调:在合成的多样化指令上进行训练,增强模型的多视角推理能力。
- �� 强化学习:通过GRPO优化推理路径选择,提升模型在不同场景下的性能。
实验设计
实验使用了多个公开数据集,包括OS-Atlas、AMEX等,采用UI-Ins-7B和UI-Ins-32B模型进行测试,评估了模型在不同基准测试中的表现。
结果分析
UI-Ins-32B在UI-I2E-Bench上取得了87.3%的准确率,显著优于现有方法。此外,模型在其他基准测试中也表现出色。
应用场景
该方法可用于智能GUI代理的开发,提升人机交互的效率和准确性,特别是在复杂应用场景中。
局限与展望
模型在处理复杂场景时可能存在推理路径选择不当的问题,未来需进一步优化推理机制。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,菜谱就像是指令,而食材就是UI元素。传统方法就像只看菜谱标题做菜,而UI-Ins则是详细阅读每个步骤,选择最合适的做法。这样一来,即使菜谱有多种描述方式,UI-Ins也能找到最佳的烹饪路径,做出美味的菜肴。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,需要根据提示找到隐藏的宝藏。以前的方法就像只看提示的第一句话,而UI-Ins就像是一个聪明的朋友,会仔细分析每个提示,找出最有效的线索,帮助你快速找到宝藏。是不是很酷?
术语表
GUI定位
将自然语言指令映射到图形用户界面中的可操作元素的过程。
研究的核心任务。
指令即推理
将指令视为动态推理路径的范式,提升模型在多样化指令下的适应能力。
研究提出的新范式。
监督微调
在合成数据上进行的训练,以增强模型的特定能力。
训练框架的第一阶段。
强化学习
通过奖励机制优化模型决策的学习方法。
训练框架的第二阶段。
GRPO
一种用于强化学习的策略优化方法。
用于优化推理路径选择。
开放问题 这项研究留下的未解疑问
- 1 如何在复杂场景中选择最优推理路径?现有方法在这方面的表现仍需提升。
- 2 如何进一步提高数据集的指令质量,以减少训练噪声?
应用场景
近期应用
智能助手
可用于开发更智能的GUI助手,提高人机交互效率。
远期愿景
自动化办公
在未来,可能彻底改变办公自动化的方式,提升生产力。
原文摘要
GUI grounding, which maps natural-language instructions to actionable UI elements, is a core capability of GUI agents. Prior works largely treats instructions as a static proxy for user intent, overlooking the impact of instruction diversity and quality on grounding performance. Through a careful investigation of existing grounding datasets, we find a 23.3% flaw rate in their instructions and show that inference-time exploitation of instruction diversity yields up to a substantial 76% relative performance improvement. In this paper, we introduce the Instruction-as-Reasoning paradigm, treating instructions as dynamic analytical pathways that offer distinct perspectives and enabling the model to select the most effective pathway during reasoning. To achieve this, we propose a two-stage training framework: supervised fine-tuning (SFT) on synthesized, diverse instructions to instill multi-perspective reasoning, followed by reinforcement learning (RL) to optimize pathway selection and composition. Our resulting models, UI-Ins-7B and UI-Ins-32B, achieve state-of-the-art results on five challenging grounding benchmarks and exhibit emergent reasoning, selectively composing and synthesizing novel instruction pathways at inference. In particular, UI-Ins-32B attains the best grounding accuracy, scoring 87.3% on UI-I2E-Bench, 57.0% on ScreenSpot-Pro, and 84.9% on MMBench-GUI L2. Furthermore, our model demonstrates strong agentic potential, achieving a 74.1% success rate on AndroidWorld using UI-Ins-7B as the executor. Our in-depth analysis reveals additional insights such as how reasoning can be formulated to enhance rather than hinder grounding performance, and how our method mitigates policy collapse in the SFT+RL framework. All code and model checkpoints will be publicly released in https://github.com/alibaba/UI-Ins.