Aria-UI: Visual Grounding for GUI Instructions

TL;DR

Aria-UI通过纯视觉方法实现GUI指令的视觉定位,提升了定位准确率。

cs.HC 🔴 高级 2024-12-20 16 次浏览
Yuhao Yang Yue Wang Dongxu Li Ziyang Luo Bei Chen Chao Huang Junnan Li
视觉定位 GUI 多模态 数据管道 动态上下文

核心发现

方法论

Aria-UI采用纯视觉方法进行GUI指令定位,摒弃HTML或AXTree辅助输入。通过可扩展的数据管道生成多样化的指令样本,并结合文本和图文交错的动作历史,提高动态上下文推理能力。

关键结果

  • Aria-UI在ScreenSpot基准测试中实现了82.4%的平均准确率,显著优于UGround等现有方法。
  • 在AndroidControl和GUI-Odyssey的离线评估中,Aria-UI的任务成功率分别达到66.3%和31.87%。
  • 在Multimodal-Mind2Web的零样本评估中,Aria-UI取得了57.5%的平均准确率。

研究意义

Aria-UI在学术界和工业界具有重要意义,解决了多平台GUI指令定位的长期痛点,尤其是在动态任务执行中提高了定位准确性。

技术贡献

Aria-UI通过纯视觉方法实现了与SOTA方法的根本性差异,提供了新的理论保证和工程可能性,尤其在动态上下文中表现出色。

新颖性

Aria-UI是首个采用纯视觉方法进行GUI指令定位的模型,与依赖HTML或AXTree的传统方法相比,具有根本性创新。

局限性

  • 在某些复杂界面中,纯视觉方法可能会遇到定位困难,尤其是元素密集的场景。
  • 模型在处理极端动态任务时可能出现性能下降。

未来方向

未来研究可以探索更复杂的动态任务场景,进一步优化模型的上下文推理能力,并扩展至更多平台。

AI 总览摘要

随着图形用户界面(GUI)在各种平台上的快速扩展,数字代理在自动化任务中的作用变得越来越重要。然而,现有的GUI指令定位方法依赖于HTML或AXTree输入,存在效率低下和信息缺失的问题。Aria-UI通过纯视觉方法进行指令定位,摒弃了辅助输入,显著提高了定位准确率。

Aria-UI采用可扩展的数据管道生成多样化的指令样本,并结合文本和图文交错的动作历史,提高动态上下文推理能力。实验结果表明,Aria-UI在多个基准测试中均取得了领先的定位准确率,尤其在动态任务执行中表现出色。

Aria-UI的创新方法为解决多平台GUI指令定位的长期痛点提供了新的理论保证和工程可能性。尽管在某些复杂界面中可能遇到定位困难,但其在动态任务场景中的表现为未来研究提供了广阔的空间。通过进一步优化模型的上下文推理能力,Aria-UI有望在更多平台上实现更高的定位准确率。

深度分析

研究背景

随着GUI在网络、桌面和移动平台上的广泛应用,自动化任务的数字代理变得至关重要。传统的指令定位方法依赖于HTML或AXTree输入,存在信息缺失和效率低下的问题。近年来,多模态模型在视觉和语言能力上取得了显著进展,但在GUI场景中的应用仍然有限。

核心问题

现有的GUI指令定位方法面临着多样化视觉布局、指令变异性和动态任务执行的挑战。这些问题要求解决方案具备强大的适应性和效率,以提高定位准确率。

核心创新

Aria-UI通过纯视觉方法进行指令定位,摒弃了HTML或AXTree辅助输入。其创新之处在于采用可扩展的数据管道生成多样化的指令样本,并结合文本和图文交错的动作历史,提高动态上下文推理能力。

方法详解

  • �� 采用纯视觉方法进行指令定位,摒弃辅助输入。
  • �� 设计可扩展的数据管道,生成多样化的指令样本。
  • �� 结合文本和图文交错的动作历史,提高动态上下文推理能力。
  • �� 在多平台上进行实验验证,确保模型的适应性和准确性。

实验设计

实验设计包括在ScreenSpot、AndroidControl和Multimodal-Mind2Web等基准测试中进行评估。使用多样化的数据集和基线进行比较,验证模型在不同平台和场景中的定位准确率。

结果分析

Aria-UI在ScreenSpot基准测试中实现了82.4%的平均准确率,显著优于UGround等现有方法。在AndroidControl和GUI-Odyssey的离线评估中,Aria-UI的任务成功率分别达到66.3%和31.87%。在Multimodal-Mind2Web的零样本评估中,Aria-UI取得了57.5%的平均准确率。

应用场景

Aria-UI可用于多平台的GUI指令定位,适用于自动化任务的数字代理,提高任务执行效率。其在动态任务场景中的表现尤为突出,适合复杂的多步任务。

局限与展望

尽管Aria-UI在多个场景中表现出色,但在某些复杂界面中,纯视觉方法可能会遇到定位困难。此外,模型在处理极端动态任务时可能出现性能下降。未来研究可以探索更复杂的动态任务场景,进一步优化模型的上下文推理能力。

通俗解读 非专业人士也能看懂

想象你在一个巨大的商场里寻找特定的商品。传统的方法是通过商场的地图(类似于HTML或AXTree)来找到商品的位置,但这些地图可能不够详细或不准确。Aria-UI就像一个聪明的导购员,只需通过观察商场的布局和顾客的行为,就能准确地找到你需要的商品。它通过分析商场的视觉信息和顾客的购物历史,帮助你在复杂的环境中快速找到目标商品。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超级复杂的游戏,你需要找到隐藏的宝藏。传统的方法是用地图,但地图可能不够详细。Aria-UI就像一个超级智能的助手,它通过观察游戏的画面和你的行动历史,帮助你找到宝藏!它就像是你的游戏中的导游,能在复杂的场景中快速定位目标。是不是很酷?

术语表

视觉定位 (Visual Grounding)

通过视觉信息确定目标元素的位置。

Aria-UI使用视觉定位来实现GUI指令的准确定位。

多模态模型 (Multimodal Model)

结合视觉和语言信息进行任务处理的模型。

Aria-UI是一个多模态模型,专为GUI指令定位设计。

数据管道 (Data Pipeline)

用于生成多样化指令样本的流程。

Aria-UI采用数据管道来生成高质量的指令样本。

动作历史 (Action History)

记录用户在任务执行过程中的行为序列。

Aria-UI结合动作历史提高动态上下文推理能力。

动态上下文 (Dynamic Context)

任务执行过程中不断变化的环境信息。

Aria-UI通过动态上下文推理提高定位准确性。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂的界面中提高纯视觉方法的定位准确性?
  • 2 在处理更复杂的动态任务时,如何进一步优化模型的上下文推理能力?

应用场景

近期应用

跨平台自动化任务

Aria-UI可用于多平台的自动化任务,提高任务执行效率。适合需要快速定位目标元素的场景。

远期愿景

动态任务优化

未来,Aria-UI可以进一步优化动态任务场景中的定位能力,适用于更复杂的多步任务。

原文摘要

Digital agents for automating tasks across different platforms by directly manipulating the GUIs are increasingly important. For these agents, grounding from language instructions to target elements remains a significant challenge due to reliance on HTML or AXTree inputs. In this paper, we introduce Aria-UI, a large multimodal model specifically designed for GUI grounding. Aria-UI adopts a pure-vision approach, eschewing reliance on auxiliary inputs. To adapt to heterogeneous planning instructions, we propose a scalable data pipeline that synthesizes diverse and high-quality instruction samples for grounding. To handle dynamic contexts in task performing, Aria-UI incorporates textual and text-image interleaved action histories, enabling robust context-aware reasoning for grounding. Aria-UI sets new state-of-the-art results across offline and online agent benchmarks, outperforming both vision-only and AXTree-reliant baselines. We release all training data and model checkpoints to foster further research at https://ariaui.github.io.

cs.HC cs.AI