核心发现
方法论
AMEX数据集通过三层次标注提升移动GUI代理性能,包括GUI交互元素定位、屏幕和元素功能描述、复杂自然语言指令。使用SPHINX Agent进行微调,验证数据集有效性。
关键结果
- 在ScreenSpot测试中,SphAgent在图标/小部件子集上表现优异,准确率达72.6%。
- 在ANDROIDCONTROL测试中,加入AMEX数据后,点击和长按动作性能提升14%。
- 在AITW测试中,综合准确率提高2.5%。
研究意义
AMEX数据集通过详细的标注提升了移动GUI代理的环境理解能力,解决了现有数据集在任务多样性和标注准确性上的不足,为学术界和工业界提供了新的研究方向。
技术贡献
AMEX提供了详细的GUI元素功能描述,超越传统图标分类方法,为移动GUI代理提供了更全面的环境理解能力。SPHINX Agent的微调验证了数据集的有效性。
新颖性
AMEX首次提供了多层次的GUI标注,尤其是对滚动元素的定义和功能描述,填补了现有数据集的空白。
局限性
- 数据集主要限于英文,其他语言支持有限。
- SPHINX Agent未进行在线评估,实际应用效果未知。
未来方向
未来工作应扩展至多语言支持,进行在线动态评估,并探索其他操作系统平台。
AI 总览摘要
移动设备上的AI代理需要更好的环境理解能力以提高任务完成效率。现有数据集在标注准确性和任务多样性上存在不足,限制了代理的性能。
AMEX数据集通过提供多层次的GUI标注,包括交互元素定位、功能描述以及复杂指令链,提升了代理的环境理解能力。SPHINX Agent的微调结果验证了数据集的有效性。
未来工作应扩展至多语言支持,并进行在线动态评估,以进一步提升代理的实际应用效果。
深度分析
研究背景
随着移动设备的普及,AI代理成为人机交互的重要工具。然而,现有的虚拟助手功能有限,无法处理复杂的GUI任务。研究者们开始探索新的移动交互范式,开发能够直接与屏幕元素交互的GUI代理。
核心问题
现有GUI代理在实际应用中面临挑战,主要由于缺乏对GUI布局和交互元素功能的理解。这些限制源于数据集的不足,无法充分反映移动GUI环境的复杂性和多样性。
核心创新
AMEX数据集通过三层次标注提升了移动GUI代理的环境理解能力。首先,定义交互元素为可点击和可滚动元素。其次,提供详细的屏幕和元素功能描述。最后,收集复杂指令链以模拟真实应用场景。
方法详解
- �� 数据收集:通过人工和自动化工具收集截图和XML数据。
- �� 标注:人工审核交互元素定位,使用GPT和Gemini生成功能描述。
- �� 微调:使用AMEX数据集微调SPHINX Agent。
实验设计
实验使用ScreenSpot、AITW和ANDROIDCONTROL数据集进行评估。通过微调SphAgent,验证AMEX数据集在提升代理性能上的有效性。
结果分析
在ScreenSpot测试中,SphAgent在图标/小部件子集上表现优异。加入AMEX数据后,ANDROIDCONTROL测试中点击和长按动作性能显著提升。在AITW测试中,综合准确率提高。
应用场景
AMEX数据集可用于训练更智能的移动GUI代理,提高任务完成效率,适用于各种移动应用场景。
局限与展望
数据集主要限于英文,其他语言支持有限。SPHINX Agent未进行在线评估,实际应用效果未知。未来工作应扩展至多语言支持,并进行在线动态评估。
通俗解读 非专业人士也能看懂
想象你在手机上使用一个智能助手,它不仅能帮你设置闹钟,还能理解屏幕上的所有图标和按钮。就像一个超级助手,它能看懂屏幕上的每个细节,知道哪个按钮可以点击,哪个区域可以滚动。这样,它就能帮你完成各种复杂的任务,比如在购物应用中找到最低价的商品,或者在音乐应用中创建新的播放列表。这个助手就像一个懂得所有应用规则的专家,能快速帮你完成任务。
简单解释 像给14岁少年讲一样
想象你在玩手机游戏,游戏里有很多按钮和菜单。现在,有一个超级助手,它能看懂这些按钮和菜单,知道每个按钮的功能。比如,它知道哪个按钮可以让你升级角色,哪个菜单可以查看任务。这个助手就像游戏里的向导,帮你快速找到需要的东西,完成任务。它能理解屏幕上的所有信息,帮你做出正确的选择。
术语表
GUI (图形用户界面)
用户通过图形元素与设备交互的界面。
在论文中,指移动设备上的应用界面。
SPHINX Agent (斯芬克斯代理)
一种用于微调和验证AMEX数据集的基线模型。
用于评估数据集对代理性能的提升。
ScreenSpot (屏幕点)
用于评估模型元素定位能力的基准数据集。
在实验中用于测试SphAgent的性能。
AITW (行动中的人工智能)
评估代理完成任务能力的大规模数据集。
用于测试SphAgent的GUI控制能力。
ANDROIDCONTROL (安卓控制)
用于评估代理在一般应用中完成任务能力的数据集。
用于测试SphAgent的性能提升。
开放问题 这项研究留下的未解疑问
- 1 如何在多语言环境中提升代理的性能?
- 2 如何通过在线动态评估验证代理的实际应用效果?
应用场景
近期应用
移动应用优化
通过AMEX数据集训练的代理可用于优化移动应用的用户体验。
远期愿景
跨平台智能助手
开发支持多操作系统的智能助手,实现更广泛的应用场景。
原文摘要
AI agents have drawn increasing attention mostly on their ability to perceive environments, understand tasks, and autonomously achieve goals. To advance research on AI agents in mobile scenarios, we introduce the Android Multi-annotation EXpo (AMEX), a comprehensive, large-scale dataset designed for generalist mobile GUI-control agents which are capable of completing tasks by directly interacting with the graphical user interface (GUI) on mobile devices. AMEX comprises over 104K high-resolution screenshots from popular mobile applications, which are annotated at multiple levels. Unlike existing GUI-related datasets, e.g., Rico, AitW, etc., AMEX includes three levels of annotations: GUI interactive element grounding, GUI screen and element functionality descriptions, and complex natural language instructions with stepwise GUI-action chains. We develop this dataset from a more instructive and detailed perspective, complementing the general settings of existing datasets. Additionally, we finetune a baseline model SPHINX Agent and illustrate the effectiveness of AMEX.The project is available at https://yxchai.com/AMEX/.