Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale
Windows Agent Arena评估多模态OS代理,Navi在Windows领域成功率19.5%。
核心发现
方法论
研究采用Windows Agent Arena框架,专注于Windows操作系统,利用Azure云进行并行化评估。任务设计基于部分可观测马尔可夫决策过程(POMDP),涵盖154个多步骤任务,涉及屏幕理解和工具使用。
关键结果
- Navi在Windows领域的成功率为19.5%,远低于人类的74.5%。在Mind2Web基准上也表现良好,显示其多模态能力。
- 使用Set-of-Marks提示结合系统可访问性树和像素检测器,Navi在多个任务中表现出色。
- 实验显示,任务并行化使评估时间缩短至20分钟,显著提高效率。
研究意义
该研究为多模态代理在真实操作系统环境中的评估提供了一个可扩展的平台,填补了现有基准在任务复杂性和模拟现实主义之间的空白。它为未来的代理开发和数据生成提供了新的研究机会。
技术贡献
Windows Agent Arena提供了一个可扩展的评估环境,支持多模态代理在Windows操作系统中的操作。Navi代理的开发展示了如何在复杂的操作系统环境中实现任务自动化。
新颖性
这是首个专注于Windows操作系统的多模态代理评估框架,显著扩展了OSWorld框架的应用范围,提供了更贴近人类计算体验的测试环境。
局限性
- Navi在Windows领域的成功率仅为19.5%,显示出在复杂任务中的局限性。
- 现有框架主要适用于Windows操作系统,可能不适用于其他操作系统。
未来方向
未来研究方向包括扩展任务种类,提升代理的任务成功率,以及探索跨操作系统的多模态代理评估方法。
AI 总览摘要
Windows Agent Arena是一个专注于Windows操作系统的多模态代理评估平台。现有的评估基准往往局限于特定的模态或领域,难以全面衡量代理在真实环境中的表现。Windows Agent Arena通过并行化评估,显著缩短了评估时间,并提供了一个可扩展的评估环境。
研究中开发的Navi代理在Windows领域的成功率为19.5%,远低于人类的74.5%。尽管如此,Navi在其他基准如Mind2Web上表现良好,显示了其多模态能力。研究还展示了如何利用Set-of-Marks提示结合系统可访问性树和像素检测器来提升代理的任务成功率。
该研究为多模态代理在真实操作系统环境中的评估提供了一个可扩展的平台,填补了现有基准在任务复杂性和模拟现实主义之间的空白。未来研究方向包括扩展任务种类,提升代理的任务成功率,以及探索跨操作系统的多模态代理评估方法。
深度分析
研究背景
随着大语言模型(LLMs)的快速发展,多模态代理在计算机操作系统中的应用潜力巨大。然而,现有的评估基准往往局限于特定的模态或领域,难以全面衡量代理在真实环境中的表现。Windows Agent Arena旨在解决这一问题,提供一个专注于Windows操作系统的多模态代理评估平台。
核心问题
现有的评估基准在任务复杂性和模拟现实主义之间存在显著差距,难以全面衡量代理在真实环境中的表现。尤其是在Windows操作系统中,缺乏一个可扩展的评估环境来测试多模态代理的能力。
核心创新
Windows Agent Arena通过并行化评估,显著缩短了评估时间,并提供了一个可扩展的评估环境。Navi代理的开发展示了如何在复杂的操作系统环境中实现任务自动化,填补了现有基准在任务复杂性和模拟现实主义之间的空白。
方法详解
- �� 使用Windows Agent Arena框架,专注于Windows操作系统。
- �� 任务设计基于部分可观测马尔可夫决策过程(POMDP)。
- �� 评估通过Azure云进行并行化,显著提高效率。
- �� 使用Set-of-Marks提示结合系统可访问性树和像素检测器。
实验设计
实验设计包括154个多步骤任务,涵盖屏幕理解和工具使用。任务并行化使评估时间缩短至20分钟。Navi在Windows领域的成功率为19.5%,在Mind2Web基准上也表现良好。
结果分析
Navi在Windows领域的成功率为19.5%,远低于人类的74.5%。在Mind2Web基准上也表现良好,显示其多模态能力。任务并行化显著提高了评估效率。
应用场景
Windows Agent Arena可用于评估多模态代理在Windows操作系统中的表现,适用于需要复杂任务自动化的场景,如软件开发和系统管理。
局限与展望
Navi在复杂任务中的成功率较低,显示出在任务复杂性和模拟现实主义之间的局限性。现有框架主要适用于Windows操作系统,可能不适用于其他操作系统。
通俗解读 非专业人士也能看懂
想象你在一个大厨房里,有很多不同的工具和食材。你需要按照食谱做一道复杂的菜,但每一步都需要不同的工具和技巧。Windows Agent Arena就像这个厨房,它提供了一个环境,让多模态代理像厨师一样,在Windows操作系统中完成各种复杂任务。Navi代理就像一个新手厨师,它能完成一些基本的步骤,但在复杂的菜肴上还需要提高。通过不断练习和改进,Navi可以逐渐胜任更复杂的任务。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的电脑游戏,这个游戏需要你在不同的窗口之间切换,完成各种任务。Windows Agent Arena就像这个游戏的舞台,而Navi是你的游戏角色。虽然Navi还不能像人类玩家那样厉害,但它正在学习如何在这个复杂的游戏世界中生存和发展。未来,Navi可能会变得更聪明,能够完成更多的任务,就像你在游戏中不断升级和进步一样。
术语表
多模态代理
能够处理多种输入模态(如文本、图像)的智能代理。
用于评估代理在Windows操作系统中的表现。
Windows Agent Arena
一个专注于Windows操作系统的多模态代理评估平台。
提供了一个可扩展的评估环境。
Navi
研究中开发的多模态代理,专注于Windows操作系统。
在Windows领域的成功率为19.5%。
Set-of-Marks
一种提示方法,结合系统可访问性树和像素检测器。
用于提升代理的任务成功率。
Azure云
微软提供的云计算服务平台。
用于并行化评估,显著提高效率。
开放问题 这项研究留下的未解疑问
- 1 如何提高Navi在复杂任务中的成功率?现有方法在任务复杂性和模拟现实主义之间存在局限。
- 2 如何扩展Windows Agent Arena以支持其他操作系统?
- 3 如何在多模态代理中实现更高效的任务自动化?
应用场景
近期应用
软件开发
通过Windows Agent Arena评估多模态代理在软件开发中的表现,提高开发效率。
远期愿景
系统管理
利用多模态代理自动化复杂的系统管理任务,降低人工成本,提高效率。
原文摘要
Large language models (LLMs) show remarkable potential to act as computer agents, enhancing human productivity and software accessibility in multi-modal tasks that require planning and reasoning. However, measuring agent performance in realistic environments remains a challenge since: (i) most benchmarks are limited to specific modalities or domains (e.g. text-only, web navigation, Q&A, coding) and (ii) full benchmark evaluations are slow (on order of magnitude of days) given the multi-step sequential nature of tasks. To address these challenges, we introduce the Windows Agent Arena: a reproducible, general environment focusing exclusively on the Windows operating system (OS) where agents can operate freely within a real Windows OS and use the same wide range of applications, tools, and web browsers available to human users when solving tasks. We adapt the OSWorld framework (Xie et al., 2024) to create 150+ diverse Windows tasks across representative domains that require agent abilities in planning, screen understanding, and tool usage. Our benchmark is scalable and can be seamlessly parallelized in Azure for a full benchmark evaluation in as little as 20 minutes. To demonstrate Windows Agent Arena's capabilities, we also introduce a new multi-modal agent, Navi. Our agent achieves a success rate of 19.5% in the Windows domain, compared to 74.5% performance of an unassisted human. Navi also demonstrates strong performance on another popular web-based benchmark, Mind2Web. We offer extensive quantitative and qualitative analysis of Navi's performance, and provide insights into the opportunities for future research in agent development and data generation using Windows Agent Arena. Webpage: https://microsoft.github.io/WindowsAgentArena Code: https://github.com/microsoft/WindowsAgentArena