JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

TL;DR

JarvisGUI通过动态任务组合评估跨设备GUI代理,揭示现有代理在真实工作流中的能力差距。

cs.AI 🔴 高级 2026-09-10 89 次浏览
Zixiang Chen Yuheng Lu Zihao Cheng Zeming Liu Jizeng Bai Ziye Huang Zhiyin Lin Zihan Li Yuhang Guo Yunhong Wang Haifeng Wang
跨设备 GUI代理 动态任务 多平台 评估基准

核心发现

方法论

JarvisGUI通过轻量级类型系统将GUI任务建模为输入输出转换,支持自动组合多步跨设备工作流,并在统一框架下动态评估代理性能。该方法在Android、Windows和Ubuntu平台上进行评估,揭示了现有开源GUI代理在状态转移意识、跨平台上下文推理和长时间依赖管理方面的不足。

关键结果

  • 实验表明,现有开源GUI代理在跨设备任务上的成功率显著低于单设备任务,尤其是在长时间依赖管理上表现不佳。
  • 跨平台任务中,代理在状态转移和上下文保持方面的能力不足,成功率仅为单设备任务的一半。
  • 在多步任务中,代理的中间步骤完成率较低,显示出在复杂任务规划方面的不足。

研究意义

JarvisGUI为评估跨设备GUI代理提供了一个新的基准,填补了现有评估方法在多设备交互方面的空白。通过揭示代理在真实世界工作流中的能力差距,该研究为未来的代理开发提供了重要的指导方向。

技术贡献

本研究首次系统地研究了跨设备GUI代理任务,提出了基于槽类型的原子任务建模框架,能够可靠、可扩展地组合复杂的跨设备任务。通过JarvisGUI,研究揭示了现有代理在跨设备协调方面的瓶颈。

新颖性

JarvisGUI是首个专门评估跨设备GUI代理的基准,突破了现有单设备评估的局限,提供了一个多平台生态系统,要求代理在多个设备间协调操作。

局限性

  • 当前的JarvisGUI主要在虚拟环境中进行评估,可能与实际设备环境存在差异。
  • 评估的代理多为开源项目,可能不代表商业代理的能力。

未来方向

未来工作可以扩展JarvisGUI以支持更多设备和操作系统,并引入真实设备环境进行评估。同时,可以开发更智能的代理以提高跨设备任务的成功率。

AI 总览摘要

在现代数字环境中,用户常常需要在多个设备和平台之间协调工作。然而,现有的GUI代理评估基准大多局限于单设备任务,无法反映真实世界的复杂性。JarvisGUI通过引入动态任务组合和跨设备评估,填补了这一空白。

JarvisGUI利用轻量级类型系统将GUI任务建模为输入输出转换,支持自动组合多步跨设备工作流。通过在Android、Windows和Ubuntu平台上进行评估,JarvisGUI揭示了现有开源GUI代理在状态转移意识、跨平台上下文推理和长时间依赖管理方面的不足。

实验结果表明,现有代理在跨设备任务上的成功率显著低于单设备任务,尤其是在长时间依赖管理上表现不佳。这一发现为未来的代理开发提供了重要的指导方向,并强调了在真实设备环境中进行评估的重要性。

深度分析

研究背景

随着多模态大语言模型的快速发展,GUI代理能够感知复杂的视觉环境并通过模拟人类交互自动执行任务。然而,现有的评估基准大多集中在单设备任务上,忽视了跨设备交互的复杂性。用户在实际操作中常常需要在智能手机、个人电脑和服务器之间协调操作,这种跨设备依赖在现有基准中未得到充分体现。

核心问题

现有的GUI代理评估基准主要局限于单设备任务,无法反映真实世界中跨设备工作流的复杂性。这导致对代理在实际应用中的准备程度评估过于乐观,无法揭示其在状态转移意识、跨平台上下文推理和长时间依赖管理方面的能力差距。

核心创新

JarvisGUI通过引入轻量级类型系统,将GUI任务建模为输入输出转换,支持自动组合多步跨设备工作流。与现有基准不同,JarvisGUI在Android、Windows和Ubuntu平台上进行评估,要求代理在多个设备间协调操作。

方法详解

  • �� 使用轻量级类型系统将GUI任务建模为输入输出转换。
  • �� 自动组合多步跨设备工作流。
  • �� 在Android、Windows和Ubuntu平台上进行评估。
  • �� 动态评估代理性能,揭示其在状态转移意识、跨平台上下文推理和长时间依赖管理方面的不足。

实验设计

实验在虚拟环境中进行,涵盖Android、Windows和Ubuntu平台。评估了多种开源GUI代理,采用两阶段规划-执行架构。实验设计包括跨设备任务的状态转移、上下文保持和长时间依赖管理能力的评估。

结果分析

实验结果表明,现有代理在跨设备任务上的成功率显著低于单设备任务,尤其是在长时间依赖管理上表现不佳。跨平台任务中,代理在状态转移和上下文保持方面的能力不足,成功率仅为单设备任务的一半。

应用场景

JarvisGUI为评估跨设备GUI代理提供了一个新的基准,适用于需要在多个设备和平台之间协调操作的应用场景。它可以帮助开发者识别代理在真实世界工作流中的能力差距,并指导未来的开发工作。

局限与展望

当前的JarvisGUI主要在虚拟环境中进行评估,可能与实际设备环境存在差异。评估的代理多为开源项目,可能不代表商业代理的能力。未来工作可以扩展JarvisGUI以支持更多设备和操作系统,并引入真实设备环境进行评估。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,需要在不同的灶台上煮不同的菜。每个灶台代表一个设备,而你就是GUI代理。你需要在不同的灶台之间来回走动,确保每道菜都能按时完成。JarvisGUI就像一个厨师比赛,评估你在多个灶台之间协调工作的能力。现有的评估基准只关注你在一个灶台上的表现,而JarvisGUI则要求你在多个灶台之间来回切换,确保每道菜都能按时完成。

简单解释 像给14岁少年讲一样

想象你在玩一个需要同时操作多个角色的游戏。每个角色都有不同的任务,你需要在他们之间快速切换,确保每个角色都能完成自己的任务。JarvisGUI就像这个游戏,评估你在多个角色之间切换和协调的能力。现有的评估基准只关注你在一个角色上的表现,而JarvisGUI则要求你在多个角色之间来回切换,确保每个角色都能按时完成任务。

术语表

GUI代理 (Graphical User Interface Agent)

一种能够通过模拟人类交互在图形用户界面上执行任务的智能程序。

在论文中用于评估跨设备任务的执行能力。

跨设备 (Cross-Device)

涉及多个设备之间的交互和协调。

在论文中指需要在多个平台之间协调操作的任务。

动态任务组合 (Dynamic Task Composition)

通过自动组合多个步骤来创建复杂任务的过程。

在论文中用于生成跨设备工作流。

轻量级类型系统 (Lightweight Type System)

一种用于建模任务输入输出转换的系统,支持自动任务组合。

在论文中用于建模GUI任务。

状态转移意识 (State-Transfer Awareness)

代理在任务执行过程中对状态变化的感知能力。

在论文中用于评估代理在跨设备任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实设备环境中评估GUI代理的跨设备能力?
  • 2 如何提高代理在长时间依赖管理上的表现?
  • 3 如何扩展JarvisGUI以支持更多设备和操作系统?

应用场景

近期应用

跨设备工作流评估

JarvisGUI可以用于评估需要在多个设备和平台之间协调操作的应用场景,帮助开发者识别代理在真实世界工作流中的能力差距。

远期愿景

智能代理开发

通过揭示现有代理的能力差距,JarvisGUI为未来的智能代理开发提供了重要的指导方向,推动更智能的代理的出现。

原文摘要

Real-world GUI usage frequently involves workflows that span multiple devices and platforms, requiring the transfer of intermediate results, maintenance of shared state, and coordination across heterogeneous environments. However, existing GUI benchmarks overwhelmingly evaluate agents on single-device, statically defined tasks, thus leaving such cross-device capabilities largely unexamined, resulting in an overly optimistic assessment of agents' readiness for real-world usage. We introduce JarvisGUI, a dynamic benchmark that evaluates GUI agents on cross-device workflows requiring coordinated interaction across heterogeneous platforms, including Android, Windows, and Ubuntu. Specifically, JarvisGUI formulates GUI tasks as input-output transformations under a lightweight type system, which allows us to automatically compose multi-step, cross-device workflows and dynamically evaluate agent performance within a unified framework. By evaluating agents in virtual environments spanning multiple operating systems, JarvisGUI reveals that state-of-the-art open-source GUI agents struggle with the state-transfer awareness, cross-platform contextual reasoning, and long-horizon dependency management required for real-world workflows, exposing a critical capability gap invisible to existing benchmarks.

cs.AI