Multi-Agent Computer Use

TL;DR

多智能体计算使用系统(MACU)在桌面和网页导航基准上提高3.4-25.5%。

cs.MA 🔴 高级 2026-06-01 16 次浏览
Jing Yu Koh Ruslan Salakhutdinov Daniel Fried
多智能体系统 任务分解 并行执行 计算机使用 长时程任务

核心发现

方法论

本文提出了一种多智能体计算使用系统(MACU),通过管理模型将任务分解为有向无环图(DAG),并行分派子智能体执行。管理模型根据子智能体的反馈不断调整DAG,确保信息传递和任务优化。该方法特别适用于部分可观测环境。

关键结果

  • MACU在OSWorld基准上提高了4.7%的成功率,平均任务完成时间减少了5.2分钟。
  • 在Odysseys长时程网页导航基准上,MACU的任务完成时间提高了1.5倍,成功率提高了25.5%。
  • 在WebTailBench-v2上,MACU的成功率从20.8%提高到29.5%,显著改善了复杂任务的执行。

研究意义

MACU系统通过多智能体协作,解决了单智能体系统在长时程任务中的瓶颈,显著提高了复杂任务的执行效率。这一方法为计算机使用智能体的扩展提供了新的方向,尤其在需要快速响应和动态调整的场景中。

技术贡献

MACU在任务分解和并行执行方面提供了新的技术框架,与现有单智能体方法相比,显著提高了任务处理效率。其DAG结构允许灵活的任务管理和信息传递,增强了系统的适应性和扩展性。

新颖性

MACU首次将多智能体系统应用于计算机使用任务,通过DAG实现任务分解和并行执行,显著区别于传统的单智能体方法。

局限性

  • MACU在处理完全可观测环境时,可能无法充分发挥其优势。
  • 系统的复杂性增加了管理模型的计算开销。
  • 需要进一步优化以减少并行执行中的资源竞争。

未来方向

未来研究可以探索MACU在更多应用场景中的表现,并优化其在资源受限环境中的效率。此外,结合更先进的智能体模型可能进一步提升系统性能。

AI 总览摘要

当前的计算机使用智能体(CUA)主要以单智能体形式部署,这种方式在处理复杂的长时程任务时效率不高。本文提出了一种多智能体计算使用系统(MACU),通过管理模型将任务分解为有向无环图(DAG),并行分派子智能体执行。管理模型根据子智能体的反馈不断调整DAG,确保信息传递和任务优化。实验表明,MACU在多个基准上显著优于强单智能体基线,尤其在长时程任务中表现突出。MACU的设计使其能够更好地应对部分可观测环境中的挑战,显著提高了任务完成效率。未来的研究可以进一步优化MACU在资源受限环境中的表现,并探索其在更多应用场景中的应用潜力。

深度分析

研究背景

计算机使用智能体(CUA)的研究旨在通过图形用户界面(GUI)与软件交互。目前的CUA大多以单智能体形式部署,虽然在某些任务上表现良好,但在处理复杂的长时程任务时效率有限。近年来,多智能体系统在不同领域的应用显示出其在任务分解和并行执行方面的优势。

核心问题

单智能体CUA在处理复杂的长时程任务时效率不高,主要瓶颈在于无法有效分解任务和并行执行。此外,单智能体系统在动态环境中的适应能力有限,难以快速调整计划。

核心创新

MACU通过管理模型将任务分解为有向无环图(DAG),实现任务的并行执行。管理模型根据子智能体的反馈不断调整DAG,确保信息传递和任务优化。这一创新使得系统能够更好地应对部分可观测环境中的挑战。

方法详解

  • �� 管理模型将任务分解为DAG,标识子任务的依赖关系和目标。
  • �� 在每次迭代中,管理模型分派并行子智能体执行DAG上的准备节点。
  • �� 根据子智能体的反馈,管理模型动态调整DAG,添加、取消或重写节点。
  • �� 通过DAG结构,管理模型保留并传递环境信息。

实验设计

实验在多个基准上进行,包括OSWorld、Online-Mind2Web、WebTailBench-v2和Odysseys。使用Qwen3.6-27B作为子智能体,Claude Opus 4.6作为管理模型。实验设置包括不同的并行子智能体数量和重规划预算,以评估MACU的性能。

结果分析

MACU在OSWorld基准上提高了4.7%的成功率,平均任务完成时间减少了5.2分钟。在Odysseys长时程网页导航基准上,MACU的任务完成时间提高了1.5倍,成功率提高了25.5%。在WebTailBench-v2上,MACU的成功率从20.8%提高到29.5%,显著改善了复杂任务的执行。

应用场景

MACU适用于需要快速响应和动态调整的复杂任务场景,如桌面应用自动化和网页导航。其并行执行能力使其在需要高效任务处理的行业中具有潜在应用价值。

局限与展望

MACU在处理完全可观测环境时,可能无法充分发挥其优势。系统的复杂性增加了管理模型的计算开销。需要进一步优化以减少并行执行中的资源竞争。未来研究可以探索MACU在更多应用场景中的表现,并优化其在资源受限环境中的效率。

通俗解读 非专业人士也能看懂

想象一个大型工厂,传统的单智能体就像一个工人需要完成所有任务,而多智能体系统就像一个团队,每个工人负责不同的部分。MACU系统通过一个管理者将任务分解,分派给不同的工人,并根据需要调整任务。这样,工厂的生产效率大大提高,因为每个工人都专注于自己的任务,并且可以根据新的信息进行调整。

简单解释 像给14岁少年讲一样

想象你和朋友们在玩一个复杂的游戏,每个人都有自己的任务。MACU就像游戏中的队长,他会把任务分配给每个人,并根据游戏进展调整计划。这样,你们可以更快地完成任务,因为每个人都知道自己该做什么,并且可以根据需要改变策略。是不是很酷?

术语表

多智能体系统 (Multi-Agent System)

由多个自主智能体组成的系统,能够相互协作完成复杂任务。

在MACU中,多个子智能体并行执行任务。

有向无环图 (Directed Acyclic Graph, DAG)

一种图结构,节点之间有方向且无环路。

用于表示任务的分解和依赖关系。

任务分解 (Task Decomposition)

将复杂任务拆分为更小的子任务,以便并行执行。

MACU通过DAG实现任务分解。

部分可观测环境 (Partially Observable Environment)

环境状态不是完全可见的,智能体需要根据不完整的信息做决策。

MACU设计考虑了部分可观测环境的挑战。

重规划 (Replanning)

根据新的信息调整原有计划,以优化任务执行。

MACU管理模型根据子智能体反馈进行重规划。

开放问题 这项研究留下的未解疑问

  • 1 如何在完全可观测环境中优化MACU的性能?
  • 2 如何减少MACU在资源受限环境中的计算开销?
  • 3 如何进一步提高MACU的任务分解效率?

应用场景

近期应用

桌面应用自动化

MACU可以用于自动化复杂的桌面应用任务,提高工作效率。

远期愿景

智能网页导航

通过MACU实现更智能的网页导航,提升用户体验和信息获取效率。

原文摘要

Computer use agents (CUAs) today are primarily deployed as single serial agents. This setup is suboptimal for complex long-horizon tasks that benefit from task decomposition, parallel execution, and consistent re-planning based on new information. In this paper, we argue that we should instead move towards evaluating and building multi-agent computer use (MACU) systems. These systems, which emphasize planning and parallel execution, alleviate many of the shortcomings of single-agent CUAs. We propose a general multi-agent setup in which a manager model decomposes computer use tasks as a directed acyclic graph (DAG), encoding relevant dependencies and goals for subagents. At each iteration, the manager dispatches parallel CUA subagents to carry out nodes on the ready frontier of the DAG, and continuously revises the DAG (adding, canceling, or rewriting nodes) as new findings arrive from subagents. This design treats the partially observable environment of computer use as a first class challenge: information that downstream agents may not be able to re-observe are retained and passed forward through the manager and DAG structure. We demonstrate that MACU consistently improves over strong single-agent baselines by $3.4-25.5\%$ on desktop (OSWorld) and web navigation (Online-Mind2Web, WebTailBench, Odysseys) benchmarks, exhibits more favorable test-time scaling, and solves complex long-horizon tasks where single-agent CUAs get stuck. On Odysseys, a long-horizon web navigation benchmark, MACU improves average task completion wall-clock time by ${\sim} 1.5 \times$, demonstrating its efficacy in speeding up traditionally slow CUA pipelines. Our findings highlight that multi-agent coordination is a promising axis for scaling computer use agents to work productively for longer and more effectively. We release all code and interactive visualizations at https://jykoh.com/multi-agent-computer-use.

cs.MA cs.CL cs.LG