Step-level Optimization for Efficient Computer-use Agents

TL;DR

提出事件驱动的步级级联优化框架,提升计算效率,成功率提高58.2%。

cs.AI 🔴 高级 2026-04-30 4 次浏览
Jinbiao Wei Kangqi Ni Yilun Zhao Guo Gan Arman Cohan
计算机使用代理 步级优化 事件驱动 级联框架 效率提升

核心发现

方法论

该研究提出了一种事件驱动的步级级联框架,用于优化计算机使用代理的效率。框架通过轻量级监控器检测风险并选择性调用强模型。包括停滞监控器和里程碑监控器,前者检测进度降级,后者识别语义检查点。

关键结果

  • 在OSWorld上,EvoCUA-8B + Kimi K2.5组合成功率达到58.2%,成本降低61.4%。
  • 在WebArena上,gpt-oss-20b + GPT-5.2组合成功率为57.8%,显著减少成本和延迟。
  • 启用停滞和里程碑检测器后,性能提升显著,覆盖不同失败模式。

研究意义

该研究显著提高了计算机使用代理的效率,解决了长时间GUI任务中的计算资源浪费问题。通过智能计算分配,降低了成本和延迟,推动了软件自动化的发展。

技术贡献

提出了一种模块化、部署导向的框架,可在现有代理上叠加而无需改变架构或重新训练模型。提供了新的计算分配策略,减少了大模型的使用频率。

新颖性

首次在计算机使用代理中实现步级级联优化,区别于传统的查询级级联,提供更精细的状态依赖控制。

局限性

  • 框架依赖于监控器的准确性,可能在复杂任务中失效。
  • 在某些情况下,停滞检测可能误触发强模型调用。
  • 里程碑检测需要进一步优化以减少误报。

未来方向

未来研究方向包括优化监控器的准确性和稳定性,以及扩展框架以支持更多类型的任务和环境。

AI 总览摘要

计算机使用代理在软件自动化中具有巨大潜力,但现有解决方案在长时间任务中效率低下。为解决这一问题,研究提出了一种事件驱动的步级级联框架,通过轻量级监控器检测风险并选择性调用强模型。框架包括停滞监控器和里程碑监控器,分别检测进度降级和语义检查点。实验结果表明,该框架在OSWorld和WebArena上显著提高了成功率,同时减少了成本和延迟。这一研究为软件自动化领域提供了新的思路,推动了高效计算机使用代理的发展。

深度分析

研究背景

计算机使用代理能够直接与图形用户界面交互,提供了一种通用软件自动化的路径。然而,现有代理在长时间任务中效率低下,主要因为每一步都调用大型多模态模型,导致计算资源浪费。

核心问题

长时间GUI任务中的计算资源分配不均衡,导致效率低下。许多步骤是例行的,可以由较小的策略可靠处理,而错误往往集中在少数高风险时刻。

核心创新

提出了一种事件驱动的步级级联框架,通过轻量级监控器检测风险并选择性调用强模型。停滞监控器检测进度降级,里程碑监控器识别语义检查点。

方法详解

  • �� 使用轻量级监控器检测风险
  • �� 停滞监控器检测进度降级
  • �� 里程碑监控器识别语义检查点
  • �� 选择性调用强模型进行恢复

实验设计

在OSWorld和WebArena上进行实验,评估框架的效率和成功率。使用多种小模型和大模型组合,比较不同配置下的性能。

结果分析

在OSWorld上,EvoCUA-8B + Kimi K2.5组合成功率达到58.2%,成本降低61.4%。在WebArena上,gpt-oss-20b + GPT-5.2组合成功率为57.8%,显著减少成本和延迟。

应用场景

该框架可用于提高各种软件自动化任务的效率,特别是在需要长时间交互的场景中,如桌面应用和网页导航。

局限与展望

框架依赖于监控器的准确性,可能在复杂任务中失效。停滞检测可能误触发强模型调用,里程碑检测需要进一步优化以减少误报。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,有时需要用小刀切菜,有时需要用大刀切肉。我们的框架就像一个智能厨师,知道什么时候该用小刀,什么时候该用大刀。这样不仅节省了时间,还减少了厨房的混乱。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩游戏,有时需要用小技能,有时需要用大招。我们的框架就像一个聪明的游戏角色,知道什么时候该用小技能,什么时候该用大招。这样不仅能赢得比赛,还能节省能量!

术语表

事件驱动 (Event-driven)

一种根据事件触发操作的机制。

用于检测风险并触发模型调用。

步级级联 (Step-level cascade)

一种在每个步骤选择模型的优化策略。

用于提高计算效率。

停滞监控器 (Stuck Monitor)

检测进度降级的组件。

用于触发强模型调用。

里程碑监控器 (Milestone Monitor)

识别语义检查点的组件。

用于验证任务进度。

语义漂移 (Semantic drift)

代理偏离用户目标的现象。

需要通过里程碑监控器检测。

开放问题 这项研究留下的未解疑问

  • 1 如何提高监控器的准确性以减少误报?
  • 2 在复杂任务中,框架的稳定性如何保证?

应用场景

近期应用

桌面应用优化

提高桌面应用中的任务效率,减少计算成本。

远期愿景

全自动化软件系统

实现更高效的自动化软件系统,减少人工干预。

原文摘要

Computer-use agents provide a promising path toward general software automation because they can interact directly with arbitrary graphical user interfaces instead of relying on brittle, application-specific integrations. Despite recent advances in benchmark performance, strong computer-use agents remain expensive and slow in practice, since most systems invoke large multimodal models at nearly every interaction step. We argue that this uniform allocation of compute is fundamentally inefficient for long-horizon GUI tasks. Such trajectories are highly heterogeneous: many steps are routine and can be handled reliably by smaller, cheaper policies, while errors tend to concentrate at a relatively small number of high-risk moments. Across computer-use benchmarks, these failures repeatedly take two forms: progress stalls, where the agent loops, repeats ineffective actions, or fails to make meaningful progress, and silent semantic drift, where the agent continues taking locally plausible actions after already deviating from the user's true goal. To address this inefficiency, we propose an event-driven, step-level cascade for computer-use agents that runs a small policy by default and escalates to a stronger model only when lightweight learned monitors detect elevated risk. Our framework combines two complementary signals: a Stuck Monitor that detects degraded progress from recent reasoning-action history and triggers recovery, and a Milestone Monitor that identifies semantically meaningful checkpoints where sparse verification is most informative for catching drift. This design turns always-on frontier-model inference into adaptive, on-demand compute allocation over the course of an evolving interaction. The framework is modular and deployment-oriented: it can be layered on top of existing computer-use agents without changing the underlying agent architecture or retraining the large model.

cs.AI