Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

TL;DR

研究推理时刻扩展对本地计算机使用代理的影响,发现计算增加常导致收益递减。

cs.AI 🟡 进阶级 2026-07-31 3 次浏览
Woongkyu Lee Jungwook Choi
推理时刻扩展 计算机使用代理 本地模型 失败模式 计算权衡

核心发现

方法论

本文系统研究了推理时刻扩展在本地计算机使用代理中的作用,涵盖上下文、时间、结构和并行维度。通过在OSWorld基准上评估Qwen3-VL-8B/30B-A3B、UI-TARS-1.5-7B和OpenCUA-7B,分析了不同扩展方式对任务成功率和计算成本的影响。

关键结果

  • 结果1:上下文扩展提高了轨迹稳定性和任务准确性,但当token成本增加时收益趋于饱和,错误模式转向过早的错误成功。
  • 结果2:时间扩展减少了最大步停滞,但未显著提高任务成功率,表明更长的时间范围往往延长错误轨迹。
  • 结果3:结构分解在本地双阶段代理中引入了规划和格式化开销,而并行扩展在高计算成本下部分缓解了这些失败。

研究意义

研究揭示了推理时刻扩展在资源受限的本地模型中的局限性,强调了选择性计算分配和失败感知控制机制的重要性。这一发现对提高本地计算机使用代理的效率具有重要意义,尤其是在隐私和成本效率至关重要的应用中。

技术贡献

本文的技术贡献在于揭示了推理时刻扩展在本地模型中的非线性动态,指出了额外计算往往改变失败模式而非提高任务成功率。提出了基于本地模型能力和局限性的代理框架设计原则。

新颖性

本研究首次系统分析了推理时刻扩展在本地计算机使用代理中的影响,提供了对上下文、时间、结构和并行维度的全面理解,填补了现有研究的空白。

局限性

  • 局限1:上下文扩展的收益在token成本增加时趋于饱和,未能显著提高任务成功率。
  • 局限2:时间扩展未能克服本地模型的推理能力限制,导致操作成本线性增长。

未来方向

未来研究可以探索更高效的上下文管理、失败感知控制机制以及适应本地模型能力的代理框架设计,以进一步提高本地计算机使用代理的效率。

AI 总览摘要

随着大语言模型的兴起,数字交互的范式发生了根本性转变,计算机使用代理(CUAs)能够自主导航复杂的图形用户界面(GUI)。然而,在本地部署这些代理以提高隐私和成本效率仍然面临挑战。本文研究了推理时刻扩展在本地CUAs中的作用,发现额外计算往往导致收益递减,并改变失败模式。

研究通过在OSWorld基准上评估Qwen3-VL、UI-TARS和OpenCUA等模型,分析了上下文、时间、结构和并行扩展对任务成功率和计算成本的影响。结果表明,上下文扩展提高了轨迹稳定性和任务准确性,但当token成本增加时收益趋于饱和。时间扩展减少了最大步停滞,但未显著提高任务成功率,表明更长的时间范围往往延长错误轨迹。

结构分解在本地双阶段代理中引入了规划和格式化开销,而并行扩展在高计算成本下部分缓解了这些失败。研究建议本地CUAs需要选择性计算分配、失败感知控制机制以及基于本地模型能力和局限性的代理框架设计,以提高效率和任务成功率。

深度分析

研究背景

随着大语言模型的快速发展,计算机使用代理(CUAs)在自主导航复杂的图形用户界面(GUI)方面取得了显著进展。这些代理能够感知屏幕状态和交互历史,执行GUI操作以完成用户指令。然而,在本地部署这些代理以提高隐私和成本效率仍然面临挑战,尤其是在硬件资源受限的情况下。

核心问题

核心问题在于如何在资源受限的本地环境中有效地扩展推理时刻,以提高计算机使用代理的性能。现有研究表明,推理时刻扩展可以通过在执行过程中增加计算来提高前沿代理的性能,但其在资源受限的本地模型中的有效性尚不清楚。

核心创新

本文的核心创新在于系统研究了推理时刻扩展在本地CUAs中的作用,涵盖上下文、时间、结构和并行维度。通过在OSWorld基准上评估不同模型,分析了不同扩展方式对任务成功率和计算成本的影响,揭示了额外计算往往改变失败模式而非提高任务成功率。

方法详解

  • �� 上下文扩展:通过增加历史长度来提高轨迹稳定性。
  • �� 时间扩展:通过增加最大步数来减少最大步停滞。
  • �� 结构分解:将推理分解为规划和执行阶段。
  • �� 并行扩展:通过生成多个候选计划来提高计划选择。

实验设计

实验在OSWorld基准上进行,评估了Qwen3-VL、UI-TARS和OpenCUA等模型。使用的指标包括任务成功率、平均步数和提示token使用量。实验还分析了不同扩展方式的成本-准确性权衡。

结果分析

结果表明,上下文扩展提高了轨迹稳定性和任务准确性,但当token成本增加时收益趋于饱和。时间扩展减少了最大步停滞,但未显著提高任务成功率。结构分解引入了规划和格式化开销,而并行扩展在高计算成本下部分缓解了这些失败。

应用场景

本研究的应用场景包括需要高隐私和成本效率的本地计算机使用代理,如个人助理、自动化办公软件和智能家居设备。这些应用需要在有限的硬件资源下实现高效的任务执行。

局限与展望

研究的局限性包括上下文扩展的收益在token成本增加时趋于饱和,时间扩展未能克服本地模型的推理能力限制,以及结构分解引入的规划和格式化开销。未来研究可以探索更高效的上下文管理和失败感知控制机制。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。上下文扩展就像是记住你之前做过的菜谱,这样你就不会重复犯错。时间扩展则是给你更多时间来完成一道复杂的菜,但如果你不知道怎么做,时间再多也没用。结构分解就像是把做饭的过程分成准备和烹饪两个阶段,但这可能会增加额外的步骤和错误。并行扩展则是同时尝试几种不同的做法,看看哪种最好,但这需要更多的食材和时间。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,需要记住之前的每一步才能赢。上下文扩展就像是游戏中的存档点,让你不至于一直卡在同一个地方。时间扩展就像是给你更多的时间来通关,但如果你不知道怎么打,时间再多也没用。结构分解就像是把游戏分成不同的关卡,但这可能会让你迷路。并行扩展就像是同时尝试几种不同的策略,但这需要更多的精力和时间。

术语表

推理时刻扩展

在执行过程中分配额外计算资源以提高性能的技术。

用于提高计算机使用代理的任务成功率。

上下文扩展

通过增加历史长度来提高轨迹稳定性的方法。

用于减少重复循环和最大步停滞。

时间扩展

通过增加最大步数来减少最大步停滞的方法。

用于提供更多机会来完成任务。

结构分解

将推理过程分解为规划和执行阶段的方法。

用于提高计划选择和减少格式错误。

并行扩展

通过生成多个候选计划来提高计划选择的方法。

用于部分缓解结构分解引入的失败。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下提高本地模型的推理能力?
  • 2 如何有效管理上下文以减少token使用量?
  • 3 如何设计适应本地模型能力的代理框架?

应用场景

近期应用

个人助理

在本地设备上运行的智能个人助理,可以在不泄露隐私的情况下执行复杂任务。

远期愿景

智能家居

在智能家居设备中实现高效的任务执行,提高用户体验和设备互操作性。

原文摘要

Deploying autonomous computer-use agents (CUAs) locally is increasingly important for privacy, cost efficiency, and practical usability, yet improving their performance under strict hardware constraints remains challenging. While recent studies show that inference-time scaling can improve frontier computer-use agents through additional computation during execution, its effectiveness for resource-constrained local models remains poorly understood. We present a systematic empirical study of inference-time scaling in local CUAs across contextual, temporal, structural, and parallel dimensions. We evaluate Qwen3-VL-8B/30B-A3B, UI-TARS-1.5-7B, and OpenCUA-7B on the OSWorld benchmark. Our results show that additional computation often yields diminishing returns while changing failure modes. Contextual scaling provides historical grounding that improves trajectory stability and task accuracy, but its gains saturate as token cost increases and failures shift from repetitive or stalled trajectories toward premature false successes. Temporal scaling similarly reduces max-step stalls, yet does not substantially improve task success, indicating that longer horizons often extend erroneous trajectories rather than correct them. We further find that structural decomposition can introduce planning and formatting overhead in local two-stage agents, while parallel scaling partially mitigates these failures at a substantial computational cost. Overall, our findings suggest that efficient local CUAs require selective compute allocation, failure-aware control mechanisms, and agentic frameworks designed around the capabilities and limitations of local models.

cs.AI