Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

TL;DR

通过失败学习:利用失败轨迹在推理时自我改进,成功率提升6.6个百分点。

cs.CV 🔴 高级 2026-06-30 2 次浏览
Xueqiao Sun Xiaohan Wang Ludwig Schmidt Serena Yeung-Levy Yuhui Zhang
多模态大语言模型 自我改进 失败驱动 推理时间 计算机使用代理

核心发现

方法论

本文提出了一种失败驱动的自我改进循环,利用多模态大语言模型(MLLM)分析失败模式,提出推理时的解决方案,并生成代码补丁以升级代理。该方法在不增加训练成本的情况下,通过轻量级的人类验证来实现。

关键结果

  • 在OSWorld基准上使用OpenCUA-72B模型,成功率从42.3%提高到48.9%,绝对提升6.6个百分点,无需额外训练成本。
  • 通过LLM分析,识别出四种主要失败类别:定位错误、能力差距、知识缺陷和冗余循环。
  • 在不同的GUI基准上进行的推广研究显示出一致的改进,特别是对于更强的模型。

研究意义

该研究通过利用失败轨迹的信息,提供了一种新的数据驱动的自我改进方法,补充了传统的成功驱动管道,显著提高了计算机使用代理的效率和性能。

技术贡献

本文提出了一种新的失败驱动自我改进循环,利用LLM进行失败分析和推理时改进,与现有方法相比,提供了更高效的代理改进机制。

新颖性

这是首次将失败轨迹转化为代理改进的研究,提出了在推理时利用LLM进行失败分析和代码补丁生成的新方法。

局限性

  • 该方法依赖于LLM的分析能力,可能在复杂的失败模式下表现不佳。
  • 需要一定的人类验证,增加了操作复杂性。

未来方向

未来工作可以探索更自动化的验证过程,减少人类参与,并将该方法应用于更广泛的任务和环境中。

AI 总览摘要

计算机使用代理利用多模态大语言模型(MLLM)来操作计算机并完成任务。传统方法依赖于成功轨迹进行自我改进,但忽略了失败轨迹中的丰富信息。本文提出了一种失败驱动的自我改进循环,通过LLM分析失败模式,提出推理时解决方案,并生成代码补丁来升级代理。实验在OSWorld基准上验证了该方法的有效性,成功率从42.3%提高到48.9%,无需额外训练成本。该研究表明,失败驱动的自我改进是成功驱动管道的有效补充,能够更高效地提高代理性能。未来工作将探索更自动化的验证过程,并将该方法应用于更广泛的任务和环境中。

深度分析

研究背景

计算机使用代理近年来因其实用性和多功能性而受到广泛关注。这些代理利用多模态大语言模型(MLLM)来观察当前计算机状态并预测下一步操作。然而,收集大规模、高质量的轨迹仍然是一个重大挑战。

核心问题

传统的自我改进方法仅利用成功轨迹,而忽略了失败轨迹中的信息。失败轨迹包含了模型弱点的丰富信息,如何有效利用这些信息是一个关键问题。

核心创新

本文提出了一种失败驱动的自我改进循环,利用LLM分析失败模式,提出推理时解决方案,并生成代码补丁。这一创新使得代理能够在推理时进行自我改进,而无需额外的训练成本。

方法详解

  • �� 使用LLM分析失败轨迹,识别常见失败模式。
  • �� 提出推理时的解决方案,并生成代码补丁。
  • �� 通过轻量级的人类验证,确保改进的有效性。
  • �� 在OSWorld基准上验证改进效果。

实验设计

实验在OSWorld基准上进行,使用OpenCUA-72B模型。通过LLM分析识别四种主要失败类别,并对每种类别提出相应的解决方案。实验结果显示,成功率从42.3%提高到48.9%。

结果分析

实验结果表明,失败驱动的自我改进方法显著提高了代理的成功率,特别是在识别和解决定位错误、能力差距、知识缺陷和冗余循环方面表现突出。

应用场景

该方法可直接应用于需要高效自我改进的计算机使用代理中,特别是在复杂的GUI环境中。

局限与展望

该方法依赖于LLM的分析能力,可能在复杂的失败模式下表现不佳。此外,轻量级的人类验证增加了操作复杂性。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们在生产线上工作。传统方法只关注生产出合格产品的工人,而忽略了那些生产出次品的工人。本文的方法就像是让工厂经理去分析这些次品,找出问题所在,并给工人提供改进建议。通过这种方式,工厂整体的生产效率得到了提高。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的电子游戏,每次失败后,你都能得到一个提示,告诉你哪里出了问题。然后你可以在下一次尝试中改进你的策略。这篇论文就是在研究如何利用这些失败的提示来让游戏角色变得更强大!

术语表

多模态大语言模型 (MLLM)

结合多种模态信息(如文本、图像)的语言模型,能够理解和生成复杂的多模态内容。

用于分析计算机使用代理的失败轨迹。

失败驱动自我改进

通过分析失败案例来改进系统性能的方法。

本文提出的核心方法。

推理时解决方案

在系统运行时提出的解决方案,用于即时改进系统性能。

由LLM分析失败模式后生成。

代码补丁

用于修复或改进软件系统的小型代码修改。

用于实现推理时解决方案。

OSWorld基准

用于评估计算机使用代理性能的标准测试环境。

实验验证中使用的基准。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务和环境中应用该方法?
  • 2 如何减少人类验证的参与,提高自动化水平?

应用场景

近期应用

计算机使用代理优化

通过失败驱动的自我改进方法,提高代理在复杂GUI环境中的性能。

远期愿景

智能系统自我改进

将该方法推广到更广泛的智能系统中,实现更高效的自我改进。

原文摘要

Computer-use agents, which leverage multimodal large language models (MLLMs) to operate computers and complete tasks, have attracted significant attention for their utility and versatility. A major challenge in developing these agents is collecting large-scale, high-quality trajectories. The standard approach generates synthetic data through a self-improving loop: an agent is placed in a verifiable environment and iteratively fine-tuned on its successful trajectories. Despite its effectiveness, this paradigm exploits only successful trajectories and discards the failed ones, even though failures carry rich information about a model's weaknesses. In this work, we explore a complementary failure-driven self-improvement loop, a data-centric paradigm that turns failed trajectories into agent improvements. Specifically, we employ an LLM to diagnose failure modes, propose inference-time solutions, and generate code patches -- lightly verified by humans -- that upgrade the agent. We validate this approach with the state-of-the-art OpenCUA-72B model on the OSWorld benchmark, improving the success rate from 42.3% to 48.9%, a gain of 6.6 percentage points, without any additional training cost and with only modest inference overhead. Our results demonstrate that failure-driven self-improvement is a viable complement to success-based pipelines, enabling more efficient agent improvement.

cs.CV cs.AI cs.CL cs.CY cs.LG