Fara-1.5: Scalable Learning Environments for Computer Use Agents

TL;DR

FaraGen1.5通过模块化环境、求解器和验证器实现计算机使用代理的可扩展数据生成,Fara1.5-27B在Online-Mind2Web上达到72.3%。

cs.AI 🔴 高级 2026-06-19 1 次浏览
Ahmed Awadallah Sahil Gupta Yash Lara Yadong Lu Hussein Mozannar Akshay Nambi Zach Nussbaum Yash Pandya Aravind Rajeswaran Corby Rosset Alexey Taymanov Luiz do Valle Vibhav Vineet Spencer Whitehead Andrew Zhao
计算机使用代理 数据生成 验证器 GPT-5.4 可扩展性

核心发现

方法论

FaraGen1.5由环境、求解器和验证器组成,使用真实和合成环境生成数据。求解器采用GPT-5.4模型,验证器确保任务正确性、效率和关键点遵循。

关键结果

  • Fara1.5-9B在Online-Mind2Web上达到63.4%,在WebVoyager上达到86.6%,显著超越Fara-7B和GUI-Owl-1.5-8B。
  • Fara1.5-27B在Online-Mind2Web上达到72.3%,与更大规模的专有系统竞争。
  • 通过FaraGen1.5生成的数据,Fara1.5系列在浏览器使用基准上设立新的标准。

研究意义

该研究解决了通过人类演示收集数据的成本和速度问题,提供了一个可扩展的解决方案,推动了计算机使用代理的研究和应用。

技术贡献

FaraGen1.5提供了一个模块化数据生成框架,结合强大的求解器和验证器,提升了数据质量和模型性能。

新颖性

首次将合成环境与真实环境结合,提供全面的任务验证,确保数据质量和模型训练的可靠性。

局限性

  • 合成环境的复杂性可能限制某些任务的真实感。
  • 验证器可能在某些情况下出现误判。
  • 模型在某些不可预测的环境中可能表现不佳。

未来方向

未来工作将集中于扩展合成环境的复杂性和多样性,并改善验证器的准确性。

AI 总览摘要

FaraGen1.5通过模块化组件实现计算机使用代理的数据生成。该系统结合真实和合成环境,使用GPT-5.4求解器和多重验证器,确保任务的正确性和效率。Fara1.5系列模型在浏览器使用基准上设立了新的标准,显著提升了任务成功率。该研究不仅解决了数据收集的成本和速度问题,还推动了计算机使用代理的研究和应用。未来工作将集中于扩展合成环境的复杂性和多样性,并改善验证器的准确性。

深度分析

研究背景

计算机使用代理在现代技术中扮演重要角色,尤其是在浏览器任务自动化方面。之前的研究主要依赖于人类演示数据,这种方法成本高且速度慢。

核心问题

收集高质量的计算机使用数据是训练代理的瓶颈。现有方法无法有效生成大规模、多样化的数据。

核心创新

FaraGen1.5通过模块化环境、求解器和验证器实现数据生成。合成环境允许安全尝试不可逆任务,求解器使用GPT-5.4模型,验证器确保数据质量。

方法详解

  • �� 使用真实和合成环境生成数据
  • �� 求解器采用GPT-5.4模型
  • �� 验证器确保任务正确性、效率和关键点遵循

实验设计

实验使用Online-Mind2Web和WebVoyager数据集,比较Fara1.5系列与其他模型的性能,验证数据生成的有效性。

结果分析

Fara1.5-9B在Online-Mind2Web上达到63.4%,在WebVoyager上达到86.6%。Fara1.5-27B在Online-Mind2Web上达到72.3%。

应用场景

该系统可用于自动化浏览器任务,如表单填写和在线购物,提升用户体验和效率。

局限与展望

合成环境的复杂性可能限制某些任务的真实感,验证器可能在某些情况下出现误判。

通俗解读 非专业人士也能看懂

想象一个虚拟的办公室,FaraGen1.5就像一个超级秘书,能够在真实和模拟的环境中处理各种任务。它使用强大的求解器来解决问题,并通过验证器确保每个步骤的准确性。就像秘书在处理复杂任务时会检查每个细节,FaraGen1.5确保每个数据点都是可靠的。

简单解释 像给14岁少年讲一样

想象你在玩一个超级游戏,FaraGen1.5是你的游戏助手,帮助你完成各种任务。它就像一个聪明的机器人,能够在真实和模拟的世界中工作,确保你每次都能赢得比赛。它使用强大的工具来解决问题,就像你在游戏中使用超级武器一样。

术语表

FaraGen1.5

一个模块化数据生成框架,用于计算机使用代理。

用于生成高质量的训练数据。

GPT-5.4

一种强大的语言模型,用于求解器。

在求解器中用于生成任务解决方案。

验证器

确保数据质量和任务正确性的组件。

用于评估生成的数据是否符合标准。

合成环境

模拟真实环境的虚拟场景,用于安全尝试任务。

用于生成不可逆任务的数据。

Fara1.5

一系列计算机使用代理模型。

在浏览器使用基准上设立新的标准。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升合成环境的复杂性和真实性?
  • 2 如何改善验证器的准确性以减少误判?

应用场景

近期应用

浏览器任务自动化

使用Fara1.5模型自动完成浏览器任务,如表单填写和在线购物。

远期愿景

智能办公助手

将Fara1.5集成到智能办公系统中,提升工作效率和用户体验。

原文摘要

Collecting computer use data from human demonstrations is expensive and slow, motivating the need for scalable generation strategies. This requires two key ingredients: environments in which agents can act and verifiers that can judge whether their demonstrations succeeded. We introduce FaraGen1.5, a scalable data pipeline for computer use agents composed of three modular components: environments, solvers, and verifiers. FaraGen1.5 uses both live websites and synthetic environments that faithfully simulate domains gated by authentication or that require irreversible actions. It employs a solver harness that can be powered by multiple models, including strong frontier models such as GPT-5.4, and also incorporates a user simulator to enable multi-turn rollouts. Finally, FaraGen1.5 scores the resulting trajectories with three complementary verifiers covering task correctness, efficiency, and critical-point adherence. Using data produced by this pipeline, we train Fara1.5, a family of native computer use agents (CUAs) at three scales built on Qwen3.5 (4B, 9B, and 27B). To train these models, we employ a supervised finetuning (SFT) recipe that carefully balances data from FaraGen1.5 for broad coverage, specific high-value tasks, and target model deficiencies in an iterative approach. Each model sets a new state of the art (SoTA) for its size class on browser-use benchmarks: Fara1.5-9B reaches 63.4% on Online-Mind2Web and 86.6% on WebVoyager, while Fara1.5-27B achieves 72.3% on Online-Mind2Web, which is competitive with much larger proprietary systems. We also release weights for the Fara1.5 models under MIT license, making SoTA computer use accessible for all beyond closed API-only systems.

cs.AI cs.LG