RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents

TL;DR

RecreationWorld框架实现混合计算机使用代理的可扩展验证环境,GPT-6 Astra在RecreationBench上得分58.1%。

cs.CL 🔴 高级 2026-09-19 27 次浏览
Shuai Bai Jiayong Deng Yikun Fu Chang Gao Xuhao Hu Mianqiu Huang Yizhen Jiang Yuheng Jing Dehui Kong Keliang Li Ning Li Wanli Li Dayiheng Liu Dunjie Lu Changwei Luo Que Shen Zheyuan Wang Zijian Wang Jie Wu Gao Wu Zhihui Xie Rui Xie Haiyang Xu An Yang Jiakang Yuan Yanming Zhang Jiajun Zhang Xi Zhang Zhenru Zhang Zhuo Zhen Mingkang Zhu Bowen Zhou
混合代理 验证环境 跨平台 自动化 人工智能

核心发现

方法论

RecreationWorld框架通过在Ubuntu、macOS、Windows、Android和Web上提供可重现的环境,允许代理在没有预定工作流程的情况下探索、实现和验证软件。该框架使用高质量的开源应用程序生成训练轨迹,支持跨平台的GUI控制和编码工具。

关键结果

  • GPT-6 Astra在RecreationBench上总得分58.1%,但仅在2.8%的任务上通过所有程序测试。
  • 代理在静态界面结构的再现上表现优于交互和计算输出。
  • 生成的应用程序比参考应用程序更小且更单一。

研究意义

RecreationWorld为混合计算机使用代理提供了一个可扩展和验证的环境,解决了传统代理在图形界面和命令行操作间缺乏交互的问题。这一框架促进了代理在不同平台和任务上的自我改进和能力迁移。

技术贡献

RecreationWorld通过提供一个统一的跨平台环境,显著扩展了混合代理的操作空间,使其能够在真实的数字工作环境中无缝切换。该框架的验证机制基于可执行行为,而非源代码相似性,提供了新的工程可能性。

新颖性

RecreationWorld首次将混合代理的操作和编码能力结合在一个长时间跨度的过程中,提供了一个自我验证的循环,超越了传统的单一模式交互。

局限性

  • 代理在交互和计算输出的再现上表现不佳,生成的应用程序较小且单一。
  • 仅在2.8%的任务上通过所有程序测试。

未来方向

未来工作可以集中在提高代理在复杂交互和计算输出上的表现,以及优化生成应用程序的结构和大小。

AI 总览摘要

RecreationWorld框架为混合计算机使用代理提供了一个可扩展和验证的环境,解决了传统代理在图形界面和命令行操作间缺乏交互的问题。通过在Ubuntu、macOS、Windows、Android和Web上提供可重现的环境,该框架允许代理在没有预定工作流程的情况下探索、实现和验证软件。

在实验中,GPT-6 Astra在RecreationBench上取得了58.1%的总得分,但仅在2.8%的任务上通过所有程序测试。代理在静态界面结构的再现上表现优于交互和计算输出,而生成的应用程序比参考应用程序更小且更单一。

RecreationWorld的验证机制基于可执行行为,而非源代码相似性,提供了新的工程可能性。未来的工作可以集中在提高代理在复杂交互和计算输出上的表现,以及优化生成应用程序的结构和大小。

深度分析

研究背景

随着计算机使用代理的进步,传统代理在图形界面和命令行操作间缺乏交互。RecreationWorld框架通过提供一个跨平台的验证环境,解决了这一问题。该框架允许代理在没有预定工作流程的情况下探索、实现和验证软件。

核心问题

传统代理在图形界面和命令行操作间缺乏交互,导致在真实数字工作中表现不佳。需要一个能够结合两者的框架,以支持代理在不同平台和任务上的自我改进。

核心创新

RecreationWorld提供了一个统一的跨平台环境,允许代理在没有预定工作流程的情况下探索、实现和验证软件。该框架的验证机制基于可执行行为,而非源代码相似性。

方法详解

  • �� 提供跨平台的可重现环境
  • �� 使用高质量开源应用生成训练轨迹
  • �� 支持跨平台的GUI控制和编码工具
  • �� 验证机制基于可执行行为

实验设计

在RecreationBench上测试了250个任务,涵盖不同的领域和平台。使用GPT-6 Astra进行实验,评估代理在不同平台和任务上的表现。

结果分析

GPT-6 Astra在RecreationBench上总得分58.1%,但仅在2.8%的任务上通过所有程序测试。代理在静态界面结构的再现上表现优于交互和计算输出。

应用场景

RecreationWorld可用于开发和测试混合计算机使用代理,支持在不同平台和任务上的自我改进和能力迁移。

局限与展望

代理在交互和计算输出的再现上表现不佳,生成的应用程序较小且单一。未来工作可以集中在优化生成应用程序的结构和大小。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。RecreationWorld就像一个智能厨师助手,它能帮你在不同的厨房设备间无缝切换,比如烤箱和搅拌机。它不仅能帮你找到食谱,还能帮你调整食材比例,确保每道菜都完美无缺。这个助手能在不同的厨房环境中工作,比如家用厨房、餐厅厨房,甚至是户外烧烤。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,你需要同时控制多个角色。RecreationWorld就像一个超级智能的游戏助手,它能帮你在不同的场景间切换,比如森林和城堡。它不仅能帮你找到隐藏的宝藏,还能帮你打败大Boss!这个助手能在不同的游戏环境中工作,比如电脑游戏、手机游戏,甚至是网页游戏。

术语表

混合代理 (Hybrid Agent)

能够在图形界面和命令行间无缝切换的智能代理。

RecreationWorld框架中的核心组件。

验证环境 (Verifiable Environment)

一个允许对代理行为进行验证的环境。

RecreationWorld提供的跨平台环境。

RecreationBench

用于评估混合代理表现的基准测试集。

包含250个任务的测试集。

GPT-6 Astra

在RecreationBench上表现最好的模型。

在实验中取得了58.1%的总得分。

开源应用 (Open-source Application)

可自由使用和修改的应用程序。

用于生成训练轨迹的高质量应用程序。

开放问题 这项研究留下的未解疑问

  • 1 如何提高代理在复杂交互和计算输出上的表现?
  • 2 生成应用程序的结构和大小如何优化?
  • 3 如何提高程序测试的通过率?

应用场景

近期应用

开发测试

开发者可以使用RecreationWorld测试混合代理在不同平台上的表现,优化其能力。

远期愿景

智能助手

RecreationWorld可以发展为一个智能助手,帮助用户在不同的数字环境中无缝切换。

原文摘要

Computer-use agents (CUAs) have advanced along two separate lines: graphical interaction and software development through code and the command line. Real digital work requires both, interleaved rather than stacked end to end. We study hybrid CUAs that autonomously decide when to explore an interface, implement software, and run and visually verify their artifacts. We introduce RecreationWorld, a five-platform framework built around recreation: given a running reference, an agent must discover its behavior and build a faithful implementation with no prescribed workflow. RecreationWorld provides reproducible environments on Ubuntu, macOS, Windows, Android, and Web, plus a unified harness with native GUI control and coding tools. The running reference serves as an oracle for hidden behavioral tests, providing execution-grounded rewards. We scale trajectory generation with high-quality open-source applications. Models trained on these trajectories improve across five out-of-distribution coding and hybrid computer-use benchmarks and more frequently verify their rendered outputs, providing evidence of transfer beyond recreation. For held-out evaluation, we introduce RecreationBench, comprising 250 diverse tasks across domains and platforms. Reference-grounded programmatic and visual assertions cover action-conditioned outcomes at multiple interaction depths; each is validated on the reference and by human reviewers before the suite is frozen for automatic scoring. GPT-6 Astra leads at 58.1% overall, but passes all programmatic tests on just 2.8% of tasks. Agents reproduce static interface structure more reliably than interactions and computed outputs, while generated applications remain smaller and more monolithic than their references. We release the benchmark, environments, and test suites.

cs.CL cs.SE