PhoneWorld: Scaling Phone-Use Agent Environments
PhoneWorld通过真实GUI轨迹创建可控手机使用环境,提升评估基准52.5分。
核心发现
方法论
PhoneWorld采用可重复使用的管道,将真实的GUI轨迹和截图转化为可控的手机使用环境、可执行任务、自动验证器和训练回放。通过恢复屏幕连接和用户目标,构建可运行的模拟安卓应用,并从中派生任务和验证器。
关键结果
- 在固定训练预算下,PhoneWorld监督替换10K步,提升HYMobileBench 17.7分,AndroidControl 6.0分,AndroidWorld 14.7分,PhoneWorld 52.5分。
- 增加PhoneWorld监督量显著提升性能,扩展应用覆盖在固定预算下产生更大收益。
- 强化学习案例显示PhoneWorld自动验证奖励可转移,提升真实手机任务成功率5.66%。
研究意义
PhoneWorld改变了手机使用代理的研究方向,从逐个构建基准转向大规模构建可验证的手机使用环境。它为评估、监督和强化学习提供了新的可能性,解决了环境供应不足的长期问题。
技术贡献
PhoneWorld提供了一种可扩展的环境构建方法,与现有基准不同,它不仅支持评估,还能生成训练数据。它的自动验证机制为强化学习提供了新的奖励设计。
新颖性
PhoneWorld首次实现了通过真实轨迹构建大规模手机使用环境,区别于现有方法,它关注环境的可扩展性和可验证性。
局限性
- PhoneWorld依赖于真实轨迹的质量和覆盖范围,可能无法完全模拟所有应用的复杂交互。
- 环境构建需要大量初始数据收集和人工审核,限制了自动化程度。
未来方向
未来工作包括扩展应用覆盖范围,优化自动化构建流程,并探索跨平台环境构建的可能性。
AI 总览摘要
手机使用代理面临的主要瓶颈是难以大规模构建可控、可重复的环境。现有基准虽在评估上取得进展,但无法提供扩展手机使用环境的可扩展方法。PhoneWorld通过将真实GUI轨迹和截图转化为可控环境,解决了这一问题。它不仅支持评估,还能生成训练数据,提升了多个评估基准的性能。PhoneWorld的自动验证机制为强化学习提供了新的奖励设计,显示了其在真实手机任务中的潜力。尽管如此,PhoneWorld仍需解决环境构建的自动化程度和覆盖范围问题。未来工作将致力于扩展应用覆盖范围和优化构建流程。
深度分析
研究背景
手机使用代理需要处理视觉丰富、状态驱动的界面,现有基准主要关注评估而非环境构建。PhoneWorld通过真实轨迹和截图创建可控环境,解决了环境供应不足的问题。
核心问题
手机使用代理的核心问题在于环境供应不足,难以大规模构建可控、可重复的环境,限制了模型的训练和评估。
核心创新
PhoneWorld通过真实轨迹恢复屏幕连接和用户目标,构建可运行的模拟安卓应用,并从中派生任务和验证器。这种方法不仅支持评估,还能生成训练数据。
方法详解
- �� 恢复屏幕连接和用户目标
- �� 构建模拟安卓应用
- �� 派生可执行任务和验证器
- �� 生成训练回放
实验设计
实验设计包括使用PhoneWorld替换AndroidWorld中的10K步,评估其对多个基准的影响,并进行强化学习案例研究。
结果分析
PhoneWorld监督替换10K步,提升HYMobileBench 17.7分,AndroidControl 6.0分,AndroidWorld 14.7分,PhoneWorld 52.5分。
应用场景
PhoneWorld可用于评估、监督和强化学习,适用于需要大规模环境构建的手机使用代理研究。
局限与展望
PhoneWorld依赖于真实轨迹的质量和覆盖范围,环境构建需要大量初始数据收集和人工审核。
通俗解读 非专业人士也能看懂
想象你在一个巨大的手机应用商店里,每个应用都有自己的展示台。PhoneWorld就像一个聪明的导游,它能快速搭建这些展示台,让你可以轻松浏览和互动。它不仅能展示应用的外观,还能模拟用户的操作,帮助你了解应用的使用方式。通过这种方式,PhoneWorld为手机使用代理提供了一个可控的训练和评估环境。
简单解释 像给14岁少年讲一样
想象你在玩一个手机游戏,游戏里有许多关卡,每个关卡都是一个不同的应用。PhoneWorld就像一个超级游戏编辑器,它能快速创建这些关卡,让你可以随意探索。它不仅能展示应用的样子,还能模拟用户的操作,帮助你了解应用的使用方式。这样,你就能在游戏里轻松学习如何使用各种应用!
术语表
PhoneWorld
一种可重复使用的管道,用于创建可控手机使用环境。
用于将真实GUI轨迹转化为可控环境。
GUI轨迹
用户在应用中操作的屏幕路径。
用于恢复屏幕连接和用户目标。
自动验证器
用于自动检查任务完成情况的程序。
用于验证用户目标是否达成。
训练回放
用于模型训练的数据记录。
从可控环境中生成的成功操作记录。
模拟安卓应用
基于真实轨迹构建的可运行应用。
用于提供可控的手机使用环境。
开放问题 这项研究留下的未解疑问
- 1 如何进一步自动化环境构建过程?
- 2 如何扩展PhoneWorld的应用覆盖范围?
- 3 如何提高真实轨迹的质量和覆盖范围?
应用场景
近期应用
手机代理评估
PhoneWorld提供了一个可控环境,用于评估手机代理的性能。
远期愿景
跨平台环境构建
探索PhoneWorld在不同平台上的应用,提供统一的环境构建解决方案。
原文摘要
A central bottleneck for phone-use agents is that controllable, reproducible environments covering real mobile behavior are hard to build at scale. Existing mobile-agent benchmarks have made important progress on evaluation, but they do not by themselves provide a scalable way to construct many new phone-use environments. We present PhoneWorld, a reusable pipeline that converts real GUI trajectories and screenshots into controllable phone-use environments, executable tasks, automatic verifiers, and training rollouts. Rather than hand-building one mobile benchmark at a time, PhoneWorld uses real trajectories to recover which screens matter, how screens connect, which interactions must change environment state, and which user goals admit automatic verification. From these signals, it builds runnable mock Android apps backed by read-only app content and mutable state, then derives executable tasks, rule-based verifiers, and training rollouts from the same environments. In its current instantiation, PhoneWorld covers 34 apps across 16 domains, spanning common consumer mobile behaviors such as search, browsing, shopping, booking, media, and social interaction. Under a fixed training budget, replacing 10K steps from an auxiliary AndroidWorld corpus in an AndroidWorld-based baseline with broad PhoneWorld supervision improves all four evaluation benchmarks at once, raising HYMobileBench by 17.7 points, AndroidControl by 6.0 points, AndroidWorld by 14.7 points, and PhoneWorld by 52.5 points. We then study two additional scaling questions: increasing the amount of PhoneWorld supervision strongly improves PhoneWorld performance, and under a fixed PhoneWorld budget, expanding app coverage yields even larger gains. Overall, PhoneWorld shifts the focus from building one mobile benchmark at a time to scaling the supply of phone-use environments themselves.