WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning

TL;DR

WM-R1通过世界模型替代真实环境,显著提升GUI代理的推理能力。

cs.AI 🔴 高级 2026-08-27 4 次浏览
Yu Han Tianwen Qian
强化学习 世界模型 GUI代理 移动平台 并行训练

核心发现

方法论

WM-R1框架通过世界模型替代真实环境进行训练,使用GRPO算法进行策略优化。世界模型负责状态转换,允许代理在执行前推理候选动作的后果。该方法支持大规模并行化和细粒度轨迹生成,并引入多维规则奖励以优化任务成功率、轨迹效率和世界模型利用率。

关键结果

  • WM-R1在AndroidWorld上达到了39.8%的成功率,比UI-R1提高了9.0个百分点,表明其在长程任务上的显著优势。
  • 在GUI-Odyssey上,WM-R1的成功率为31.6%,超越了UI-R1的21.5%,显示出在跨应用导航任务中的优越性。
  • WM-R1在ScreenSpot-Pro的图标定位上提高了15.1个百分点,显示出其在GUI定位任务中的改进。

研究意义

WM-R1通过消除对真实环境的依赖,降低了训练成本和不稳定性,为移动平台上的GUI代理提供了一种高效的训练方法。其在长程任务和复杂环境中的优越表现,表明其在自动化复杂数字工作流方面的潜力。

技术贡献

WM-R1引入了世界模型作为训练环境的核心组件,与传统的GRPO方法相比,提供了全新的训练视角。通过模拟环境中的状态转换,WM-R1实现了更高效的策略优化和更强的推理能力。

新颖性

WM-R1是首个完全在模拟环境中训练GUI代理的框架,通过将世界模型嵌入推理过程,实现了在执行前的动作后果评估,与现有方法相比具有显著创新性。

局限性

  • WM-R1在处理极端复杂或动态变化的环境时可能表现不佳,因为世界模型的预测能力有限。
  • 在某些情况下,过度依赖世界模型可能导致计算资源的浪费。

未来方向

未来的研究可以探索更复杂的世界模型,以进一步提高WM-R1在动态环境中的表现。此外,结合其他强化学习策略可能会带来更多的性能提升。

AI 总览摘要

WM-R1是一种全新的强化学习框架,旨在通过世界模型替代真实环境来训练移动平台上的GUI代理。传统的强化学习方法通常需要大量的真实环境交互,这导致了高昂的资源成本和不稳定性,尤其是在GUI场景中。WM-R1通过使用世界模型作为状态转换的来源,消除了对真实环境的需求,并支持大规模并行化和细粒度轨迹生成。

在实验中,WM-R1在Android移动基准测试中表现出色,显著优于仅使用GRPO的基线方法。这表明WM-R1在长程任务和复杂环境中的优越性,尤其是在需要多步推理的任务中。WM-R1的成功在于其能够在执行前评估候选动作的后果,从而优化任务成功率、轨迹效率和世界模型利用率。

尽管WM-R1展示了显著的性能提升,但在处理极端复杂或动态变化的环境时仍存在挑战。未来的研究可以探索更复杂的世界模型和其他强化学习策略,以进一步提高性能。WM-R1的出现为移动平台上的自动化复杂数字工作流提供了新的可能性。

深度分析

研究背景

近年来,随着移动设备的普及,自动化GUI代理的需求不断增加。传统的强化学习方法在训练这些代理时,通常依赖于大量的真实环境交互,这导致了高昂的资源成本和不稳定性。尽管一些研究尝试通过世界模型来增强推理能力,但大多数方法仅在推理时使用世界模型,而未将其集成到训练过程中。

核心问题

在GUI场景中,强化学习面临三个主要瓶颈:计算成本高、不可逆性强以及环境噪声大。这些问题限制了代理在复杂环境中的表现,尤其是在需要多步推理的任务中。

核心创新

WM-R1通过将世界模型嵌入到训练过程中,彻底消除了对真实环境的依赖。其核心创新在于:1) 使用世界模型进行状态转换,2) 在执行前评估候选动作的后果,3) 支持大规模并行化和细粒度轨迹生成。

方法详解

  • �� 使用Qwen2.5-VL-3/7B作为基础模型,结合AndroidCode、GUI-Odyssey和GUI-R1数据集进行训练。
  • �� 采用GRPO算法进行策略优化,通过多维规则奖励驱动策略更新。
  • �� 世界模型负责状态转换,允许代理在执行前推理候选动作的后果。

实验设计

实验在AndroidWorld、GUI-Odyssey和AndroidControl等基准上进行,评估WM-R1在长程任务和GUI定位任务中的表现。使用Code2World-8B模型生成可渲染的HTML,并通过无头浏览器渲染为截图。

结果分析

WM-R1在AndroidWorld上的成功率为39.8%,比UI-R1提高了9.0个百分点。在GUI-Odyssey上,WM-R1的成功率为31.6%,超越了UI-R1的21.5%。在ScreenSpot-Pro的图标定位上,WM-R1提高了15.1个百分点。

应用场景

WM-R1可用于自动化复杂的数字工作流,尤其是在移动平台上。其在长程任务和复杂环境中的优越表现,使其在移动应用开发和测试中具有重要应用价值。

局限与展望

尽管WM-R1展示了显著的性能提升,但在处理极端复杂或动态变化的环境时仍存在挑战。此外,过度依赖世界模型可能导致计算资源的浪费。未来的研究可以探索更复杂的世界模型和其他强化学习策略,以进一步提高性能。

通俗解读 非专业人士也能看懂

想象一个工厂,工厂里的机器人需要完成一系列任务。传统方法要求机器人在真实环境中不断尝试,这既耗时又昂贵。WM-R1就像是给机器人配备了一套虚拟模拟器,让它们可以在虚拟环境中练习,直到找到最佳方案。这样一来,机器人在真实环境中执行任务时就能更加高效和准确。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下,你在玩一个超级复杂的手机游戏。这个游戏有很多关卡,每一关都需要你做出正确的选择才能过关。现在,想象有一个超级智能的助手,它可以在你做出选择之前,先在模拟世界里试一试,然后告诉你哪个选择最好!这就是WM-R1做的事情哦!它帮助电脑程序在虚拟世界里练习,这样它们在真实世界里就能表现得更好!是不是很酷?

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过与环境交互来学习最优策略。

在WM-R1中用于训练GUI代理。

世界模型 (World Model)

一种模拟环境状态转换的模型,用于预测未来状态。

WM-R1使用世界模型替代真实环境进行训练。

GRPO (Group Relative Policy Optimization)

一种策略优化算法,通过相对优势计算进行策略更新。

WM-R1使用GRPO进行策略优化。

GUI代理 (GUI Agent)

一种自动化工具,能够在图形用户界面中执行任务。

WM-R1训练的对象。

并行化 (Parallelization)

同时执行多个计算任务以提高效率。

WM-R1支持大规模并行化训练。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态变化的环境中提高世界模型的预测精度仍是一个开放问题。
  • 2 现有方法在处理极端复杂的任务时表现不佳,需要进一步研究。

应用场景

近期应用

移动应用测试

WM-R1可用于自动化移动应用的测试流程,提高测试效率和准确性。

远期愿景

复杂工作流自动化

WM-R1在复杂数字工作流的自动化中具有潜力,可能改变未来的工作方式。

原文摘要

GUI agents trained with reinforcement learning (RL) have showcased strong environment learning capabilities on mobile platforms. However, RL typically demands extensive real-environment interactions, leading to high resource costs and instability, especially in GUI scenarios. To address these, we propose WM-R1, the first reinforcement learning framework that trains mobile GUI agents with world models instead of real environments. Specifically, world models serve as the source of state transitions during all rollouts, replacing the real Android environment within the training loop. WM-R1 also embeds world models directly into the thinking process, enabling agents to reason about the consequences of candidate actions before committing to the final action. Crucially, WM-R1 eliminates the need for real-environment interaction, supports massively parallelized and step-level granularized trajectory generation grounded in world models, and introduces a multi-dimensional rule-based reward that jointly optimizes task success, trajectory efficiency, and world model utilization. For efficient training, we curate a high-quality dataset of 2000 challenging tasks. Experiments on Android mobile benchmarks demonstrate that WM-R1-trained agents significantly outperform GRPO-only baselines and inference-time simulation methods. Code is available at https://github.com/genalyu/WM-R1 .

cs.AI