Towards Scalable Lightweight GUI Agents via Multi-role Orchestration

TL;DR

LAMO框架通过多角色编排提升轻量级GUI代理的任务扩展性,在ScreenSpot-pro上达到52.6%的准确率。

cs.AI 🔴 高级 2026-04-15 14 次浏览
Ziwei Wang Junjie Zheng Leyang Yang Sheng Zhou Xiaoxuan Tang Zhouhua Fang Zhiwei Liu Dajun Chen Yong Li Jiajun Bu
轻量级代理 多模态大模型 GUI自动化 多角色编排 任务扩展性

核心发现

方法论

LAMO框架通过角色导向的数据合成和两阶段训练策略提升轻量级MLLM的任务扩展性。第一阶段使用困惑度加权交叉熵优化进行知识蒸馏和视觉感知增强,第二阶段通过强化学习进行角色导向的协作探索。

关键结果

  • LAMO-3B在ScreenSpot-pro上实现了52.6%的屏幕定位准确率,显著优于其他轻量级模型。
  • 在AndroidControl-High上,LAMO-3B的成功率达到77.1%,显示出强大的任务执行能力。
  • 在MiniWob++在线环境中,LAMO-3B表现出色,验证了其在多角色系统中的潜力。

研究意义

该研究为轻量级GUI代理在资源受限设备上的应用提供了新的可能性,解决了大规模模型部署成本高的问题。通过多角色编排,LAMO框架提升了轻量级模型的任务扩展性,使其能够适应复杂的实际场景。

技术贡献

LAMO框架通过角色导向的数据合成和两阶段训练策略,突破了轻量级模型在任务扩展性上的瓶颈,提供了新的工程实现可能性,特别是在多角色系统中的应用。

新颖性

LAMO是首个将多角色编排应用于轻量级GUI代理的框架,通过角色导向的数据合成和强化学习,显著提升了轻量级模型的任务扩展性。

局限性

  • 在复杂的GUI布局中,LAMO-3B的屏幕定位准确率仍有提升空间。
  • 在资源极其有限的设备上,LAMO-3B的性能可能受限。

未来方向

未来研究可以探索LAMO框架在更多实际应用中的适应性,并优化其在极端资源受限环境中的性能。

AI 总览摘要

轻量级GUI代理在资源受限设备上的应用面临挑战,现有方法难以在实际场景中有效部署。LAMO框架通过多角色编排,赋予轻量级MLLM以GUI特定知识和任务扩展性,使其能够参与真实的GUI工作流。其核心技术包括角色导向的数据合成和两阶段训练策略,显著提升了模型的任务扩展性。在实验中,LAMO-3B在多项基准测试中表现优异,尤其是在ScreenSpot-pro和AndroidControl等环境中。该研究为轻量级模型在复杂场景中的应用提供了新思路,但在极端资源受限环境中的性能仍需进一步优化。

深度分析

研究背景

近年来,多模态大模型在GUI自动化领域取得了显著进展,但其高昂的部署成本限制了在资源受限设备上的应用。轻量级GUI代理因其低成本和高效性受到关注,但其任务扩展性和适应性仍需提升。

核心问题

轻量级GUI代理在复杂场景中面临任务扩展性不足的问题,难以适应多角色系统的需求。现有方法在高层次推理和低层次执行的结合上存在瓶颈。

核心创新

LAMO框架通过角色导向的数据合成和两阶段训练策略,提升了轻量级模型的任务扩展性。其创新之处在于通过多角色编排,解决了轻量级模型在复杂场景中的适应性问题。

方法详解

  • �� 角色导向的数据合成:将GUI自动化分解为五个核心能力。• 困惑度加权交叉熵优化:提升模型的视觉感知能力。• 强化学习:通过多任务协作探索,优化角色导向任务。

实验设计

实验使用了ScreenSpot、AndroidControl等基准测试,评估了LAMO-3B在不同环境中的性能。实验设计包括多角色编排和在线环境测试。

结果分析

LAMO-3B在ScreenSpot-pro上实现了52.6%的准确率,在AndroidControl-High上达到77.1%的成功率,验证了其在多角色系统中的潜力。

应用场景

LAMO框架可用于需要高效GUI自动化的场景,如移动设备应用管理、桌面软件操作等,具有广泛的行业应用潜力。

局限与展望

LAMO-3B在复杂GUI布局中的性能仍需提升,未来研究可优化其在极端资源受限环境中的表现。

通俗解读 非专业人士也能看懂

想象你在一个大型超市购物,超市有很多不同的区域,每个区域都有特定的功能。LAMO框架就像是一个聪明的购物助手,它能快速识别每个区域的功能,并帮助你高效完成购物任务。通过角色导向的数据合成和两阶段训练策略,LAMO就像是一个经验丰富的导购员,能够在不同的购物场景中提供最佳的购物建议。

简单解释 像给14岁少年讲一样

嘿,小朋友!想象一下,你在玩一个超级复杂的游戏,这个游戏有很多不同的关卡,每个关卡都有不同的任务。LAMO就像是一个超厉害的游戏助手,它能帮你快速识别每个关卡的任务,并给你最佳的通关建议。通过角色导向的数据合成和两阶段训练策略,LAMO就像是一个经验丰富的游戏向导,能够在不同的游戏场景中提供最佳的通关策略。

术语表

多模态大模型 (Multimodal Large Language Models)

结合多种数据模态(如文本、图像)的语言模型,能够处理复杂的多模态任务。

在LAMO框架中用于提升GUI代理的任务扩展性。

角色导向的数据合成 (Role-oriented Data Synthesis)

根据任务需求合成特定角色的数据,提升模型在特定任务中的表现。

用于LAMO框架中的数据准备阶段。

困惑度加权交叉熵 (Perplexity-Weighted Cross-Entropy)

一种优化方法,通过加权困惑度来提升模型的视觉感知能力。

用于LAMO框架的第一阶段训练。

强化学习 (Reinforcement Learning)

通过与环境的交互来学习最优策略的机器学习方法。

用于LAMO框架的第二阶段训练。

多角色编排 (Multi-role Orchestration)

通过协调多个角色来提升系统的任务扩展性和适应性。

LAMO框架的核心创新之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端资源受限环境中优化LAMO框架的性能?
  • 2 LAMO框架在更多实际应用场景中的适应性如何?

应用场景

近期应用

移动设备应用管理

通过LAMO框架,用户可以更高效地管理和操作移动设备上的应用程序,提高工作效率。

远期愿景

智能家居管理

LAMO框架可用于智能家居设备的自动化管理,实现更智能的家居生活体验。

原文摘要

Autonomous Graphical User Interface (GUI) agents powered by Multimodal Large Language Models (MLLMs) enable digital automation on end-user devices. While scaling both parameters and data has yielded substantial gains, advanced methods still suffer from prohibitive deployment costs on resource-constrained devices. When facing complex in-the-wild scenarios, lightweight GUI agents are bottlenecked by limited capacity and poor task scalability under end-to-end episodic learning, impeding adaptation to multi-agent systems (MAS), while training multiple skill-specific experts remains costly. Can we strike an effective trade-off in this cost-scalability dilemma, enabling lightweight MLLMs to participate in realistic GUI workflows? To address these challenges, we propose the LAMO framework, which endows a lightweight MLLM with GUI-specific knowledge and task scalability, allowing multi-role orchestration to expand its capability boundary for GUI automation. LAMO combines role-oriented data synthesis with a two-stage training recipe: (i) supervised fine-tuning with Perplexity-Weighted Cross-Entropy optimization for knowledge distillation and visual perception enhancement, and (ii) reinforcement learning for role-oriented cooperative exploration. With LAMO, we develop a task-scalable native GUI agent, LAMO-3B, supporting monolithic execution and MAS-style orchestration. When paired with advanced planners as a plug-and-play policy executor, LAMO-3B can continuously benefit from planner advances, enabling a higher performance ceiling. Extensive static and online evaluations validate the effectiveness of our design.

cs.AI