核心发现
方法论
本文提出了一种新的训练范式,通过引导式在策略蒸馏和多解双层GRPO框架,显著提升轻量级GUI代理的性能。引导式在策略蒸馏结合了oracle参考轨迹和动态检索机制,减少了幻觉并缓解了多解任务中的认知失调。多解双层GRPO框架在宏观子任务规划和微观执行匹配上进行联合对齐,提升了长时序任务的探索能力。
关键结果
- 在ScreenSpot-Pro上,LiteGUI在文本和图标识别的准确率分别达到52.79%和15.62%,显著超过其他轻量级模型。
- 在OS-World和Lite-Bench上,LiteGUI在任务成功率上与大规模模型相当,显示出其在多种环境下的强大适应性。
- 消融研究表明,引导式在策略蒸馏和多解双层探索能够充分释放2B/3B规模代理的潜力,超越传统模仿学习的性能极限。
研究意义
该研究通过引入新的训练范式,显著提升了轻量级GUI代理的性能,使其在多种基准测试中达到或接近大规模模型的水平。这不仅为在设备上运行的轻量级模型提供了新的可能性,也为跨平台自动化交互带来了更高效的解决方案。通过解决传统监督微调的过拟合和策略僵化问题,本文的方法为小规模模型在动态UI环境中的错误恢复提供了更好的支持。
技术贡献
本文的技术贡献在于提出了一种无需SFT的训练范式,通过引导式在策略蒸馏和多解双层GRPO框架,突破了传统方法的性能瓶颈。引导式在策略蒸馏通过动态检索机制减少了幻觉,而多解双层GRPO框架则通过联合对齐宏观和微观任务,提升了长时序任务的探索能力。
新颖性
这是首次将引导式在策略蒸馏应用于GUI代理领域,通过结合oracle参考轨迹和动态检索机制,显著减少了多解任务中的认知失调。与现有方法相比,本文的方法在处理多解任务时提供了更灵活的探索能力。
局限性
- 在某些复杂UI场景下,模型可能仍会出现策略僵化的问题,影响任务成功率。
- 数据生成管道的自动化程度有限,可能需要大量人工干预。
未来方向
未来的研究方向包括进一步优化数据生成管道,提高自动化程度,以及探索更高效的多解任务处理机制。
AI 总览摘要
在现代计算机使用中,GUI代理的开发越来越受到关注。然而,现有的轻量级模型在处理复杂任务时往往力不从心,传统的监督微调方法容易导致过拟合和策略僵化。为了解决这些问题,本文提出了一种新的训练范式,通过引导式在策略蒸馏和多解双层GRPO框架,显著提升了轻量级GUI代理的性能。
引导式在策略蒸馏结合了oracle参考轨迹和动态检索机制,减少了幻觉并缓解了多解任务中的认知失调。多解双层GRPO框架通过联合对齐宏观子任务规划和微观执行匹配,提升了长时序任务的探索能力。此外,本文还构建了一个自动化的数据生成管道,用于合成带有丰富多解注释的GUI任务轨迹。
实验结果表明,LiteGUI在多个基准测试中达到了最先进的性能,尤其在轻量级模型中表现突出。消融研究进一步证明了引导式在策略蒸馏和多解双层探索的有效性,能够充分释放2B/3B规模代理的潜力。未来的研究方向包括进一步优化数据生成管道,并探索更高效的多解任务处理机制。
深度分析
研究背景
近年来,自动化计算机使用受到越来越多的关注,GUI代理作为一种利用视觉理解来解释和执行计算机任务的系统,成为研究热点。尽管已有工作主要集中在使用大规模模型构建GUI代理,但适用于设备端或边缘部署的轻量级模型的发展仍然较少。小规模模型通常被认为难以处理复杂任务,因为其容量有限。
核心问题
现有的轻量级GUI代理在处理复杂任务时往往力不从心,传统的监督微调方法容易导致过拟合和策略僵化。这种局限性降低了零样本泛化能力,并阻碍了动态UI环境中的有效错误恢复。
核心创新
本文提出了一种新的训练范式,通过引导式在策略蒸馏和多解双层GRPO框架,显著提升了轻量级GUI代理的性能。引导式在策略蒸馏结合了oracle参考轨迹和动态检索机制,减少了幻觉并缓解了多解任务中的认知失调。
方法详解
- �� 引导式在策略蒸馏:结合oracle参考轨迹和动态检索机制,减少幻觉。
- �� 多解双层GRPO框架:联合对齐宏观子任务规划和微观执行匹配,提升探索能力。
- �� 数据生成管道:合成带有丰富多解注释的GUI任务轨迹。
实验设计
实验使用了ScreenSpot-Pro、OS-World和Lite-Bench三个基准测试,评估了LiteGUI的性能。通过在ScreenSpot-Pro上增强的ShowUI-Desktop-8k数据集和Lite-dataset进行训练,LiteGUI在多个任务中表现出色。
结果分析
LiteGUI在ScreenSpot-Pro上的文本和图标识别准确率分别达到52.79%和15.62%,显著超过其他轻量级模型。在OS-World和Lite-Bench上,LiteGUI在任务成功率上与大规模模型相当。
应用场景
LiteGUI可用于跨平台自动化交互,尤其适用于资源受限的设备端应用。其高效的任务执行能力使其在多种计算机使用场景中具有广泛的应用潜力。
局限与展望
尽管LiteGUI在多个基准测试中表现出色,但在某些复杂UI场景下,模型可能仍会出现策略僵化的问题。此外,数据生成管道的自动化程度有限,可能需要大量人工干预。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。传统的做法是跟着一本食谱一步步来,但有时你会发现食谱不够灵活,导致你在面对不同食材时束手无策。LiteGUI就像一个聪明的助手,它不仅能根据食谱给你建议,还能灵活调整步骤,比如当你没有某种调料时,它会建议你用其他调料替代。通过这种方式,它帮助你在厨房里更高效地完成任务。
简单解释 像给14岁少年讲一样
嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,需要同时控制好多角色。LiteGUI就像是一个超级聪明的助手,能帮你在游戏中做出最好的选择。它不仅能记住你之前做过的所有决定,还能根据当前的情况给你最好的建议。就像在游戏中,它能帮你找到最快的通关路线,让你成为游戏大师!
术语表
引导式在策略蒸馏
通过结合oracle参考轨迹和动态检索机制,减少幻觉并缓解多解任务中的认知失调。
用于提升轻量级GUI代理的性能。
多解双层GRPO
联合对齐宏观子任务规划和微观执行匹配,提升长时序任务的探索能力。
用于改善长时序任务中的探索能力。
ScreenSpot-Pro
一个用于评估GUI代理性能的基准测试,包含多种任务类型。
用于评估LiteGUI的性能。
Lite-dataset
包含30,000个完整长时序路径和11,000个多解注释的GUI数据集。
用于训练LiteGUI。
强化学习
通过与环境交互来学习最优策略的机器学习方法。
用于提升LiteGUI的任务执行能力。
开放问题 这项研究留下的未解疑问
- 1 如何在复杂UI场景中进一步减少策略僵化问题?
- 2 如何提高数据生成管道的自动化程度?
应用场景
近期应用
跨平台自动化交互
LiteGUI可用于提高设备端应用的任务执行效率,尤其适用于资源受限的环境。
远期愿景
智能UI代理
随着技术的进步,LiteGUI可能成为智能UI代理的核心组件,提供更高效的用户交互体验。
原文摘要
Developing lightweight, on-device vision-language GUI agents is essential for efficient cross-platform automated interaction. However, current on-device agents are constrained by limited model capacity, and further performance improvements remain urgently needed. Traditional Supervised Fine-Tuning (SFT) for small-scale models often leads to overfitting, catastrophic forgetting and policy rigidity, and thus fails to fully address these challenges. In this work, we propose a novel SFT-free training paradigm that significantly enhances the performance of small-scale models. We first present the initial systematic integration of generalized knowledge distillation into the GUI agent domain via Guided On-policy Distillation. By incorporating oracle reference trajectories together with a dynamic retrieval mechanism, our method reduces hallucinations and mitigates the cognitive misalignment inherent in multi-solution GUI tasks. Building on this foundation, we further introduce a Multi-solution Dual-level GRPO framework that jointly aligns macro-level subtask planning with micro-level execution matching, thereby improving exploration in long-horizon GUI agent scenarios. In addition, we construct an automated data generation pipeline to synthesize GUI task trajectories with rich multi-solution annotations. Extensive experiments show that our method achieves state-of-the-art performance among lightweight models while remaining competitive with substantially larger-scale models across all benchmarks. Ablation studies further demonstrate that structured on-policy distillation and multi-solution dual-level exploration can fully unlock the capabilities of 2B/3B scale agents, surpassing the performance limits of conventional imitation learning.