Faithful Mobile GUI Agents with Guided Advantage Estimator

TL;DR

Faithful-Agent框架通过引导优势估计器将Trap SR从13.88%提升至80.21%。

cs.AI 🔴 高级 2026-05-02 7 次浏览
Haowen Hu Pengzhou Cheng Zheng Wu Lingzhong Dong Gongshen Liu Zhuosheng Zhang
图形用户界面 视觉语言模型 增强学习 信任度 优势估计器

核心发现

方法论

研究提出了Faithful-Agent框架,通过两个阶段的管道来增强GUI代理的信任度。第一阶段是基于信任度的SFT,旨在通过证据扰动来灌输放弃行为。第二阶段是RFT,利用引导优势估计器(GuAE)来防止低方差回滚组中的优势崩溃,并通过思想行动一致性奖励来提升信任度。

关键结果

  • 实验结果显示,Faithful-Agent在第二阶段将Trap SR从基线的13.88%提升至80.21%,同时保持了稳健的通用指令跟随性能。
  • 在不同场景下,Faithful-Agent的整体成功率达到了71.67%。
  • 通过对比不同的GRPO变体,GuAE有效地缓解了优势崩溃问题。

研究意义

该研究在视觉语言模型的图形用户界面交互领域具有重要意义。它解决了当前GUI代理在证据基础和内部一致性方面的长期痛点,提供了一种更可靠的自动化解决方案。

技术贡献

技术贡献包括引入了引导优势估计器(GuAE),在低方差回滚组中保持优势不崩溃,并通过思想行动一致性奖励来增强信任度。这些设计与现有的SOTA方法有根本区别,提供了新的理论保证和工程可能性。

新颖性

这是首次将信任度作为GUI代理的核心问题来处理,并通过引导优势估计器来解决优势崩溃问题,与现有方法相比具有根本创新。

局限性

  • 在极端稀疏奖励情况下,系统可能仍会出现信任度下降的问题。
  • 某些复杂的用户界面可能会导致模型的误判。

未来方向

未来的研究方向包括探索更复杂的用户界面场景,并进一步优化引导优势估计器以适应不同的奖励结构。

AI 总览摘要

图形用户界面(GUI)代理在视觉语言模型的支持下,展示了强大的交互能力。然而,这些代理常常依赖记忆的捷径,而不是基于显示的屏幕证据或用户指令进行操作。为了解决这一问题,研究团队提出了Faithful-Agent,一个以信任度为优先的框架,重新定义了GUI交互,以优先考虑证据基础和内部一致性。该框架采用了两阶段管道:第一阶段是基于信任度的SFT,旨在通过证据扰动来灌输放弃行为;第二阶段是RFT,利用引导优势估计器(GuAE)来防止低方差回滚组中的优势崩溃,并通过思想行动一致性奖励来提升信任度。实验结果显示,Faithful-Agent在第二阶段将Trap SR从基线的13.88%提升至80.21%,同时保持了稳健的通用指令跟随性能。该研究在视觉语言模型的图形用户界面交互领域具有重要意义,解决了当前GUI代理在证据基础和内部一致性方面的长期痛点,提供了一种更可靠的自动化解决方案。

深度分析

研究背景

近年来,视觉语言模型(VLM)在图形用户界面(GUI)交互领域取得了显著进展。这些模型能够处理视觉观察和文本指令,生成可执行的操作。然而,现有的GUI代理常常依赖记忆的捷径,而不是基于显示的屏幕证据或用户指令进行操作。这种不忠实的行为导致了交互失败,影响了自动化的可靠性。

核心问题

核心问题在于GUI代理的不忠实行为,包括未能基于界面状态进行决策和偏离用户指令。这种行为导致了内部不一致和偶尔的错误交互,影响了自动化的可靠性。

核心创新

研究提出了Faithful-Agent框架,通过两个阶段的管道来增强GUI代理的信任度。第一阶段是基于信任度的SFT,旨在通过证据扰动来灌输放弃行为。第二阶段是RFT,利用引导优势估计器(GuAE)来防止低方差回滚组中的优势崩溃,并通过思想行动一致性奖励来提升信任度。

方法详解

  • �� Faithfulness-oriented SFT: Instills abstainment behaviors under evidence perturbations.
  • �� RFT with GuAE: Prevents advantage collapse in low-variance rollout groups.
  • �� Thought-action consistency reward: Enhances alignment between stated intent and executed actions.

实验设计

实验设计包括使用多个数据集进行训练和测试,比较不同的GRPO变体和奖励设计。关键超参数包括回滚组大小和奖励组合权重。通过消融研究评估了各组件的贡献。

结果分析

实验结果显示,Faithful-Agent在第二阶段将Trap SR从基线的13.88%提升至80.21%,同时保持了稳健的通用指令跟随性能。通过对比不同的GRPO变体,GuAE有效地缓解了优势崩溃问题。

应用场景

该框架可用于移动、网页和桌面环境的自动化交互,特别是在需要高信任度的场景中。它为行业提供了更可靠的自动化解决方案。

局限与展望

在极端稀疏奖励情况下,系统可能仍会出现信任度下降的问题。某些复杂的用户界面可能会导致模型的误判。未来的研究方向包括探索更复杂的用户界面场景,并进一步优化引导优势估计器以适应不同的奖励结构。

通俗解读 非专业人士也能看懂

想象一个工厂,工人在生产线上工作。每个工人都有自己的任务,但有时他们会因为记忆的捷径而犯错。Faithful-Agent就像一个聪明的监督员,确保工人们根据实际情况而不是记忆来做决定。它通过两个阶段的训练来提高工人的准确性,第一阶段是教他们如何在信息不完整时停止工作,第二阶段是帮助他们在复杂情况下做出更好的决策。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要根据屏幕上的提示来做出决定。但有时候,屏幕上的信息不完整,你可能会做出错误的决定。Faithful-Agent就像一个聪明的助手,帮助你在信息不完整时做出正确的选择。它通过两个阶段的训练来提高你的游戏技能,第一个阶段是教你如何在信息不完整时停止,第二个阶段是帮助你在复杂情况下做出更好的决策。

术语表

Faithful-Agent (忠实代理)

一种以信任度为优先的框架,旨在增强GUI代理的信任度。

用于解决GUI代理的不忠实行为问题。

Guided Advantage Estimator (引导优势估计器)

一种防止低方差回滚组中优势崩溃的机制。

用于增强RFT阶段的信任度。

SFT (监督微调)

一种通过证据扰动来灌输放弃行为的训练阶段。

用于Faithful-Agent的第一阶段训练。

RFT (增强微调)

一种通过引导优势估计器来增强信任度的训练阶段。

用于Faithful-Agent的第二阶段训练。

Trap SR (陷阱成功率)

衡量代理在复杂场景中的成功率。

用于评估Faithful-Agent的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端稀疏奖励情况下进一步提高信任度?
  • 2 在复杂用户界面场景中,如何优化模型以减少误判?

应用场景

近期应用

移动设备自动化

该框架可用于提高移动设备上的自动化交互的可靠性。

远期愿景

跨平台自动化

该框架有潜力在多个平台上实现高信任度的自动化交互。

原文摘要

Vision-language model based graphical user interface (GUI) agents have shown strong interaction capabilities. However, they often behave unfaithfully, relying on memorized shortcuts rather than grounding actions in displayed screen evidence or user instructions. To address this, we propose Faithful-Agent, a faithfulness-first framework that reformulates GUI interaction to prioritize evidence groundedness and internal consistency. Faithful-Agent employs a two-stage pipeline: (i) a faithfulness-oriented SFT stage to instill abstainment behaviors under evidence perturbations; (ii) an RFT stage that further amplifies faithfulness by introducing the guided advantage estimator (GuAE), an anchor-based and variance-adaptive advantage tempering mechanism built upon GRPO. GuAE prevents advantage collapse in low-variance rollout groups under sparse GUI rewards, and with a thought-action consistency reward, Faithful-Agent (Stage II) elevates the Trap SR from 13.88\% to 80.21\% relative to the baseline, while preserving robust general instruction-following performance.

cs.AI