Plover: Steering GUI Agents through Plan-Centric Interaction

TL;DR

提出Plover,基于计划的视觉GUI自动化系统,通过外部化任务计划实现可检视、可修正,提升透明度与控制性。

cs.AI 🔴 高级 2026-07-17 41 次浏览
Madhumitha Venkatesan Shicheng Wen Jiajing Guo Jorge Piazentin Ono Liu Ren Dongyu Liu
GUI自动化 计划驱动 人机交互 多模态修正 系统修复

核心发现

方法论

Plover采用规划-执行架构,将任务计划作为持久化、可编辑的工件外部化,支持显式监督和局部修正。系统由规划器(基于启发式搜索和规则)生成结构化计划,执行器(基于屏幕像素匹配和动作映射)实现任务操作,执行过程中通过状态反馈支持动态修正。引入智能重规划机制(IR),结合用户驱动和系统驱动两种模式,确保计划连续性和修正的局部性。通过多模态交互(自然语言、截图标注)实现精确修正,增强系统透明度和可控性。

关键结果

  • 在38个挑战性任务中,自动执行失败的任务达26个,经过人机合作修复后,成功率提升至88%,平均修正次数为2.04次。系统能识别空间模糊、多步偏差和状态误解等失败类型,局部修正显著改善任务完成率。实验证明,计划外部化和可编辑机制使用户能有效监控和修正执行偏差,提升系统的可修复性和透明度。
  • 在场景模拟中,系统通过可视化计划和交互式修正,增强了用户对任务流程的理解和干预能力。对比传统黑箱式自主系统,Plover在复杂多步骤任务中表现出更高的修复成功率和用户满意度,验证了计划外部化的有效性。
  • 通过多模态修正和局部修复策略,系统在多种GUI环境下展现出良好的适应性,特别是在界面结构不稳定或信息密集的场景中,修复能力明显优于基线方法。

研究意义

该研究突破了GUI自动化中计划不可见、修正困难的瓶颈,推动人机协作向更透明、可控、适应性强的方向发展。通过外部化任务计划,系统实现了对执行过程的可视化和可修正,为复杂、长流程的自动化任务提供了新思路。这不仅提升了自动化的可靠性,也增强了用户对系统的信任与控制感,具有重要的理论和实践价值。未来,结合深度学习和更丰富的多模态交互,有望实现更智能、更自主的GUI代理。

技术贡献

本文提出了基于计划的GUI自动化架构,将任务计划作为持久化、可检视的工件外部化,突破了传统黑箱式系统的限制。引入智能重规划(IR)机制,实现计划的动态修正和连续性维护,结合自然语言和截图标注支持多模态修正。系统架构设计创新性地将规划、执行和修正环节解耦,提升了系统的可控性和修复能力。实验验证显示,该方法在多任务、多场景中显著优于现有的自主系统,提供了理论上的新框架和工程上的实现路径。

新颖性

本研究首次将计划外部化作为GUI自动化的核心机制,结合多模态交互实现局部修正和可视化修复,显著提升了系统的透明度和修复能力。与现有的自主代理和规则驱动方法不同,Plover强调计划的可检视性和可编辑性,突破了传统黑箱模型的限制,提供了更具交互性和可控性的自动化方案。

局限性

  • 系统在极端界面变化或复杂交互中仍可能出现计划偏离或修正失败,尤其在界面结构高度不稳定时,计划的准确性和修正效率受到影响。
  • 多模态交互依赖用户的准确标注和理解,存在误操作或理解偏差的风险,影响修复效果。
  • 系统在大规模或高频率修正场景下的性能和响应速度尚需优化,尤其在复杂多步骤任务中可能存在延迟。

未来方向

未来将结合深度学习模型提升界面理解和计划生成的智能化水平,增强系统的自主修复能力。同时,探索更丰富的多模态交互方式(如手势、语音)以提升用户体验。还计划扩展到多平台、多应用场景,增强系统的泛化能力,推动GUI自动化向更高层次的自主和协作发展。

AI 总览摘要

在当今复杂多变的用户界面环境中,自动化工具面临着巨大的挑战。传统的基于规则或脚本的自动化方法,因界面结构的频繁变化而变得脆弱,难以适应动态环境。近年来,视觉感知与自然语言理解的结合推动了多模态GUI代理的发展,但大多系统仍以“黑箱”方式内部处理计划和修正,用户难以理解或干预其行为。为解决这一问题,本文提出了Plover,一种基于计划的视觉GUI自动化系统。

Plover的核心创新在于将任务计划作为持久、可检视、可编辑的外部工件,支持用户在执行过程中实时监控、修正和重规划。系统由规划器、执行器和交互界面三部分组成,规划器生成结构化计划,执行器基于像素匹配实现操作,交互界面则提供可视化的计划和状态反馈。引入智能重规划机制(IR),结合用户驱动和系统驱动两种模式,确保任务连续性和修正的局部性。多模态交互(自然语言、截图标注)增强了修正的精确性和可控性。

在实验中,Plover在38个复杂任务中表现出优异的修复能力,成功率由自动执行的不足到合作修复后提升至88%,平均修正次数为2.04次。系统能有效识别空间模糊、多步偏差和状态误解等失败类型,局部修正显著改善任务完成率。这一成果表明,将计划外部化与多模态修正结合,极大增强了GUI自动化的可修复性和透明度。

该研究为GUI自动化提供了新范式,推动了人机协作向更智能、更可控的方向发展。未来,结合深度学习和更丰富的交互方式,有望实现更自主、更高效的自动化系统,极大地提升用户体验和系统可靠性。

深度分析

研究背景

GUI自动化经历了从基于规则脚本到视觉感知驱动的转变。早期方法如Selenium和RPA工具依赖固定元素标识,易受界面变化影响。近年来,视觉和自然语言结合的多模态模型(如GPT-4、VisualGPT)推动了基于像素的代理发展,支持更灵活的操作。然而,这些系统多为“黑箱”式,缺乏对计划的可视化和修正能力,导致用户难以理解和干预。尽管如此,自动化的透明性和修复性仍是核心挑战,尤其在复杂、多步骤任务中。

核心问题

现有视觉GUI代理多为自主执行,缺乏对任务计划的可视化和修正机制,导致在界面变化或错误发生时,用户难以识别和修正偏差。系统的“黑箱”特性限制了用户对执行过程的理解和干预能力,尤其在长流程或高风险场景中,错误可能悄然累积,影响任务完成率。如何实现计划的外部化、可检视和局部修正,成为提升系统可靠性和用户信任的关键。

核心创新

本文提出将任务计划作为持久化、可编辑的外部工件,突破传统的内部推理限制,支持用户在执行过程中实时监控和修正。引入智能重规划(IR)机制,结合自然语言和截图标注,实现局部修正和连续修复,增强系统的透明度和可控性。系统架构将规划、执行和修正环节解耦,支持多模态交互,显著优于现有的自主代理和规则驱动方法,为GUI自动化带来全新的人机协作范式。

方法详解

  • �� 规划器:基于启发式搜索和规则,生成结构化、版本化的任务计划,明确任务步骤和依赖关系。
  • �� 执行器:利用像素匹配和动作映射,将计划中的步骤转化为鼠标键盘操作,实时观察界面状态。
  • �� 交互界面:提供计划可视化、状态监控和多模态修正工具(自然语言、截图标注),支持用户监督和修正。
  • �� 智能重规划(IR):结合用户修正和非进展检测,动态修正未完成步骤,保持计划连续性。
  • �� 多模态交互:支持自然语言指令和截图标注,增强空间修正的精确性。
  • �� 反馈机制:系统实时显示执行状态,支持局部修正和计划版本管理。

实验设计

采用38个复杂GUI任务作为测试集,包括表单填写、数据迁移等,基线为自主执行模型。对比实验中,系统在修复失败任务后,成功率提升至88%,平均修正次数为2.04。评估指标包括成功率、修正次数和用户满意度。还进行了场景模拟,验证计划外部化对任务连续性的支持。通过对失败类型的分析,识别空间模糊和偏差修正的关键场景,验证了系统的修复能力和交互效果。

结果分析

系统在挑战性任务中实现了显著修复效果,成功率由自动执行的不足到合作修复后大幅提升。局部修正策略有效应对空间模糊、多步骤偏差,提升了任务完成率。多模态交互增强了用户对计划的理解和干预能力,验证了计划外部化和可编辑机制的实用性。这些结果表明,计划的可视化和修正能力是提升GUI自动化修复性的重要因素。

应用场景

该系统适用于复杂、长流程的企业自动化场景,如财务报表、数据录入、软件测试等。用户只需提供自然语言指令或截图标注,即可实现高效修正。未来,结合深度学习模型,可推广到多平台、多应用,提升自动化的智能化水平,减少人工干预成本。

局限与展望

系统在极端界面变化或复杂交互中仍存在计划偏离的风险,特别在界面结构高度不稳定时,修正效率降低。多模态交互依赖用户的准确操作,存在误差。高频修正场景下,性能和响应速度仍需优化,未来需结合深度学习提升鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,菜单和步骤就像一份食谱。传统自动化就像是用硬编码的指令,只能在菜单不变时用。一旦厨房布局变了,比如锅放错位置,指令就会失效。现在,Plover像是把食谱放在厨房的墙上,随时可以看、改,甚至用手指标记需要调整的地方。这样,当你发现锅放错了位置或需要加料时,可以直接在墙上的食谱上标记,系统就会根据新的指示调整操作。它让厨房变得更灵活,厨师(用户)可以随时干预,确保菜肴按预期完成。这就像把任务计划变成一份活的、可编辑的“厨房指南”,让自动化变得更聪明、更可靠。

简单解释 像给14岁少年讲一样

想象你在学校里做科学实验,老师给你一份步骤说明。以前的自动化就像是照着说明机械操作,遇到问题就像锅坏了或材料不对,系统自己也不知道,不能帮你修正。现在,Plover就像是把实验步骤写在白板上,你可以用笔直接改写步骤,告诉系统哪里出错了。比如你发现某个步骤不对,可以用手指在白板上画圈,系统会根据你的标记调整下一步操作。这样,你就能更轻松地控制整个实验流程,不会因为一点点偏差就全乱了。它让自动化变得像你自己在操控实验一样,既灵活又可靠。

术语表

Structured Plan (结构化计划)

一种明确表达任务步骤和依赖关系的计划,支持版本控制和编辑。技术上为版本化的树状结构,便于修正和追踪。

用于描述Plover中生成的任务计划,支持用户监督和修正。

智能重规划(IR)

结合用户修正和非进展检测的动态修正机制,保持计划连续性,局部调整未完成步骤。技术上为基于规则的局部重规划算法。

实现任务执行中的动态修正,确保任务连续性。

多模态交互

结合自然语言和视觉标注(截图、手势)实现用户指令和修正。技术上支持多模态输入融合与空间定位。

支持用户用自然语言或截图标记进行任务修正。

计划外部化

将任务计划作为持久化、可检视的外部工件存储,支持实时监控和编辑。技术上为计划的版本管理和可视化界面。

核心创新,增强系统的透明度和修正能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升系统在极端界面变化下的修复鲁棒性,特别是在界面结构高度不稳定或信息密集的场景中,仍是未来研究的重点。

应用场景

近期应用

企业自动化流程监控

利用Plover实现财务、HR等企业流程的自动化,用户可以在执行过程中实时监控和修正偏差,确保流程准确高效。

软件测试与界面调试

自动化测试脚本可通过计划外部化进行调试和修正,提高测试的灵活性和可靠性。

远期愿景

智能自主GUI代理

结合深度学习和多模态交互,未来实现更高水平的自主修复和适应能力,推动自动化向真正的智能代理转变。

原文摘要

Graphical user interface (GUI) automation remains challenging in real-world environments, where dynamic layouts, unexpected dialogs, and evolving interface states can cause autonomous agents to drift from user intent. Recent vision-based multimodal agents improve flexibility by operating directly over screenshots and natural language instructions, but planning and adaptation often remain internal, limiting users' ability to inspect, supervise, or correct system behavior. We present Plover, a plan-centric vision-based GUI automation system that externalizes task plans and replanning as persistent, inspectable, and revisable artifacts. Through a planner--executor architecture, Plover supports explicit supervision of evolving execution, localized correction through editable plans, natural-language guidance, and screenshot-grounded interventions, while preserving prior progress during repair. A formative study with six participants informed the interaction design. We then evaluate Plover through benchmark failure-case repair and scenario-based workflow analyses. Our results show that many autonomous GUI-agent failures are structurally repairable when plans remain visible and interventions are localized, and that explicit replanning helps make GUI automation more transparent, controllable, and adaptable.

cs.AI