LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

TL;DR

LPO通过信息熵和动态距离奖励优化GUI交互位置,显著提升精度。

cs.LG 🔴 高级 2025-06-11 53 次浏览
Jiaqi Tang Yu Xia Yi-Feng Wu Yuwei Hu Yuhui Chen Qing-Guo Chen Xiaogang Xu Xiangyu Wu Hao Lu Yanqing Ma Shiyin Lu Qifeng Chen
人工智能 GUI交互 位置优化 强化学习 深度学习

核心发现

方法论

LPO结合信息熵预测潜在交互区域,利用基于物理距离的动态奖励衡量位置重要性,并通过GRPO实现全局偏好优化。具体流程包括:• 将界面划分为网格窗口,计算每个窗口的信息熵作为预测依据;• 引入基于距离的动态奖励函数,强化位置精度;• 结合偏好优化策略,指导代理在大规模GUI空间中探索。该方法充分利用区域信息密度和空间距离,提升交互准确性。

关键结果

  • 在Multimodal Mind2Web(Deng et al., 2023b)和VisualWebBench(Liu et al., 2024)等离线基准上,LPO在元素识别准确率、操作F1值和步骤成功率方面均优于SOTA方法,提升幅度达3-5%。在WebVoyager(He et al., 2024)线上环境中,任务成功率平均提高了9%,表现出强泛化能力。
  • 通过消融实验验证,信息熵窗口奖励和动态距离奖励分别提升了整体性能,二者结合实现了最优效果。LPO在多任务、多场景下均展现出稳定的优越性,验证了其在复杂GUI环境中的适应性。
  • 实验结果显示,LPO在GUI定位、操作精度和偏好探索方面均优于传统静态边界和文本匹配策略,特别在长尾场景和真实应用中表现出明显优势。

研究意义

该研究突破了GUI交互中空间定位的瓶颈,提出的LPO方法通过信息密度和空间距离的结合,有效解决了现有方法在高精度定位上的局限。其在自动化界面操作、智能助手和人机交互中的应用潜力巨大,推动了自主代理在复杂环境中的实用化。长远来看,LPO为多模态交互系统提供了新的技术路径,有望引领智能界面设计的变革,降低人工成本,提升交互效率。

技术贡献

技术上,LPO创新性地结合信息熵和动态距离奖励,提出基于区域信息密度的预测机制和空间距离的动态调节策略。引入GRPO框架,有效扩展了探索空间,增强了偏好优化的效果。该方法在深度学习基础上实现端到端训练,兼顾局部精度和全局探索,显著优于传统静态边界和文本匹配策略,为GUI智能交互提供了理论和工程基础。

新颖性

本研究首次将信息熵用于GUI界面区域的交互位置预测,结合动态距离奖励实现空间精度优化,突破了以往静态边界和文本匹配的局限。创新性地引入GRPO框架,系统性提升了偏好探索能力,为GUI智能代理的高精度定位提供了全新思路。

局限性

  • 当前方法依赖界面划分的网格参数,可能在极端复杂或动态变化的界面中表现不佳,需进一步自适应调节。
  • 模型训练和推理仍存在较高计算成本,尤其在大规模环境中,实时性有待优化。
  • 在某些极端场景下,信息熵和距离奖励可能受到噪声干扰,影响定位精度,未来需引入鲁棒性机制。

未来方向

未来将探索多模态信息融合,结合视觉、文本和用户行为数据,提升界面理解能力;同时优化模型结构,降低计算复杂度,实现实时高精度交互;此外,计划在更多真实场景中部署验证,推动智能界面自主化发展。

AI 总览摘要

随着自主代理技术的发展,基于自然语言的GUI交互正成为智能系统的重要方向。现有方法多依赖监督微调(SFT)实现空间定位,但在精度方面存在明显瓶颈,主要由于对位置数据感知不足。强化学习虽被尝试应用,但缺乏有效的空间位置评估机制,导致交互误差难以控制。为解决这一难题,本文提出了位置偏好优化(LPO)策略,结合信息熵和动态距离奖励,显著提升了GUI交互的空间精度。

LPO的核心思想是利用界面区域的信息密度预测潜在交互位置,并通过引入基于物理距离的动态奖励,强化模型对关键位置的关注。这一机制不仅提升了交互的准确性,还增强了探索能力。实验结果显示,在多个离线基准和真实线上环境中,LPO均优于现有SOTA方法,表现出优异的泛化和鲁棒性。

该研究的意义在于突破了GUI空间定位的技术瓶颈,为智能界面操作提供了新思路。其创新点在于结合信息熵和空间距离,系统性优化偏好探索,为未来多模态、多场景的自主交互奠定基础。尽管如此,模型仍面临计算成本高和复杂界面适应性不足的挑战。未来,作者计划融合更多模态信息,优化模型效率,推动智能代理在实际应用中的普及。整体而言,LPO为GUI智能交互开启了新的技术路径,具有广阔的应用前景。

深度分析

研究背景

近年来,随着多模态大模型(如GPT-4、PaLM)在自然语言处理和视觉理解中的突破,GUI交互逐渐由人工操作转向智能自动化。早期方法如Set-of-Mark(Yang et al., 2023)依赖规则和边界,存在决策空间有限和定位不精的问题。随之出现的视觉引导策略(Hong et al., 2023)通过视觉输入实现更自然的交互,但仍难以实现高精度空间定位。近年来,强化学习(Qin et al., 2025)被引入优化交互策略,但缺乏有效的空间位置评估机制,导致误差积累。当前研究集中在结合视觉、文本和偏好信息,提升交互的准确性和鲁棒性,但仍面临空间感知不足和泛化能力有限的挑战。

核心问题

核心问题在于GUI代理在复杂界面中实现高精度空间定位的难题。传统方法多依赖静态边界或文本匹配,难以适应动态变化和多样化场景,导致交互偏差。现有强化学习策略缺乏对空间位置的有效评估机制,难以实现精细操作。解决这一瓶颈对于自动化界面操作、智能助手和人机交互的普及至关重要。问题的复杂性在于界面信息丰富但空间分布不均,如何利用区域信息密度和空间距离实现精准定位,是当前的技术难点。

核心创新

本研究提出的LPO具有三大创新:• 利用信息熵评估界面区域信息密度,预测潜在交互位置,解决静态边界不适应的问题;• 引入基于物理距离的动态奖励,动态调整位置重要性,提升空间定位的精度;• 结合GRPO框架,系统性优化偏好探索能力,增强大规模GUI空间的探索效率。这些创新突破了传统静态策略的局限,为高精度GUI交互提供了理论基础和工程实现。

方法详解

  • �� 将界面划分为网格窗口,计算每个窗口的信息熵作为区域重要性指标;• 利用信息熵最大值窗口作为预测基础,结合位置坐标生成奖励;• 引入基于欧几里得距离的动态奖励函数,衡量操作点的空间准确性;• 结合偏好优化(GRPO),通过优势函数调整策略偏好,扩大探索空间;• 在训练过程中,端到端优化模型参数,确保偏好和空间感知同步提升。

实验设计

采用Mind2Web(Deng et al., 2023b)和VisualWebBench(Liu et al., 2024)等离线数据集,评估元素识别、操作准确率和步骤成功率。线上在WebVoyager(He et al., 2024)进行多网站任务测试,验证模型泛化能力。超参数方面,采用学习率1e-6,结合偏好奖励和正则化项,进行多轮训练。对比基线包括UI-R1、GUI-R1和InfiGUI-R1,进行消融验证,确保每个组件的贡献。

结果分析

LPO在离线基准中元素识别准确率提升3-5%,操作F1值提升4-6%,步骤成功率提升2-4%。线上任务成功率平均提高9%,在复杂多场景中表现优异。消融实验显示,信息熵奖励和距离奖励各自贡献显著,结合后效果最佳。整体结果表明,LPO在空间定位和偏好探索方面优于传统静态边界和文本匹配策略,尤其在真实应用中表现出强适应性。

应用场景

该技术可广泛应用于自动化网页操作、智能助手、虚拟界面交互等场景,特别适合需要高精度定位的任务,如自动填写、界面导航和复杂操作。未来,结合多模态信息和强化学习,可实现更智能、更自主的界面交互系统,降低人工成本,提升用户体验。

局限与展望

模型在极端复杂或动态变化界面中的适应性尚待提升,界面划分参数可能影响效果。训练成本较高,实时性不足。信息熵和距离奖励受噪声影响,鲁棒性需增强。未来需优化算法结构,降低计算复杂度,增强模型在多变环境中的稳定性。

通俗解读 非专业人士也能看懂

想象你在一个超级复杂的厨房里做菜。每个区域都可能藏着你需要的食材,但有些地方信息丰富,比如冰箱旁边或调料架上,而空旷的桌子上几乎没有用的东西。你需要找到最重要的地方去拿东西,不能随便乱跑。这个研究就像教厨师用一种聪明的方法,先用“信息密度”判断哪里可能藏有食材,然后用“距离”判断哪个地方更容易到达。这样,厨师就能更快、更准地找到需要的东西,做出美味的菜。这个方法让自动机器人在界面上也能像厨师一样聪明,知道在哪个区域操作最有效,极大提高了效率和准确性。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你需要找到特定的宝藏。游戏里的地图上有很多地方,但宝藏通常藏在信息丰富的区域,比如宝箱旁边或任务提示附近。而空旷的地方几乎没有用。这个研究就像教你用一种聪明的方法,先找出地图上信息最多的区域,然后根据距离判断哪个区域更容易到达。这样,你就可以更快找到宝藏,不会迷路。这就像给机器人装上了“聪明的眼睛”和“导航系统”,让它在界面上也能像你一样聪明地找到目标,操作更准确、更快。

术语表

信息熵 (Information Entropy)

衡量界面区域信息丰富程度的指标,越高代表区域越复杂、内容越多。

用于预测潜在交互位置的区域重要性。

动态距离奖励 (Dynamic Distance Reward)

根据操作点与目标点的空间距离动态调整奖励值,鼓励空间定位的精确性。

提升GUI交互中位置的空间精度。

GRPO (Group Relative Preference Optimization)

一种偏好优化框架,通过比较偏好优势值,指导策略探索。

实现偏好引导的全局空间探索。

GUI Grounding (GUI定位)

将界面元素与视觉信息对应的能力,确保操作的准确性。

评估模型在界面元素上的空间定位效果。

偏好优化 (Preference Optimization)

通过偏好信号引导模型学习更优的交互策略。

提升GUI代理的交互精度与效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或动态变化的界面中保持高精度定位仍是未解难题,现有模型在快速变化环境中的鲁棒性不足,未来需要结合多模态信息和自适应机制提升性能。

应用场景

近期应用

网页自动化操作

利用LPO实现网页元素的高精度识别与自动操作,适用于自动填写、数据采集等场景。

智能界面助手

为虚拟助手提供更准确的界面交互能力,提升用户体验和操作效率。

远期愿景

自主界面交互系统

结合多模态信息,开发全自动、可适应多场景的智能交互系统,降低人工成本。

原文摘要

The advent of autonomous agents is transforming interactions with Graphical User Interfaces (GUIs) by employing natural language as a powerful intermediary. Despite the predominance of Supervised Fine-Tuning (SFT) methods in current GUI agents for achieving spatial localization, these methods face substantial challenges due to their limited capacity to accurately perceive positional data. Existing strategies, such as reinforcement learning, often fail to assess positional accuracy effectively, thereby restricting their utility. In response, we introduce Location Preference Optimization (LPO), a novel approach that leverages locational data to optimize interaction preferences. LPO uses information entropy to predict interaction positions by focusing on zones rich in information. Besides, it further introduces a dynamic location reward function based on physical distance, reflecting the varying importance of interaction positions. Supported by Group Relative Preference Optimization (GRPO), LPO facilitates an extensive exploration of GUI environments and significantly enhances interaction precision. Comprehensive experiments demonstrate LPO's superior performance, achieving SOTA results across both offline benchmarks and real-world online evaluations. Our code will be made publicly available soon, at https://github.com/jqtangust/LPO.

cs.LG cs.AI cs.CV