Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents

TL;DR

引入Ground-Truth Alignment评估框架,诊断VLM移动代理的推理-执行差距。

cs.CL 🔴 高级 2025-10-03 16 次浏览
Lingzhong Dong Ziqi Zhou Shuaibo Yang Haiyue Sheng Pengzhou Cheng Zongru Wu Zheng Wu Gongshen Liu Zhuosheng Zhang
视觉语言模型 移动代理 推理 执行差距 评估框架

核心发现

方法论

本文提出了一种新的评估框架,名为Ground-Truth Alignment (GTA),用于测量推理链与真实动作的匹配度。结合标准的Exact Match (EM)指标,GTA可以诊断推理准确性和执行准确性之间的差距。通过四象限诊断空间,模型输出被分类为理想、执行差距、双重错误和推理差距。

关键结果

  • 在多种移动交互任务中,推理-执行差距普遍存在,执行差距比推理差距更频繁。即使在最大的模型中,执行差距仍然显著存在。
  • 通过扩大模型规模,整体差距有所减少,但执行差距依然明显。
  • 实验表明,GTA框架能够可靠地反映最先进模型中的系统性EG/RG模式。

研究意义

该研究为诊断和减少移动代理中的推理-执行差距提供了具体的工具和见解,支持开发更可信赖的移动代理。这对于提高用户信任度和减少潜在的有害行为授权具有重要意义。

技术贡献

技术贡献包括引入GTA评估框架,提供了一种新的方法来分离推理准确性与执行准确性。通过这种方法,研究揭示了现有模型中的系统性错误模式,并为未来的模型改进提供了方向。

新颖性

这是首次系统性地诊断VLM驱动的移动代理中的推理-执行差距。与传统的执行准确性评估不同,GTA框架提供了更细粒度的诊断能力。

局限性

  • GTA框架的评估依赖于准确的CoT生成,错误的推理链可能导致错误的GTA评分。
  • 在某些复杂任务中,模型可能会过度依赖于推理链的表面合理性。

未来方向

未来工作可以探索如何进一步缩小执行差距,特别是在复杂和动态环境中。还可以研究如何增强模型在推理过程中的透明性和可解释性。

AI 总览摘要

视觉语言模型(VLM)驱动的移动代理在理解自然语言指令并在移动设备上执行相应操作方面显示出巨大潜力。然而,现有的评估方法往往忽视了推理过程与实际执行之间的一致性,这可能导致用户对系统过度信任,从而授权潜在的有害行为。

本文引入了一种新的评估框架,名为Ground-Truth Alignment (GTA),用于诊断推理-执行差距。通过结合GTA和标准的Exact Match (EM)指标,研究揭示了两种主要的推理-执行差距:执行差距(EG)和推理差距(RG)。实验结果表明,这些差距在多种移动交互任务中普遍存在,尤其是执行差距更为频繁。

尽管扩大模型规模可以减少整体差距,但即使在最先进的模型中,执行差距仍然显著存在。研究表明,GTA框架能够可靠地反映系统性错误模式,为开发更可信赖的移动代理提供了具体的诊断工具和支持。

深度分析

研究背景

近年来,视觉语言模型(VLM)在移动代理中的应用取得了显著进展。这些代理能够通过解释屏幕截图和自然语言指令来执行移动设备上的操作。然而,现有的评估方法主要关注执行准确性,而忽视了推理过程与实际执行之间的一致性。

核心问题

核心问题在于推理-执行差距的存在,这可能导致用户对系统过度信任,从而授权潜在的有害行为。现有的评估方法无法有效诊断这些差距,限制了对模型行为的深入理解。

核心创新

本文的核心创新在于引入了Ground-Truth Alignment (GTA)评估框架。GTA通过测量推理链与真实动作的匹配度,提供了一种新的方法来诊断推理-执行差距。

方法详解

  • �� 引入GTA评估框架,结合Exact Match (EM)指标。
  • �� 设计自动化GTA评估器,将自由形式的推理链映射为GTA评分。
  • �� 通过广泛的实验,系统性地量化和描述执行差距(EG)和推理差距(RG)。

实验设计

实验在多个移动交互基准上进行,包括AITZ、CAGUI和AndroidControl。评估了模型的推理准确性(GTA)和执行准确性(EM),并进行了广泛的实验以量化和描述执行差距(EG)和推理差距(RG)。

结果分析

实验结果表明,推理-执行差距在多种移动交互任务中普遍存在,尤其是执行差距更为频繁。即使在最先进的模型中,执行差距仍然显著存在。

应用场景

GTA框架可以用于诊断和减少移动代理中的推理-执行差距,支持开发更可信赖的移动代理。这对于提高用户信任度和减少潜在的有害行为授权具有重要意义。

局限与展望

GTA框架的评估依赖于准确的CoT生成,错误的推理链可能导致错误的GTA评分。在某些复杂任务中,模型可能会过度依赖于推理链的表面合理性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一本食谱(推理链),告诉你如何做一道菜(执行动作)。如果你按照食谱做,但最后菜不对,那就是执行差距。如果你做对了菜,但食谱和你实际做的步骤不一致,那就是推理差距。这个研究就像是在检查你的食谱和实际做法是否一致,以确保你每次都能做出完美的菜。

简单解释 像给14岁少年讲一样

想象你在玩一个手机游戏,游戏会给你一些指令,比如点击屏幕上的某个按钮。现在,假设你的手机助手也在玩这个游戏,但有时候它会搞错,虽然它想对了,但按错了按钮,这就是执行差距。有时候它按对了按钮,但想的和做的不一样,这就是推理差距。这个研究就是为了帮助手机助手更聪明,不再犯这些错误!

术语表

视觉语言模型 (VLM)

结合视觉和语言信息的模型,用于理解和生成多模态数据。

用于移动代理中解释屏幕截图和自然语言指令。

推理链 (CoT)

模型在执行任务时生成的中间推理步骤序列。

用于提高执行准确性和对用户意图的对齐。

Ground-Truth Alignment (GTA)

用于评估推理链与真实动作匹配度的指标。

诊断推理-执行差距的核心指标。

执行差距 (EG)

推理正确但执行失败的情况。

在GTA评估中用于识别模型的执行问题。

推理差距 (RG)

执行成功但推理过程与实际执行不一致的情况。

在GTA评估中用于识别模型的推理问题。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂和动态环境中进一步缩小执行差距?
  • 2 如何增强模型在推理过程中的透明性和可解释性?

应用场景

近期应用

移动应用导航

通过改进推理-执行一致性,提升移动应用的导航能力,减少用户错误操作。

自动化任务执行

在自动化任务中应用GTA框架,提高执行准确性和任务完成效率。

远期愿景

可信赖的智能助手

开发更可信赖的智能助手,能够在复杂环境中准确执行用户指令。

原文摘要

Mobile-use agents powered by vision-language models (VLMs) have shown great potential in interpreting natural language instructions and generating corresponding actions based on mobile graphical user interface. Recent studies suggest that incorporating chain-of-thought (CoT) reasoning tends to improve the execution accuracy. However, existing evaluations emphasize execution accuracy while neglecting whether CoT reasoning aligns with ground-truth actions. This oversight fails to assess potential reasoning-execution gaps, which in turn foster over-trust: users relying on seemingly plausible CoTs may unknowingly authorize harmful actions, potentially resulting in financial loss or trust crisis. In this work, we introduce a new evaluation framework to diagnose reasoning-execution gaps. At its core lies Ground-Truth Alignment (GTA), which measures whether the action implied by a CoT matches the ground-truth action. By combining GTA with the standard Exact Match (EM) metric, we jointly assess both the reasoning accuracy and execution accuracy. This joint perspective reveals two types of reasoning-execution gaps: (i) Execution Gap (EG), where the reasoning correctly identifies the correct action but execution fails, and (ii) Reasoning Gap (RG), where execution succeeds but reasoning process conflicts with the actual execution. Experimental results across a wide range of mobile interaction tasks reveal that reasoning-execution gaps are prevalent, with execution gaps occurring more frequently than reasoning gaps. Moreover, while scaling up model size reduces the overall gap, sizable execution gaps persist even in the largest models. Further analysis shows that our framework reliably reflects systematic EG/RG patterns in state-of-the-art models. These findings offer concrete diagnostics and support the development of more trustworthy mobile-use agents.

cs.CL