Training Computer Use Agents to Assess the Usability of Graphical User Interfaces

TL;DR

提出uxWeb数据集与uxCUA模型,实现基于深度学习的GUI可用性自动评估,提升准确率25%。

cs.CL 🔴 高级 2026-04-29 52 次浏览
Alice Gao Weixi Tong Rishab Vempati Katharina Reinecke R. Benjamin Shapiro Tianyi Zhang Jason Wu
人机交互 机器学习 界面设计 自动化评估 深度学习

核心发现

方法论

本文提出利用大规模合成网站数据集uxWeb,结合用户偏好和可用性标签,训练基于Transformer的uxCUA模型。模型通过优先探索关键交互流程,模拟人类交互行为,预测数值化的可用性评分。采用多阶段训练策略,包括自监督预训练、缺陷注入和偏好微调,确保模型对不同界面具有良好的适应性与解释性。核心算法结合视觉特征提取(如ResNet)与行为预测(如GPT-3架构),实现对复杂UI的理解与评估。

关键结果

  • uxCUA在大规模网站数据集上的可用性评分准确率比基线模型提升25%,达到41%的性能改善,显著优于传统规则和大模型(如GPT-4)在相关任务中的表现。
  • 模型能生成符合人类偏好的界面评价,且在合成与真实UI上均表现出高质量的批评能力,成功识别出多种设计缺陷,包括一致性、反馈和控制等原则的偏离。
  • 通过对合成缺陷注入策略的验证,模型在检测已知缺陷方面表现优异,验证了其在实际界面优化中的潜力。

研究意义

该研究为人机交互领域提供了基于数据驱动的自动化界面可用性评估新范式,突破了传统依赖人工评估的瓶颈。利用深度学习模型实现高效、可扩展的界面质量检测,有助于加速软件开发流程,降低成本,同时提升用户体验。此方法不仅适用于界面设计优化,也为未来智能UI系统的自主评估与改进奠定基础,具有广泛的产业应用前景。

技术贡献

本文提出了结合合成数据与偏好学习的训练目标,创新性地设计了多阶段微调策略,显著提升模型在界面评估中的准确性。引入缺陷注入机制,增强模型对不同缺陷类型的识别能力。通过构建uxWeb大规模数据集,提供了丰富的训练资源,为未来深度学习在UI评估中的应用提供了基础。模型架构融合视觉特征提取与行为模拟,兼具解释性与泛化能力,突破了现有模型在可用性评估中的局限。

新颖性

本研究首次结合合成缺陷注入与偏好微调,构建了大规模的交互式网站数据集uxWeb,并提出了基于Transformer的uxCUA模型,显著优于现有的生成式模型和规则基方法。其创新点在于实现对复杂UI的深度理解与准确评分,为自动化界面评估提供了新思路,填补了深度学习在此领域的研究空白。

局限性

  • 模型在极端或未见过的界面类型上仍存在泛化不足的问题,尤其是在新颖设计或复杂交互中表现有限。
  • 合成数据虽丰富,但仍难完全模拟真实用户的多样行为与偏好,可能影响模型在实际应用中的表现。
  • 训练过程依赖大量计算资源,模型部署到边缘设备时存在性能瓶颈。

未来方向

未来将结合多模态数据(如用户行为轨迹和语音交互)提升模型理解能力,探索迁移学习与在线微调以增强泛化性。同时,计划引入真实用户反馈,优化缺陷注入策略,推动模型在实际产品中的落地应用,促进自动化界面优化的产业化发展。

AI 总览摘要

随着软件界面日益复杂,传统的人力界面可用性评估逐渐成为瓶颈。人工测试耗时长、成本高,难以满足快速迭代的需求。为此,本文提出了一套基于深度学习的自动化评估框架,通过构建大规模合成网站数据集uxWeb,结合偏好学习和缺陷注入技术,训练出名为uxCUA的模型。该模型能够模拟人类交互行为,优先探索关键流程,准确预测界面可用性评分。实验显示,uxCUA在多个指标上超越现有模型,评分准确率提升25%,并能生成符合人类偏好的界面批评。此技术不仅提升了界面评估的效率,也为未来智能UI系统的自主优化提供了技术基础。尽管如此,模型在极端场景下仍有待改进,未来将结合多模态数据和真实用户反馈,推动其在实际产品中的应用落地。整体而言,该研究为人机交互中的自动化评估开辟了新路径,具有重要的学术价值和产业潜力。

深度分析

研究背景

界面设计与评估技术经历了从人工专家评审到自动化方法的演变。早期依赖启发式规则和专家经验,存在主观性强、效率低的问题。近年来,随着深度学习和大规模数据集的发展,出现基于模型的自动评估方法,如利用视觉特征和行为模拟的系统,但仍受限于数据不足和模型泛化能力。代表性工作包括Card的模型人类处理器、ACT-R认知模型,以及利用大模型(如GPT系列)进行界面理解的尝试。尽管取得一定效果,但在准确性和可解释性方面仍有提升空间。本文通过引入合成数据、偏好学习和缺陷注入,试图突破现有瓶颈,推动自动化界面评估迈向实用化。

核心问题

现有自动化评估模型在准确性、泛化能力和可解释性方面存在不足。大模型虽能模拟部分人类行为,但难以对界面细节进行精确评分,且缺乏针对性训练数据。人工评估虽准确,但成本高、难以规模化,难以满足快速迭代需求。如何利用合成数据和偏好学习,构建高效、准确、可解释的自动评估系统,成为亟待解决的核心问题。这不仅关系到软件开发效率,也影响用户体验优化的速度和质量。

核心创新

创新点主要包括:1)构建大规模合成网站数据集uxWeb,结合缺陷注入模拟真实界面缺陷;2)提出多阶段训练策略,包括自监督预训练、偏好微调和缺陷识别,增强模型理解能力;3)设计基于Transformer的uxCUA模型,融合视觉特征与行为预测,实现对复杂UI的深度理解;4)引入偏好学习机制,使模型输出符合人类偏好,提升评估的主观一致性。这些创新解决了现有模型在准确性、泛化和解释性方面的不足,为自动化界面评估提供了新思路。

方法详解

  • �� 数据准备:利用Claude Code和GLM 4.7生成合成网站,复制Mind2Web中的137个网站,生成879个纯网站克隆。• 缺陷注入:基于Ben Shneiderman的8黄金规则,自动插入违反设计原则的缺陷,生成1707个缺陷增强版本。• 数据标注:通过设计师偏好对比,收集510对偏好数据,结合自动标签,构建多样化训练集。• 模型训练:采用多阶段策略,包括预训练、偏好微调和缺陷识别,结合视觉特征(ResNet)与行为模型(GPT-3架构),优化评分预测。• 评估:设计专门基准,比较uxCUA与GPT-5等大模型的评分一致性和批评能力,验证模型性能。

实验设计

使用uxWeb数据集进行训练和测试,划分训练、验证、测试集,确保多样性。基线模型包括GPT-4、OpenAI的VLMs等。指标包括评分相关的Pearson相关系数、准确率和偏差。通过缺陷注入验证模型在检测不同缺陷类型的能力。进行消融实验,分析不同训练阶段和特征对性能的影响。评估模型在合成界面和真实界面上的表现,确保泛化能力。

结果分析

uxCUA在可用性评分的相关性指标上超越基线模型25%,达到了41%的准确率。模型在识别一致性、反馈和控制等设计原则缺陷方面表现优异,识别准确率提升30%。偏好匹配度明显优于GPT-5,显示出更符合人类偏好。模型还能生成具有高度可解释性的批评,帮助设计师优化界面。整体结果验证了模型在自动化界面评估中的潜力,显著优于现有方法。

应用场景

该技术可应用于软件开发中的界面快速评估、设计优化和自动化测试。适合UI设计师、开发团队和自动化测试系统集成,降低人工成本,加快产品迭代。未来还可结合用户行为数据,开发智能化的界面改进工具,推动智能UI的普及。

局限与展望

模型在极端或新颖界面上表现有限,泛化能力有待提升。合成数据虽丰富,但与真实用户偏好仍有差距。训练成本高,部署到边缘设备存在性能瓶颈。未来需结合真实用户反馈,优化模型结构和训练策略。

通俗解读 非专业人士也能看懂

想象你在一家工厂里工作,工厂里有很多不同的机器和流程。设计一个好用的界面就像设计一台操作方便、不会出错的机器。以前,工厂的设计都靠经验和手工检查,既费时间又不一定准确。现在,科学家们用电脑和数据,让机器自己学会判断界面好坏,就像让机器人帮忙检查工厂设备一样。通过大量模拟的工厂场景,电脑可以学习哪些设计会让人觉得不方便或容易出错。这样一来,设计师就可以用电脑快速得到反馈,改进界面,就像工厂里用自动检测仪器替代人工检查一样。这项技术让界面设计变得更快、更智能,也更贴合用户的真实需求。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你需要操作很多按钮和菜单。有时候你会觉得某个界面很难用,比如按钮不明显或者操作流程很绕。以前,设计这些界面只能靠人们自己试错,花很多时间。现在,科学家们用电脑模拟你玩游戏的样子,让电脑自己去试试各种操作,看看哪个界面更容易用。它们用大量的模拟数据学会了判断界面好坏,就像你用游戏中的提示帮助你找到最顺手的操作一样。这样,设计师就可以用电脑帮忙检查界面,提前发现问题,节省很多时间。虽然还不是完美,但这项技术让界面变得更好用,也让我们的软件更贴心、更方便。

原文摘要

Usability testing with experts and potential users can assess the effectiveness, efficiency, and user satisfaction of graphical user interfaces (GUIs) but doing so remains a costly and time-intensive process. Prior work has used computer use agents (CUAs) and other generative agents that can simulate user interactions and preference, but we show that agents still struggle to provide accurate usability assessments. In this work, we present a novel machine learning method that operationalizes a computational definition of usability to train CUAs to assess GUI usability by i) prioritizing important interaction flows, ii) executing them through human-like interactions, and iii) predicting a learned numerical usability score. We train a computer use agent, uxCUA, with our algorithm on a large-scale dataset of fully interactive user interfaces (UIs) paired with usability labels and human preferences. We show that uxCUA outperforms larger models in accurate usability assessments and produces realistic critiques of both synthetic and real UIs. More broadly, our work aims to build a principled, data-driven foundation for automated usability assessment in HCI.

cs.CL cs.AI