SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

TL;DR

SkillLens利用视觉技能卡实现GUI动作预测,提升11.6点Step SR。

cs.AI 🔴 高级 2026-08-11 55 次浏览
Zhou Liu Ligang Huang Zeli Su Zewei Pan Zhaoyang Han Xing Chen Yuanfeng Song Wentao Zhang
人工智能 视觉-语言模型 GUI自动化 知识检索 模型蒸馏

核心发现

方法论

本文提出Visual Skill Cards(VSCs)作为一种状态条件的记忆表示,将可重用的流程、适用性线索、视觉证据与验证信号结合。SkillLens通过Trace-to-VSC将异构交互数据转化为统一的VSC库,利用检索-扩展机制在推理时选择性加载证据,并在固定的视觉-语言模型执行器上进行 grounded GUI动作预测。其核心机制包括:索引检索、证据筛选与加载、以及基于实时界面状态的动作预测。该方法有效平衡了运行时的证据成本与视觉细节的丰富性,支持层级化的技能组织和源自多源数据的知识整合。

关键结果

  • 在Mind2Web和WebLINX-BrowserGym两个基准上,SkillLens显著提升了gpt-4o执行器的Step SR+11.6点、Overall+2.9点,验证了其在复杂GUI任务中的有效性。
  • 引入CardDistill后,学生模型在Mind2Web和WebLINX-BG上分别达到Step SR+12.0和Overall+3.2的提升,显示知识蒸馏结合VSC的潜力。
  • 通过消融实验验证:只加载关键证据视图、层级化技能结构和源数据的多源整合均对性能提升具有显著贡献,验证了设计的合理性。

研究意义

该研究突破了GUI动作预测中缺乏视觉程序记忆的瓶颈,提出外部可重用的视觉技能卡,使模型能在保持固定架构的同时,利用外部知识增强推理能力。这不仅提升了模型的泛化能力,也为自动化软件操作、智能助手等应用提供了新的技术路径。其结合检索与蒸馏的框架,为未来多模态交互系统的知识管理与迁移提供了理论基础和实践方案,有望推动AI在复杂交互场景中的应用普及。

技术贡献

本文提出的VSC机制实现了异构交互数据的标准化与封装,支持高效检索与局部证据扩展。SkillLens通过分离检索与证据加载,显著降低了运行时成本,同时保持了丰富的视觉细节。引入的层级化技能组织增强了知识的表达能力。CardDistill则创新性地将VSC作为训练时的教师信号,实现模型的无缝迁移与知识蒸馏。整体架构结合了视觉-语言模型、信息检索与模型蒸馏的最新技术,提供了一个完整的GUI动作预测解决方案。

新颖性

本研究首次提出将可重用的视觉技能卡(VSCs)作为GUI程序的状态条件记忆,通过Trace-to-VSC实现异构数据的标准化,结合检索-扩展机制优化推理效率。相比传统的纯文本技能或长轨迹示范,VSC提供了结构化、压缩且可扩展的知识封装。引入的层级化技能组织和源数据多源融合机制,显著提升了模型的泛化和适应能力。CardDistill的创新在于利用VSC作为教师信号进行模型蒸馏,减少了推理时的检索负担,推动了知识迁移技术的发展。

局限性

  • 该方法依赖于高质量的交互数据和准确的源适配器,数据偏差可能影响VSC的泛化能力。
  • 在极端复杂或动态变化的界面环境中,VSC的适应性和更新机制仍需优化。
  • 模型在处理未覆盖的长尾场景或新颖流程时,可能表现出一定的局限性,需结合在线学习或持续更新策略。

未来方向

未来将探索VSC的自动扩展与动态更新机制,提升其在实时变化环境中的适应性。同时,结合强化学习优化VSC的检索策略,增强模型的自主学习能力。此外,将VSC应用于多模态交互、跨平台迁移和更复杂的任务场景,推动其在工业界的落地与推广。

AI 总览摘要

SkillLens通过引入视觉技能卡(VSCs)解决了现有GUI动作预测模型缺乏视觉程序记忆的问题。传统方法多依赖长轨迹或文本技能,难以在复杂界面中准确识别下一步操作。本文提出的VSC将流程、适用性线索、视觉证据与验证信号结合,形成一种状态条件的记忆单元。SkillLens利用Trace-to-VSC将异构交互数据转化为标准化的技能卡库,采用检索-扩展机制在推理时选择性加载关键证据,显著降低运行成本。核心创新在于:一是将多源数据封装为结构化的VSC,二是分离检索与证据加载,三是支持层级化技能组织。实验结果显示,在Mind2Web和WebLINX-BrowserGym两个基准上,SkillLens提升了gpt-4o执行器的Step SR+11.6点,Overall+2.9点,验证了其在复杂GUI任务中的优越性。引入的CardDistill算法进一步将VSC知识迁移到学生模型,取得Step SR+12.0和Overall+3.2的提升。该框架不仅增强了模型的泛化能力,也为未来多模态交互系统的知识管理提供了新思路。未来工作将关注VSC的动态更新和跨平台迁移,推动其在实际应用中的落地。整体而言,SkillLens为GUI自动化和智能助手提供了一种高效、可扩展的知识封装与利用机制,具有重要的理论和实践价值。

深度分析

研究背景

随着人工智能在软件自动化中的应用不断深入,基于视觉-语言模型的GUI理解逐渐成为研究热点。早期方法多依赖规则或长轨迹示范,难以实现高效泛化。近年来,诸如OpenAI的GPT系列、Google Gemini等模型在多模态理解方面取得突破,但在GUI任务中仍面临程序记忆不足的问题。现有的技能包和知识库多为参数化流程或长轨迹,缺乏结构化、可检索的外部记忆,限制了模型在复杂场景中的表现。视觉记忆与检索技术虽有所发展,但多集中于文档或对话历史,缺少针对GUI状态的程序化封装。SkillLens的创新在于提出VSC,将流程、证据与验证信号封装为结构化单元,为GUI任务提供了新的知识管理路径。

核心问题

现有GUI动作预测模型多依赖静态的训练数据或长轨迹示范,难以在实时环境中高效利用外部知识。缺乏结构化的视觉程序记忆导致模型在识别相似控件或确认流程状态时易出错。复杂界面中的相似元素难以区分,模型常因缺乏上下文感知而误操作。如何在保持模型架构不变的情况下,动态引入丰富的视觉流程知识,成为关键难题。解决方案需兼顾运行时效率、知识的可重用性与可解释性,满足工业应用对高效、可靠的GUI理解的需求。

核心创新

本研究的核心创新在于提出Visual Skill Cards(VSCs)作为一种状态条件的外部记忆,将流程、适用性线索、视觉证据与验证信号封装为结构化单元。Trace-to-VSC机制实现了异构交互数据的标准化,支持多源数据的封装与层级组织。SkillLens通过检索-扩展机制,选择性加载关键证据,避免全量加载带来的成本。引入层级化技能组织,支持长短期任务的封装与调用。CardDistill利用VSC作为教师信号,将知识迁移到学生模型,实现无检索推理。这一框架突破了传统的纯文本或长轨迹示范的局限,为GUI理解提供了高效、结构化的知识封装方案。

方法详解

  • �� 将异构交互数据(如网页、桌面操作记录)转化为标准化的VSC格式,封装流程、线索、视觉证据与验证信息。
  • �� 通过Trace-to-VSC机制,将轨迹片段总结为可重用的技能卡,支持层级化组织。
  • �� 在推理时,利用索引机制(如文本索引或VLM-board)检索相关VSCs,筛选出最匹配的候选集。
  • �� 采用局部证据扩展策略,只加载所选VSC的高分辨率视图,结合实时界面状态进行动作预测。
  • �� 设计固定的视觉-语言模型执行器,条件于加载的证据与界面,输出 grounded GUI动作。
  • �� 训练阶段,利用VSC作为教师信号,通过CardDistill将知识迁移到学生模型,实现无检索推理。
  • �� 实验中,评估模型在Mind2Web、WebLINX-BrowserGym和OSWorld-G上的性能变化,验证VSC的有效性与蒸馏的迁移效果。

实验设计

采用Mind2Web、WebLINX-BrowserGym和OSWorld-G三大基准,比较不同模型(如gpt-4o、Qwen3-VL-2B、Gemini 2.5)在Step SR、元素识别、整体表现等指标上的提升。设置不同的VSC条件(全技能、无技能、只加载关键证据)进行消融分析,验证VSC的贡献。采用固定的检索策略(文本索引、VLM-board)和不同的证据扩展策略,评估运行时成本与性能折中。训练中,利用CardDistill将VSC知识迁移到学生模型,观察其在无检索条件下的表现变化。通过多场景、多模型、多指标的对比,全面验证VSC机制的有效性和蒸馏策略的优越性。

结果分析

VSC机制在Mind2Web中使Step SR提升11.6点,Overall提升2.9点,显著优于无技能基线。WebLINX-BG上,Step SR+3.2,整体性能持续改善。引入CardDistill后,学生模型在两个基准上分别达到了Step SR+12.0和Overall+3.2的提升,验证了知识迁移的有效性。消融实验显示,只加载关键证据视图和层级化技能结构对性能提升具有关键作用。不同检索策略(如VLM-board)在不同场景下表现差异,验证了检索-扩展机制的灵活性。整体结果表明,VSC不仅提升了模型的准确性,也降低了推理成本,具备良好的实用潜力。

应用场景

该技术适用于自动化软件操作、智能助手、企业流程自动化等场景,尤其在复杂界面理解与操作中表现优越。只需提供界面截图和任务描述,模型即可自主识别控件、确认流程状态,减少人工调试。未来,结合在线学习和持续更新机制,可实现动态知识库维护,适应多变的应用环境。长远来看,VSC框架有望推动多模态交互系统的智能化升级,实现更高效、更可靠的自动化操作。

局限与展望

当前方法依赖高质量的交互数据和源适配器,数据偏差可能影响VSC的泛化能力。在极端复杂或动态变化的界面中,VSC的适应性和更新机制仍需优化。此外,模型在处理未覆盖的长尾场景或新颖流程时表现有限,需结合在线学习策略。计算成本方面,证据加载仍存在一定开销,未来需优化检索与加载效率。整体而言,未来需解决知识更新、场景适应和成本控制等关键问题。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭。每次做菜前,你会准备好食材、步骤和工具的清单。SkillLens就像是厨房里的智能助手,它记住各种菜谱(流程),知道什么时候用哪些食材(界面元素),还会根据你做菜的状态(界面变化)提醒你下一步。它会把这些信息整理成一张“菜谱卡”,每次你想做菜时,只需找出对应的卡片,助手就会告诉你需要准备的食材、操作步骤和确认菜是否做好。这样,无论你做什么菜,都能快速找到正确的步骤,不会迷路,也不用每次都重新查资料。它让做饭变得简单又高效,甚至还能学会新菜谱,变成厨房里的超级助手。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,比如冒险游戏。每次你遇到新任务,都需要记住怎么操作,比如怎么找到宝藏、打败怪物或者解谜。SkillLens就像你的游戏助手,它会把每个任务的关键步骤和提示都写成一张“技能卡”。当你再次遇到类似的任务时,只要查找相关的卡片,它就会告诉你下一步该做什么,还会帮你确认你是否做对了。这样,你不用每次都从头学,也不用记一大堆细节,只要看一眼技能卡,就知道怎么继续。它让游戏变得更容易,也让你变成更厉害的玩家!

术语表

Visual Skill Card(VSC,视觉技能卡)

一种封装流程、线索和视觉证据的结构化记忆单元,用于GUI动作预测。它结合了操作流程、适用性线索、界面视觉信息和验证信号。

在本文中,VSC作为外部知识存储,用于增强模型的程序记忆和推理能力。

Trace-to-VSC(轨迹转技能卡)

将异构交互数据转化为标准化的技能卡的机制,提取可重用的流程片段和视觉证据。

用于构建VSC库,实现多源数据的封装与层级组织。

Grounded GUI Action(基础GUI动作)

基于实时界面状态和证据,预测并执行的具体用户操作(如点击、输入等)。

模型在推理时,依赖VSC和实时界面信息进行 grounded 动作预测。

CardDistill(技能卡蒸馏)

利用VSC作为教师信号,将知识迁移到学生模型,实现无检索的推理能力。

训练阶段,将VSC知识融入模型参数,减少推理成本。

开放问题 这项研究留下的未解疑问

  • 1 如何自动扩展VSC库以适应不断变化的界面和任务场景,仍需研究动态更新机制。未来需要探索结合在线学习和持续训练的方法,以保持知识的时效性和适应性。

应用场景

近期应用

自动化软件操作

利用SkillLens实现自动化测试、数据录入和界面导航,减少人工干预,提高效率。只需提供界面截图和任务描述,模型即可自主识别控件并执行操作。

智能助手

集成到桌面或网页助手中,帮助用户完成复杂操作,提升用户体验。模型能理解界面状态,提供实时操作建议。

远期愿景

跨平台智能交互系统

将VSC技术推广到不同操作系统和应用场景,实现跨平台的自动化和智能化操作,推动工业自动化和智能办公的普及。

原文摘要

Computer-using agents can perceive rich software interfaces, yet their decisions often lack visual procedural memory: they may recognize individual controls without identifying which familiar workflow is active, which control matters next, or what evidence would confirm progress. Raw interaction traces preserve such information but are long and noisy to condition on, whereas text-only skills often omit the visual state that makes a procedure applicable. We introduce Visual Skill Cards (VSCs), a state-conditioned memory representation that binds reusable procedures with applicability cues, visual evidence, and verification signals. SkillLens constructs VSCs from heterogeneous interaction experience through Trace-to-Visual-Skill-Card and, at inference time, retrieves relevant cards and selectively expands only the evidence needed by a fixed visual-language model executor for grounded GUI action prediction. The same representation also supports CardDistill, which uses VSC evidence as privileged teacher context to train a student that acts without runtime card retrieval. Across Multimodal-Mind2Web and WebLINX-BrowserGym, SkillLens improves the frozen GPT-5.4-mini executor by +11.6 points in Step SR and +2.9 points in Overall, respectively; CardDistill further improves the corresponding student-only Qwen3-VL-2B metrics by +12.0 and +3.2 points.

cs.AI