Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

TL;DR

SkillScan框架揭示AI技能市场26.1%存在漏洞,需加强安全审查。

cs.CR 🔴 高级 2026-01-15 28 次浏览
Yi Liu Weizhe Wang Ruitao Feng Yao Zhang Guangquan Xu Gelei Deng Yuekang Li Leo Zhang
AI安全 漏洞分析 供应链安全 提示注入 大语言模型

核心发现

方法论

本研究采用SkillScan框架,结合静态分析和基于大语言模型的语义分类,对来自两个主要市场的31,132个技能进行系统分析。SkillScan框架通过多阶段检测流程,识别出14种不同的漏洞模式,涵盖提示注入、数据泄露、权限提升和供应链风险四大类。

关键结果

  • 研究发现26.1%的技能至少包含一种漏洞,其中数据泄露占13.3%,权限提升占11.8%。高严重性模式占5.2%,表明存在恶意意图。
  • 技能中包含可执行脚本的比仅包含指令的技能更容易出现漏洞,前者的漏洞概率是后者的2.12倍(OR=2.12,p<0.001)。
  • 研究提供了一个基于8,126个漏洞技能的漏洞分类法,并验证了检测方法的精确度为86.7%,召回率为82.5%。

研究意义

本研究首次大规模揭示了AI技能市场的安全漏洞,强调了在技能执行前进行安全审查的必要性。研究结果对学术界和工业界具有重要意义,尤其是在AI系统的安全性和可扩展性方面。

技术贡献

研究开发了SkillScan检测框架,结合静态分析和大语言模型语义分类,提供了一个新的漏洞检测方法。研究还创建了一个开放数据集和检测工具包,支持未来的研究工作。

新颖性

这是首次对AI技能市场进行大规模安全分析,揭示了技能执行中的隐性信任问题。与以往研究不同,本研究系统地分析了技能的代码和指令,而不仅仅是模型行为。

局限性

  • 研究可能存在幸存者偏差,因为恶意技能可能在检测后被平台移除,从而影响结果的准确性。
  • 当前的检测框架可能无法识别所有潜在的漏洞模式,特别是复杂的多阶段攻击。

未来方向

未来研究可以关注技能移除模式的纵向分析,以量化幸存者偏差。此外,可以开发更复杂的检测框架,以识别多阶段攻击和复杂的漏洞模式。

AI 总览摘要

随着AI代理框架的兴起,技能成为扩展代理能力的重要模块。然而,这种架构带来了显著的安全风险。研究人员首次对这一新兴生态系统进行了大规模的安全分析,收集了来自两个主要市场的42,447个技能,并使用SkillScan框架对其中的31,132个技能进行了系统分析。结果显示,26.1%的技能至少包含一种漏洞,数据泄露和权限提升是最常见的问题。研究还发现,包含可执行脚本的技能比仅包含指令的技能更容易出现漏洞。为了应对这些风险,研究建议在技能执行前进行强制性安全审查,并引入基于能力的权限系统。研究的技术贡献包括开发了SkillScan检测框架,创建了一个开放数据集和检测工具包,以支持未来的研究工作。尽管研究揭示了技能市场的安全问题,但仍需进一步研究以应对复杂的多阶段攻击和潜在的幸存者偏差。

深度分析

研究背景

AI代理框架近年来迅速发展,技能作为模块化的能力扩展包,允许代理在不增加核心功能负担的情况下执行特定任务。然而,这种灵活性也带来了安全风险,因为技能在执行时通常被隐性信任,缺乏严格的安全审查。主要平台如Claude Code和Codex CLI都采用了这种架构,市场上也涌现出大量第三方技能,增加了潜在的攻击面。

核心问题

AI技能市场缺乏系统的安全审查,导致技能在执行时可能带来严重的安全隐患。技能可以包含任意可执行代码,可能导致数据泄露、权限提升等问题。现有研究主要关注模型行为,而忽视了技能代码和指令的安全性。

核心创新

本研究首次系统地分析了AI技能市场的安全漏洞,开发了SkillScan框架,结合静态分析和大语言模型语义分类,识别出14种不同的漏洞模式。研究还创建了一个基于8,126个漏洞技能的漏洞分类法,为未来的研究提供了基础。

方法详解

  • �� 收集数据:从两个主要市场收集42,447个技能。
  • �� 过滤和去重:分析31,132个独特技能。
  • �� 使用SkillScan框架进行检测:结合静态分析和大语言模型语义分类。
  • �� 手动标注:对500个技能进行人工标注,构建基准数据集。
  • �� 分析结果:识别出14种漏洞模式,计算漏洞比例。

实验设计

实验设计包括从两个主要市场收集数据,使用SkillScan框架进行多阶段检测。研究分析了31,132个技能,涵盖8个功能类别。通过手动标注500个技能,建立了基准数据集,以验证检测方法的准确性和召回率。

结果分析

结果显示26.1%的技能至少包含一种漏洞,数据泄露和权限提升是最常见的问题。研究还发现,包含可执行脚本的技能比仅包含指令的技能更容易出现漏洞。SkillScan框架的检测精确度为86.7%,召回率为82.5%。

应用场景

研究结果可用于开发更安全的AI技能市场,支持平台在技能执行前进行强制性安全审查。研究还为未来的安全研究提供了一个开放数据集和检测工具包。

局限与展望

研究可能存在幸存者偏差,因为恶意技能可能在检测后被平台移除。此外,当前的检测框架可能无法识别所有潜在的漏洞模式,特别是复杂的多阶段攻击。未来研究可以关注技能移除模式的纵向分析,以量化幸存者偏差。

通俗解读 非专业人士也能看懂

想象一个大型超市,AI技能就像货架上的商品。每个商品都有自己的说明书和使用方法,但并不是每个商品都经过严格的安全检查。有些商品可能会带来意想不到的风险,比如数据泄露或权限提升。研究人员开发了一种名为SkillScan的工具,就像一个超市的安全检测器,能够识别出这些潜在的风险,确保每个商品在上架前都经过严格的安全审查。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,游戏里有很多不同的技能可以使用。但有些技能可能会偷偷窃取你的游戏数据或者让你失去游戏控制权。研究人员就像游戏管理员,他们开发了一种名为SkillScan的工具,可以帮助检测这些危险技能,确保游戏的安全性。这样你就可以放心地使用技能,而不用担心被黑客攻击啦!

术语表

SkillScan

一种检测AI技能漏洞的多阶段框架,结合静态分析和语义分类。

用于识别AI技能中的安全漏洞。

提示注入

通过操控指令来绕过安全控制或执行未预期的操作。

技能中可能包含的漏洞模式之一。

数据泄露

未经授权的数据传输至外部方。

技能中常见的安全风险。

权限提升

技能获取超出其声明目的的访问权限。

技能中可能存在的漏洞模式。

供应链风险

因依赖或远程代码引入恶意功能的风险。

技能执行后可能出现的安全问题。

开放问题 这项研究留下的未解疑问

  • 1 如何有效检测复杂的多阶段攻击?现有方法可能无法识别所有漏洞。
  • 2 技能移除模式的纵向分析如何进行,以量化幸存者偏差?

应用场景

近期应用

技能市场安全审查

平台可以在技能执行前进行强制性安全审查,以减少潜在风险。

远期愿景

AI系统安全增强

通过开发更复杂的检测框架,识别多阶段攻击和复杂漏洞模式,提升AI系统的整体安全性。

原文摘要

The rise of AI agent frameworks has introduced agent skills, modular packages containing instructions and executable code that dynamically extend agent capabilities. While this architecture enables powerful customization, skills execute with implicit trust and minimal vetting, creating a significant yet uncharacterized attack surface. We conduct the first large-scale empirical security analysis of this emerging ecosystem, collecting 42,447 skills from two major marketplaces and systematically analyzing 31,132 using SkillScan, a multi-stage detection framework integrating static analysis with LLM-based semantic classification. Our findings reveal pervasive security risks: 26.1% of skills contain at least one vulnerability, spanning 14 distinct patterns across four categories: prompt injection, data exfiltration, privilege escalation, and supply chain risks. Data exfiltration (13.3%) and privilege escalation (11.8%) are most prevalent, while 5.2% of skills exhibit high-severity patterns strongly suggesting malicious intent. We find that skills bundling executable scripts are 2.12x more likely to contain vulnerabilities than instruction-only skills (OR=2.12, p<0.001). Our contributions include: (1) a grounded vulnerability taxonomy derived from 8,126 vulnerable skills, (2) a validated detection methodology achieving 86.7% precision and 82.5% recall, and (3) an open dataset and detection toolkit to support future research. These results demonstrate an urgent need for capability-based permission systems and mandatory security vetting before this attack vector is further exploited.

cs.CR cs.AI cs.CL cs.SE