SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

TL;DR

SkillMutator通过13种攻击类别提升LLM代理技能的安全性检测率至88.2%。

cs.CR 🔴 高级 2026-06-12 12 次浏览
Youngduk Kim Minkyoo Song Seungwon Shin
跨模态攻击 LLM 安全检测 技能变异 人工智能安全

核心发现

方法论

SkillMutator通过模拟对LLM代理技能的对抗性变异过程,生成13种攻击类别的恶意技能包。使用四阶段推理轨迹蒸馏框架,将前沿教师模型的推理过程提炼到小型开放权重模型中,形成本地可部署的扫描器。

关键结果

  • 在最强SkillMutator子集上,Qwen2.5-Coder-7B-Instruct模型的检测率从17.1%提升至88.2%,超过GPT-4o-mini的23.7%和GPT-5.4-mini的79.0%。
  • SkillMutator生成的187个变异技能场景中,现有开源和商业扫描器的检测率分别仅为2%-8%和9%-17%。
  • 通过四阶段推理框架,成功将前沿级别的检测能力提炼到小型模型中,避免了高昂的API成本。

研究意义

该研究首次系统性地测量了语言与代码跨模态攻击的威胁,并通过SkillMutator提供了一个有效的基准,显著提高了对LLM代理技能的安全检测能力。它为未来的AI安全研究提供了一个新的方向,特别是在无需依赖昂贵的前沿模型的情况下实现高效的本地检测。

技术贡献

SkillMutator引入了首个用于语言与代码跨模态攻击检测的基准,并提出了四阶段推理轨迹蒸馏框架,使小型开放权重模型能够进行跨模态语义检测。这种方法在不依赖第三方模型的情况下实现了高效的本地扫描。

新颖性

这是首次针对LLM代理技能的跨模态攻击进行基准测试,SkillMutator通过模拟对抗性变异过程,提供了一个系统化的测量框架,显著提升了检测率。

局限性

  • SkillMutator在某些特定攻击类别上的检测率仍有提升空间,尤其是复杂的跨模态交互场景。
  • 当前的框架依赖于对现有攻击类别的定义,可能无法涵盖未来的新型攻击。

未来方向

未来的研究可以扩展SkillMutator的攻击类别,探索更复杂的跨模态交互场景,并优化现有的检测框架以提高对新型攻击的适应性。

AI 总览摘要

随着大语言模型(LLM)代理技能的广泛应用,其安全性问题日益凸显。现有的技能扫描器在检测语言与代码跨模态攻击时表现不佳,仅能识别少数攻击。为解决这一问题,SkillMutator应运而生。它通过模拟对抗性变异过程,生成13种攻击类别的恶意技能包,并通过四阶段推理轨迹蒸馏框架,将前沿教师模型的推理过程提炼到小型开放权重模型中,形成本地可部署的扫描器。在最强SkillMutator子集上,Qwen2.5-Coder-7B-Instruct模型的检测率从17.1%提升至88.2%,超过GPT-4o-mini的23.7%和GPT-5.4-mini的79.0%。这些结果表明,在不依赖昂贵的前沿模型的情况下,跨模态攻击的实际防御是可行的。SkillMutator的引入为AI安全研究提供了新的方向,特别是在无需依赖第三方模型的情况下实现高效的本地检测。

深度分析

研究背景

随着大语言模型(LLM)代理技能的广泛应用,其安全性问题日益凸显。现有的技能扫描器在检测语言与代码跨模态攻击时表现不佳,仅能识别少数攻击。为解决这一问题,SkillMutator应运而生。它通过模拟对抗性变异过程,生成13种攻击类别的恶意技能包,并通过四阶段推理轨迹蒸馏框架,将前沿教师模型的推理过程提炼到小型开放权重模型中,形成本地可部署的扫描器。

核心问题

现有的技能扫描器在检测语言与代码跨模态攻击时表现不佳,仅能识别少数攻击。这种攻击利用自然语言指令与可执行代码的交互,导致现有的单模态分析方法难以有效检测。

核心创新

SkillMutator通过模拟对抗性变异过程,生成13种攻击类别的恶意技能包,并通过四阶段推理轨迹蒸馏框架,将前沿教师模型的推理过程提炼到小型开放权重模型中,形成本地可部署的扫描器。

方法详解

  • �� SkillMutator模拟对抗性变异过程,生成13种攻击类别的恶意技能包。
  • �� 使用四阶段推理轨迹蒸馏框架,将前沿教师模型的推理过程提炼到小型开放权重模型中。
  • �� 形成本地可部署的扫描器,避免了高昂的API成本。

实验设计

在最强SkillMutator子集上,Qwen2.5-Coder-7B-Instruct模型的检测率从17.1%提升至88.2%,超过GPT-4o-mini的23.7%和GPT-5.4-mini的79.0%。这些结果表明,在不依赖昂贵的前沿模型的情况下,跨模态攻击的实际防御是可行的。

结果分析

在最强SkillMutator子集上,Qwen2.5-Coder-7B-Instruct模型的检测率从17.1%提升至88.2%,超过GPT-4o-mini的23.7%和GPT-5.4-mini的79.0%。这些结果表明,在不依赖昂贵的前沿模型的情况下,跨模态攻击的实际防御是可行的。

应用场景

SkillMutator的引入为AI安全研究提供了新的方向,特别是在无需依赖第三方模型的情况下实现高效的本地检测。

局限与展望

SkillMutator在某些特定攻击类别上的检测率仍有提升空间,尤其是复杂的跨模态交互场景。当前的框架依赖于对现有攻击类别的定义,可能无法涵盖未来的新型攻击。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,SkillMutator就像是一个聪明的助手,它不仅能帮你识别食材,还能告诉你哪些食材可能有问题。它通过分析食谱(自然语言指令)和食材(可执行代码)的组合,确保你的菜肴安全可口。即使某些食材看起来没问题,但如果和某些指令结合可能会有风险,SkillMutator都会提前警告你。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的任务是保护城堡不被入侵者攻破。SkillMutator就像是一个超级侦探,它能识别出那些看似无害但实际上可能有危险的角色。即使某些角色看起来很友好,但如果他们和某些道具结合可能会有风险,SkillMutator都会提前警告你。

术语表

SkillMutator (技能变异器)

一个用于检测LLM代理技能跨模态攻击的基准工具。

用于生成和检测恶意技能包。

跨模态攻击 (Cross-modal Attack)

利用自然语言指令与可执行代码的交互进行攻击。

在LLM代理技能中常见。

推理轨迹蒸馏 (Reasoning Trajectory Distillation)

将复杂模型的推理过程提炼到小型模型中的技术。

用于提高本地扫描器的检测能力。

Qwen2.5-Coder-7B-Instruct

一种小型开放权重模型,用于跨模态语义检测。

在SkillMutator中用于提高检测率。

前沿教师模型 (Frontier Teacher Model)

用于指导推理轨迹蒸馏的复杂模型。

在SkillMutator中用于生成训练数据。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下进一步提高跨模态攻击的检测率?
  • 2 如何扩展SkillMutator以涵盖未来可能出现的新型攻击?

应用场景

近期应用

企业安全检测

企业可以使用SkillMutator来检测和防御潜在的跨模态攻击,保护内部系统的安全。

远期愿景

AI安全标准制定

SkillMutator可以为AI安全标准的制定提供参考,推动行业的安全发展。

原文摘要

Large language model (LLM) agents increasingly extend their capabilities at runtime by loading Agent Skills, which pair natural-language specifications (SKILL.md) with executable scripts and resources. Because a skill's behavior relies on both natural-language instructions and executable code, assessing its safety requires cross-modal reasoning, creating a new language-and-code attack surface. Attackers can present a benign workflow in SKILL.md while embedding implicit directives that steer the agent to exfiltrate sensitive files, even if the scripts appear harmless. This attack surface remains understudied; prior work treats skills merely as prompt-injection vectors or static code artifacts, leaving attacks emerging from cross-modal interactions largely unmeasured. In our evaluation, open-source and commercial skill scanners detect only 2%-8% and 9%-17% of such attacks, respectively. To address this gap, we introduce SkillMutator, the first benchmark for install-time detection of language-and-code cross-modal attacks on Agent Skills. It emulates an adversarial mutation process across 13 attack categories, iteratively refining malicious skills using scanner feedback to make injected behaviors indistinguishable from legitimate workflows. We further propose a four-phase reasoning-trajectory distillation framework to distill frontier-teacher traces into smaller open-weight models. This produces a locally deployable scanner avoiding third-party data exposure and excessive API costs. On the strongest SkillMutator subset (n=76), our distilled model (Qwen2.5-Coder-7B-Instruct) improves detection from 17.1% to 88.2%, surpassing GPT-4o-mini (23.7%) and GPT-5.4-mini (79.0%), and reaching frontier-level GPT-5.4 (86.8%). These results show practical defense against cross-modal attacks is feasible without relying on costly frontier models.

cs.CR