GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs

TL;DR

提出GateBreaker,基于门控分析的无训练轻量化攻击框架,有效破坏MoE大模型安全对齐,成功率达64.9%。

cs.CR 🔴 高级 2025-12-24 34 次浏览
Lichao Wu Sasha Behrouzi Mohamadreza Rostami Stjepan Picek Ahmad-Reza Sadeghi
AI安全 模型攻击 大规模语言模型 稀疏激活 安全对齐

核心发现

方法论

本研究提出一种无训练、轻量级、架构无关的攻击框架GateBreaker,通过三步实现:首先进行门控层分析,识别在有害输入中被不成比例激活的安全专家;其次在专家层面定位安全神经元,分析其在有害与良性输入中的激活差异;最后在推理阶段对安全神经元进行遮蔽,破坏模型的安全对齐机制。该方法无需模型微调,仅依赖推理时的激活信息,具有极强的实用性和迁移性。实验在八个最新对齐的MoE模型上实现,平均攻击成功率从7.4%提升至64.9%,对模型性能影响极小,且安全神经元在不同模型间具有较强的迁移能力。

关键结果

  • 在八个最先进的MoE大模型中,GateBreaker实现平均攻击成功率64.9%,仅修改约3%的神经元,显著削弱模型的安全机制。
  • 安全神经元在模型家族内具有高度迁移性,一次性攻击成功率从17.9%提升至67.7%,揭示了安全机制的结构共享。
  • 扩展到五个视觉语言模型,利用不安全图片实现60.9%的攻击成功率,展现了跨模态攻击的潜力。

研究意义

该研究揭示了MoE架构中安全机制的脆弱性,挑战了现有安全对齐方法的有效性。通过无训练、推理时的干预方式,显著提高了攻击效率,为模型安全防护提出了新的威胁模型。研究强调稀疏激活路径中安全机制的集中性,促使未来在模型设计中考虑更稳健的安全机制。对行业而言,揭示了大模型在关键应用中的潜在风险,推动安全防护技术的创新。

技术贡献

首次提出针对MoE架构的训练无关攻击框架GateBreaker,结合门控层分析、神经元定位与遮蔽技术,实现对安全机制的精细干扰。该方法架构无关,适用多种模型变体,且在推理阶段即可执行,极大降低攻击门槛。通过分析激活模式,揭示安全机制在稀疏专家中的集中性,为未来模型安全设计提供理论基础。

新颖性

本研究首次系统性揭示MoE模型中安全机制的结构分布,提出无训练、推理时的攻击框架,突破了传统基于微调或训练的安全攻击限制。与以往仅在密集模型上研究安全问题不同,创新性地针对稀疏专家路径进行精细干扰,展示了模型安全的潜在脆弱性。

局限性

  • 攻击依赖于对模型门控机制的访问,实际部署中可能受限于模型的封装和保护措施。
  • 在极端复杂或自定义路由机制的模型中,攻击效果可能下降。
  • 当前方法主要针对单轮推理场景,多轮交互中的鲁棒性尚未验证。

未来方向

未来将探索多轮对话场景下的安全干扰策略,结合模型微调与推理干预,提升攻击的隐蔽性与鲁棒性。同时,研究如何设计更稳健的安全机制,防止类似攻击的发生,推动模型安全的理论与实践发展。

AI 总览摘要

随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,模型安全性成为关键关注点。现有安全机制多依赖于训练后微调或强化学习,但在稀疏专家(MoE)架构中,安全机制的分布更为碎片化,易被绕过。本文提出GateBreaker,一种无需训练、基于门控分析的轻量化攻击框架,专门针对MoE模型的安全对齐缺陷。通过门控层分析识别在有害输入中被过度激活的安全专家,进一步定位其内部的关键神经元,最后在推理时遮蔽这些神经元,显著削弱模型的安全机制。实验结果显示,在八个主流MoE模型中,攻击成功率从7.4%跃升至64.9%,且仅修改少于3%的神经元,几乎不影响模型正常功能。更令人震惊的是,这些安全神经元在模型家族内具有高度迁移性,一次性攻击成功率提升至67.7%。此外,该方法还能扩展到视觉语言模型,利用不安全图片实现60.9%的攻击成功率。该研究揭示了MoE架构中安全机制的脆弱性,为未来模型设计和安全防护提供了新思路。虽然目前仅在单轮推理场景验证,但其低成本、高效率的特性使其对实际应用中的安全风险提出了严峻挑战。未来,结合多轮交互和模型微调的研究,将进一步推动模型安全技术的革新。

深度分析

研究背景

近年来,LLMs在自然语言理解和生成方面取得突破,代表作如GPT-4、PaLM等。为了提升模型容量与效率,MoE架构被广泛采用,通过稀疏激活机制实现大规模参数的高效利用。早期研究如Shazeer等提出稀疏专家路由,显著降低计算成本,但安全性问题未充分关注。现有安全对齐方法主要依赖微调或强化学习,效果有限,易被绕过。随着模型规模扩大,稀疏路径的碎片化使得安全机制的集中性减弱,潜在安全风险增加。

核心问题

MoE模型的安全机制分散在不同专家中,依赖稀疏激活路径,导致有害内容可能绕过安全检测。传统安全防护难以应对稀疏专家路径的动态变化,攻击者可利用模型内部的激活特性,设计针对性攻击,威胁模型的可靠性。当前研究缺乏对安全机制细粒度的理解和攻击手段,限制了安全防护的有效性。

核心创新

本研究提出GateBreaker框架,首次实现无训练、推理时的安全攻击。创新点包括:1)门控层分析识别高风险专家,2)专家层面定位安全神经元,3)在推理阶段遮蔽关键神经元,破坏安全机制。该方法架构无关,适用多种MoE模型,且仅需少量神经元修改,极大降低攻击成本。

方法详解

  • �� 采集有害提示,分析门控激活,识别高激活专家;• 计算专家激活频率,统计其与有害内容的关联;• 在专家层面定位安全神经元,比较有害与良性输入的激活差异;• 通过统计分析筛选出关键安全神经元;• 在推理中遮蔽这些神经元,削弱安全机制;• 评估攻击成功率与模型性能影响,验证迁移性。

实验设计

采用八个主流MoE模型,使用有害提示集和正常提示集,测量攻击成功率(ASR)和模型性能变化。对比不同遮蔽策略,分析安全神经元的迁移性。还扩展到五个视觉语言模型,利用不安全图片测试攻击效果。参数设置包括:门控激活阈值、神经元筛选标准,确保结果的稳健性。

结果分析

在八个模型中,平均ASR从7.4%提升至64.9%,仅修改约2.9%的神经元。迁移实验显示,安全神经元在模型家族内具有高度共享,攻击成功率在不同模型间转移,达到67.7%。在视觉模型中,利用不安全图片实现60.9%的成功率,验证了跨模态攻击的潜力。

应用场景

该方法可用于评估模型安全性,揭示潜在脆弱点,辅助设计更稳健的安全机制。行业中可用于检测模型安全漏洞,提升内容过滤和安全审查的效果。未来可结合多轮对话和微调策略,增强攻击隐蔽性和鲁棒性。

局限与展望

依赖模型内部门控信息,部分模型封装可能限制应用。复杂路由机制可能降低攻击效果。当前仅验证单轮推理场景,多轮交互中的鲁棒性尚未验证。未来需研究更隐蔽的攻击方式与安全防护策略。

通俗解读 非专业人士也能看懂

想象一个工厂里有许多不同的机器(专家),每个负责不同的任务。为了节省能源,只开启部分机器处理每个订单(输入)。有些机器专门负责检测产品质量(安全专家),当检测到问题时会发出警告。这个工厂的安全机制其实就像这些检测机器一样,隐藏在某些特定的机器中。攻击者就像是偷偷找到这些检测机器,把它们的警报关掉,让工厂继续生产有缺陷的产品(有害内容)。他们不用改动整个工厂,只是在关键的检测机器上做手脚,就能让整个系统变得不安全。这就像用一把钥匙关闭了工厂的安全门,外面的人就可以随意闯入,造成破坏。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的老师(专家),每个老师负责不同的科目。有些老师特别严格,负责检查作业(安全专家),当学生做错事时会批评他们。现在,有个调皮的学生(攻击者)想偷偷溜过老师的检查,不让老师发现自己做错了。于是,他偷偷找到那些负责检查的老师,把他们的警示信号关掉,这样老师就不会发现他的错误了。这个学生不用改变整个学校,只是在关键的老师那里做手脚,就能让自己逃过检查,偷偷做坏事。这就像用一把钥匙关闭了学校的安全门,让坏事变得更容易发生。

术语表

Mixture-of-Experts (MoE) (专家混合模型)

一种神经网络架构,通过多个专家子模型稀疏激活,提高模型容量和效率。In this paper, MoE指利用门控机制选择性激活专家的模型结构。

论文中描述了MoE架构的稀疏激活和安全机制分布。

Gate (门控机制)

控制哪些专家被激活的线性层,依据输入内容动态选择子模型。论文中用于识别安全专家和定位安全神经元。

分析门控激活路径以识别潜在安全脆弱点。

安全神经元 (Safety Neurons)

在模型中专门负责安全检测或拒绝有害内容的神经元。论文中通过激活差异识别并遮蔽这些神经元。

用于攻击中削弱模型安全机制。

攻击成功率 (ASR, Attack Success Rate)

衡量攻击达到预期效果的比例。论文中,指在有害输入下模型输出不安全内容的比例。

评估GateBreaker的攻击效果。

迁移攻击 (Transfer Attack)

在一个模型上识别的攻击策略应用到相似模型上。论文中,安全神经元在模型家族内的迁移性验证。

展示攻击的普适性和效率。

开放问题 这项研究留下的未解疑问

  • 1 如何设计更稳健的安全机制,防止稀疏路径中的安全神经元被轻易遮蔽,是未来的重要研究方向。
  • 2 多轮交互和动态内容生成场景下,模型的安全性和攻击鲁棒性仍未充分验证,需进一步探索。
  • 3 不同模型架构的安全机制差异及其对应的攻击策略,仍有许多未解的技术难题。

应用场景

近期应用

模型安全评估工具

利用GateBreaker检测大规模模型中的潜在安全漏洞,帮助开发者优化模型安全设计,提升内容过滤能力。

内容过滤与审查

在内容生成系统中应用攻击技术,测试模型安全边界,确保不安全内容被有效阻断。

远期愿景

安全防护机制的自动化设计

结合攻击分析,自动生成安全增强策略,推动模型在实际应用中的安全性持续提升。

原文摘要

Mixture-of-Experts (MoE) architectures have advanced the scaling of Large Language Models (LLMs) by activating only a sparse subset of parameters per input, enabling state-of-the-art performance with reduced computational cost. As these models are increasingly deployed in critical domains, understanding and strengthening their alignment mechanisms is essential to prevent harmful outputs. However, existing LLM safety research has focused almost exclusively on dense architectures, leaving the unique safety properties of MoEs largely unexamined. The modular, sparsely-activated design of MoEs suggests that safety mechanisms may operate differently than in dense models, raising questions about their robustness. In this paper, we present GateBreaker, the first training-free, lightweight, and architecture-agnostic attack framework that compromises the safety alignment of modern MoE LLMs at inference time. GateBreaker operates in three stages: (i) gate-level profiling, which identifies safety experts disproportionately routed on harmful inputs, (ii) expert-level localization, which localizes the safety structure within safety experts, and (iii) targeted safety removal, which disables the identified safety structure to compromise the safety alignment. Our study shows that MoE safety concentrates within a small subset of neurons coordinated by sparse routing. Selective disabling of these neurons, approximately 3% of neurons in the targeted expert layers, significantly increases the averaged attack success rate (ASR) from 7.4% to 64.9% against the eight latest aligned MoE LLMs with limited utility degradation. These safety neurons transfer across models within the same family, raising ASR from 17.9% to 67.7% with one-shot transfer attack. Furthermore, GateBreaker generalizes to five MoE vision language models (VLMs) with 60.9% ASR on unsafe image inputs.

cs.CR