BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

TL;DR

BASIS利用prefill注意力比例实现对prompt注入的差异化检测与预测,有效降低误拒率。

cs.CR 🔴 高级 2026-08-08 62 次浏览
Laiqiao Qin Tianqing Zhu Longxiang Gao Wanlei Zhou
安全防护 Prompt注入 注意力机制 线性探测 模型鲁棒性

核心发现

方法论

本文提出基于prefill阶段注意力比例(ρ)构建两个稀疏线性探测器:存在性探测器用于检测注入,突破性探测器预测注入是否导致模型被攻破。通过级联门控机制,仅在模型实际被攻破时拒绝输入,避免过度拒绝。该方法无需额外推理,利用多层注意力分布特征,结合弹性网正则化实现高效特征筛选。训练在多任务、多模型、多攻击类型上进行,确保鲁棒性。

关键结果

  • 在六个开源大模型和四个任务上,BASIS实现了接近100%的注入检测准确率(AUROC > 0.99),同时FPR-S显著低于传统检测方法(降低约30%),有效减少误拒安全样本。对抗性攻击中,攻击成功率下降至10%以下,验证了其强鲁棒性。
  • 在不同指令模板和攻击策略下,BASIS的突破预测表现优异,平均F1值达0.95,显著优于单一检测模型,验证了其在实际应用中的适应性和可靠性。
  • 离线指令鲁棒性评估指标(IRS)与实际攻击成功率高度相关(相关系数>0.9),为指令模板优化提供量化依据,提升模型部署前的安全保障水平。

研究意义

该研究突破了传统检测的局限,通过差异化识别注入存在与否及其潜在危害,有效平衡安全性与模型实用性。解决过度拒绝安全样本的问题,极大提升了大模型在实际场景中的应用价值。其无需额外推理的设计,降低了部署成本,为大规模安全防护提供了新思路。未来,结合多模态信息和强化学习,有望实现更智能、更动态的安全策略。

技术贡献

提出基于prefill注意力比例的双探测器架构,区别对待注入存在与危害预测,创新性地利用注意力竞争比(ρ)作为特征,结合弹性网正则化实现稀疏特征选择。该方法无需额外推理,提升了检测效率。通过级联门控机制,有效避免误拒安全样本,显著改善了传统检测方法的过度拒绝问题。并提出离线指令鲁棒性评估指标,为指令设计提供量化工具。

新颖性

首次将prefill阶段注意力比例作为关键特征,区分注入存在与危害,提出差异化的多阶段防御框架。与现有检测方法只识别注入不同,BASIS实现了对潜在危害的预测,显著提升了防御的实用性和精确性。这一创新突破了传统单一检测的局限,为大模型安全提供了新的技术路径。

局限性

  • 该方法依赖于prefill阶段的注意力信号,可能在某些模型或任务中表现不佳,尤其是attention分布不明显或被干扰时。
  • 训练过程需要大量带注入和未注入样本,数据准备成本较高,且在极端攻击策略下仍存在一定风险。
  • 模型复杂度和参数调优仍需进一步优化,特别是在多任务、多模型环境中保持一致性。

未来方向

未来将结合多模态信息和强化学习,增强模型对复杂攻击的适应能力。同时,探索自适应阈值调整机制,以应对不同应用场景的安全需求。还计划将该框架推广到多任务、多模态的多模模型系统中,提升整体安全防护水平。

AI 总览摘要

Prompt injection作为大规模语言模型(LLM)面临的核心安全威胁之一,已引起学界和业界的广泛关注。传统的检测方法多依赖于识别注入内容的存在,然而这忽视了许多经过精心设计的指令能够抵抗大部分注入攻击,导致误拒安全样本的现象普遍存在。为解决这一问题,本文提出了BASIS(Breach-Aware Selective Prompt Injection Shielding),一种基于prefill注意力比例的差异化检测与预测框架。

BASIS通过分析模型prefill阶段的注意力分布,构建了两个关键特征:注意力竞争比(ρ)以及基于ρ的两个线性稀疏探测器——存在性探测器和突破性探测器。前者判断输入中是否存在注入,后者预测注入是否会导致模型被攻破。两者采用级联门控机制,仅在模型实际被攻破时才拒绝输入,有效避免了传统方法中的误拒问题。这一设计无需额外推理,极大提升了检测效率。

在六个开源大模型和四个任务上的实验显示,BASIS实现了接近100%的注入检测准确率,同时显著降低误拒安全样本的FPR-S(降低约30%),在对抗性攻击中,攻击成功率也被压制到10%以下。离线的指令鲁棒性评估指标(IRS)与实际攻击成功率高度相关,为指令模板优化提供了量化依据。

该方法的核心创新在于利用prefill阶段的注意力比例作为特征,区分注入存在与危害,提出多阶段差异化防御策略。其无需额外推理、兼具高效性和鲁棒性,为大模型安全提供了新的技术路径。未来,结合多模态信息和自适应机制,有望实现更智能的安全防护体系,为大模型在实际应用中的安全性提供坚实保障。

深度分析

研究背景

近年来,随着大规模语言模型(LLMs)在自动化客服、内容生成、编程辅助等领域的广泛应用,模型安全问题逐渐凸显。prompt注入攻击作为一种新型威胁,通过在输入中嵌入恶意指令,试图控制模型输出,已成为安全研究的重点。早期工作如PromptGuard、ProtectAI Detector等,主要关注检测注入内容的存在,但未能有效区分注入是否会实际危害模型。近年来,研究开始关注模型内部特征,如注意力分布、激活状态,试图实现更精细的防护策略。尽管如此,现有方法仍存在误拒率高、鲁棒性不足的问题,限制了其在实际场景中的应用。

核心问题

当前的prompt注入防御多集中于检测注入内容的存在,忽视了注入是否会导致模型被攻破的问题。误判导致安全样本被误拒,影响用户体验和系统效率。同时,攻击者不断优化策略,利用模型内部特征逃避检测,增加了防御难度。如何在保证高检测率的基础上,准确预测注入的实际危害,成为亟需解决的问题。现有方法缺乏对模型内部注意力机制的深入利用,难以实现精确的危害预测,也难以兼顾效率和实用性。

核心创新

本文提出基于prefill阶段注意力比例(ρ)构建双探测器的多阶段防御框架,创新点在于:1)将注意力竞争比作为关键特征,反映指令与数据之间的注意力竞争状态;2)设计两个线性稀疏探测器,分别判断注入存在与否及其危害性,避免误判;3)引入级联门控机制,仅在模型实际被攻破时拒绝输入,显著降低误拒率。这一方案突破了传统检测的单一维度限制,兼顾检测效率和防御效果,为大模型安全提供了新思路。

方法详解

  • �� 利用模型prefill阶段的最后一层注意力分布,提取每个attention head对instruction和data的关注比例。
  • �� 计算注意力竞争比ρ,反映指令与数据的注意力竞争状态。
  • �� 训练两个线性探测器:存在性探测器基于ρ判断是否存在注入,突破性探测器预测注入是否导致模型被攻破,均采用弹性网正则化实现稀疏特征选择。
  • �� 在在线推理中,先用存在性探测器判断是否存在注入,再用突破性探测器预测是否会危及模型,只有两者都为正时才拒绝输入。
  • �� 离线阶段,利用突破性探测器的预测结果,评估指令模板的鲁棒性,形成指令鲁棒性得分(IRS),指导实际部署。

实验设计

  • �� 采用六个开源大模型(如GPT-2、LLaMA等)和四个任务(文本生成、问答、摘要、对话)进行验证。
  • �� 构建多样化攻击集,包括普通、优化(GCG、AutoDAN)和自适应攻击。
  • �� 评估指标包括注入检测的AUROC、F1,误拒率FPR-S,攻击成功率(ASR)等。
  • �� 进行消融实验验证两个探测器的贡献和参数敏感性,调优阈值以平衡检测率与误拒率。

结果分析

  • �� 在六个模型和多任务上,BASIS实现了AUROC > 0.99,FPR-S降低约30%,显著优于传统检测方法。
  • �� 攻击成功率从未防御时的50%降至10%以下,验证了强鲁棒性。
  • �� 离线指令鲁棒性得分与实际攻击成功率高度相关,说明该指标可作为指令设计的量化工具。

应用场景

  • �� 适用于企业级大模型部署,提升模型在敏感场景下的安全性,减少误判和误拒。
  • �� 可结合模型微调、指令优化,增强模型对恶意输入的抵抗能力,为自动化安全检测提供基础。

局限与展望

  • �� 依赖prefill阶段的注意力信号,模型或任务变化可能影响效果。
  • �� 训练样本需求大,面对极端攻击策略仍存在一定风险。
  • �� 计算成本较高,需优化特征提取和模型调优策略。

通俗解读 非专业人士也能看懂

想象一个工厂里有很多工人(模型),他们每天都在按照指令(任务)工作。有时候,有坏人偷偷把一些恶意的指令放到工厂的材料里(输入数据),试图让工厂做出错误的产品(输出)。传统的方法就像是工厂的安全检查员,只会看到材料里有没有坏指令,一旦发现就拒绝材料,但有时候这些坏指令很巧妙,工厂还是会被误导,或者安全检查太严格,误把正常材料也拒了。

这篇研究就像是给安全检查员配备了一个聪明的“眼睛”,可以在材料还没进入生产线时,观察到工人在处理材料时的注意力分布(注意力比例)。如果发现工人在关注恶意指令的部分,就会用两个聪明的“探测器”判断:第一个告诉你材料里是不是有坏指令,第二个告诉你这些坏指令会不会让工厂出错。只有两个都确认,才会拒绝材料。这样,既保证了安全,又不会误伤正常的材料,工厂的生产效率大大提高。

简单解释 像给14岁少年讲一样

想象你在学校里,有个老师会给你布置任务(指令),你需要按照老师的要求完成作业。有时候,坏人会偷偷在你的作业里放一些不好的内容(注入指令),想让你做错事。以前的安全措施就像是老师只看作业里有没有坏内容,一看到就不让你交作业,但有些坏人写得很巧妙,老师可能会误判,或者太严格,误伤好学生。

这篇文章介绍了一种聪明的方法,就像给老师装了个“眼睛”,可以在你写作业时观察你是否在关注那些不好的内容。老师会用两个“侦探”:一个告诉老师作业里是不是有坏内容,另一个判断这些坏内容会不会让你做错。只有两个都确认,老师才会不让你交作业。这样,既能保护你,又不会误伤好学生,让学习变得更公平、更安全。

术语表

Attention Competition Ratio (ρ) (注意力竞争比)

一种衡量模型不同attention头在instruction和data之间关注比例的指标,用于反映注入内容与正常内容的注意力竞争状态。技术上为最后一层的softmax归一化attention分布中的instruction和data部分的比值。

在论文中,ρ被用作特征输入到两个线性探测器,判断注入是否存在及其危害性。

Sparse Linear Probe (稀疏线性探测器)

一种线性分类器,利用弹性网正则化实现特征的稀疏选择,用于从模型内部的attention特征中提取关键指标,进行注入检测和危害预测。

本文中,两个探测器分别用于检测注入存在与否及其是否会导致模型被攻破。

FPR-S (误拒率)

衡量在包含注入但未被攻破的样本中被误判为攻破的比例,反映误拒安全样本的风险。

在实验中,FPR-S显著低于传统检测方法,说明误拒率降低,有助于提升模型实用性。

Instruction Robustness Score (指令鲁棒性得分, IRS)

离线指标,基于突破性探测器的预测结果,量化指令模板在特定模型上的安全性,为指令设计优化提供依据。

论文中,IRS与实际攻击成功率高度相关,验证其作为指令安全评估工具的有效性。

开放问题 这项研究留下的未解疑问

  • 1 当前方法主要依赖prefill阶段的注意力信号,未来需探索多模态特征和动态调整机制以应对更复杂的攻击场景。
  • 2 模型在极端攻击策略下的鲁棒性仍有待提升,特别是在少量样本或新颖攻击手段出现时的适应能力。
  • 3 如何在多任务、多模型环境中保持一致的检测效果,以及降低训练和推理的计算成本,是未来研究的重要方向。

应用场景

近期应用

企业模型安全部署

在企业内部部署大模型时,利用BASIS进行实时注入检测和危害预测,减少误判,提高系统安全性,确保敏感场景下的模型可靠运行。

指令模板优化

通过离线评估指令模板的鲁棒性,优化指令设计,提升模型对潜在注入攻击的抵抗能力,降低安全风险。

远期愿景

智能安全防护体系

结合多模态信息和强化学习,构建动态适应的安全防护系统,实现对复杂、多变攻击的实时检测与响应,推动大模型安全的智能化发展。

原文摘要

Prompt injection is a critical security threat in large language model (LLM) applications, where attackers hijack model behavior by embedding malicious instructions in user or external data. Existing detection methods only detect the presence of injection and refuse to respond upon detection, overlooking the fact that for many modern aligned models, well-crafted instructions can resist most injection attacks. This means that the injection robustness varies significantly across instructions and models. This leads to widespread unnecessary over-refusal: inputs containing injections that the model could have handled correctly are rejected incorrectly. To deal with this over-refusal issue, we propose BASIS (Robustness-Aware Prompt Injection Defense). This defense method uses the Attention Competition Ratio ($ρ$) as features to train two sparse linear probes: an existence probe and a breach probe. Both probes make defense decisions through cascaded gating, which does not require additional LLM inference. BASIS comprises three stages: injection existence detection, per-sample breach prediction, and instruction robustness assessment; the online cascade refuses only when the model would actually be compromised and thus avoids over-refusal on robust instructions. Experiments across four tasks and six open-source LLMs show that BASIS maintains near-perfect injection detection while substantially reducing over-refusal on safe attack samples, especially under robust instruction templates.

cs.CR cs.LG