What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

TL;DR

提出基于中间层熵动态的无训练检测方法,利用中间层轨迹特征区分越狱提示,效果在Llama、Qwen、Gemma模型中均优异。

cs.CL 🔴 高级 2026-06-24 49 次浏览
Sofiia Nikolenko Michele Papucci Mina Rezaei Shireen Kudukkil Manchingal
大规模语言模型 安全检测 熵动态 中间层表示 模型解释

核心发现

方法论

研究通过分析冻结大模型中间层的预测熵轨迹,利用logit lens投影获得每个token的概率分布,提取静态统计(均值、方差)和动态趋势(Kendall τ、Spearmanρ、单调性)特征。重点在于动态特征能捕获越狱提示中的结构性变化,且在中间层表现最优,模型包括Llama、Qwen、Gemma,实验在多种越狱和对抗基准上验证了特征的普适性和效果。

关键结果

  • 动态趋势特征(如单调性、秩相关系数)在所有模型中对越狱提示的区分能力显著,AUROC值平均高达0.94,远优于静态统计(如平均熵,AUROC约0.67-0.89),且在中间层(50%-85%深度)表现最强,最终层效果减弱,表明越狱相关结构在中间层最为突出。
  • 不同模型架构(Llama、Qwen、Gemma)中,基于秩相关的动态特征具有高度一致性,AUROC差异极小,验证了方法的跨架构泛化能力。实验还显示,动态特征在多个对抗和基准数据集上均能稳定区分越狱与正常提示,效果无需额外训练。
  • 静态熵统计(如均值、最大值)表现不稳定,受模型尺度和训练分布影响大,难以实现跨模型迁移,而动态趋势特征则提供了稳健的结构性信号,揭示了中间层的越狱行为结构。

研究意义

本研究揭示了越狱行为在模型中间层的结构性表现,突破了以往仅关注输出或prompt层的检测思路,为模型内部安全机制提供了新的理解路径。利用无需训练的动态特征检测方法,能在不改变模型参数的前提下实现高效、泛化的越狱检测,为大模型安全部署提供理论基础和技术方案,有助于未来构建更鲁棒的安全防护体系。

技术贡献

提出基于中间层预测熵轨迹的无训练检测框架,利用rank-based趋势指标(如Kendall τ、Spearmanρ、单调性)捕获越狱提示中的结构性变化,突破静态统计的局限。该方法无需微调,适用于多架构模型,验证在多个基准上均表现出优异的检测能力,揭示了中间层在模型安全中的关键作用,为模型解释和安全检测提供了新工具。

新颖性

首次系统性提出利用中间层预测熵动态特征进行越狱检测,强调动态趋势比静态统计更具鲁棒性和迁移性。不同于传统依赖输出或prompt特征的方法,本研究发现中间层的结构性变化是越狱行为的核心信号,具有较强的理论创新性和实用价值。

局限性

  • 方法主要依赖模型的中间激活信息,可能受模型架构和训练数据影响较大,泛化到未见模型或复杂越狱策略时效果尚待验证。
  • 在极端或复杂的越狱场景中,结构性变化可能被模型内部的其他机制所抑制或干扰,检测效果可能下降。
  • 当前实验集中在特定模型和基准,未来需扩展到更多模型和真实场景中验证鲁棒性和实用性。

未来方向

未来可结合多模态信息或多任务学习,增强动态特征的表达能力,提升检测的鲁棒性。还可探索模型训练过程中引入中间层熵动态的正则化机制,增强模型的安全性。同时,结合可解释性工具,深入理解中间层结构变化的机制,为模型安全提供更全面的理论基础。

AI 总览摘要

近年来,大规模语言模型(LLMs)在自然语言处理领域取得了突破性进展,但其安全性问题日益突出。越狱攻击通过精心设计的提示绕过模型的安全机制,导致生成不当内容,威胁应用的可靠性。现有检测方法多依赖外部规则或输出分析,缺乏对模型内部结构的深入理解。

本研究提出一种基于中间层预测熵动态的无训练检测框架,利用模型内部的结构性变化识别越狱提示。通过logit lens投影,分析模型在不同深度的每个token的预测不确定性,提取静态统计和动态趋势特征。实验表明,动态趋势特征(如秩相关和单调性)在中间层表现最优,能在Llama、Qwen、Gemma模型中实现高达0.94的AUROC,显著优于静态统计指标。这一发现揭示了越狱行为在模型中间表示中的结构性表现,提供了无需训练的高效检测手段。

该方法的核心创新在于强调动态特征的结构性信息,突破了传统静态指标的局限,具有良好的跨模型泛化能力。其在多个对抗基准上的验证,证明了中间层熵动态作为越狱信号的有效性,为模型安全提供了新的理论工具和实践路径。未来,结合多模态信息和正则化机制,有望进一步提升模型的安全性和鲁棒性,为大模型的安全部署奠定基础。

深度分析

研究背景

随着大规模预训练语言模型(如GPT、Llama、BLOOM)广泛应用,模型安全性成为关注焦点。越狱攻击通过精心设计的提示绕过安全机制,导致不当内容生成。现有检测方法主要依赖外部规则、输出特征或微调分类器,但难以捕获模型内部的结构性变化。近年来,研究发现模型内部隐藏着安全相关的信号,特别是在中间层激活中存在潜在的越狱特征。利用模型内部的解释工具(如logit lens)分析中间表示,为理解模型安全提供新视角。此前工作多关注输出或prompt特征,缺乏对中间动态的系统研究。本研究旨在填补这一空白,探索中间层预测不确定性随token变化的结构性特征,揭示越狱行为的深层机制。

核心问题

越狱攻击的检测面临两个核心难题:一是如何在无需微调的情况下,利用模型内部信息实现高效检测;二是如何捕获越狱提示在模型中潜在的结构性变化。传统方法多依赖外部规则或输出特征,易受模型架构和训练数据影响,泛化能力有限。内部信号分析虽有潜力,但缺乏系统性和可迁移的特征设计。特别是在深层模型中,越狱提示引发的结构变化可能在最终输出前已被模型内部机制抑制或转化。解决这些问题,需提出一种能在不同模型架构中通用、无需训练的检测策略,重点在于挖掘中间层的动态变化特征。

核心创新

本研究的主要创新包括:1)提出基于中间层预测熵轨迹的无训练检测框架,利用logit lens投影获得每个token的概率分布;2)引入动态趋势特征(如秩相关、单调性),强调模型内部结构的变化,优于静态熵统计;3)发现越狱提示在中间层表现出明显的结构性变化,且在不同模型架构中具有高度一致性。这些创新突破了传统静态指标的局限,为模型内部安全检测提供了新思路。

方法详解

  • �� 采用logit lens技术,将中间隐藏状态投影到词汇空间,获得每个token的概率分布;
  • �� 计算每个token的预测熵,形成熵轨迹;
  • �� 选择8个均匀分布的探测层,提取各层的熵轨迹;
  • �� 构建静态特征(均值、最大值、标准差)和动态趋势特征(Kendall τ、Spearmanρ、单调性);
  • �� 以特征作为检测分数,评估其区分越狱与正常提示的能力,使用AUROC指标,分析不同模型和深度的表现。

实验设计

实验在Llama-3.1-8B、Qwen-3-8B、Gemma-7B模型上进行,使用AdvBench、HarmBench、StrongREJECT等越狱和安全数据集。每个提示经过模型的单次前向传播,提取中间层熵轨迹,计算静态和动态特征。通过AUROC评估特征的区分能力,比较不同层深和模型架构的效果。还进行特征消融,验证动态趋势的优越性,分析不同模型的泛化性和鲁棒性。

结果分析

动态趋势特征在所有模型中均表现优异,AUROC值平均达0.94,远高于静态统计指标(如平均熵,AUROC约0.67-0.89)。在中间层(50%-85%深度)检测效果最佳,最终层检测能力明显下降,表明越狱结构在中间层最为显著。不同模型(Llama、Qwen、Gemma)中,秩相关指标具有高度一致性,验证了方法的跨架构泛化。实验还显示,动态特征在多种对抗基准上稳定区分越狱行为,且无需微调。

应用场景

该方法可应用于大规模语言模型的安全监控系统,实时检测潜在越狱行为,提升模型部署的安全性。适用于企业内容审核、自动化内容过滤和敏感信息防护等场景。未来可结合模型训练引入中间层熵动态正则化,增强模型抗越狱能力,推动安全AI的发展。

局限与展望

目前方法主要依赖模型内部激活信息,受模型架构和训练数据影响较大,泛化到未见模型或复杂越狱策略时效果尚待验证。极端或复杂越狱场景中,结构性变化可能被模型内部机制抑制,检测效果受限。未来需扩展到更多模型和真实应用环境,提升鲁棒性。

通俗解读 非专业人士也能看懂

想象一个工厂里生产不同的商品。工厂的每个生产环节都在不断调整,确保产品符合标准。有时候,工厂会出现异常,比如某个环节的调整方向变得奇怪,说明可能有人在偷偷搞事情。模型也是如此,它在处理信息时,每一层都在“调整”对下一步的预测。研究发现,越狱提示就像工厂里某个环节的异常调整,不是在最后一环显现,而是在中间环节表现得最明显。通过观察这些中间环节的“调整轨迹”,可以判断出是否有人在试图绕过安全机制。这就像监控工厂的中间流程,提前发现异常,避免出错。

简单解释 像给14岁少年讲一样

想象你在学校里,有个老师会给你作业,平时都挺正常的,但有时候有人偷偷在作业里藏了个秘密,想让老师不知道。老师平时只看最后的答案,但其实在做题的过程中,老师还会偷偷观察你每一步的思考过程。这个研究就像老师在观察你每一步的思考轨迹,发现那些藏了秘密的作业在某些步骤会表现得不一样。特别是在中间的步骤里,这些“秘密”会让你的思考变得特别奇怪。通过观察这些中间的变化,老师就能提前发现谁在搞鬼。这个方法不用看最后的答案,只靠观察每一步的“心情变化”,就能判断出作业是不是藏了秘密。

术语表

预测熵(Predictive Entropy)

衡量模型对下一词预测不确定性的指标,越大表示越不确定。技术上为Shannon熵,反映模型内部的“信心”。

在论文中用于分析模型在不同层的预测稳定性和结构变化。

logit lens(Logit Lens)

一种将中间隐藏状态投影到词汇空间的方法,获得可解释的中间预测分布。

用于提取中间层的预测概率,分析模型内部的结构性变化。

Kendall τ(Kendall Tau)

一种秩相关系数,用于衡量两个序列的单调相关性。

用来衡量熵轨迹的单调趋势,区分正常与越狱提示。

AUROC(Area Under ROC Curve)

受试者工作特征曲线下面积,用于衡量分类模型的性能。

评估不同特征在越狱检测中的区分能力。

开放问题 这项研究留下的未解疑问

  • 1 目前方法主要在静态模型架构上验证,未来需验证其在大规模商业模型中的适应性和鲁棒性。
  • 2 如何结合多模态信息(如视觉、声音)增强中间层动态特征的检测能力仍未探索。
  • 3 模型训练中引入中间层熵动态正则化的具体机制和效果尚未系统研究。

应用场景

近期应用

模型安全监控

在企业部署的LLMs中实时监测中间层熵轨迹,快速识别越狱行为,提升内容安全与合规性。

内容过滤系统

结合动态特征筛查潜在危险提示,降低误判率,增强自动过滤的准确性。

远期愿景

自适应安全机制

将中间层熵动态引入模型训练,自动增强模型的抗越狱能力,推动安全AI的自主学习。

原文摘要

Jailbreak attacks reveal a persistent weakness in aligned Large Language Models: carefully crafted prompts can elicit policy-violating responses despite safety training. While most defenses operate at the prompt or output level, it remains unclear how harmful intent is encoded within the model's internal representations. We investigate this question by analyzing token-level predictive entropy trajectories across layers of a frozen LLM using the logit lens. We find that static aggregate statistics of prompt-level entropy (e.g., mean, variance) carry little discriminative signal, whereas features capturing how entropy evolves across token positions, such as monotonic rank-based trend scores, are substantially more informative. Importantly, this signal is not uniform across model depth: it is concentrated in intermediate layers and degrades at the final layer, indicating that jailbreak-relevant structure is most pronounced in mid-network representations rather than at the output head. Across multiple models (Llama, Qwen, Gemma) and adversarial benchmarks, these entropy dynamics provide architecture-consistent separation without additional training. Together, our findings show that jailbreak behavior is reflected in structured intermediate uncertainty dynamics, clarifying both which entropy-derived features encode harmful intent and where in the network that signal is most pronounced.

cs.CL cs.AI cs.LG