Bait-and-Recover: Poisoning Internal Refusal Signals to Defend LLMs against White-Box Editing Jailbreaks

TL;DR

Bait-and-Recover方法通过诱饵和恢复适配器提高LLMs拒绝率至71.75%。

cs.CR 🔴 高级 2026-09-05 5 次浏览
Tian Gao Zhipeng Xie Yuhao Wu Junhua Liu Xin Fang
大语言模型 白盒攻击 安全防护 权重编辑 拒绝信号

核心发现

方法论

Bait-and-Recover方法在模型的权重层面进行防御,通过在攻击者读取激活的地方放置诱饵适配器,并在后续层放置恢复适配器,利用梯度路由训练,解耦观察路径和行为路径。通过主动破坏用于测量的残差信号,扰乱攻击者的编辑搜索,同时恢复层恢复下游计算。

关键结果

  • 在四个开放权重模型中,防御将白盒编辑搜索下的最低拒绝率从16.25%提高到71.75%,在严格的行为保持预算下(KL <= 0.10),对通用基准的影响可以忽略不计。
  • Heretic攻击的最小拒绝率在KL <= 0.10预算下提高了55.50个百分点。
  • 在KL <= 0.20预算下,防御的最小拒绝率为65.25,仍比基线高出55.25个百分点。

研究意义

该研究通过在模型权重中嵌入防御机制,提供了一种有效的白盒攻击防御策略,显著提高了模型的安全性。它不仅提高了拒绝率,还保持了模型的通用能力,填补了现有安全机制的空白。

技术贡献

Bait-and-Recover方法通过诱饵和恢复适配器的设计,实现了观察路径和行为路径的解耦,提供了一种新的权重级别的防御策略。这种方法在不影响模型通用能力的情况下,提高了对Heretic攻击的防御能力。

新颖性

该方法首次通过诱饵和恢复适配器的组合,主动破坏攻击者的测量假设,提供了一种新的防御思路,与现有的行为级别安全训练互为补充。

局限性

  • 在某些复杂的攻击场景下,该方法可能无法完全防御,尤其是当攻击者能够绕过诱饵信号时。
  • 对计算资源有一定要求,可能不适用于资源受限的环境。

未来方向

未来的研究可以探索如何进一步优化诱饵和恢复适配器的设计,以提高防御的鲁棒性和效率。同时,可以研究该方法在不同类型模型中的适用性。

AI 总览摘要

大语言模型(LLMs)的开放权重使其易受白盒攻击,攻击者可以通过编辑投影矩阵来抑制安全对齐。现有的安全机制大多集中在行为输出上,而忽视了内部拒绝信号的保护。

Bait-and-Recover方法通过在模型的权重层面进行防御,放置诱饵适配器和恢复适配器,利用梯度路由训练,解耦观察路径和行为路径。通过主动破坏用于测量的残差信号,扰乱攻击者的编辑搜索,同时恢复层恢复下游计算。

实验结果表明,该方法在四个开放权重模型中,将白盒编辑搜索下的最低拒绝率从16.25%提高到71.75%,在严格的行为保持预算下(KL <= 0.10),对通用基准的影响可以忽略不计。这种防御策略不仅提高了模型的安全性,还保持了模型的通用能力,填补了现有安全机制的空白。未来的研究可以探索如何进一步优化该方法的设计,以提高防御的鲁棒性和效率。

深度分析

研究背景

随着大语言模型(LLMs)的发展,开放权重的发布为模型的安全对齐提供了透明性,但同时也暴露了其对抗性权重编辑的风险。现有的安全机制大多集中在行为输出上,而忽视了内部拒绝信号的保护。

核心问题

白盒攻击者可以通过读取模型的内部计算,估计拒绝方向,并搜索投影矩阵编辑来抑制安全对齐。这种攻击方法成本低且广泛适用,现有的安全机制难以有效防御。

核心创新

Bait-and-Recover方法通过在模型的权重层面进行防御,放置诱饵适配器和恢复适配器,利用梯度路由训练,解耦观察路径和行为路径。通过主动破坏用于测量的残差信号,扰乱攻击者的编辑搜索。

方法详解

  • �� 在攻击者读取激活的地方放置诱饵适配器
  • �� 在后续层放置恢复适配器
  • �� 利用梯度路由训练,解耦观察路径和行为路径
  • �� 主动破坏用于测量的残差信号,扰乱攻击者的编辑搜索
  • �� 恢复层恢复下游计算

实验设计

实验在四个开放权重模型上进行,使用Heretic攻击进行评估。防御将白盒编辑搜索下的最低拒绝率从16.25%提高到71.75%,在严格的行为保持预算下(KL <= 0.10),对通用基准的影响可以忽略不计。

结果分析

实验结果表明,Bait-and-Recover方法显著提高了模型的拒绝率,尤其是在KL <= 0.10预算下,拒绝率提高了55.50个百分点。该方法在保持模型通用能力的同时,提高了对Heretic攻击的防御能力。

应用场景

该方法可以直接应用于开放权重的大语言模型,以提高其对白盒攻击的防御能力。它可以在发布模型权重之前嵌入防御机制,从而提高模型的安全性。

局限与展望

尽管该方法在实验中表现出色,但在某些复杂的攻击场景下可能无法完全防御,尤其是当攻击者能够绕过诱饵信号时。此外,对计算资源有一定要求,可能不适用于资源受限的环境。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,Bait-and-Recover方法就像在锅里放了一些特殊的香料(诱饵适配器),这些香料会让尝试偷看你食谱的人(攻击者)闻到一种错误的味道。同时,你在锅的另一边放了一些调味料(恢复适配器),确保最终的菜肴味道如常。这种方法通过让攻击者闻到错误的味道,扰乱他们的判断,同时确保你的菜肴味道不变。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个游戏,有个坏蛋总是想偷看你的策略。Bait-and-Recover方法就像是你在游戏里放了一个假线索,让坏蛋误以为他知道你的计划,但实际上他被误导了。同时,你还有一个秘密武器,确保你的真正计划不受影响。这就是这个方法的神奇之处!

术语表

白盒攻击 (White-box Attack)

攻击者可以完全访问模型的内部结构和参数,进行针对性的攻击。

在论文中,白盒攻击指的是攻击者可以读取模型的内部计算,进行投影矩阵编辑。

诱饵适配器 (Bait Adapter)

一种放置在模型层中的适配器,用于干扰攻击者的测量信号。

诱饵适配器通过在攻击者读取激活的地方放置,主动破坏用于测量的残差信号。

恢复适配器 (Recovery Adapter)

一种放置在模型后续层中的适配器,用于恢复下游计算。

恢复适配器在诱饵适配器之后放置,确保模型的正常计算不受影响。

梯度路由 (Gradient Routing)

一种训练方法,通过控制梯度的流动,实现不同路径的解耦。

梯度路由用于训练诱饵和恢复适配器,解耦观察路径和行为路径。

拒绝信号 (Refusal Signal)

模型内部用于区分有害和无害提示的信号方向。

拒绝信号是攻击者试图估计和编辑的目标,以抑制模型的安全对齐。

开放问题 这项研究留下的未解疑问

  • 1 如何在资源受限的环境中有效应用Bait-and-Recover方法?
  • 2 在更复杂的攻击场景下,该方法的防御效果如何?
  • 3 如何进一步优化诱饵和恢复适配器的设计?

应用场景

近期应用

开放权重模型防御

在发布模型权重之前嵌入防御机制,提高模型对白盒攻击的防御能力。

远期愿景

通用安全机制

开发一种通用的安全机制,适用于各种类型的模型和攻击场景,提高整体模型安全性。

原文摘要

Open-weight large language models face a low-cost white-box threat from representation engineering attacks. Attackers can estimate refusal directions and search for projection-matrix edits that suppress safety alignment while preserving general capabilities, within minutes on a single GPU and without gradient-based training. We propose Bait-and-Recover, a weight-level defense that places a bait adapter where attackers read activations and a paired recovery adapter at the subsequent layer. Trained via gradient routing, this decouples the observation path from the behavior path. By actively poisoning the residual signal used for measurement, Bait-and-Recover disrupts the attacker's edit search, while the recovery layer restores clean downstream computation. Across four open-weight models, our defense raises the minimum refusal rate against white-box edit searches from 16.25% to 71.75% under a strict behavior-preservation budget (KL <= 0.10), with negligible impact on general benchmarks. By invalidating the core measurement assumption of these attacks, observation-path poisoning offers a practical complement to behavior-level safety training.

cs.CR cs.AI cs.CL