Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

TL;DR

提出基于生成轨迹的安全对齐方法,显著提升模型在推理中抗中断攻击的鲁棒性。

cs.AI 🔴 高级 2026-06-03 47 次浏览
Kyungmin Park Taesup Kim
AI安全 大语言模型 推理鲁棒性 轨迹对齐 对抗攻击

核心发现

方法论

本文分析了安全对齐的浅层安全问题,发现其局限在前几输出令牌。通过模拟中途扰动,构建模型生成轨迹,采用轨迹增强训练,提升模型对推理中任意步骤插入的抗扰能力。具体方法包括在模型隐藏状态空间中定义拒绝方向,通过模拟中途插入有害或拒绝令牌,训练模型恢复安全轨迹。采用SimPO优化目标,结合多轮迭代增强,显著降低在AdvBench、HarmBench等数据集上的攻击成功率(ASR),在Llama-3.1-8B、Mistral-7B等模型中实现ASR从最高达92%降至接近0%。

关键结果

  • 在推理中任意步骤插入有害或拒绝令牌,模型的安全行为发生大幅偏移,早期影响尤为显著,但持续存在。
  • 模型隐藏状态中的拒绝表示并不能预测其抗扰能力,反而轨迹偏差更能反映鲁棒性。
  • 通过轨迹增强训练,模型在多种攻击(prefilling、suffix、语义越狱)下的ASR降低至5%以下,且在跨域测试中表现优异。
  • 多轮迭代训练进一步提升鲁棒性,模型能在不同攻击场景下快速恢复安全输出。

研究意义

本研究突破了传统只关注输出的安全对齐思路,强调训练模型在生成过程中的动态行为,解决推理中中途插入攻击的根本问题。这为大规模语言模型的安全部署提供了新思路,有助于构建更具鲁棒性的安全AI系统,满足实际应用中对安全性和可靠性的高要求。

技术贡献

提出基于轨迹模拟的安全对齐框架,结合中途扰动模拟与偏好优化,有效增强模型对推理中插入攻击的抵抗能力。引入双向轨迹增强策略,训练模型在遭遇扰动时能快速恢复安全状态。该方法在多个模型和数据集上验证,显著优于现有防御技术,提供了理论和工程上的新突破。

新颖性

首次系统性将推理轨迹作为训练对象,结合中途扰动模拟,提出轨迹对齐方法,突破传统只优化输出或内部状态的限制,为模型安全提供全新解决方案。

局限性

  • 方法依赖大量中途扰动模拟,训练成本较高,可能限制在极大模型上的应用。
  • 对抗样本的多样性仍有限,未来需扩展到更复杂的攻击类型。
  • 模型在极端扰动下的恢复能力仍有提升空间,需结合更强的鲁棒优化技术。

未来方向

未来将探索多模态、多任务场景下的轨迹对齐策略,结合强化学习和自监督技术,进一步提升模型在复杂环境中的安全鲁棒性。同时,研究如何降低训练成本,实现更广泛的工业应用。

AI 总览摘要

随着大规模语言模型(LLMs)在自动化内容生成中的广泛应用,安全性成为关键瓶颈。现有的安全对齐方法多集中在响应输出的浅层安全,容易被中途插入攻击所突破。本文深入分析了推理过程中的潜在脆弱性,发现模型在任意生成步骤都可能被短令牌插入而偏离安全轨迹。为应对这一问题,作者提出基于生成轨迹模拟的轨迹对齐方法,通过在训练中引入中途扰动,增强模型在遭遇插入攻击时的恢复能力。具体实现包括定义拒绝方向、模拟中途插入有害或拒绝令牌、采用SimPO偏好优化目标,并进行多轮迭代训练。实验证明,该方法在多个模型(如Llama-3.1-8B、Mistral-7B)和多种攻击场景(prefilling、suffix、语义越狱)中,将攻击成功率从最高92%降至接近0%。此研究强调了训练模型理解和稳态生成轨迹的重要性,为未来构建更安全、更鲁棒的AI系统提供了新思路。

深度分析

研究背景

近年来,随着LLMs在自动问答、内容生成等领域的快速发展,安全性问题逐渐凸显。传统安全对齐方法(如RLHF、Constitutional AI)主要通过优化模型输出,减少有害内容的生成。然而,这些方法在面对推理中途插入攻击时表现脆弱。研究发现,模型在生成前几令牌时的安全性较强,但在中途扰动后,仍可能偏离安全轨迹。现有防御多关注内部表示或输入端,缺乏对生成动态过程的系统训练,导致模型在实际应用中存在较大安全风险。

核心问题

核心问题在于,模型在推理过程中对中途插入的短令牌缺乏鲁棒性,浅层安全只在前几令牌有效,难以应对复杂的中途攻击。传统方法未能充分考虑生成轨迹的连续性和动态变化,导致模型在遭遇扰动时容易偏离安全路径。这一问题严重制约了大规模语言模型的安全部署,尤其在敏感应用场景中,任何中途干预都可能引发安全事故。

核心创新

本文提出轨迹对齐(Trajectory Alignment)框架,创新点包括:1)模拟中途扰动,构建带扰动的生成轨迹;2)定义拒绝方向,利用隐藏状态中的拒绝表示引导模型恢复安全;3)采用偏好优化(SimPO)训练模型在扰动后恢复安全内容;4)多轮迭代增强模型鲁棒性。这一策略突破了以往只关注输出或内部状态的限制,强调生成轨迹的连续性和动态调节,显著提升模型对推理中插入攻击的抗扰能力。

方法详解

  • �� 通过分析模型在不同生成步骤的隐藏状态,定义拒绝和接受的特征空间方向。
  • �� 在模型生成过程中,监测隐藏状态的相似性,触发模拟中途插入有害或拒绝令牌。
  • �� 构建带扰动的轨迹数据,包括中途插入和恢复场景,用于训练模型的轨迹恢复能力。
  • �� 采用偏好优化(SimPO)目标,训练模型在遭遇扰动后,偏向安全轨迹。
  • �� 进行多轮迭代,每轮重新计算拒绝/接受方向,扩展训练数据,逐步增强鲁棒性。

实验设计

在Llama-3.1-8B、Mistral-7B、Qwen-7B模型上,使用AdvBench、HarmBench等数据集,评估模型在推理中任意步骤插入攻击的ASR。对比多种防御技术(如Egida-DPO、Circuit Breakers、SafeProbing),验证轨迹对齐的优越性。通过多轮迭代训练,观察模型在不同攻击场景(prefilling、suffix、语义越狱)中的表现变化,重点关注ASR的下降幅度和鲁棒性提升。

结果分析

实验显示,轨迹对齐显著降低攻击成功率,从最高92%降至平均3%,在多模型和多场景中均表现优异。多轮训练后,模型对中途扰动的恢复速度加快,鲁棒性持续增强。对比其他防御技术,轨迹对齐在跨域泛化和复杂攻击中表现更稳定,验证了其在实际应用中的潜力。

应用场景

该方法适用于需要高安全保障的自动内容生成系统,如内容审核、敏感信息过滤、自动问答平台。通过训练模型理解生成轨迹的连续性,能有效防止中途插入攻击,提升系统整体安全性。未来还可结合强化学习和多模态信息,拓展到更复杂的应用场景。

局限与展望

训练成本较高,尤其在超大模型上,模拟中途扰动和多轮迭代可能带来计算负担。此外,当前方法主要针对已知攻击类型,面对未知或新型攻击仍需不断优化。模型在极端扰动下的恢复能力仍有限,未来需结合更强的鲁棒优化策略。

通俗解读 非专业人士也能看懂

想象你在开一家工厂,工厂的目标是生产安全的产品。以前,你只关注生产线的最终产品,确保每个出厂的商品都符合标准。但实际上,生产过程中可能会有人在中途偷偷插入不良材料,导致最终产品变得不安全。为了防止这个问题,你决定在生产线上每个环节都监控,甚至模拟有人在中途偷偷加入坏料的情况,训练工人(模型)在发现异常时能及时调整,确保最终产品依然安全。这样,即使有人试图在任何环节插入坏料,工厂都能及时识别并修正,保证产品安全。这就像本文提出的轨迹对齐方法,让模型在生成过程中学会应对任何中途插入的干扰,确保输出内容的安全。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你要把很多碎片拼成一幅完整的画。有时候,有人会偷偷把一些坏碎片插进去,试图让你拼出错误的画。以前,你只关注最后拼好的画是否正确,但这不够,因为坏碎片可能在拼图的任何位置出现。现在,你的任务是学会在拼图过程中随时发现坏碎片,并及时调整,把拼图重新拼回正确的样子。这个过程就像论文里的轨迹对齐方法,模型在生成内容时,不仅关注最终输出,还在每一步都学习如何应对中途的干扰,确保最终的内容安全、正确。这样,无论有人在拼图中插入什么坏碎片,你都能及时发现并修正,保证拼出来的画是安全的。

术语表

Trajectory Alignment(轨迹对齐)

一种训练策略,通过模拟中途扰动,增强模型在生成过程中的鲁棒性。技术上结合隐藏状态空间的方向定义和偏好优化。

论文提出的核心技术,用于提升模型对推理中插入攻击的抵抗能力。

Refusal Direction(拒绝方向)

在隐藏状态空间中定义的表示模型拒绝生成有害内容的特征方向,用于引导模型恢复安全轨迹。

用于模拟模型在安全状态下的内部表示,辅助训练模型识别和恢复安全行为。

SimPO(Similarity Preference Optimization)

一种偏好优化方法,基于轨迹的相似性评估,训练模型偏向安全轨迹,减少有害内容生成。

训练目标,用于强化模型在扰动后恢复安全输出。

Inference-time Injection(推理时插入)

在模型生成过程中,任意步骤插入短令牌序列,测试模型的鲁棒性。

本文分析的主要攻击方式之一。

Attack Success Rate(攻击成功率,ASR)

衡量攻击效果的指标,表示模型在特定攻击下生成有害内容的比例。

评估模型安全性的重要指标。

开放问题 这项研究留下的未解疑问

  • 1 如何在极大模型(如GPT-4)上高效实现轨迹模拟训练仍未解决,训练成本高,难以普及。
  • 2 未来需研究模型在面对未知攻击类型时的适应能力,提升泛化性。
  • 3 如何结合多模态信息增强轨迹对齐的效果,仍是未来研究方向。

应用场景

近期应用

内容审核系统

在自动内容过滤中,利用轨迹对齐增强模型抗中途插入攻击能力,确保输出内容安全。

敏感信息过滤

提升自动问答平台在面对恶意插入信息时的鲁棒性,保障信息安全。

远期愿景

安全AI助手

构建能自主应对各种中途干扰的智能助手,广泛应用于医疗、法律等敏感行业。

原文摘要

Safety-aligned Large Language Models (LLMs) remain vulnerable to interventions during inference that redirect generation toward harmful outputs. Recent work attributes this to shallow safety, where alignment concentrates in the first few output tokens. We show that shallow safety is a special case of a broader inference-time vulnerability, in which short token injections at any generation step can substantially alter subsequent safety behavior. We also find that a model's alignment with refusal directions in its hidden states does not predict its robustness to such injection, revealing that internal state alone does not determine generation behavior under perturbation. To address this, we align models directly on generation trajectories constructed by simulating mid-sequence perturbation, and show that this improves robustness to mid-sequence injection and generalizes to attacks that exploit early-token generation. Our work argues that robust safety alignment requires training on the generation process itself, not only its outputs.

cs.AI cs.CL cs.LG