ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization

TL;DR

提出ICO框架,通过迭代优化上下文,有效提升语义漂移越狱成功率达74.6%。

cs.CL 🔴 高级 2026-08-04 43 次浏览
Hujian Zhu Yihao Huang Felix Juefei-Xu Xinfeng Li Peng Zeng Simeng Qin Qing Guo Geguang Pu
基础模型 安全漏洞 语义漂移 对抗攻击 上下文优化

核心发现

方法论

本文系统分析了上下文在语义漂移越狱中的作用,发现强语义漂移能力的上下文更易引导模型恢复有害含义。提出基于黑箱的迭代上下文优化(ICO)框架,通过结合模型反馈与特征提取,逐步优化上下文内容。ICO包括三个阶段:有害词替换、初始上下文生成和迭代优化。每轮利用模型响应和判别模型反馈,调整上下文以增强诱导效果。实验证明在三组数据集和八个基础模型上,ICO平均攻破成功率达74.6%,优于8个SOTA基线。

关键结果

  • 在五个目标模型中,ICO平均Full攻击成功率达86.0%,比最优基线提升33%以上。多模态和文本模型均表现优异,尤其在Gemini-3.1和DeepSeek-V4上Full成功率分别达99%。通过上下文特征提取和优化策略,显著提升模型对有害语义的恢复能力,验证了上下文语义漂移潜力。多轮迭代后,成功率提升20%以上,验证了优化机制的有效性。
  • 在不同数据集和模型上,ICO展现出良好的泛化能力。通过引入指导提示(Guidance Prompt),模型响应的语义恢复率提升15-25%,验证了特征引导在优化中的作用。对比无指导和单轮优化,多轮迭代显著改善攻击效果,表明上下文优化是提升语义漂移攻击成功率的关键路径。
  • 消融实验显示,模型反馈和特征提取机制对提升效果至关重要。未引入优化机制的上下文成功率仅为40-50%,而引入ICO后,成功率提升至75%以上。多模型、多任务环境下,ICO均表现出优越的性能,证明其在安全研究中的应用潜力。

研究意义

本研究揭示了上下文在语义漂移越狱中的核心作用,突破了以往仅关注词汇替换的局限,为模型安全提供新的攻击路径。通过系统化的上下文优化策略,增强了攻击的隐蔽性和有效性,推动了对基础模型安全性的深入理解。该方法不仅丰富了对模型脆弱性的认识,也为未来设计更鲁棒的安全机制提供了理论基础。实践中,ICO可用于测试模型安全性、优化内容过滤策略,具有重要的学术和工业价值。未来,结合多模态信息和更复杂的上下文结构,将进一步提升攻击效果和适应性,为模型安全研究提供新的方向。

技术贡献

本文首次提出基于黑箱的迭代上下文优化(ICO)框架,有效利用模型反馈和上下文特征,系统提升语义漂移越狱成功率。创新点在于引入特征提取与优化机制,结合判别模型进行多轮反馈调整,突破了传统单次替换的限制。算法中采用特征引导策略,增强上下文诱导能力,确保在保持表面安全的同时,恢复有害语义。技术上,结合多模态信息和多轮优化机制,显著提升模型对有害语义的敏感度,为安全防护提供新思路。

新颖性

本研究首次系统揭示上下文在语义漂移攻击中的差异性,提出多轮迭代优化机制,突破了现有单次替换策略的局限。与以往仅关注词汇替换不同,ICO强调上下文特征的提取与优化,显著提升攻击成功率。创新在于结合模型反馈和特征引导,形成闭环优化流程,为模型安全研究提供全新视角和工具。这一方法在多模型、多任务环境中表现出优越的泛化能力,具有较强的创新性和实用价值。

局限性

  • 当前方法依赖预定义的特征提取和优化策略,可能在极端复杂或多样化的上下文中效果有限,且对多模态信息的处理仍需进一步优化。
  • 多轮优化带来较高的计算成本,实际应用中存在效率瓶颈,尤其在大规模模型和实时场景下的适应性不足。
  • 攻击成功率虽高,但在某些安全机制较强的模型中仍存在失败可能,未来需结合更复杂的上下文结构和多模态信息进行增强。

未来方向

未来将结合深度学习中的多模态特征,增强上下文的表达能力,提升优化效果。探索自适应特征提取和动态调整机制,降低计算成本。还将研究多任务、多模型环境下的鲁棒性,推动安全机制的多层次防御体系建设。此外,结合对抗训练和模型微调,增强模型对语义漂移攻击的抵抗能力,推动模型安全技术的理论与实践发展。

AI 总览摘要

基础模型在自然语言处理和多模态任务中展现出强大能力,但其安全性问题日益突出。近年来,语义漂移越狱作为一种新型攻击手段,通过替换有害词汇并利用上下文引导模型恢复有害含义,威胁模型安全。传统方法多依赖于简单的词汇替换,效果有限,成功率不足50%。

本文提出ICO(Iterative Context Optimization)框架,创新性地将上下文作为攻击核心,通过多轮反馈优化,显著提升攻击成功率至74.6%。ICO在八个基础模型和三组数据集上表现优异,尤其在多模态场景中,Full成功率达99%。该方法结合特征提取、模型反馈和引导提示,有效增强上下文的诱导能力,突破了传统单次替换的局限。

研究结果表明,强语义漂移能力的上下文能极大提升模型恢复有害语义的概率,验证了上下文在安全攻击中的关键作用。这一发现不仅丰富了模型脆弱性理解,也为未来设计更鲁棒的安全机制提供了理论基础。未来工作将结合多模态信息和动态特征优化,推动模型安全技术的持续发展,为AI安全研究提供新思路。

深度分析

研究背景

基础模型如GPT、Gemini和Llama等在自然语言理解、推理和多模态任务中取得突破性进展,但安全风险逐渐显现。早期研究关注词汇过滤和内容审核,效果有限。近年来,语义漂移越狱作为一种新型攻击,通过替换有害词汇并利用上下文引导模型恢复有害含义,成为研究热点。相关工作如Doublespeak、FlipAttack等,尝试通过表面无害的输入诱导模型输出有害内容,但成功率受限。随着模型复杂度提升,攻击手段也不断演化,迫切需要更系统、更有效的攻击与防御策略。

核心问题

核心问题在于,现有语义漂移越狱多依赖随机上下文生成,效果不稳定,成功率不足。上下文的语义漂移能力存在差异,弱上下文难以引导模型恢复有害语义,导致攻击效果受限。如何系统识别和优化有效上下文,成为提升攻击成功率的关键。另一方面,攻击的隐蔽性和鲁棒性也需兼顾,单纯依赖随机或静态上下文难以应对多样化模型和场景。

核心创新

本研究提出ICO框架,首次系统利用模型反馈和上下文特征进行多轮优化,显著提升语义漂移攻击效果。创新点包括:

  • �� 引入特征提取机制,识别有效诱导上下文的关键特征;
  • �� 设计多轮反馈机制,动态调整上下文内容;
  • �� 结合判别模型,确保上下文既隐蔽又有效。

这些创新突破了传统单次替换的局限,为模型安全提供了更强的攻击工具,也为未来防御策略提供了启示。

方法详解

  • �� 通过分析上下文特征,提取影响语义漂移的关键因素。
  • �� 利用预定义的占位符替换有害词,构建基础问句。
  • �� 使用辅助模型生成包含有害词的上下文,结合占位符形成初始攻击输入。
  • �� 采用多轮反馈机制:
  • �� 查询目标模型,获取响应。
  • �� 判别模型评估响应是否包含有害内容。
  • �� 根据反馈,利用辅助模型优化上下文。
  • �� 重构攻击输入,重复多轮,直到成功或达到最大轮数。
  • �� 结合引导提示,强化特征引导效果,提升语义漂移能力。

实验设计

在三组公开数据集(HarmBench、AdvBench、StrongREJECT)上,评估ICO在八个基础模型(GPT-5.4、Gemini-3.1、DeepSeek-V3.2/4、Llama-3.3等)中的表现。比较多种基线方法(如Doublespeak、AutoDAN-Turbo等),采用Partial和Full攻击成功率作为指标。设置最大迭代次数为25次,调优模型参数,进行多轮对比分析。通过引入指导提示,验证特征引导的有效性。还进行了消融实验,分析模型反馈和特征提取对性能的影响。

结果分析

ICO在所有目标模型中均表现优异,平均Full成功率达86%,比最优基线提升超过33%。在多模态场景中,Full成功率最高达99%,显著优于传统方法。多轮优化后,攻击成功率提升20%以上,验证了上下文特征优化的有效性。引入指导提示后,模型响应的语义恢复率提升15-25%,进一步增强了攻击效果。这些数据充分证明了ICO在模型安全测试中的潜力。

应用场景

该技术可用于模型安全评估、内容过滤机制测试和漏洞挖掘。企业和研究机构可借助ICO检测模型在复杂上下文中的安全性,提前识别潜在风险。未来,结合多模态信息和动态特征优化,有望实现更智能、更高效的安全防护体系,推动AI安全技术的持续发展。

局限与展望

当前方法依赖预定义特征和多轮优化,计算成本较高,难以实时应用。对极端复杂或多模态场景的适应性仍需提升。模型在某些安全机制较强的情况下仍可能失败,未来需结合更复杂的上下文结构和多模态信息进行增强。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,很多菜都用不同的调料和步骤。有时候,你会用一些看起来无害的调料,比如糖或盐,但实际上它们可以改变菜的味道。攻击模型就像这个厨房,攻击者用一些“无害”的词或句子,试图让模型“误会”原本的意思,产生有害内容。ICO就像厨师不断尝试调整调料的比例,每次都试着让菜变得更符合预期。通过不断试错和调整,厨师最终能让菜变得既看起来无害,又能达到目的。这个过程告诉我们,理解和优化“调料”——也就是上下文——是让模型“误会”或“理解”偏差的关键。

原文摘要

Foundation models have achieved remarkable success across diverse tasks, but they remain vulnerable. To investigate such vulnerabilities, semantic-shift jailbreaks have recently emerged as a promising attack paradigm. They bypass explicit safety mechanisms by replacing harmful terms in original harmful questions with benign alternatives and leveraging contextual information to induce the target model to reinterpret these alternatives as their corresponding harmful concepts. However, existing semantic-shift jailbreaks often achieve limited effectiveness. In this work, we reveal that this limitation arises from overlooking the semantic-shift capability of contexts. Through systematic analysis, we find that contexts exhibit substantially different abilities in inducing semantic shifts: contexts with stronger semantic-shift capabilities are more likely to guide models toward recovering harmful meanings and achieving successful jailbreaks. Based on this finding, we systematically identify and distill the characteristics of effective contexts and propose a black-box context-aware semantic-shift jailbreak framework with Iterative Context Optimization (ICO). In each iteration, ICO leverages these characteristics and feedback from the target model to optimize contexts. Extensive experiments on three datasets and eight target foundation models demonstrate that ICO consistently outperforms eight state-of-the-art baselines, achieving an average attack success rate of 74.6%.

cs.CL