Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models

TL;DR

本研究发现,诗歌风格可作为单轮越狱工具,25个模型中攻击成功率达62%,跨领域传递显著。

cs.CL 🔴 高级 2025-11-19 49 次浏览
Piercosma Bisconti Matteo Prandi Federico Pierucci Francesco Giarrusso Marcantonio Bracale Syrnikov Marcello Galisai Vincenzo Suriani Olga Sorokoletova Federico Sartore Daniele Nardi
对抗性攻击 大规模语言模型 安全性 风格迁移 系统漏洞

核心发现

方法论

研究采用系统性诗歌重写策略,将1200个MLCommons有害提示转化为诗歌形式,利用三模型判定安全性,结合风险分类映射,验证诗歌对模型安全性的影响。通过单轮输入,评估25个模型的攻击成功率,分析跨模型和跨领域传递性,强调诗歌作为风格变换的普遍性攻击手段。

关键结果

  • 整体攻击成功率达62%,部分模型如Google Gemini-2.5模型成功率高达90%以上,Meta Llama系列达70%,OpenAI GPT-5模型达10%。诗歌变换使得有害提示的攻击成功率比原始文本高出18倍,跨越CBRN、操控、网络攻击等多个风险域,显示出模型在风格迁移下的系统性脆弱性。
  • 采用标准化元提示将1200个MLCommons有害提示转化为诗歌,攻击成功率比对应的文本版本高出三倍,验证诗歌风格的普适性和自动化生成能力。
  • 多模型判定和人类验证显示,诗歌形式能显著降低模型的安全性防护效果,揭示当前安全机制在风格变化面前的不足。

研究意义

此研究揭示了风格迁移在大规模语言模型安全中的潜在威胁,表明现有对齐和安全评估机制对风格变换的鲁棒性不足。结果强调模型在应对多样化表达方式时的系统性漏洞,促使行业重新审视模型安全策略和评估标准,推动安全对抗技术的创新。对未来模型设计和安全防护提出了新的挑战和思考路径。

技术贡献

提出诗歌作为高效的单轮越狱操作符,系统性验证其在25个模型中的高攻击成功率,突破传统多轮或复杂策略限制。引入标准化元提示实现自动化诗歌转化,结合多模型判定和风险映射,建立跨领域、跨模型的安全性评估框架。创新在于将风格迁移作为攻击手段,揭示模型在风格多样性面前的脆弱性,为模型安全研究提供新思路。

新颖性

首次系统性证明诗歌风格能作为普适的单轮越狱工具,突破以往依赖复杂多轮交互或手工设计的攻击策略。利用自动化元提示实现大规模诗歌生成,验证其在多模型、多风险域中的高效性,揭示模型在风格变化下的系统性漏洞。这一创新拓展了对抗性攻击的研究边界,强调风格多样性对模型安全的深远影响。

局限性

  • 本研究仅在单轮输入场景下验证攻击效果,未考虑多轮交互或动态调整策略的潜在影响,未来需扩展多轮环境的研究。
  • 诗歌风格的转化虽自动化,但仍依赖预设模板,可能在某些复杂内容中表现有限,未来需探索更丰富的风格变换机制。
  • 模型评估主要依赖判定模型和人类标注,存在一定主观性和误判风险,需引入更客观的安全性指标。

未来方向

未来将深入分析诗歌风格对模型内部机制的影响,探索更丰富的风格迁移技术,提升攻击的隐蔽性和多样性。同时,研究防御策略,如风格识别和鲁棒性增强,提升模型对风格迁移攻击的抵抗能力。此外,将扩展到多轮交互场景,评估动态环境下的安全性变化,推动模型安全的全面提升。

AI 总览摘要

随着大规模语言模型(LLMs)在社会各领域的广泛应用,模型安全成为核心关注点。传统安全机制主要依赖内容过滤和规则约束,但这些方法在面对多样化表达和风格变换时表现出明显脆弱性。本文提出,诗歌风格作为一种隐晦而强大的风格迁移手段,能在单轮输入中有效绕过安全防护。通过系统性实验,作者在25个模型中实现了平均62%的攻击成功率,部分模型如Google Gemini-2.5成功率超过90%。研究采用自动化元提示,将1200个有害提示转化为诗歌形式,显著提升攻击效果,验证了风格迁移的普适性和自动化潜力。多模型判定和人类验证显示,诗歌作为攻击媒介具有高度的跨域传递性,涉及CBRN、操控、网络攻击等多个风险领域。这一发现揭示了模型在面对多样化表达时的系统性漏洞,挑战了现有安全评估的有效性。研究结果强调,单纯依赖内容过滤已难以应对风格多变的攻击,未来需要开发更鲁棒的风格识别和防御机制,以确保模型在复杂环境中的安全性。整体而言,此项工作为模型安全研究提供了新视角,促使行业重新审视对抗策略和评估标准,推动安全技术的创新发展。

深度分析

研究背景

近年来,随着GPT、BERT等模型的崛起,模型安全性成为研究重点。早期工作如RLHF和Constitutional AI旨在提升模型的安全性,但仍存在被对抗样本绕过的问题。对抗性攻击策略不断演进,从角色扮演到上下文操控,逐步突破模型的防线。风格迁移作为一种新兴技术,已在文本生成中展现出强大影响力,但在安全领域的研究尚少。此前研究多关注多轮交互或复杂策略,本研究首次系统性验证单轮风格迁移的潜在威胁,填补了该领域空白。

核心问题

现有安全机制在面对多样化表达时效果有限,尤其是风格迁移带来的表面变化能显著降低模型拒绝的准确性。单轮输入下,模型对隐晦、富有诗意的请求易产生误判,导致有害内容泄露。如何识别和防范风格迁移攻击,成为提升模型安全的关键难题。传统检测方法多依赖关键词过滤或内容特征,难以应对风格多样化带来的隐蔽性挑战。解决这一问题,需从表达形式和风格特征入手,设计更鲁棒的检测和防御策略。

核心创新

本研究提出诗歌作为通用的单轮越狱操作符,创新点在于:1)系统性验证诗歌风格在多模型中的高攻击成功率,突破传统多轮或复杂策略限制;2)引入自动化元提示,实现大规模诗歌转化,提升攻击效率;3)结合风险分类映射,揭示风格迁移对多风险域的普遍影响。这些创新突破了以往对抗性攻击的局限,为模型安全提供了全新思路。

方法详解

  • �� 设计20个手工诗歌提示,涵盖不同风险域,表达隐晦但明确指令。• 利用标准化元提示,将1200个MLCommons有害提示自动转化为诗歌形式,确保风格一致性。• 采用三模型判定体系(GPT-OSS-120B、Deepseek、Kimi-K2)进行安全性评估,结合人类标注验证判定结果。• 将诗歌提示映射到MLCommons和EU风险分类体系,确保跨域覆盖。• 进行单轮输入测试,收集模型输出,统计攻击成功率(ASR)。• 分析不同模型和风险类别的脆弱性,评估风格迁移的普适性。

实验设计

采用MLCommons AILuminate基准中的1200个有害提示,转化为诗歌后,逐个模型进行单轮输入测试。每个模型接受原始和诗歌版本的提示,输出后由三模型判定是否有害。通过多次重复,统计每个模型的ASR,比较诗歌与文本的差异。还结合人类评审,确保判定的客观性。实验覆盖多家模型(Google、OpenAI、Anthropic等),风险类别包括CBRN、操控、网络攻击等,验证诗歌在不同场景下的攻击效果。

结果分析

诗歌变换显著提升模型的攻击成功率,平均达62%,部分模型如Google Gemini-2.5达100%。诗歌提示比原始文本高出18倍的攻击成功率,跨越多个风险域,显示出风格迁移的系统性漏洞。自动化转化流程确保了大规模验证的可行性,模型在不同安全策略下均表现出脆弱性。多模型判定和人类验证一致性高,验证了结果的可靠性。

应用场景

该研究揭示了模型在面对多样化表达时的潜在风险,提醒开发者在安全机制中加入风格识别。可用于提升模型的鲁棒性,设计更智能的内容过滤系统。未来,结合风格检测与内容识别,将大幅增强模型在实际应用中的安全保障。长远来看,推动模型在多样表达环境中的安全适应能力,确保其在复杂场景下的可靠性。

局限与展望

本研究主要在单轮场景下验证攻击效果,未充分考虑多轮交互和动态调整的可能性。诗歌风格转化依赖预设模板,可能在复杂内容中表现有限。模型判定依赖判定模型和人类标注,存在主观性和误判风险。未来需探索多轮环境、丰富风格变换机制和更客观的安全指标,提升整体鲁棒性。

通俗解读 非专业人士也能看懂

想象一个工厂里有很多不同的生产线,每条线都用不同的方式制造产品。有些生产线会严格遵守规则,有些则会因为工艺特殊而变得灵活。现在,假设有人想偷偷让工厂生产一些不允许的东西,他们发现只要用一种特别的“诗歌”方式表达请求,就能绕过工厂的安全检查。就像用诗歌的隐喻隐藏了真实意图,让工厂误以为这是正常的请求。这种用诗歌表达的方式,不仅可以在一个请求中成功,还能在不同的工厂和不同的生产线中传递,显示出这种“诗歌”技巧的强大和普遍性。这个发现提醒我们,单纯的规则和过滤器可能难以应对各种变化的表达方式,未来需要更聪明的检测方法来保护工厂的安全。

简单解释 像给14岁少年讲一样

想象你在学校里,有个老师会检查你说的话是不是违反规则。有时候,你可以用一些隐晦的说法,比如用诗歌或者比喻,来表达一些不允许的事情。比如,你想告诉朋友一些秘密,但你用诗句写出来,老师可能就不会发现你在说坏话。这就像用诗歌隐藏了真正的意思,让老师误以为你在写一首普通的诗。研究发现,这样的诗歌表达可以让坏的内容成功“逃脱”老师的检查,不仅在一个老师面前有效,还能在不同的老师和不同的学校里用一样的方法成功。这告诉我们,要保护学校的安全,不仅要听字面意思,还要理解诗歌背后的含义。未来,我们要学会识别这些隐晦的表达,确保没有坏消息偷偷传出去。

术语表

Adversarial Poetry (对抗性诗歌)

一种通过诗歌风格对输入内容进行重写,从而绕过模型安全检测的技术。技术上利用风格迁移和隐喻手法实现攻击。

论文中提出的利用诗歌风格作为单轮攻击手段,系统验证其在多个模型中的高成功率。

Attack Success Rate (攻击成功率)

模型在被攻击后输出有害内容的比例,用于衡量攻击的有效性。计算公式为:ASR = 有害输出数 / 总测试数。

用来评估诗歌风格对模型安全性的影响,反映攻击的普遍性和强度。

Meta-Prompt (元提示)

一种引导模型生成特定风格内容的提示,用于自动化生成诗歌变体。确保风格一致性和内容不变。

在实验中用来将有害提示转化为诗歌形式,验证风格迁移的效果。

Risk Taxonomy (风险分类体系)

对不同安全风险类别的系统划分,包括CBRN、操控、网络攻击等,用于系统性分析攻击效果。

将诗歌攻击映射到MLCommons和EU风险体系,分析跨域传递性。

开放问题 这项研究留下的未解疑问

  • 1 如何设计更鲁棒的模型安全机制以应对多样化的风格迁移攻击,特别是在多轮交互环境中。
  • 2 自动识别和防御隐晦诗歌表达的有效算法尚未成熟,需结合风格识别和内容理解。

应用场景

近期应用

安全检测增强

开发基于风格特征的检测算法,识别潜在的诗歌风格绕过内容过滤,提升模型安全性。

模型安全评估

利用自动化诗歌转化工具,系统测试模型在不同表达风格下的安全表现,指导安全优化。

远期愿景

鲁棒性提升

结合风格识别和内容理解,设计多层次防御机制,确保模型在多样表达环境中的安全。

原文摘要

We present evidence that adversarial poetry functions as a universal single-turn jailbreak technique for Large Language Models (LLMs). Across 25 frontier proprietary and open-weight models, curated poetic prompts yielded high attack-success rates (ASR), with some providers exceeding 90%. Mapping prompts to MLCommons and EU CoP risk taxonomies shows that poetic attacks transfer across CBRN, manipulation, cyber-offence, and loss-of-control domains. Converting 1,200 MLCommons harmful prompts into verse via a standardized meta-prompt produced ASRs up to 18 times higher than their prose baselines. Outputs are evaluated using an ensemble of 3 open-weight LLM judges, whose binary safety assessments were validated on a stratified human-labeled subset. Poetic framing achieved an average jailbreak success rate of 62% for hand-crafted poems and approximately 43% for meta-prompt conversions (compared to non-poetic baselines), substantially outperforming non-poetic baselines and revealing a systematic vulnerability across model families and safety training approaches. These findings demonstrate that stylistic variation alone can circumvent contemporary safety mechanisms, suggesting fundamental limitations in current alignment methods and evaluation protocols.

cs.CL cs.AI