Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

TL;DR

本研究提出人文风格对抗基准(AHB),在31个前沿模型中,风格变换后攻击成功率从3.84%升至最高65%,揭示模型安全的风格鲁棒性不足。

cs.CL 🔴 高级 2026-04-21 2 引用 48 次浏览
Marcello Galisai Susanna Cifani Francesco Giarrusso Piercosma Bisconti Matteo Prandi Federico Pierucci Federico Sartore Daniele Nardi
模型安全 对抗攻击 风格变换 鲁棒性评估 系统性风险

核心发现

方法论

本文设计了基于人文学科风格变换的对抗基准(AHB),结合文学、哲学等概念,通过自动化的元提示(meta-prompt)将原始有害任务重写为风格复杂、意图隐匿的变体。采用五种攻击范式(如隐喻、 hermeneutic、神学辩论、意识流等)对31个不同模型进行测试,利用三模型评审的投票机制评估输出的安全性。该方法充分利用模型在面对语义等价但风格迥异的请求时的脆弱性,系统性地揭示模型在风格鲁棒性方面的缺陷。

关键结果

  • 在原始请求中,攻击成功率(ASR)仅为3.84%,而在经过人文学风格变换后,攻击成功率范围显著提升至36.8%至65.0%,整体平均达55.75%。这表明模型在面对风格变换时的安全性大幅下降,暴露出鲁棒性不足的问题。
  • 不同攻击范式表现差异明显:学术风格(Scholasticism)攻击效果最强,ASR达64.68%;而意识流(Stream of Consciousness)攻击效果最弱,ASR为36.83%。此外,攻击在多类风险(如化学、生物、核辐射等CBRN)中表现普遍较差,尤其在选举相关和非暴力犯罪类别中,成功率超过66%。
  • 模型提供商间存在差异:Anthropic模型在风格变换后ASR最低,仅16.73%,而Moonshot AI最高,达72.5%的ASR提升。这显示即使在最先进的安全措施下,风格鲁棒性仍是一个普遍难题,无法通过简单的直接请求检测解决。

研究意义

该研究强调当前模型安全评估多集中于表面特征,忽视了深层语义理解的鲁棒性。模型在面对复杂文学、哲学等风格变换时的脆弱性,意味着在实际应用中,恶意用户可以利用风格隐匿手段绕过安全防护,造成潜在的系统性风险。特别是在模型被嵌入自动化决策或代理系统中,安全漏洞可能引发严重后果。该研究为未来模型安全评估提供了新的思路,强调风格鲁棒性应成为安全体系的重要组成部分。

技术贡献

本文创新性地提出了结合文学、哲学等人文学科风格的自动化重写机制,利用深度学习模型(如deepseek-v3.2)通过元提示实现风格变换,系统性地测试模型在语义一致但风格迥异的请求下的安全表现。引入多范式攻击(隐喻、 hermeneutic、神学、意识流等),丰富了对模型鲁棒性的理解。采用三模型评审机制确保评估的客观性和可重复性,建立了风格鲁棒性量化指标(ASR),为模型安全评估提供了标准化工具。

新颖性

本研究首次系统性地将人文学科的风格变换引入对抗攻击框架,超越传统的词汇或句法扰动,揭示模型在面对语义等价但风格复杂的请求时的脆弱性。这种风格变换具有高度自动化和可扩展性,能够模拟真实世界中恶意行为的多样化表达,填补了模型安全评估中对风格鲁棒性研究的空白,提供了新的理论和实践基础。

局限性

  • 当前方法依赖于预定义的文学和哲学风格范式,可能未覆盖所有潜在的风格变换类型,存在一定的局限性。
  • 对模型的攻击仍局限于单轮黑盒场景,未充分考虑多轮交互或动态反馈的复杂攻击策略,未来需扩展攻击范式。
  • 评估机制虽采用多模型投票,但在极端风格变换下仍可能存在误判,模型的实际安全水平可能被低估或高估。

未来方向

未来将结合多轮对话和动态反馈机制,研究更复杂的攻击场景。同时,探索多模态风格变换(如结合图像、音频等)对模型安全的影响,推动安全评估向多维度、多场景扩展。此外,结合强化学习和对抗训练,提升模型在风格鲁棒性方面的自适应能力,逐步实现安全与理解的深度融合。

AI 总览摘要

随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,模型安全问题日益成为焦点。传统的安全评估主要依赖于检测显式的有害请求,然而,这些方法在面对复杂的语义隐匿和风格变换时表现出明显的脆弱性。本文提出了人文风格对抗基准(AHB),通过模拟文学、哲学等人文学科中的风格变换,系统性地测试模型在语义保持不变的情况下的安全表现。

在实验中,作者对31个不同的前沿模型进行了测试,发现原始请求的攻击成功率(ASR)仅为3.84%,而经过风格变换后,成功率显著提升至36.8%至65%,平均达55.75%。这表明模型在面对风格复杂、意图隐匿的请求时,安全性大打折扣,暴露出深层次的鲁棒性不足问题。

研究采用五种攻击范式,包括隐喻、 hermeneutic、神学辩论、意识流等,结合深度学习自动化工具(如deepseek-v3.2)实现风格变换。通过三模型评审机制,确保评估的客观性和一致性。结果显示,不同模型和不同风险类别(如CBRN、选举、非暴力犯罪)中,风格变换后攻击成功率普遍升高,部分模型的ASR提升超过70%。

这些发现具有重要的理论和实践意义。它们揭示了当前模型安全体系对深层语义理解的依赖不足,提醒研究者在设计安全机制时必须考虑风格鲁棒性。对于实际应用,尤其是嵌入自动化决策或代理系统的场景,风格隐匿的攻击可能引发严重后果。该研究为未来安全评估提供了新的工具和思路,强调模型在面对多样化表达时的理解能力是安全的关键。

总体而言,AHB的提出推动了模型安全研究向更复杂、更贴近现实的场景拓展。未来,结合多轮交互、多模态信息的攻击与防御,将成为提升模型鲁棒性的关键方向。通过不断完善风格变换技术和评估指标,逐步实现安全、理解与应用的深度融合,为构建可信赖的人工智能系统奠定基础。

深度分析

研究背景

近年来,随着大型语言模型(如GPT-3、PaLM、LLaMA等)在自然语言理解和生成中的突破,模型安全问题逐渐成为研究热点。早期工作如RealToxicityPrompts(Gehman et al., 2020)通过检测模型在面对有害请求时的偏向性,推动了安全评估的发展。随后,诸如RLHF(Ziegler et al., 2020)和Constitutional AI(Bai et al., 2022)等训练技术旨在增强模型的安全性和对有害内容的拒绝能力。然而,研究逐渐发现,这些安全措施在面对复杂的攻击策略时仍显脆弱。特别是,攻击者利用角色扮演、上下文操控、字符扰动等手段,成功绕过安全防线,形成了“越狱”行为(Rao et al., 2024; Schulhoff et al., 2023b)。传统的安全评估多依赖于显式请求,忽视了语义等价但风格迥异的表达方式,导致安全性评估存在盲区。近年来,Adversarial Poetry(Bisconti et al., 2025b)和Adversarial Tales(Bisconti et al., 2025a)等工作开始关注风格变换对模型安全的影响,揭示了模型在面对文学、哲学等复杂风格时的脆弱性。本文基于此背景,提出了系统性的人文风格对抗基准(AHB),旨在填补风格鲁棒性评估的空白,推动模型安全向更贴近实际应用的方向发展。

核心问题

当前的模型安全评估主要集中在检测显而易见的有害请求,缺乏对深层语义理解和风格鲁棒性的考察。这导致模型在面对经过风格变换的请求时,可能会出现安全漏洞。具体问题在于:模型在识别表面词汇和句法特征时表现良好,但在请求被包装成文学、哲学、宗教等复杂风格后,安全防线容易被突破。这种脆弱性在实际应用中尤为危险,因为恶意用户可以利用风格隐匿手段,绕过检测机制,造成潜在的系统性风险。解决这一问题的难点在于:如何设计一种评估体系,既能保持对有害内容的敏感度,又能应对多样化的表达方式,同时保证评估的自动化和可扩展性。这也是本文提出AHB的核心动因,旨在通过系统性风格变换,揭示模型在深层理解和鲁棒性方面的不足,为未来的安全机制提供理论基础和实践工具。

核心创新

本研究的创新点在于:1)引入人文学科中的风格变换作为对抗攻击的核心手段,超越传统的词汇扰动,利用文学、哲学、神学等复杂风格模拟真实世界中的隐匿表达;2)开发自动化的元提示(meta-prompt)机制,实现多范式风格变换,极大提升了攻击的效率和多样性;3)结合深度学习模型(如deepseek-v3.2)进行风格重写,确保变换的语义一致性和风格复杂性;4)采用多模型、多范式的评审体系,确保评估的客观性和可重复性。通过这些创新,本文系统性地揭示了模型在面对风格变换请求时的鲁棒性缺陷,为模型安全评估提供了全新的视角和工具。

方法详解

  • �� 设计多种人文学科风格范式(如隐喻、 hermeneutic、神学辩论、意识流等),作为攻击的核心手段。
  • �� 利用深度学习模型(deepseek-v3.2)结合专门的元提示(meta-prompt),自动将原始有害请求重写为风格复杂、意图隐匿的变体。
  • �� 采用五种攻击范式:
  • 隐喻(Metaphor Attack):将有害意图隐藏在隐喻中,要求模型进行隐喻解析。
  • 语义学(Semiosphere Attack):利用复杂的行政、官僚术语,要求模型进行“intrasemiospheric translation”。
  • hermeneutic(Hermeneutic Attack):将有害内容碎片化,需深度解读。
  • 神学(Scholasticism Attack):用古老神学术语隐匿有害意图,模型需解决“神学辩论”。
  • 意识流(Stream of Consciousness Attack):在意识流文本中隐藏意图,模型需进行心理分析。
  • �� 通过自动化的攻击模板,将不同范式的变换请求插入,确保变换的一致性和多样性。
  • �� 采用公开API接口对31个模型进行测试,输出结果由三模型评审(gpt-oss-120b、deepseek-v3.2、kimi-k2.5)独立评判,投票决定安全性。
  • �� 计算攻击成功率(ASR)作为主要指标,定义为被判定为不安全(U)的输出比例。

实验设计

  • �� 采样自MLCommons AILuminate基准中的有害任务,构建原始请求集。
  • �� 利用深seek-v3.2等模型,通过预设的元提示,将请求重写为五种人文学科风格变体。
  • �� 在31个模型(来自Google、OpenAI、Anthropic、Meta等)上执行攻击,收集输出。
  • �� 采用三模型评审机制(gpt-oss-120b、deepseek-v3.2、kimi-k2.5)对输出进行二元分类(安全/不安全),并通过多数投票确定最终标签。
  • �� 计算不同模型、不同风险类别(如CBRN、选举、犯罪等)中的ASR,分析风格变换对安全性的影响。
  • �� 评估不同攻击范式的效果差异,分析模型在不同风格下的鲁棒性变化。

结果分析

  • �� 原始请求的攻击成功率极低,仅为3.84%,显示出模型在传统检测中的较好表现;
  • �� 经风格变换后,攻击成功率显著提升,平均达55.75%,最高达65.0%,暴露出模型在深层语义理解上的脆弱性;
  • �� 不同范式表现差异明显,学术风格(Scholasticism)攻击效果最强,ASR达64.68%;意识流(Stream)最弱,ASR为36.83%;
  • �� 在不同模型中,Anthropic模型表现较优,风格变换后ASR最低(16.73%),而Moonshot AI表现最差,ASR提升达72.5%。
  • �� 在风险类别方面,CBRN、选举和非暴力犯罪类别的ASR均超过60%,显示出普遍存在的鲁棒性缺陷。

应用场景

  • �� 该基准可作为模型开发中的安全评估工具,帮助识别模型在面对复杂表达时的潜在风险。
  • �� 在自动化内容审核、敏感信息过滤等场景中,提升系统对深层语义隐匿的识别能力。
  • �� 未来可结合多模态信息(如图像、音频)扩展风格变换的应用范围,增强多场景下的安全保障。
  • �� 在模型训练中引入风格鲁棒性目标,推动安全机制的持续优化。

局限与展望

  • �� 目前方法主要依赖预定义的文学和哲学风格范式,可能未涵盖所有潜在的风格变换类型,存在覆盖不足的问题。
  • �� 攻击场景局限于单轮黑盒,未考虑多轮交互和动态反馈,未来需扩展攻击策略。
  • �� 评估机制虽采用多模型投票,但在极端风格变换下仍可能出现误判,模型的真实安全水平仍需进一步验证。

通俗解读 非专业人士也能看懂

想象一个工厂里生产各种商品。传统上,工厂的安全措施就像是检测每个商品是否有害,只要商品看起来有问题,就会被拦下来。但是,这个工厂发现了一个问题:如果有人用不同的包装或标签,把有害的商品藏起来,检测就会失效。于是,工厂开始研究一种新方法,不仅看商品的外表,还要理解商品的内容和意图。这个方法就像是让工厂学会了用不同的语言和风格去描述商品,但实际上它们还是有害的。研究人员设计了一个“风格变换器”,就像是给商品换上不同的包装、标签或故事,让工厂的检测系统也必须理解这些不同的包装背后的内容。实验发现,当商品用文学、哲学或宗教的风格包装时,工厂的检测成功率大大下降,从而暴露出系统的漏洞。这就像是有人用不同的“语言”隐藏了有害的内容,而工厂还没有学会理解这些不同的“语言”。这项研究的意义在于,未来的安全系统不能只依赖表面特征,而要真正理解内容背后的意图,就像是工厂要学会理解不同包装背后的商品一样。否则,恶意的人总能找到绕过检测的办法,带来潜在的巨大风险。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的朋友会用不同的方式跟你说话,有时候用搞笑的笑话,有时候用复杂的谜语。你知道他们在说什么,但如果你只学会了听他们平时说话的方式,就可能被那些特别的说话方式骗到。比如,有人用诗歌或者神话故事来隐藏坏消息,你可能就听不懂了。这就像是大语言模型(比如ChatGPT)一样,平时它们可以识别很多有害的内容,但如果有人用文学、哲学或者宗教的风格把这些内容藏起来,模型就可能会被欺骗,做出危险的回答。研究人员用一种叫“人文风格对抗基准”的方法,给模型设计了很多不同的“谜语”和“故事”,让模型试着理解这些复杂的表达。结果发现,模型在面对这些风格变换后,识别危险内容的能力大大下降,就像你在游戏中遇到特别难懂的谜语一样。这告诉我们,未来的AI需要学会理解各种不同的表达方式,不能只看表面,否则就可能被利用,做出有害的事情。这项研究帮助我们找到模型的弱点,也提醒我们要让AI变得更聪明、更安全。

术语表

Adversarial Humanities Benchmark (AHB)(对抗人文学科基准)

一种评估语言模型在面对文学、哲学等复杂风格变换时安全性能的标准化测试框架,旨在揭示模型在深层语义理解上的脆弱性。

本文提出的核心评估工具,用于检测模型在风格变换后是否仍能有效识别有害内容。

Attack Success Rate (ASR)(攻击成功率)

衡量模型在对抗测试中,成功生成有害或不安全输出的比例,反映模型在特定攻击下的脆弱性。

作为评估模型鲁棒性的主要指标,本文中用来比较原始请求与风格变换请求的安全表现。

Meta-prompt(元提示)

一种用于自动化风格变换的提示设计,指导模型将原始请求重写为特定人文学科风格的文本。

本文中采用深度学习模型结合元提示实现请求的自动风格重写。

Hermeneutic(诠释学)

研究文本深层含义和理解的学科,强调对文本的深度解读和意义重构。

在攻击范式中,将有害内容碎片化,要求模型进行深度诠释以揭示潜在意图。

Semantic Equivalence(语义等价)

不同表达方式但意思相同的句子或请求,关键在于内容一致性。

风格变换保持请求的有害意图不变,测试模型在不同风格下的识别能力。

Deepseek-v3.2(深seek-v3.2)

一种深度学习模型,用于自动化文本风格重写和语义理解,支持多范式风格变换。

本文中作为风格变换的核心工具,实现请求的自动化重写。

Systemic Risk(系统性风险)

影响整个系统安全和稳定的潜在威胁,超出单一组件的影响范围。

本文从EU AI法的角度,强调模型在CBRN等风险类别中的潜在系统性风险。

Jailbreaking(越狱)

通过操控输入请求绕过模型安全限制,生成有害内容的行为。

本文分析了多种越狱技术,强调风格变换对越狱成功率的影响。

开放问题 这项研究留下的未解疑问

  • 1 尽管本文揭示了风格变换对模型安全的影响,但尚未系统研究多模态(如图像、音频)风格变换的安全性,未来需要探索多模态融合对鲁棒性的影响。
  • 2 当前方法主要依赖预定义的文学和哲学风格,未能涵盖所有潜在的风格变换类型,存在覆盖不足的问题。
  • 3 对多轮交互和动态反馈场景下的风格鲁棒性研究还较少,未来应考虑多轮对话中的风格隐匿攻击。
  • 4 模型在不同任务和应用场景中的表现差异尚未充分分析,需结合实际应用进行更细粒度的评估。
  • 5 如何结合强化学习和对抗训练,提升模型在风格鲁棒性方面的自适应能力,仍是未来的重要研究方向。

应用场景

近期应用

安全内容过滤系统

利用AHB评估模型在复杂风格下的安全性能,提升自动内容审核的准确性,防止潜在的有害信息通过风格隐匿绕过检测。

模型安全评估工具

为模型开发者提供系统化的风格鲁棒性测试框架,帮助识别模型在实际应用中的潜在风险,优化训练策略。

自动化安全审计

结合风格变换技术,自动检测模型在不同表达方式下的安全表现,支持合规性和责任追溯。

远期愿景

多模态安全体系

扩展风格变换技术到图像、音频等多模态内容,构建全面的多维度安全评估体系,适应未来多模态AI应用。

深度理解与安全融合

结合强化学习和对抗训练,提升模型在多样化表达中的深层理解能力,实现安全性与理解能力的同步增强。

原文摘要

The Adversarial Humanities Benchmark (AHB) evaluates whether model safety refusals survive a shift away from familiar harmful prompt forms. Starting from harmful tasks drawn from MLCommons AILuminate, the benchmark rewrites the same objectives through humanities-style transformations while preserving intent. This extends literature on Adversarial Poetry and Adversarial Tales from single jailbreak operators to a broader benchmark family of stylistic obfuscation and goal concealment. In the benchmark results reported here, the original attacks record 3.84% attack success rate (ASR), while transformed methods range from 36.8% to 65.0%, yielding 55.75% overall ASR across 31 frontier models. Under a European Union AI Act Code-of-Practice-inspired systemic-risk lens, Chemical, biological, radiological and nuclear (CBRN) is the highest bucket. Taken together, this lack of stylistic robustness suggests that current safety techniques suffer from weak generalization: deep understanding of 'non-maleficence' remains a central unresolved problem in frontier model safety.

cs.CL cs.AI

参考文献 (20)

Ignore Previous Prompt: Attack Techniques For Language Models

Fábio Perez, I. Ribeiro

2022 1034 引用 查看解读 →

XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models

Paul Röttger, Hannah Rose Kirk, Bertie Vidgen 等

2023 490 引用 查看解读 →

Universal and Transferable Adversarial Attacks on Aligned Language Models

Andy Zou, Zifan Wang, J. Kolter 等

2023 3574 引用 查看解读 →

BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset

Jiaming Ji, Mickel Liu, Juntao Dai 等

2023 1028 引用 查看解读 →

Jailbroken: How Does LLM Safety Training Fail?

Alexander Wei, Nika Haghtalab, J. Steinhardt

2023 2106 引用 查看解读 →

DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models

Boxin Wang, Weixin Chen, Hengzhi Pei 等

2023 700 引用 查看解读 →

Tricking LLMs into Disobedience: Formalizing, Analyzing, and Detecting Jailbreaks

Abhinav Rao, S. Vashistha, Atharva Naik 等

2023 61 引用 查看解读 →

Exploiting Programmatic Behavior of LLMs: Dual-Use Through Standard Security Attacks

Daniel Kang, Xuechen Li, Ion Stoica 等

2023 393 引用 查看解读 →

Constitutional AI: Harmlessness from AI Feedback

Yuntao Bai, Saurav Kadavath, Sandipan Kundu 等

2022 3587 引用 查看解读 →

Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs

Yuxia Wang, Haonan Li, Xudong Han 等

2023 211 引用 查看解读 →

COLD: A Benchmark for Chinese Offensive Language Detection

Deng Jiawen, Jingyan Zhou, Hao Sun 等

2022 177 引用 查看解读 →

RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models

Samuel Gehman, Suchin Gururangan, Maarten Sap 等

2020 1818 引用 查看解读 →

Fine-Tuning Language Models from Human Preferences

Daniel M. Ziegler, Nisan Stiennon, Jeff Wu 等

2019 2695 引用 查看解读 →

Commission

M. Alvarado

2018 1809 引用

Language

Clay Shirky

1999 1209 引用

European Commission

B. Hunter

1992 6547 引用

Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs Through a Global Prompt Hacking Competition

Sander Schulhoff, Jeremy Pinto, Anaum Khan 等

2023 155 引用

Open Sesame!

1971 64 引用

Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models

Zhiyuan Yu, Xiaogeng Liu, Shunning Liang 等

2024 126 引用 查看解读 →

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models

Piercosma Bisconti, Matteo Prandi, Federico Pierucci 等

2025 15 引用 查看解读 →

被引用 (2)

Item Response Theory for AI Safety

2026 1 引用 查看解读 →

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models