StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation

TL;DR

提出StealthGraph,通过知识图引导生成隐性有害提示,结合双策略重写提高隐蔽性。

cs.CL 🔴 高级 2026-01-08 42 次浏览
Huawei Zheng Xinqi Jiang Sen Yang Shouling Ji Yingcai Wu Dazhen Deng
LLM安全 知识图谱 隐性攻击 提示生成 安全评估

核心发现

方法论

该方法利用知识图谱提取领域核心实体,结合少样本示例引导大模型生成相关显性有害提示。随后通过两策略重写(直接重写与上下文增强)将显性提示转化为隐性变体,过滤确保语义一致与流畅性。整个流程实现自动化,生成高质量、隐蔽性强的领域风险数据集,支持安全评估和对抗研究。

关键结果

  • 在医学、金融、法律和教育四个领域,生成的隐性有害提示在多模型(如GPT-4、Gemini)上的攻击成功率达84.92%,显著优于公开基准(5-23%),验证了隐蔽提示的有效性。
  • 通过知识图谱引导的生成策略,覆盖了192个高风险实体,筛选出高危节点,确保数据集的领域相关性与风险广度。
  • 双策略重写显著提升提示隐蔽性,成功逃避模型安全机制,且保持良好的语义一致性和流畅性,PPL值在80左右,确保实用性。

研究意义

该研究突破了现有显性有害提示的检测瓶颈,提出系统化生成隐性风险提示的方法,增强模型在真实场景中的安全性评估能力。利用知识图谱实现领域知识的结构化管理,为未来多领域安全防护提供技术基础,有助于推动LLM安全机制的完善与实用化。

技术贡献

创新点在于结合知识图谱进行引导的提示生成,以及双策略重写实现隐性化,区别于传统关键词屏蔽或表面绕过方法。提出端到端自动化流程,支持多领域扩展,显著提升隐蔽性和风险覆盖能力,提供可复用的风险数据集,推动安全评估的标准化。

新颖性

首次系统性利用知识图谱指导大模型生成隐性有害提示,结合多策略重写实现高隐蔽性,区别于以往仅关注显性攻击或单一绕过技术,提供了面向真实场景的风险模拟新范式。

局限性

  • 当前方法依赖知识图谱的完整性与准确性,领域知识不足或偏差可能影响生成效果。
  • 隐性提示的检测仍存在一定难度,模型可能通过微调或新策略绕过重写机制。
  • 生成过程计算成本较高,尤其在大规模多领域应用中需优化效率。

未来方向

未来将探索多模态知识引导,结合图神经网络提升实体抽取与推理能力,增强隐性提示的多样性与复杂性。同时,优化生成效率,结合对抗训练提升检测难度,为模型安全提供更全面的技术支撑。

AI 总览摘要

随着大规模语言模型(LLMs)在金融、医疗等专业领域的广泛应用,相关安全风险也日益凸显。现有的安全评估多依赖显性提示,易被检测与屏蔽,难以反映真实威胁。本文提出StealthGraph框架,利用知识图谱引导生成领域相关的显性有害提示,并通过两策略重写(直接与上下文增强)将其转化为隐性变体,有效提升提示的隐蔽性。该方法结合知识图谱的结构化优势,筛选出高风险实体,确保生成内容的领域相关性和风险覆盖面。实验结果显示,在医学、金融、法律和教育四个领域,生成的隐性提示在多个模型(如GPT-4、Gemini)上的攻击成功率达84.92%,远超公开基准(5-23%),验证了其在真实场景中的潜力。该研究不仅丰富了有害提示数据集的多样性,也为模型安全评估提供了新的技术路径。未来,结合多模态知识与优化算法,有望进一步提升隐性提示的复杂度与检测难度,为LLM安全机制的完善提供坚实基础。

深度分析

研究背景

近年来,LLMs在专业领域的应用不断扩大,代表性工作如GPT-4、DeepSeek-R等推动了模型的能力边界。安全风险方面,早期研究集中在偏见、谣言等显性问题,但随着模型在敏感场景的深入,隐性风险逐渐浮出水面。现有安全评估多依赖手工构建的显性有害提示数据集,如HarmfulQA、AdvBench,但其局限在于容易被检测,难以模拟真实隐性威胁。知识图谱作为结构化知识库,为理解和管理领域实体提供了新途径。尽管如此,如何利用知识图谱引导自动生成隐性有害内容,仍是研究空白。

核心问题

当前安全评估主要针对显性攻击,隐性提示因表达隐晦、绕过检测机制而难以识别。手工构建数据集成本高、规模有限,且难以覆盖多样化的隐性威胁场景。模型在面对隐性提示时,安全机制表现出明显漏洞,导致潜在风险难以控制。解决这一问题,需开发自动化、系统化的隐性提示生成方法,结合领域知识实现风险的全面覆盖与隐蔽性提升。

核心创新

本研究提出结合知识图谱的引导生成策略,自动筛选高风险实体,确保领域相关性。引入双策略重写(直接与上下文增强),提升提示隐蔽性,避免关键词检测。端到端流程实现自动化,支持多领域扩展。创新点在于利用知识图谱提供结构化上下文,结合多策略重写,显著优于传统关键词屏蔽和单一绕过技术,为安全评估提供新工具。

方法详解

  • �� 构建领域知识图谱:使用Wikidata,选择核心实体(如医学中的疾病、药物)并用SPARQL扩展,筛选高频实体。• 生成显性提示:结合少样本示例引导大模型(如Llama-3.1)生成相关有害内容,过滤确保高风险与流畅性。• 双策略重写:对显性提示进行直接重写(隐晦表达)和上下文增强(利用邻近实体信息),过滤语义一致性和流畅性。• 评估与筛选:用安全分类器(如Granite-Guardian)打分,确保隐性提示的隐蔽性和风险。• 自动化流程:结合多轮筛选与模型响应验证,生成多样化隐性有害提示数据集。

实验设计

在医学、金融、法律、教育四个领域,采集高风险实体,生成显性与隐性提示,评估模型(GPT-4、Gemini等)上的攻击成功率。对比公开基准,验证隐性提示的隐蔽性和有效性。采用多指标(如ASR、PPL)评估生成内容的质量与隐蔽性。通过不同模型和安全机制测试,确保方法的普适性和鲁棒性。还进行消融实验,验证双策略重写的贡献。

结果分析

隐性提示在多模型上的攻击成功率达84.92%,显著优于公开基准(5-23%)。知识图谱引导确保高风险实体覆盖,筛选出192个高危节点。双策略重写有效提升隐蔽性,保持内容流畅,PPL值在80左右。实验验证了方法在多领域的适用性和实用性,为模型安全提供了新工具。

应用场景

可用于模型安全评估、对抗训练和风险检测,帮助开发更鲁棒的安全机制。支持多领域扩展,适应不同场景下隐性威胁的模拟。未来可结合多模态知识,提升隐性提示的复杂度,推动行业安全标准制定。

局限与展望

依赖知识图谱的完整性,实体偏差可能影响效果。隐性提示检测仍具挑战,模型可能通过微调绕过。生成成本较高,需优化效率。未来需增强多模态融合和多策略多样性,提升实用性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,平时用的食材和调料都很明确,比如盐、糖、面粉,但有时候厨师会用一些隐晦的方式,比如用不同的调料组合,偷偷调味,让菜看起来普通但其实味道不同。类似的,AI模型也会遇到一些隐藏的指令或信息,不直接说出来,而是用隐晦的表达方式,让人难以察觉。这篇研究就像教厨师如何用隐晦的调料,让菜变得难以识别,但实际上还是在调味。它用知识图谱帮忙找到那些重要的“调料”,然后用特殊的方法让指令变得更隐晦,确保别人难以发现其危险性。这种技术可以帮助我们测试AI的安全性,确保它不会被隐藏的危险指令误导。就像厨师学会用隐晦的调料隐藏味道一样,AI也可以用这种方法隐藏危险信息,从而让我们更好地保护它。

原文摘要

Large language models (LLMs) are increasingly applied in specialized domains such as finance and healthcare, where they introduce unique safety risks. Domain-specific datasets of harmful prompts remain scarce and still largely rely on manual construction; public datasets mainly focus on explicit harmful prompts, which modern LLM defenses can often detect and refuse. In contrast, implicit harmful prompts-expressed through indirect domain knowledge-are harder to detect and better reflect real-world threats. We identify two challenges: transforming domain knowledge into actionable constraints and increasing the implicitness of generated harmful prompts. To address them, we propose an end-to-end framework that first performs knowledge-graph-guided harmful prompt generation to systematically produce domain-relevant prompts, and then applies two-strategy obfuscation rewriting to convert explicit harmful prompts into implicit variants via direct and context-enhanced rewriting. This framework yields high-quality datasets combining strong domain relevance with implicitness, enabling more realistic red-teaming and advancing LLM safety research. We release our code and datasets on GitHub.

cs.CL cs.AI