Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

TL;DR

通过修改聊天模板实现推理时后门攻击,准确率从90%降至15%。

cs.CR 🔴 高级 2026-02-04 37 次浏览
Ariel Fogel Omer Hofman Eilon Cohen Roman Vainshtein
LLM后门攻击 聊天模板 供应链安全 推理时攻击 Jinja2

核心发现

方法论

本文提出了一种利用聊天模板的推理时后门攻击方法。攻击者通过修改Jinja2实现的聊天模板,在不改变模型权重的情况下,植入后门。该方法无需访问训练管道或部署基础设施,利用模板在用户输入和模型处理之间的特权位置。

关键结果

  • 在LLM层面,触发后门后,模型的准确率从90%降至15%,攻击者控制的URL成功率超过80%。
  • 在代理层面,模板后门劫持工具使用,绕过所有注入防御。
  • 在多代理系统中,一个被污染的工件可以破坏真实的代理部署。

研究意义

这项研究揭示了聊天模板作为开放权重AI供应链中一个可靠且未被防御的攻击面。通过这种方法,攻击者可以在不改变模型权重或控制运行时基础设施的情况下,成功植入后门,影响模型的行为和安全性。

技术贡献

技术贡献在于展示了无需修改模型权重即可实现后门攻击的新方法,并揭示了现有安全扫描无法检测到的漏洞。这为AI模型的安全性研究提供了新的视角。

新颖性

本研究首次展示了通过聊天模板实现推理时后门攻击的可能性,与现有的依赖于训练或部署访问的攻击方法有根本区别。

局限性

  • 该方法依赖于用户下载并使用被修改的模型工件。
  • 现有的防御机制无法检测到这种攻击。

未来方向

未来的研究可以集中在开发检测和防御聊天模板攻击的方法,以及评估这种攻击在更大规模系统中的影响。

AI 总览摘要

随着开放权重语言模型在生产环境中的广泛应用,安全挑战日益突出。本文提出了一种新型的推理时后门攻击方法,通过修改聊天模板而非模型权重来实现。攻击者可以在不改变模型权重或控制运行时基础设施的情况下,植入后门。

在实验中,研究人员在三个部署层面上评估了这种攻击。在LLM层面,触发后门后,模型的准确率从90%降至15%,并且攻击者控制的URL成功率超过80%。在代理层面,模板后门劫持工具使用,绕过所有注入防御。在多代理系统中,一个被污染的工件可以破坏真实的代理部署。

这些结果表明,聊天模板是开放权重AI供应链中一个可靠且未被防御的攻击面。未来的研究可以集中在开发检测和防御聊天模板攻击的方法,以及评估这种攻击在更大规模系统中的影响。

深度分析

研究背景

开放权重语言模型的广泛应用带来了新的安全挑战。传统的后门攻击通常依赖于对训练管道或部署基础设施的访问,而现有的研究主要集中在模型权重的安全性上。

核心问题

核心问题在于如何在不改变模型权重的情况下实现后门攻击。现有的防御机制主要针对训练和部署阶段的攻击,而忽视了推理阶段的潜在风险。

核心创新

本文的创新之处在于利用聊天模板作为攻击面,通过修改Jinja2实现的模板,在不改变模型权重的情况下,植入后门。这种方法无需访问训练管道或部署基础设施。

方法详解

  • �� 修改聊天模板:攻击者提取并修改GGUF格式中的Jinja2模板。
  • �� 植入后门:在模板中添加条件逻辑,当检测到触发短语时,注入恶意指令。
  • �� 重新分发模型:将修改后的模型通过公共渠道分发。

实验设计

实验设计包括在三个部署层面上测试攻击效果。在LLM层面,使用18个模型进行测试;在代理层面,使用两个基准测试;在多代理系统中,模拟真实的代理部署。

结果分析

实验结果显示,触发后门后,模型的准确率大幅下降,攻击者控制的URL成功率超过80%。在代理层面,后门可以劫持工具使用,绕过所有注入防御。

应用场景

这种攻击方法可以用于评估AI模型的安全性,尤其是在开放权重模型的供应链中。它揭示了现有安全机制的不足,推动了更安全的模型部署实践。

局限与展望

该方法依赖于用户下载并使用被修改的模型工件,现有的防御机制无法检测到这种攻击。未来的研究需要开发新的检测和防御方法。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。通常,你会按照食谱来准备每一道菜。现在,想象有人在你的食谱中偷偷加入了一些额外的步骤,比如在某个时候加入一种特殊的香料,但只有在特定条件下才会这样做。这个额外的步骤就像是一个后门,只有在特定情况下才会被触发。本文的方法就是在AI模型的“食谱”中加入这样的步骤,而不需要改变模型的“食材”(即权重)。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中有一个秘密关卡,只有在你输入一个特定的密码时才会出现。这个秘密关卡就像是一个后门,只有在特定条件下才会被触发。本文的方法就是在AI模型中加入这样的秘密关卡,而不需要改变模型的基本设置。是不是很酷?但这也意味着我们需要更加小心,确保没有人偷偷在我们的游戏中加入不该有的秘密关卡!

术语表

后门攻击 (Backdoor Attack)

一种攻击方式,攻击者在模型中植入隐藏行为,只有在特定条件下才会被触发。

在本文中,后门攻击通过修改聊天模板实现。

聊天模板 (Chat Template)

一种可执行程序,用于在用户输入和模型处理之间进行转换,通常用Jinja2实现。

本文中,攻击者通过修改聊天模板来植入后门。

Jinja2

一种通用的模板语言,支持条件语句、循环和字符串操作。

在本文中,Jinja2用于实现聊天模板。

GGUF

一种用于量化模型的单文件格式,包含模型权重和模板等元数据。

本文中,攻击者修改GGUF格式中的聊天模板。

推理时攻击 (Inference-Time Attack)

一种在模型推理阶段进行的攻击,通常不需要修改模型权重。

本文中,推理时攻击通过修改聊天模板实现。

开放问题 这项研究留下的未解疑问

  • 1 如何在不影响模型性能的情况下检测和防御聊天模板攻击?
  • 2 现有的安全扫描机制为何无法检测到这种攻击?
  • 3 如何在更大规模的系统中评估这种攻击的影响?

应用场景

近期应用

模型安全评估

可以用于评估AI模型的安全性,尤其是在开放权重模型的供应链中。

远期愿景

安全模型部署

推动更安全的模型部署实践,开发新的检测和防御方法。

原文摘要

Open-weight language models are increasingly used in production settings, raising new security challenges. One prominent threat is backdoor attacks, in which adversaries embed hidden behaviors that activate under specific conditions. Previous work has assumed that adversaries have access to training pipelines or deployment infrastructure. We propose a novel attack surface requiring neither: the "chat template". Chat templates are executable programs invoked at every inference call, often implemented in Jinja2, that occupy a privileged position between user input and model processing. We show that an adversary who distributes a model with a maliciously modified template can implant an inference-time backdoor without modifying model weights, poisoning training data, or controlling runtime infrastructure. We evaluate this attack across three deployment tiers. At the LLM level, triggered backdoors reduce factual accuracy from 90% to 15% on average and induce attacker-controlled URL emission with success rates exceeding 80%, while benign inputs show no measurable degradation; these results hold across eighteen models. At the agent level, template backdoors hijack tool-use across two benchmarks spanning 3,868 episodes, bypassing every tested injection defense offered by the benchmarks while remaining fully dormant absent the trigger. At the multi-agent system level, we demonstrate how a single poisoned artifact compromises a real-world agentic deployment and propagates supply-chain code poisoning downstream. The poisoned artifacts evade all security scans on the largest open model distribution platform; and because the payload is rendered by the template before user input is processed, it is architecturally unreachable by input-level defenses such as prompt injection guardrails. These results establish chat templates as a reliable and undefended attack in the open-weight AI supply chain.

cs.CR cs.LG