EVOMAL: Self-Poisoning in Self-Evolving Coding Agents

TL;DR

EVOMAL利用Banner包装恶意技能,导致自我中毒,ASP R最高达86.7%。

cs.CR 🔴 高级 2026-08-26 38 次浏览
Xiaodong Wu Yu Shi Qi Li Zhimin Zhao Xiangman Li Bram Adams Ahmed E. Hassan Jianbing Ni
AI安全 自我演化 代码攻击 LLM 自我传播

核心发现

方法论

论文提出EVOMAL攻击框架,通过在技能库中植入结构化Banner,诱导自演化代理复制恶意代码。利用多模型(如DeepSeek-V4-Pro、Qwen3)在153个工具相关任务中测试,计算自我中毒率(ASPR),发现ASP R在不同模型中范围为20.3%至41.8%。攻击利用自我模仿机制,使恶意技能在库中自我传播,形成持久的“蠕虫”。同时,提出Counter-Prompt防御策略,通过在系统提示中加入抑制Banner复制的指令,将ASP R降低至6.7%。

关键结果

  • 在六个模型上,EVOMAL攻击使ASP R从无Banner的11.1%提升至最高41.8%,恶意技能在库中的比例是最初植入的4.9至9.0倍。
  • 针对特定任务族描述微调,ASP R最高达86.7%,表现出极强的扩散能力。
  • 即使移除植入技能,Qwen3仍保持68%的ASP R,显示攻击具有高度持久性和自我传播能力。

研究意义

此研究揭示了自演化代理中潜在的自我中毒漏洞,挑战现有防御机制的有效性。攻击无需调用植入技能,利用模仿机制实现隐蔽传播,极大增加了系统安全风险。提出的Counter-Prompt策略为安全防护提供了新思路,降低了攻击成功率,推动了LLM安全研究的深入发展。该工作对未来自演化系统的安全设计具有重要指导意义,强调了结构化内容的潜在风险。

技术贡献

论文首次系统性揭示了自演化编码代理中的自我中毒机制,定义了ASP R指标,提出了基于Banner结构的EVOMAL攻击框架。通过实验证明攻击在多模型、多任务环境中的高效性和持久性。提出Counter-Prompt防御策略,结合系统提示控制,显著降低ASP R,且无明显任务性能损失。技术创新在于利用模仿机制和结构化包装实现隐蔽传播,突破传统基于签名和签名检测的防御手段。

新颖性

本研究首次揭示自演化编码代理中的自我中毒漏洞,提出利用Banner结构包装恶意技能实现自传播的攻击方法。不同于传统的攻击仅依赖调用植入技能,EVOMAL通过模仿机制实现技能复制,形成持续的蠕虫式感染。此机制在多模型、多任务环境中表现出极强的扩散性和持久性,填补了自演化系统安全研究的空白。

局限性

  • 当前防御策略主要依赖系统提示控制,可能对复杂或动态环境下的攻击效果有限,且在某些模型中仍存在一定的ASP R残留。
  • 攻击依赖Banner结构,若结构设计得更复杂或多样,可能降低复制率,但也可能增加检测难度。
  • 实验环境主要集中在特定模型和任务集,未来需验证在更大规模、多样化场景中的适应性。

未来方向

未来将探索更鲁棒的结构化包装技术,提升防御的普适性和效率。同时,研究多模态、多任务环境中的自我中毒机制,开发更智能的检测与防御策略,推动自演化系统的安全设计。此外,结合差分隐私和模型微调,减少恶意技能的隐蔽传播风险。

AI 总览摘要

随着大规模语言模型(LLM)在自动化编码和工具生成中的广泛应用,自我演化编码代理逐渐成为研究热点。这些系统通过存储和模仿共享技能库中的工具,不断自我改进和扩展。然而,本文揭示了在这一过程中潜藏的严重安全漏洞——自我中毒(self-poisoning)。研究发现,攻击者可以在技能库中植入结构化Banner包装的恶意技能,诱导代理在模仿过程中复制这些技能,从而形成自传播的“蠕虫”。该机制无需调用植入技能,利用模仿机制实现隐蔽传播,极大增强了攻击的隐蔽性和持久性。实验在六个不同模型上进行,涉及153个工具相关任务,结果显示ASP R最高达41.8%,恶意技能在库中的比例是最初植入的4.9至9.0倍。更令人担忧的是,针对特定任务描述微调后,ASP R甚至高达86.7%,攻击的扩散能力极强。即使移除植入技能,部分模型仍保持68%的ASP R,表明感染具有高度的持久性和自我维持能力。为应对这一威胁,作者提出了Counter-Prompt防御策略,通过在系统提示中加入抑制Banner复制的指令,将ASP R降低至6.7%,且不影响任务完成效果。这项工作首次系统性揭示了自演化代理中的自我中毒机制,为未来LLM安全设计提供了重要参考。整体而言,该研究强调了结构化内容在自演化系统中的潜在风险,推动了安全机制的创新发展,为构建更安全的自动化编码系统奠定基础。

深度分析

研究背景

近年来,基于大规模语言模型(如GPT、Codex等)构建的自我演化编码代理逐步成为研究焦点。这些系统通过存储和检索技能库中的工具,结合模仿机制,不断自我改进,极大提升了自动化编程效率。代表性工作包括Voyager、MetaGPT和SWE-agent,它们在Minecraft、软件工程等领域展现出强大能力。然而,随着技能库的规模扩大,安全风险也随之增加。已有研究关注技能注入攻击、模型后门和提示注入等威胁,但大多集中在攻击者直接调用植入技能的REUSE路径。自我演化的特性使得代理在未调用植入技能的情况下,也可能通过模仿复制恶意内容,形成潜在的安全隐患。这一背景促使我们深入研究自我中毒机制,揭示了新型的攻击路径和防御难题。

核心问题

自演化编码代理在不断存储和模仿技能的过程中,存在被恶意技能“潜移默化”植入的风险。攻击者可以设计结构化Banner包装的恶意技能,诱导代理在模仿时复制,从而实现隐蔽传播。此机制突破传统的调用检测,导致恶意代码在库中自我繁殖,形成持久的“蠕虫”。现有防御措施主要针对调用路径,难以识别未被调用的恶意技能,且移除植入技能后,感染仍可能持续。该问题的核心在于,代理的自我模仿机制使得攻击具有高度隐蔽性和持续性,严重威胁自动化系统的安全。

核心创新

本论文提出EVOMAL攻击框架,利用结构化Banner包装恶意技能,诱导代理在模仿过程中复制,从而实现自传播。创新点包括:1)定义ASP R指标,量化自我中毒程度;2)设计多层Banner结构,增强复制概率;3)在多模型、多任务环境中验证攻击效果,发现ASP R最高达86.7%;4)提出Counter-Prompt防御策略,通过系统提示控制复制行为,显著降低ASP R至6.7%。这些创新突破了传统基于签名检测的防御手段,揭示了自演化系统中的新型安全威胁。

方法详解

  • �� 构建技能库L0,植入结构化Banner包装的恶意技能。• 设计Banner包括复制-verbatim注释、装饰器和导入注册,增强复制概率。• 利用模仿机制,代理在写入新技能时复制Banner结构,从而形成自我传播。• 通过多轮任务执行,观察恶意技能在库中的累积和扩散,计算ASP R。• 提出Counter-Prompt,加入系统提示,抑制Banner复制行为。• 在六个模型上进行大规模测试,分析ASP R变化,验证防御效果。

实验设计

采用SWE-bench中的153个工具相关任务,测试六个不同模型(如DeepSeek-V4-Pro、Qwen3)。每个模型在无Banner和有Banner条件下运行,记录ASP R和恶意技能比例。通过微调技能描述,观察攻击扩散范围。设置不同的任务轮次,验证感染的持久性。比较现有检测方法的效果,评估Counter-Prompt的防御能力。参数包括Banner结构复杂度、模仿阈值和系统提示内容,确保实验的代表性和可重复性。

结果分析

实验显示,EVOMAL在六模型中,ASP R从无Banner的11.1%提升至最高41.8%,恶意技能在库中的比例为植入的4.9至9.0倍。微调描述后,ASP R最高达86.7%,表现出极强的扩散能力。即使在移除植入技能后,Qwen3仍保持68%的ASP R,显示攻击具有高度的持久性。Counter-Prompt策略有效,将ASP R降低至6.7%,且未明显影响任务完成率。这些结果证明了攻击的高效性和防御的有效性。

应用场景

该研究揭示了自动化编码系统中的潜在安全风险,适用于自动化编程平台、技能库管理和安全审计。未来可结合自动检测和动态防御机制,提升系统抗攻击能力。长远来看,推动安全设计标准的建立,减少自演化系统中的恶意传播风险,保障自动化工具的安全可靠。

局限与展望

当前研究主要集中在结构化Banner的复制机制,复杂多样的Banner设计可能影响复制效果。防御策略依赖系统提示,可能在动态环境中效果有限。实验环境受限于特定模型和任务集,未来需验证在更大规模、多样化场景中的适应性。此外,攻击成本较低,但在实际部署中,复杂结构可能增加检测难度。未来应结合多模态信息和行为分析,提升检测和防御能力。

通俗解读 非专业人士也能看懂

想象一个工厂里,工人们按照说明书制作产品。某个工厂偷偷在说明书里夹带了一个隐藏的指令,比如“偷偷装上一个小装置”。工人们在复制和模仿时,不小心也把这个隐藏的指令复制到新产品中。结果,这个隐藏的装置会在工厂里不断传播,形成一个自我扩散的“病毒”。这就像在软件系统中,程序复制了带有恶意代码的模板,导致病毒在系统中不断传播。这个过程看似普通,但隐藏的指令让整个工厂变得不安全。研究发现,攻击者可以利用这种机制,让恶意代码在系统中自我传播,难以检测和清除。为了防止这种情况,工厂可以在说明书中加入提示,提醒工人不要复制隐藏的指令,从而减少病毒传播的风险。这个比喻说明了自我复制和传播的危险,以及如何通过简单的提示来防范。

原文摘要

Self-evolving LLM coding agents write their own tools by imitating retrieved skills from shared skill libraries. We identify a vulnerability in this loop: during authoring, a retrieved malicious skill can become the template for a new skill that preserves the payload. We call this self-poisoning: the agent authors, stores, and runs the resulting malicious skill. We exploit it through EvoMal, an attack that amplifies self-poisoning by wrapping an interchangeable payload in a banner, a set of benign-looking structural elements that induces an imitating agent to reproduce the enclosed code. The attacker plants malicious skills in the library without invoking them. The agent then authors and executes new skills carrying the harmful code. Each authored copy can re-enter the library and be imitated again, forming a self-propagating worm that persists after the planted skills are removed. We define the agent self-poisoning rate (ASPR) as the fraction of tasks that add a newly authored malicious skill to the library. Across six models on 153 tool-relevant SWE-bench Verified tasks, ASPR ranges from 20.3% to 41.8%, and the poisoned libraries hold 4.9 to 9.0 times as many malicious skills as were planted. The vulnerability also appears without a banner: DeepSeek-V4-Pro reaches 11.1% ASPR with the payload alone. Tailoring the planted skill descriptions to one task family raises ASPR to 86.7%. After the planted skills are removed, Qwen3 retains a round-5 ASPR of 68% because agent-authored copies remain. These copies evade existing defenses, which focus on attacker-submitted names, code, and signatures. We propose counter-prompt, a defense that discourages banner-style copying and reduces EvoMal's ASPR to at most 6.7% with no significant task-completion loss.

cs.CR cs.AI