EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

TL;DR

EvoSafeHarness优化模型与领域特定的安全机制,将攻击成功率从45.6%降至10.0%。

cs.CR 🔴 高级 2026-09-05 2 次浏览
Nanxi Li Yingzi Ma Yulong Cao Edward Suh Bo Li Dawn Song Chaowei Xiao
安全性 大语言模型 系统防护 领域适应 攻击检测

核心发现

方法论

EvoSafeHarness是一种优化框架,专注于为冻结模型在目标领域合成可部署的安全机制。该框架结合自然语言策略和可执行代码逻辑,通过模型行为、领域规范和新上下文对抗性审查指导搜索,拒绝基于基准的特定规则。

关键结果

  • 在DecodingTrust-Agent上,EvoSafeHarness将平均攻击成功率从45.6%降至10.0%,同时仅损失3.3点的效用,15个模型×领域组合中有14个取得最佳成绩。
  • 在AgentDojo上达到82.8%的效用和0.0%的攻击成功率,是CaMeL效用的两倍,并且在未见过的AgentDyn套件中实现了无变化转移。
  • 在Agent-SafetyBench上对每个受害者均获得最佳分数,并在16次自适应PAIR攻击下将平均攻击成功率保持在20%以下。

研究意义

EvoSafeHarness在学术界和工业界具有重要意义。它解决了现有固定专家设计防御在不同模型和领域间的适应性不足的问题,通过优化模型和领域特定的安全机制,提升了安全效用前沿,提供了更灵活的部署方案。

技术贡献

EvoSafeHarness的技术贡献在于其优化框架的灵活性和适应性。与现有的固定防御不同,它能够根据具体的模型和领域需求调整安全机制,提供了新的理论保证和工程可能性。

新颖性

EvoSafeHarness首次实现了模型和领域特定的安全机制优化。与SafeHarness等相关工作相比,其创新在于通过对抗性验证和领域规范指导的搜索过程,提供了更高效的安全效用平衡。

局限性

  • EvoSafeHarness在某些复杂领域可能需要更长的优化时间,影响部署效率。
  • 在极端对抗性环境下,可能需要额外的安全机制来确保全面防护。

未来方向

未来工作可以探索EvoSafeHarness在更多领域的适应性,以及在更复杂的对抗性环境下的性能表现。此外,进一步优化搜索算法以提高效率也是一个重要方向。

AI 总览摘要

EvoSafeHarness是一种针对大语言模型代理的安全优化框架,旨在解决现有系统级安全机制在不同模型和领域间适应性不足的问题。现有的安全机制通常由专家设计并应用于各种异构模型和领域,但这种方法在实际部署中可能导致过度阻断或安全关系遗漏。

EvoSafeHarness通过自然语言策略和可执行代码逻辑的联合搜索,结合模型行为、领域规范和新上下文对抗性审查,自动合成适用于冻结模型的可部署安全机制。在四个代理基准测试中,EvoSafeHarness在安全效用前沿上表现优于固定专家设计的防御。在DecodingTrust-Agent上,EvoSafeHarness将平均攻击成功率从45.6%降至10.0%,同时仅损失3.3点的效用。

EvoSafeHarness的成功在于其灵活的优化框架,能够根据具体的模型和领域需求调整安全机制。这种方法不仅提升了安全效用平衡,还为未来的安全机制设计提供了新的思路。尽管在某些复杂领域可能需要更长的优化时间,但其在适应性和效率上的优势使其成为一种有前景的安全解决方案。

深度分析

研究背景

随着大语言模型代理从演示走向部署,它们逐渐接触到敏感数据、金融账户、生产系统和外部服务,安全性成为操作要求。现有的模型级防御方法虽然提高了模型区分可信指令的能力,但缺乏独立于模型行为的系统级强制边界,这促使了系统级防御的实施。

核心问题

现有的安全机制通常由专家设计并应用于各种异构模型和领域,但这种方法在实际部署中可能导致过度阻断或安全关系遗漏。如何在不同模型和领域间实现最佳的安全效用平衡是一个亟待解决的问题。

核心创新

EvoSafeHarness通过自然语言策略和可执行代码逻辑的联合搜索,结合模型行为、领域规范和新上下文对抗性审查,自动合成适用于冻结模型的可部署安全机制。与现有的固定防御不同,它能够根据具体的模型和领域需求调整安全机制。

方法详解

  • �� 自然语言策略和可执行代码逻辑的联合搜索
  • �� 结合模型行为、领域规范和新上下文对抗性审查
  • �� 自动合成适用于冻结模型的可部署安全机制
  • �� 在四个代理基准测试中进行验证

实验设计

实验在四个代理基准测试中进行,包括DecodingTrust-Agent、AgentDojo、Agent-SafetyBench和AgentDyn。使用的指标包括攻击成功率(ASR)和效用。基线对比包括CaMeL、DRIFT和Progent。

结果分析

EvoSafeHarness在DecodingTrust-Agent上将平均攻击成功率从45.6%降至10.0%,同时仅损失3.3点的效用。在AgentDojo上达到82.8%的效用和0.0%的攻击成功率,是CaMeL效用的两倍。

应用场景

EvoSafeHarness可用于需要高安全性和效用平衡的领域,如金融、医疗和自动驾驶。其灵活的优化框架使其适用于多种模型和领域。

局限与展望

EvoSafeHarness在某些复杂领域可能需要更长的优化时间,影响部署效率。在极端对抗性环境下,可能需要额外的安全机制来确保全面防护。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。EvoSafeHarness就像一个智能厨师助手,它会根据不同的食材和菜谱自动调整烹饪方法,确保每道菜既美味又安全。现有的厨师助手可能只适合某些特定的菜谱,而EvoSafeHarness可以根据不同的食材和需求,灵活调整烹饪策略,避免过度烹饪或遗漏关键步骤。这样,无论你做什么菜,它都能帮助你达到最佳的味道和安全标准。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的任务是保护一个城堡。EvoSafeHarness就像一个超级智能的防御系统,它会根据不同的敌人和攻击方式,自动调整防御策略。现有的防御系统可能只适合某些特定的攻击,而EvoSafeHarness可以根据不同的敌人和攻击方式,灵活调整防御策略,确保你的城堡始终安全。这样,无论敌人多么狡猾,你都能轻松应对!

术语表

大语言模型 (Large Language Model)

一种能够理解和生成自然语言的人工智能模型,通常用于对话、翻译等任务。

在论文中用于生成和执行自然语言策略。

攻击成功率 (Attack Success Rate)

衡量攻击成功的频率,通常用百分比表示。

用于评估安全机制的有效性。

效用 (Utility)

衡量系统在正常操作下的性能,通常与安全性相对。

用于评估安全机制的影响。

对抗性审查 (Adversarial Review)

一种评估方法,通过模拟攻击来测试系统的安全性。

用于指导安全机制的优化。

系统级安全机制 (System-Level Safety Harness)

一种独立于模型的安全防护层,用于增强系统的整体安全性。

在论文中作为优化目标。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端对抗性环境下提高EvoSafeHarness的性能?
  • 2 在更多领域中应用EvoSafeHarness的适应性如何?

应用场景

近期应用

金融安全

EvoSafeHarness可用于金融系统,确保交易安全,防止欺诈。

远期愿景

自动驾驶安全

EvoSafeHarness可用于自动驾驶系统,确保车辆在复杂环境中的安全性。

原文摘要

Large Language Model (LLM) agents are turning language into real-world effects, making safety necessary against both indirect prompt injections and direct harmful requests. System-level safety harnesses add an enforcement layer beyond model-level defenses, but existing harnesses are usually designed once by experts and applied across heterogeneous models and domains. Effective protection is deployment-dependent: models differ in how much enforcement they need before utility declines, while domains differ in the effects, state, and action sequences that must be governed. A harness that is strict enough for one model may over-block another, and a policy that transfers across domains may miss application-specific safety relations. We present EvoSafeHarness, a safety-specific optimization framework that synthesizes a deployable harness for a frozen model in a target domain. It jointly searches a natural-language policy and executable code logic, guided by model behavior, domain specifications, and fresh-context adversarial review to reject benchmark-specific rules. Across four agent benchmark families, EvoSafeHarness achieves a stronger safety-utility frontier than fixed expert-designed defenses. On DecodingTrust-Agent, it reduces average attack success rate from 45.6% to 10.0% at a 3.3-point utility cost and achieves the best score in 14 of 15 cells. On AgentDojo, it reaches 82.8% utility at 0.0% ASR, twice CaMeL's utility at the same operating point, and transfers unchanged to unseen AgentDyn suites. It also achieves the best score on Agent-SafetyBench for every victim and keeps mean ASR below 20% under adaptive PAIR attacks with a refinement budget of 16. Analysis shows that domain semantics determine which safety relations and trajectory state are needed, while model and runtime behavior determine how and where those relations should be enforced.

cs.CR