RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems

TL;DR

RIFT-Bench提供了一种动态红队测试方法,统一评估多样的代理AI系统。

cs.AI 🔴 高级 2026-06-23 38 次浏览
Yarin Yerushalmi Levi Roy Betser Amit Giloni Lidor Erez Itay Gershon Oren Rachmil Sindhu Padakandla Roman Vainshtein
AI安全 红队测试 代理系统 大语言模型 系统评估

核心发现

方法论

RIFT-Bench采用了一种基于表示的方法,通过两个自动化阶段进行动态红队测试。首先,发现阶段提取系统结构;然后,扫描阶段执行自适应对抗攻击。该方法使用105个自适应对抗探针,跨越多种攻击向量和目标,对45个代理系统进行了测试。

关键结果

  • RIFT-Bench成功评估了45个代理系统,展示了其在异构架构上的有效性。
  • 通过105个对抗探针,RIFT-Bench实现了跨系统的可比性和可扩展性。
  • 该方法支持直接评估缓解策略,增强了系统安全性。

研究意义

RIFT-Bench为代理AI系统的安全评估提供了一个可扩展的基础。它解决了现有评估方法在异构系统间缺乏统一比较的问题,推动了AI安全领域的发展。

技术贡献

RIFT-Bench引入了NodeSpec,一种代码驱动的层次表示法,改善了系统可读性并支持有针对性的系统修改。它还开发了自动化发现和扫描模块,实现了结构感知的探针选择和攻击实例化。

新颖性

RIFT-Bench是首个在代理AI系统中应用统一表示进行动态红队测试的方法。与现有方法相比,它提供了更广泛的系统覆盖和更深入的攻击评估。

局限性

  • RIFT-Bench依赖于系统的白盒访问,可能不适用于所有部署环境。
  • 工具仿真可能无法完全捕捉真实工具的行为。

未来方向

未来的研究方向包括扩展RIFT-Bench以支持更多的攻击向量和系统类型,以及改进工具仿真的准确性。

AI 总览摘要

代理AI系统正迅速从研究原型转变为实际应用,但其安全性评估面临挑战。现有方法往往局限于特定实现或领域,缺乏跨异构系统的统一比较。RIFT-Bench通过一种基于表示的方法,提供了动态红队测试的解决方案。它通过两个自动化阶段——发现和扫描,实现了对代理系统的结构提取和自适应对抗攻击的执行。实验表明,RIFT-Bench在45个代理系统上表现出色,证明了其在异构架构上的有效性。该方法不仅支持系统和攻击的评估,还能直接评估缓解策略,为代理AI系统的安全评估提供了一个可扩展的基础。然而,RIFT-Bench依赖于系统的白盒访问,这可能限制其在某些环境中的应用。未来的研究将致力于扩展其攻击向量和系统类型的支持。

深度分析

研究背景

随着大语言模型的进步,代理AI系统在多步推理、工具使用和跨领域协调方面表现出色。然而,这些系统也暴露出新的安全威胁,如目标劫持和工具误用。现有的安全评估方法往往局限于特定实现,缺乏统一的比较标准。

核心问题

代理AI系统的异构性使得安全评估变得复杂。不同的框架、架构和编码实践导致缺乏标准化,阻碍了跨系统的可比性和互操作性。

核心创新

RIFT-Bench通过引入NodeSpec,提供了一种统一的系统表示法,支持动态红队测试。它通过两个自动化阶段实现了结构提取和攻击实例化,提供了可扩展的安全评估基础。

方法详解

  • �� 发现阶段:提取系统的NodeSpec表示,集成工具仿真。

  • �� 扫描阶段:使用NodeSpec进行探针选择和攻击实例化。

  • �� 评估:通过执行跟踪评估系统的对抗鲁棒性。

实验设计

实验在45个代理系统上进行,涵盖多个框架和架构。使用105个对抗探针,生成超过10,000个攻击测试,展示了RIFT-Bench的可扩展性和有效性。

结果分析

RIFT-Bench在45个系统上展示了其在异构架构上的有效性。通过105个探针实现了跨系统的可比性,支持直接评估缓解策略。

应用场景

RIFT-Bench可用于评估代理AI系统的安全性,特别是在需要跨系统比较和评估缓解策略的场景中。

局限与展望

RIFT-Bench依赖于系统的白盒访问,可能不适用于所有环境。工具仿真可能无法完全捕捉真实工具的行为。

通俗解读 非专业人士也能看懂

想象你在一个复杂的工厂工作,这个工厂有许多不同的机器和流程。RIFT-Bench就像一个智能监控系统,能够自动识别工厂中的每个机器和流程,然后测试它们的安全性。它会模拟各种可能的故障和攻击,确保每个机器都能安全运行。即使工厂的机器和流程各不相同,RIFT-Bench也能通过统一的方式进行评估,确保整体安全。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏,每个玩家都有不同的角色和技能。RIFT-Bench就像一个超级智能的游戏管理员,它能自动识别每个玩家的角色和技能,然后测试他们的安全性。它会模拟各种可能的攻击,确保每个玩家都能安全地玩游戏。即使玩家的角色和技能各不相同,RIFT-Bench也能通过统一的方式进行评估,确保游戏的公平和安全。

术语表

NodeSpec (节点规格)

一种用于表示代理系统结构的层次化表示法。

用于提取系统结构并支持攻击实例化。

RIFT-Bench

一种用于代理AI系统的动态红队测试方法。

用于统一评估多样的代理系统。

对抗探针

一种可重用的系统无关的攻击模板。

用于生成具体的攻击实例。

工具仿真

通过LLM模拟工具行为以进行安全评估。

用于安全和成本意识的执行环境。

白盒测试

一种测试方法,测试者可以访问系统的内部实现。

用于RIFT-Bench的系统结构提取和攻击实例化。

开放问题 这项研究留下的未解疑问

  • 1 如何在不依赖白盒访问的情况下进行有效的安全评估?
  • 2 如何提高工具仿真的准确性以更好地模拟真实环境?

应用场景

近期应用

企业安全评估

企业可以使用RIFT-Bench评估其代理AI系统的安全性,确保其在不同攻击场景下的鲁棒性。

远期愿景

标准化安全评估

RIFT-Bench有望成为代理AI系统安全评估的标准方法,推动行业的安全标准化。

原文摘要

Agentic AI systems powered by large language models (LLMs) are rapidly evolving into autonomous decision-making systems, exposing attack vectors beyond those of traditional LLM vulnerabilities. Existing security evaluations are often tied to specific implementations or domains, limiting unified comparison across heterogeneous systems. To address this gap, we introduce RIFT-Bench, a representation-driven methodology for dynamic red-teaming that enables unified evaluations across diverse agentic architectures. Building on a novel hierarchical representation, RIFT-Bench operates in two automated phases: Discovery, which extracts system structure, and Scanning, which executes adaptive adversarial attacks. It directly evaluates the examined system using 105 adaptive adversarial probes spanning diverse attack vectors and objectives. We demonstrate the effectiveness of the proposed evaluation pipeline across 45 agentic systems spanning a diverse range of implementations, showing that the approach generalizes effectively to heterogeneous agentic architectures. Beyond systems and attacks, RIFT-Bench also supports direct evaluation of mitigation strategies. These key capabilities make RIFT-Bench a scalable foundation for security evaluation of agentic AI systems in practice. Infrastructure code and benchmark artifacts are available at https://tinyurl.com/RIFTBench.

cs.AI