Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms

TL;DR

本文比较分析了功能调用与模型上下文协议在LLM代理中的安全漏洞,发现架构影响攻击成功率。

cs.CR 🔴 高级 2025-07-09 56 次浏览
Tarek Gasmi Ramzi Guesmi Ines Belhadj Jihene Bennaceur
AI安全 软件漏洞 架构设计 LLM代理 威胁评估

核心发现

方法论

采用统一威胁分类框架,设计了三千二百五十个攻击场景,涵盖七个不同语言模型。通过模拟简单、复合和链式攻击,评估AI特有的提示注入与传统软件漏洞(如JSON注入、拒绝服务)在两种架构下的成功率。实验采用多阶段攻击模型,结合威胁分类和多维指标,系统分析架构对漏洞的影响。结果利用攻击成功率(ASR)和拒绝率(RR)指标,验证不同架构在复杂攻击中的表现差异。

关键结果

  • 功能调用架构整体攻击成功率为73.5%,高于模型上下文协议的62.59%,显示其对系统性漏洞更敏感。链式攻击成功率达91-96%,极大增强攻击效果。复杂攻击(链式)显著提高成功率,表明架构设计对安全性具有根本影响。即使是高推理能力模型,也表现出更高的易受攻击性,反映其在威胁检测与利用之间的矛盾。
  • 实验验证了不同攻击路径的交互作用,复合攻击在两种架构中均显著提升成功率,揭示多层次漏洞叠加的风险。模型内部推理能力虽增强威胁检测,但在复杂链式攻击中反而更易被利用,提示架构优化需兼顾推理与安全。
  • 研究成果为跨域安全评估提供了系统方法,强调架构选择对安全态势的决定性作用,为未来安全部署提供依据。

研究意义

本研究填补了AI与软件安全交叉领域的空白,首次系统性比较了两种主流架构在多维威胁下的表现。结果表明架构设计不仅影响模型性能,也深刻影响安全风险,为工业界提供了科学的安全部署指导。通过揭示复杂攻击的高成功率,促使开发者在设计系统时考虑多层次防护策略,推动安全架构的优化升级。研究成果具有重要理论价值和实际应用意义,有助于构建更稳健的AI代理系统,减少潜在的安全隐患。

技术贡献

提出了一套跨域威胁分类与评估框架,结合多阶段攻击模型,系统分析功能调用与模型上下文协议在不同架构中的漏洞表现。创新点在于引入链式攻击和复合攻击的概念,量化架构对攻击路径的影响,提供了可量化的安全指标。该方法突破了以往单一漏洞分析的局限,为多维安全评估提供了理论基础。实验验证了复杂攻击在不同架构中的高成功率,揭示了架构设计对安全的深远影响,为未来多层次安全防护提供了技术支撑。

新颖性

本研究首次系统性比较了功能调用与模型上下文协议两大架构在多维威胁场景下的表现,提出了多阶段攻击模型,强调了复杂链式攻击的高风险。相较于现有文献多关注单一漏洞或单一架构,本工作从整体系统角度出发,揭示了架构设计对安全的决定性作用,具有较强的创新性和前瞻性。

局限性

  • 实验主要基于模拟攻击场景,实际系统中的复杂性和多样性可能导致结果偏差。某些攻击路径在真实环境中难以实现或检测,未来需结合真实应用场景验证模型的泛化能力。
  • 模型推理能力虽被视为安全优势,但在链式攻击中反而表现出更高的易受攻击性,提示架构优化仍需平衡推理性能与安全性。
  • 研究未充分考虑不同硬件和网络环境对攻击效果的影响,未来应扩展多环境、多平台的安全评估体系。

未来方向

未来将深入研究多层次防御机制,结合动态威胁检测与自适应架构优化,提升系统整体安全性。同时,计划引入真实应用场景中的实证验证,结合行业标准制定更全面的安全评估指标,推动安全架构的标准化与自动化。还将探索多模型协同与联邦学习环境下的安全策略,为大规模部署提供理论支撑。

AI 总览摘要

随着大规模语言模型(LLMs)在自动化决策和人机交互中的广泛应用,系统的安全性成为关键关注点。现有研究多集中于模型本身的漏洞,忽视了多组件系统中架构设计对安全的深远影响。本研究通过比较功能调用(Function Calling)与模型上下文协议(MCP)两种架构,系统分析了它们在面对多样化攻击场景下的表现差异。

采用统一威胁分类框架,设计了超过三千个攻击场景,涵盖简单、复合和链式攻击,模拟了AI特有的提示注入与传统软件漏洞如JSON注入、拒绝服务等。实验结果显示,功能调用架构在整体攻击成功率上优于MCP(73.5%对62.59%),但在系统性漏洞方面更脆弱。链式攻击成功率高达91-96%,极大增强了攻击效果。令人意外的是,推理能力更强的模型反而更易被利用,揭示了推理与安全之间的复杂关系。

这些发现强调架构设计在安全中的核心作用,为未来构建更稳健的AI代理系统提供了理论基础。研究不仅丰富了安全评估方法,也为工业界提供了实用的架构优化建议。未来工作将结合动态威胁检测和多模型协同,推动安全架构的持续演进,确保AI系统的可靠性与安全性。

深度解读

原文摘要

Large Language Model (LLM) agents face security vulnerabilities spanning AI-specific and traditional software domains, yet current research addresses these separately. This study bridges this gap through comparative evaluation of Function Calling architecture and Model Context Protocol (MCP) deployment paradigms using a unified threat classification framework. We tested 3,250 attack scenarios across seven language models, evaluating simple, composed, and chained attacks targeting both AI-specific threats (prompt injection) and software vulnerabilities (JSON injection, denial-of-service). Function Calling showed higher overall attack success rates (73.5% vs 62.59% for MCP), with greater system-centric vulnerability while MCP exhibited increased LLM-centric exposure. Attack complexity dramatically amplified effectiveness, with chained attacks achieving 91-96% success rates. Counterintuitively, advanced reasoning models demonstrated higher exploitability despite better threat detection. Results demonstrate that architectural choices fundamentally reshape threat landscapes. This work establishes methodological foundations for cross-domain LLM agent security assessment and provides evidence-based guidance for secure deployment. Code and experimental materials are available at https: // github. com/ theconsciouslab-ai/llm-agent-security.

cs.CR cs.AI