Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis

TL;DR

通过协调小型语言模型,Qwen3-4B与Foundation-Sec-8B的混合系统在恶意软件分析中表现优于单一LLM,准确率达35.30%。

cs.CR 🔴 高级 2026-07-22 7 次浏览
Adel ElZemity Shujun Li Budi Arief
恶意软件分析 小型语言模型 开放权重 多代理系统 证据驱动

核心发现

方法论

研究采用四种架构:多代理管道、对抗性辩论框架、层级咨询系统和混合架构。每种架构通过不同的方式增强小型语言模型的能力,特别是在恶意软件分析的结构化问题上。

关键结果

  • 混合系统在Meta的CyberSecEval基准测试中达到35.30%的整体准确率,超过最强的网络安全专用基线(22.54%)和最强的未验证前沿基线(34.77%)。
  • 在相同的证据管道下,证据驱动的Gemini配置达到38.22%的准确率,显示了证据驱动的协调可以显著提高协作SLM的性能。
  • 案例研究表明混合系统能够纠正单一模型无法处理的新型规避技术,如EtherHiding和ClickFix。

研究意义

研究表明,通过证据驱动的协调,小型语言模型可以在恶意软件分析中提供与大型语言模型相媲美的性能。这为资源受限的环境提供了可行的解决方案,减少了计算资源和托管成本。

技术贡献

研究提出了四种新的协调架构,展示了如何通过任务分解、对抗性辩论和专家咨询来提升小型语言模型的性能。这些架构在恶意软件分析中提供了新的理论保证和工程可能性。

新颖性

这是首次将多种小型语言模型协调应用于恶意软件分析,展示了证据驱动的协调如何在复杂的推理任务中超越单一大型语言模型。

局限性

  • 混合系统在处理简单问题时可能会引入不必要的信息,影响准确率。
  • 需要进一步研究如何优化证据收集和辩论阶段的协同效应。

未来方向

未来研究可以探索如何进一步优化协调架构的性能,并将其应用于其他领域的结构化问题解决。

AI 总览摘要

恶意软件分析是网络安全中的关键瓶颈,要求快速解读复杂的引爆报告。虽然大型语言模型在技术工件解读方面表现出色,但其封闭性和高昂的API成本促使人们探索开放权重的替代方案。本文研究了小型语言模型的协调是否能在恶意软件引爆报告的结构化问题上匹敌或超越单一LLM的性能。我们设计并评估了四种协调架构,包括多代理管道、对抗性辩论框架、层级咨询系统和混合架构。混合系统在Meta的CyberSecEval基准测试中达到35.30%的整体准确率,超过最强的网络安全专用基线(22.54%)和最强的未验证前沿基线(34.77%)。这些发现表明,证据驱动的协调可以显著提高协作SLM的性能,为资源受限的环境提供了可行的解决方案。未来研究可以探索如何进一步优化协调架构的性能,并将其应用于其他领域的结构化问题解决。

深度分析

研究背景

恶意软件分析在网络安全操作中是一个关键瓶颈。分析师必须快速分类可疑样本,解读复杂的引爆报告,并在时间压力下评估威胁严重性。传统的静态和动态分析管道生成丰富的遥测数据,但从这些多方面的报告中提取可操作的情报需要对恶意软件技术、操作系统内部和攻击框架有专家知识。

核心问题

恶意软件分析需要快速解读复杂的引爆报告,这些报告涵盖文件系统、网络和进程行为。虽然大型语言模型在技术工件解读方面表现出色,但其封闭性和高昂的API成本促使人们探索开放权重的替代方案。

核心创新

本文提出了四种新的协调架构:多代理管道、对抗性辩论框架、层级咨询系统和混合架构。这些架构通过任务分解、对抗性辩论和专家咨询来提升小型语言模型的性能。

方法详解

  • �� 多代理管道:将分析分解为结构化的证据收集和推理阶段。 • 对抗性辩论框架:两个代理迭代地批判对方的推理。 • 层级咨询系统:将通用SLM与网络安全专家模型配对。 • 混合架构:结合证据驱动的管道与对抗性辩论推理。

实验设计

我们在Meta的CyberSecEval恶意软件分析基准测试上测试了11个开放权重SLM、3个网络安全预训练模型和6个前沿LLM。混合系统(Qwen3-4B与Foundation-Sec-8B)在整体准确率上超过了最强的基线模型。

结果分析

混合系统在Meta的CyberSecEval基准测试中达到35.30%的整体准确率,超过最强的网络安全专用基线(22.54%)和最强的未验证前沿基线(34.77%)。

应用场景

研究结果可应用于资源受限的环境,为恶意软件分析提供高效的解决方案,减少计算资源和托管成本。

局限与展望

混合系统在处理简单问题时可能会引入不必要的信息,影响准确率。需要进一步研究如何优化证据收集和辩论阶段的协同效应。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。大型语言模型就像一个经验丰富的厨师,可以快速做出美味的菜肴,但需要昂贵的食材和设备。小型语言模型就像一个新手厨师,虽然技术不如经验丰富的厨师,但通过合作和使用简单的工具,也能做出美味的菜肴。本文研究如何通过协调多个新手厨师来超越单个经验丰富的厨师的表现。

简单解释 像给14岁少年讲一样

想象你在玩一个多人游戏。大型语言模型就像一个超级玩家,可以快速完成任务,但需要昂贵的装备。小型语言模型就像普通玩家,虽然装备不如超级玩家,但通过合作和策略,也能完成任务。本文研究如何通过协调多个普通玩家来超越单个超级玩家的表现。

术语表

SLM (小型语言模型)

指参数较少且可以在消费级硬件上运行的语言模型。

用于恶意软件分析的结构化问题解决。

LLM (大型语言模型)

指参数较多且需要高性能计算资源的语言模型。

用于技术工件解读。

CyberSecEval

Meta提供的恶意软件分析基准测试。

用于评估语言模型在安全任务上的能力。

恶意软件引爆报告

包含文件系统、网络和进程行为的复杂报告。

用于恶意软件分析。

对抗性辩论框架

两个代理迭代地批判对方的推理。

用于增强小型语言模型的推理能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化协调架构的性能?
  • 2 如何将这些架构应用于其他领域的结构化问题解决?

应用场景

近期应用

资源受限环境

为恶意软件分析提供高效解决方案,减少计算资源和托管成本。

远期愿景

广泛应用

将协调架构应用于其他领域的结构化问题解决,推动自动化分析的发展。

原文摘要

Malware analysis demands rapid interpretation of complex detonation reports spanning filesystem, network, and process behaviours. While large language models (LLMs) demonstrate impressive capabilities for technical artifact interpretation, the opacity and escalating API costs of closed-weight frontier models motivate exploration of open-weight alternatives. However, many open-weight models are large, demanding significant compute resources and incurring non-trivial hosting costs that place them beyond reach for resource-constrained deployments. This paper investigates whether orchestrated ensembles of small language models (SLMs) can match or exceed single LLM performance on structured questions about malware detonation reports. We established baselines by testing eleven open-weight SLMs, three cyber security pre-trained models, and six frontier LLMs on Meta's CyberSecEval Malware Analysis benchmark. We then designed and evaluated four orchestration architectures: (i) a multi-agent pipeline that decomposes analysis into structured evidence-collection and reasoning stages, (ii) an adversarial debate framework in which two agents iteratively critique each other's reasoning, (iii) a hierarchical consultation system that pairs a general-purpose SLM with a cyber-specialised expert model, and (iv) a hybrid architecture that combines evidence-grounded pipelines with adversarial debate reasoning. The hybrid system (Qwen3-4B with Foundation-Sec-8B) achieved 35.30% overall accuracy, exceeding the strongest cyber-specialised baseline (22.54%) and the strongest ungrounded frontier baseline (34.77%); when given the same evidence pipeline, grounded Gemini remained the strongest configuration at 38.22%. These findings show that evidence-grounded orchestration can substantially improve the performance of collaborative SLMs for supporting interpretation of malware detonation reports.

cs.CR cs.AI