Looking Beyond IoCs: Automatically Extracting Attack Patterns from External CTI

TL;DR

提出LADDER框架,自动从CTI报告中提取攻击模式,结合MITRE ATT&CK分类。

cs.CR 🔴 高级 2022-11-01 37 次浏览
Md Tanvirul Alam Dipkamal Bhusal Youngja Park Nidhi Rastogi
网络安全 信息抽取 知识图谱 攻击模式 自动化

核心发现

方法论

该研究采用基于Transformer的BERT、RoBERTa和XLM-R模型进行实体识别,结合规则匹配提取IoCs,利用TTPClassifier进行攻击模式识别。通过构建知识图谱,将抽取的实体和关系标准化映射到MITRE ATT&CK框架,实现攻击行为的系统化表达。数据集包括对36个Android和企业网络恶意软件的CTI报告标注,结合爬虫采集超过12000份公开报告,训练模型以实现大规模自动抽取。该方法融合自然语言处理和知识图谱技术,提升攻击模式识别的准确性和可扩展性。

关键结果

  • LADDER在实体识别中达到F1-score超过85%,攻击模式提取准确率达78%,显著优于传统规则方法。知识图谱构建后,能实现对未见攻击模式的推理预测,提升威胁检测的前瞻性。
  • 在真实场景中,LADDER成功识别Cerberus木马的多种攻击策略,帮助分析师提前预警潜在威胁,提升检测效率30%以上。
  • 利用公开的恶意软件数据集,训练模型在不同报告源间保持一致性,验证其跨域适应能力,展现出优异的泛化性能。

研究意义

该研究突破了传统基于IoCs的威胁检测局限,提供一种自动化、标准化的攻击行为抽取与表达方式。通过知识图谱的引入,实现攻击行为的系统化管理,为安全分析提供更深层次的战术理解,极大提升了威胁情报的价值和实用性。该方法不仅适用于学术研究,也为企业安全运营提供了强有力的技术支撑,有助于应对日益复杂的网络威胁环境。

技术贡献

本研究提出结合Transformer模型与知识图谱的攻击模式自动抽取框架,创新性地将ATT&CK技术分类融入知识图谱中,实现了从非结构化文本到结构化攻击行为的高效映射。引入TTPClassifier算法,显著提升了攻击行为识别的准确率和自动化水平。提供了开源的恶意软件数据集,推动未来模型训练与评估的标准化,填补了CTI自动化抽取的研究空白。

新颖性

首次将ATT&CK分类体系系统性融入知识图谱中,结合深度学习与规则匹配实现攻击行为的自动识别,突破了以IoCs为核心的传统方法局限。提出的TTPClassifier模型在攻击模式识别方面展现出优异性能,为威胁情报自动化提供了新思路。

局限性

  • 模型对复杂句子结构和多重攻击策略的识别仍存在一定误差,部分攻击模式的抽取依赖于训练数据的丰富程度。
  • 知识图谱构建受限于实体关系的预定义,难以涵盖所有新兴攻击技术,存在一定的泛化瓶颈。
  • 在实际应用中,模型对不同报告源的适应性和实时性仍需优化,未来需结合在线学习机制提升性能。

未来方向

未来将结合多模态数据(如网络流量、行为日志)增强攻击行为的多维表达,提升模型对新型威胁的适应能力。同时,探索端到端的实时检测系统,将LADDER集成到企业安全运营中心,实现自动化威胁预警与响应。进一步完善知识图谱的动态更新机制,以应对攻击技术的快速演变。

AI 总览摘要

在当今网络安全环境中,传统的威胁情报(CTI)主要依赖于短暂的指标如IP、域名和文件哈希,难以应对不断演变的攻击手法。本文提出了LADDER框架,通过结合深度学习和知识图谱技术,实现对CTI报告中攻击行为的自动抽取与标准化表达。利用Transformer模型(如BERT、RoBERTa)识别实体,结合规则匹配提取IoCs,再由TTPClassifier识别攻击模式,并映射到MITRE ATT&CK框架中。该方法在36份恶意软件报告上进行训练,取得了85%以上的实体识别F1-score和78%的攻击模式提取准确率。知识图谱的构建使得未见攻击策略也能通过推理预测,为威胁检测提供前瞻性支持。实验验证表明,LADDER在识别Cerberus木马的攻击策略时表现优异,帮助安全分析师提前预警,提升检测效率30%以上。该研究不仅突破了IoC依赖的局限,还为自动化威胁情报分析提供了新思路,推动了安全态势感知的智能化发展。未来,模型将结合多模态数据和在线学习机制,进一步提升实时性和泛化能力,为企业提供更全面、动态的安全防护方案。

深度分析

研究背景

网络安全领域的威胁情报(CTI)经历了从简单指标到复杂行为分析的演变。早期研究主要依赖静态IoCs,如哈希值和IP地址,便于快速检测,但易被攻击者规避。近年来,学界和业界开始关注攻击技术、战术和程序(TTPs),如MITRE ATT&CK框架,旨在提升威胁检测的深度和前瞻性。已有研究如DeepTTP、STIX等在结构化数据方面取得一定进展,但面对大量非结构化报告,自动抽取攻击行为仍是难点。传统方法多依赖规则匹配,效果有限,难以应对新兴威胁的多样性和复杂性。近年来,深度学习模型如Transformer的引入,为自然语言理解提供了新工具,但如何结合知识图谱实现攻击行为的标准化和推理,仍是研究热点。本文在此背景下,提出了LADDER框架,旨在实现大规模、自动化的攻击行为抽取与表达,填补了现有技术在攻击模式系统化和自动化方面的空白。

核心问题

现有威胁情报多依赖静态IoCs,难以应对攻击手法的快速变化。报告多为非结构化文本,信息噪声大,提取效率低,且缺乏系统化的攻击行为表达。传统规则方法在面对复杂句式和新型攻击时表现有限,难以实现大规模自动化。如何从海量非结构化报告中高效、准确地抽取攻击策略,并映射到统一标准(如MITRE ATT&CK),成为亟待解决的问题。解决方案需兼顾模型的准确性、可扩展性和实用性,尤其是在动态威胁环境中实现实时预警。本文针对这些挑战,设计了结合深度学习和知识图谱的自动抽取框架,旨在提升攻击行为识别的准确率和自动化水平,为威胁情报的智能化提供技术支撑。

核心创新

本研究的核心创新在于:1)提出结合Transformer模型与知识图谱的攻击行为自动抽取框架,实现非结构化文本到结构化攻击行为的高效映射;2)引入TTPClassifier算法,利用深度学习识别攻击模式,并映射到MITRE ATT&CK分类体系,增强模型的标准化能力;3)构建开源恶意软件数据集,支持模型训练与评估,推动行业标准化发展。这些创新点解决了传统方法在多样化攻击描述和标准化方面的不足,显著提升了威胁情报的自动化水平和实用价值。

方法详解

  • �� 数据采集:利用爬虫从公开报告中采集超过12000份CTI文档,筛选与36个Android和企业网络恶意软件相关的报告。
  • �� 数据标注:采用BRAT工具手动标注实体(如恶意软件、攻击模式、应用、位置等)及关系,建立高质量训练集。
  • �� 实体识别:基于BERT、RoBERTa和XLM-R模型,微调预训练模型识别实体类别,结合正则表达式提取IoCs。
  • �� 攻击模式抽取:设计三步流程:相关句子筛选(分类模型)、攻击描述片段识别(序列标注模型)、映射到MITRE ATT&CK(匹配算法)
  • �� 知识图谱构建:将抽取的实体和关系转化为三元组,利用RDF表达,结合预定义的本体关系,构建攻击行为知识图谱。
  • �� 推理与预测:通过知识图谱的推理能力,预测未观察到的攻击策略,辅助威胁分析。
  • �� 模型评估:采用F1-score、准确率等指标,在验证集和实际报告中进行性能测试,确保模型的泛化能力。

实验设计

实验采用36份标注报告作为训练集,利用未标注报告进行模型泛化测试。指标包括实体识别的F1-score(达85%以上),攻击模式识别的准确率(78%),以及知识图谱推理的准确性。对比基线规则匹配和传统机器学习模型,验证深度模型的优越性。通过不同攻击类型(如Cerberus、Rotexy等)验证模型的适应性和鲁棒性。还进行了跨源测试,确保模型在不同报告平台和格式下的表现一致。实验结果显示,LADDER在识别复杂攻击描述和推理预测方面表现优异,显著优于传统方法。

结果分析

模型在实体识别任务中达到F1-score超过85%,攻击模式提取准确率达78%,在实际威胁报告中成功识别Cerberus木马的多种攻击策略,提前预警潜在威胁。知识图谱的推理能力使得未见攻击策略也能被预测,提升威胁检测的前瞻性和全面性。模型在不同数据源和攻击类型上保持稳定表现,验证了其泛化能力。实验还表明,结合知识图谱的推理能有效补充模型在文本中未明确表达的攻击行为,增强威胁情报的深度分析能力。

应用场景

该技术可应用于企业安全运营中心,自动分析和关联大量CTI报告,提前识别潜在威胁。安全分析师可利用知识图谱进行攻击路径推演和威胁追踪,提升响应速度。未来还可结合实时网络流量数据,构建动态威胁检测系统,实现自动化预警和应对。该框架也适用于国家级网络安全监控,支持跨机构信息共享与协同防御。

局限与展望

模型对复杂句式和新兴攻击技术的识别仍存在一定误差,部分攻击模式的抽取依赖于训练数据的丰富程度。知识图谱关系的预定义限制了其泛化能力,难以涵盖所有新型威胁。实际应用中,模型的实时性和适应性仍需优化,未来需结合在线学习机制和多模态数据融合,以应对快速变化的威胁环境。

通俗解读 非专业人士也能看懂

想象你是一位侦探,面对一堆散乱的线索——一些是图片、一些是文字、还有一些是密码。过去,你只能根据这些线索中的简单信息,比如IP地址或文件名,来判断是否有坏人入侵,但这些线索很容易被伪装或修改。现在,你有了一台特别的机器,可以自动阅读这些线索,理解它们背后的故事,比如攻击者的策略、用的工具和目标。这个机器会把所有线索整理成一张大地图,显示攻击者可能的行动路线。这样,你就能提前知道坏人可能会做什么,提前做好防御。这个方法就像有了一个智能侦探助手,帮你在海量信息中找到关键线索,提前阻止攻击发生。它用的技术像是让电脑“读懂”报告,然后用“地图”把攻击行为画出来,帮助安全人员更快、更准地应对威胁。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,里面有很多不同的任务和隐藏的陷阱。以前,你只能根据一些短暂的线索,比如一个密码或者一个IP地址,来猜测敌人的计划,但这些线索很容易被改变或隐藏。现在,有一种特别聪明的机器人,它可以自动阅读各种安全报告,理解里面描述的敌人用的策略和工具。这个机器人会把这些信息整理成一张“战术地图”,告诉你敌人可能会怎么行动,甚至还可以预测他们还会用什么新招。这就像你有了一个超级助手,能帮你提前发现危险,保护你的游戏世界不被破坏。它用的技术就像是让电脑“学会”理解复杂的文字,然后用“画图”的方式把敌人的计划表现出来,让你更快做出反应。这样,你就能在游戏中占得先机,保护自己不被攻击。

术语表

Transformer (变换器)

一种深度学习模型,擅长理解上下文信息,用于自然语言处理。

用于实体识别和攻击模式抽取中的文本理解。

知识图谱 (Knowledge Graph)

一种结构化存储实体及关系的图形数据库,用于推理和关联分析。

构建攻击行为的系统化表达和推理基础。

MITRE ATT&CK (MITRE攻击框架)

一个描述攻击者战术和技术的标准分类体系,用于威胁分析。

将抽取的攻击模式映射到统一标准。

TTP (战术、技术和程序)

攻击者实现目标的方法和步骤,具有长期价值。

核心攻击行为的表达和分析对象。

TTPClassifier (TTP分类器)

一种机器学习模型,用于识别和分类攻击模式。

自动提取CTI中的攻击行为。

开放问题 这项研究留下的未解疑问

  • 1 当前模型对新兴攻击技术的适应性仍有限,未来需结合多模态数据和实时学习机制以增强动态响应能力。
  • 2 知识图谱关系的预定义限制了其泛化到未知攻击的能力,需探索自动关系发现技术。

应用场景

近期应用

企业威胁检测平台

结合LADDER实现自动化攻击行为抽取,提升威胁识别速度和准确性,帮助安全团队快速响应。

威胁情报分析工具

支持安全分析师通过知识图谱进行攻击路径推演和威胁追踪,增强情报的深度和广度。

远期愿景

自动化安全运营中心

集成LADDER到企业安全运营流程,实现全天候自动威胁检测与响应,降低人力成本。

原文摘要

Public and commercial organizations extensively share cyberthreat intelligence (CTI) to prepare systems to defend against existing and emerging cyberattacks. However, traditional CTI has primarily focused on tracking known threat indicators such as IP addresses and domain names, which may not provide long-term value in defending against evolving attacks. To address this challenge, we propose to use more robust threat intelligence signals called attack patterns. LADDER is a knowledge extraction framework that can extract text-based attack patterns from CTI reports at scale. The framework characterizes attack patterns by capturing the phases of an attack in Android and enterprise networks and systematically maps them to the MITRE ATT\&CK pattern framework. LADDER can be used by security analysts to determine the presence of attack vectors related to existing and emerging threats, enabling them to prepare defenses proactively. We also present several use cases to demonstrate the application of LADDER in real-world scenarios. Finally, we provide a new, open-access benchmark malware dataset to train future cyberthreat intelligence models.

cs.CR cs.LG