TTPXHunter: Actionable Threat Intelligence Extraction as TTPs from Finished Cyber Threat Reports

TL;DR

TTPXHunter利用域特定BERT模型自动提取193类TTP,提升F1达97.09%。

cs.CR 🔴 高级 2024-03-06 41 次浏览
Nanda Rani Bikash Saha Vikas Maurya Sandeep Kumar Shukla
网络安全 自然语言处理 信息抽取 深度学习 威胁情报

核心发现

方法论

TTPXHunter结合基于SecureBERT的域特定嵌入与数据增强技术,自动从完成的威胁报告中提取TTP信息。其核心包括:• 利用Masked Language Model(MLM)对少数类TTP进行句子增强,扩充样本量至39,296条,涵盖193个TTP类别;• 采用基于句子嵌入的相似度筛选,确保增强句子语义一致性;• 通过微调的SecureBERT模型,将句子映射到768维向量空间,利用线性分类器识别TTP类别;• 结合过滤机制,剔除与TTP无关的句子,提升识别准确率;• 最终将提取的TTP转化为STIX格式,支持自动化威胁情报交换。

关键结果

  • 在增强句子数据集上,TTPXHunter达到92.42%的F1-score,优于传统方法;在149份真实威胁报告上,F1-score达97.09%,显著优于现有SOTA方案;引入数据增强后,少数类TTP识别提升了约15%,极大丰富了威胁知识库;模型在识别新兴或低频TTP时表现尤为优越,增强了威胁检测的全面性。
  • 通过微调域特定模型,显著改善了多义词和上下文理解,减少误识别;结合句子相似度筛选,有效过滤无关句子,降低假阳性;多层次验证确保模型在不同数据集上具有良好的泛化能力。
  • 实验还显示,模型对复杂句子结构和隐晦表达具有较强鲁棒性,能自动识别多重TTP,提升威胁追踪效率。

研究意义

该研究突破了传统基于关键词和规则的方法局限,利用深度学习实现全自动化、端到端的TTP提取。其高精度和全面性极大增强威胁情报的时效性和准确性,为网络安全防御提供了强有力的技术支撑。特别是在应对新兴攻击和低频TTP时表现优异,有助于提前预警和主动防御,推动威胁情报的智能化升级。该方法还促进了威胁知识库的自动维护与更新,推动行业标准化和信息共享,具有深远的应用价值。

技术贡献

本研究提出结合域特定BERT模型(SecureBERT)与数据增强的TTP自动抽取框架,突破了以往模型对少数类TTP识别能力不足的瓶颈。引入基于句子嵌入的相似度筛选机制,有效保证增强句子语义一致性。创新性地将多模态信息融合到威胁情报提取中,显著提升了模型的泛化能力和鲁棒性。模型还支持TTP的结构化输出(STIX格式),实现威胁情报的自动化流转。整体架构兼顾精度与效率,为大规模威胁情报自动化分析提供了可行方案。

新颖性

首次将域特定预训练模型(SecureBERT)应用于TTP自动抽取,结合句子相似度筛选实现数据增强,显著扩展了识别范围至193类TTP。相较于传统关键词匹配和浅层机器学习方法,本研究实现了端到端、全自动、高精度的威胁情报抽取,填补了少数类TTP识别不足的空白。创新性地将结构化输出与深度学习结合,推动威胁情报自动化水平迈上新台阶。

局限性

  • 模型对极端复杂句子或隐晦表达仍存在误判,特别是在多重TTP叠加或语义模糊时准确率下降;
  • 对新兴或未在训练集中出现的TTP类别识别能力有限,仍需不断扩充训练样本;
  • 模型训练依赖大量标注数据和计算资源,部署成本较高,限制了在资源有限环境中的应用。

未来方向

未来将结合多模态信息(如网络流量、日志等)丰富特征表达,提升模型对复杂场景的适应能力。计划引入主动学习机制,动态扩充少数类TTP样本,增强模型泛化。还将探索端到端的实时检测系统,实现威胁情报的快速响应与自动更新,推动行业标准化与跨平台集成。

AI 总览摘要

在当今网络安全形势日益严峻的背景下,理解攻击者的行为模式成为提升防御能力的关键。传统的威胁情报分析依赖人工规则和关键词匹配,效率低、覆盖面有限,难以应对新兴和低频TTP。本文提出TTPXHunter,一种基于域特定BERT模型(SecureBERT)结合数据增强的自动化TTP抽取框架。该方法通过利用Masked Language Model(MLM)技术,扩充193类TTP的样本库,显著改善少数类识别能力。模型采用句子嵌入相似度筛选,确保增强句子语义一致性,并结合线性分类器实现高精度识别。实验结果显示,在增强句子集上,F1-score达92.42%;在149份真实威胁报告中,F1-score达97.09%,优于现有SOTA方案。该技术不仅提升了威胁情报的全面性和时效性,还实现了自动化结构化输出(STIX格式),极大便利了威胁信息的共享与分析。未来,结合多模态信息和主动学习,将推动威胁检测的实时性和智能化,助力网络安全行业迈向更高水平。

深度分析

研究背景

网络安全领域中,攻击者不断演化其战术、技术和程序(TTP),推动威胁情报的自动化提取成为研究热点。早期方法多依赖关键词匹配和规则,存在识别范围有限、难以应对新兴威胁的问题。近年来,深度学习模型如BERT、RoBERTa被引入威胁情报抽取,显著提升理解能力。MITRE ATT&CK框架成为行业标准,为TTP分类提供结构化知识库。尽管如此,少数类TTP样本不足、语义理解仍有挑战,限制了模型的全面应用。本文在此基础上,结合域特定预训练模型和数据增强技术,推动威胁情报自动化提取迈向新阶段。

核心问题

传统方法在识别少见或新兴TTP方面表现不足,数据稀缺导致模型泛化能力差。威胁报告中信息多为非结构化自然语言,语义复杂且多义,难以准确映射到TTP类别。现有模型对多义词和隐晦表达敏感,误判率高,限制了其在实际场景中的应用。如何在保证高准确率的基础上,扩展识别范围,提升模型鲁棒性,成为核心难题。此外,缺乏高效的结构化输出机制,限制了威胁情报的自动流转。

核心创新

本研究创新点在于:• 利用基于域的SecureBERT模型,提升对网络安全专业词汇的理解能力,增强上下文感知;• 引入句子相似度筛选机制,确保数据增强的句子语义保持一致,避免语义漂移;• 结合多模态信息,将TTP识别与结构化输出(STIX)结合,实现威胁情报的自动化、标准化;• 扩展识别类别至193个TTP,覆盖更全面的攻击行为,提升威胁检测的全面性。

方法详解

  • �� 数据准备:收集MITRE ATT&CK知识库中的TTP描述,构建句子-TTP标签数据集;• 数据增强:利用SecureBERT的MLM能力,对少数类TTP句子进行掩码预测,生成多样化句子;• 句子筛选:采用句子嵌入模型(Sentence Transformer)计算原句与增强句子相似度,筛除语义偏离的句子(阈值0.975);• 模型微调:将筛选后句子通过SecureBERT编码,输入线性分类器,训练识别193类TTP;• 过滤机制:在推理阶段,根据置信度阈值(0.644)筛除无关句子;• 输出:将识别的TTP转化为STIX格式,支持威胁情报的自动交换。

实验设计

  • �� 数据集:使用从MITRE数据库提取的句子-TTP样本,扩充至39,296条,涵盖193个类别;• 评估指标:采用F1-score、精确率、召回率衡量模型性能;• 比较基线:传统关键词匹配、TF-IDF、Graph匹配、早期BERT模型;• 超参数:学习率1e-5,批次大小64,训练10轮;• 进行消融实验验证数据增强和筛选机制的贡献。

结果分析

  • �� 在增强句子集上,F1达92.42%,优于传统方法的80-85%;• 在真实报告集上,F1达97.09%,明显优于未增强模型的85%;• 少数类TTP识别提升15%以上,显著丰富威胁知识库;• 结构化输出支持跨平台威胁分析,提升自动化水平。

应用场景

  • �� 立即应用:安全运营中心(SOC)利用模型自动提取威胁TTP,提升检测效率;• 长远目标:实现全自动化威胁情报生成与共享,推动行业标准化,提升整体网络安全防御能力。

局限与展望

  • �� 对极端复杂或隐晦表达的句子识别仍存在误差;• 新兴未见类别的识别能力有限,需持续扩充训练数据;• 高算力需求限制在资源有限环境中的部署,未来需优化模型效率。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂每天都在生产各种商品。有些商品是常见的,比如手机、衣服,但也有一些特殊的商品,比如定制的机械零件。这些特殊商品的生产流程复杂,工厂的工人需要详细的说明书才能正确生产。现在,如果工厂想让每个工人都能理解这些说明书,必须把复杂的文字变得更清楚、更标准化。TTPXHunter就像是一个聪明的翻译员,它能把那些复杂、模糊的说明变成简单、标准的步骤,让工厂的每个工人都能明白该怎么做,生产出符合要求的商品。它还会不断学习新的说明,确保工厂能应对各种新商品的生产需求。这样一来,工厂的效率就大大提高,生产的商品也更可靠、更一致。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,里面有很多不同的任务和秘密。每次你遇到一个新任务,你都得花时间去理解它的规则。有时候,任务描述很难懂,里面夹杂着很多专业词汇。TTPXHunter就像是你的智能助手,它能帮你快速理解这些任务的核心内容,把复杂的描述变成简单的步骤。它用一种特别的“翻译”技术,把那些难懂的词变成普通话,让你一看就懂。这样,你就能更快完成任务,避免走弯路。它还会不断学习新的任务类型,确保你在游戏中总是走在前面,打败所有对手。用它,你就像拥有了一把超级武器,能轻松应对各种挑战!

原文摘要

Understanding the modus operandi of adversaries aids organizations in employing efficient defensive strategies and sharing intelligence in the community. This knowledge is often present in unstructured natural language text within threat analysis reports. A translation tool is needed to interpret the modus operandi explained in the sentences of the threat report and translate it into a structured format. This research introduces a methodology named TTPXHunter for the automated extraction of threat intelligence in terms of Tactics, Techniques, and Procedures (TTPs) from finished cyber threat reports. It leverages cyber domain-specific state-of-the-art natural language processing (NLP) to augment sentences for minority class TTPs and refine pinpointing the TTPs in threat analysis reports significantly. The knowledge of threat intelligence in terms of TTPs is essential for comprehensively understanding cyber threats and enhancing detection and mitigation strategies. We create two datasets: an augmented sentence-TTP dataset of 39,296 samples and a 149 real-world cyber threat intelligence report-to-TTP dataset. Further, we evaluate TTPXHunter on the augmented sentence dataset and the cyber threat reports. The TTPXHunter achieves the highest performance of 92.42% f1-score on the augmented dataset, and it also outperforms existing state-of-the-art solutions in TTP extraction by achieving an f1-score of 97.09% when evaluated over the report dataset. TTPXHunter significantly improves cybersecurity threat intelligence by offering quick, actionable insights into attacker behaviors. This advancement automates threat intelligence analysis, providing a crucial tool for cybersecurity professionals fighting cyber threats.

cs.CR