← 最新论文
💬 NLP

TTPrint: Evidence-Grounded TTP Extraction via Diverge-then-Converge Verification

TTPrint 是一个新颖的框架,它通过采用“先发散后收敛”的策略,从网络威胁情报报告中提取 MITRE ATT&CK 技术:首先广泛识别锚定于具体证据的候选行为,随后依据权威定义对其进行严格验证,从而在召回率和精确率上均显著优于现有方法。

原作者: Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki, Qian Cui, Wei Ding, Peng Gao

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki, Qian Cui, Wei Ding, Peng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正试图破解一份庞大而混乱的犯罪现场报告。这份报告长达数百页,混杂着技术术语和模糊的描述。你的任务是找出特定的“作案手法”(Modus Operandi,即罪犯如何实施犯罪),并将它们与一本名为 MITRE ATT&CK 的庞大官方规则手册进行匹配。

问题在于棘手之处:

  1. 切勿遗漏任何内容:如果你漏掉了一种技术,罪犯就能带着新伎俩逍遥法外。
  2. 切勿凭空捏造:如果你猜测了一种实际上并不存在的技术,就会浪费所有人的时间去追逐幻影。

现有的方法(如旧式规则手册或单次通过的人工智能)难以同时做到这两点。它们要么遗漏太多线索,要么猜测出太多错误的结果。

此时,TTPRINT 登场了。这是一个新系统,它通过模拟人类侦探团队采用“先发散后收敛”(Diverge-then-Converge)的策略来解决这一问题。这可以看作是一个两步过程:先广泛撒网,再精准收网

TTPRINT 侦探工作流程

第一阶段:“发散”(广泛撒网)

TTPRINT 并不试图立即猜测答案,而是将庞大的犯罪报告拆解为微小的、易于消化的片段,称为“原子行为”(atomic behaviors)。

  • 类比:想象将一本 50 页的小说切割成一个个独立的句子。
  • 它的作用:对于每一个微小的句子,人工智能会问:“这可能是什么?”它会从规则手册中生成一份长长的可能匹配列表。它故意撒下大网,即使这意味着提出一些不太可能的选项。此阶段的目标是召回率(Recall):确保没有任何真实线索被遗漏。

第二阶段:“锚定”(寻找证据)

在人工智能确认猜测之前,它必须证明该线索出自文本中的何处。

  • 类比:如果你说“嫌疑人使用了撬棍”,你就必须指出报告中确切写着“嫌疑人使用了撬棍”的那句话。你不能仅仅说“我认为他们用了撬棍,因为他们打破了窗户”。
  • 它的作用:TTPRINT 使用一种严格的非人工智能算法,找到支持该行为的特定文本“窗口”。这将每一个猜测都锚定在具体的证据上,防止人工智能基于整篇文档的总体氛围而产生幻觉(即凭空捏造)。

第三阶段:“收敛”(精准收网)

现在进入严格的验证阶段。人工智能将“可能”的匹配列表与特定的“证据窗口”结合起来。

  • 类比:一名资深侦探审查初级侦探列出的清单。他们对照具体的句子(证据)和官方规则手册的定义。他们会问:“这句话真的符合规则手册的定义,还是仅仅是一个松散的猜测?”
  • 它的作用:人工智能会分配一个置信度分数。如果匹配度弱,则予以剔除;如果匹配度高,则予以保留。这一步确保了精确度(Precision):只有真正由文本支持的事实才会被保留。

为何此法更有效

该论文声称,以往的方法试图一次性完成所有这些步骤(就像侦探一口气猜出整个故事)。这会导致错误:

  • 过于谨慎:为了避免猜错,它们会遗漏细微的线索。
  • 过于自信:由于报告中的措辞与规则手册并不完全匹配,它们会做出错误的猜测。

TTPRINT 将“猜测”与“核查”分离开来。通过拆分任务,它可以在猜测时大胆(捕捉所有内容),在核查时严格(只保留真相)。

结果

研究人员在两个数据集上测试了 TTPRINT:

  1. TRAM-Clean:现有数据集的清理版本(他们修正了原始标签中的错误)。
  2. TTPRINT-Bench:一个全新的数据集,包含 150 份从头开始创建的完整报告。

成绩单

  • 在新数据集上,TTPRINT 取得了 87.39% 的成功率(Macro-F1)。
  • 最佳的前代方法(使用“思维链”的标准人工智能)仅达到 58.02%
  • TTPRINT 将分数提高了近 30%,这意味着它发现了更多真实的技术,同时犯了更少的错误。

控制“旋钮”

一个很酷的功能是一个名为 τ\tau 的“阈值旋钮”。

  • 调高它:你会得到更少的结果,但你 100% 确定它们是正确的(高精确度)。这适用于无法承受犯错风险的自动化系统。
  • 调低它:你会得到更多的结果,几乎能捕捉到所有内容,即使其中一些可能不太可靠(高召回率)。这适用于希望捕捉所有潜在威胁并稍后调查的安全团队。

总结

TTPRINT 就像一名侦探,他首先根据报告中的每一句话写下每一个可能的理论,然后在撰写最终案件档案之前,严格地将每个理论与具体证据进行核对。这种方法使其能够比任何以往的方法捕捉到更多真实威胁,并减少误报。

注:该论文严格专注于从英文报告中提取这些技术。它不声称能预测未来攻击、实时阻止黑客,或作为医疗或法律诊断工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →