← 最新论文
💻 computer science

Validating Threat Modeling Results with the Help of Vulnerable Test Applications

本文提出并验证了一种基于漏洞的威胁建模完整性评估方法,通过证明由大语言模型辅助的工具(ThreMoLIA)在发现故意植入漏洞的测试应用中的已知漏洞方面优于微软威胁建模工具,从而证实了该方法的有效性。

原作者: Oleksandr Adamov, Davide Fucci, Felix Viktor Jedrzejewski, Ricardo Britto, Nishrith Saini

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Oleksandr Adamov, Davide Fucci, Felix Viktor Jedrzejewski, Ricardo Britto, Nishrith Saini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一座城堡。在砌下第一块砖之前,你希望确保已经想到了窃贼可能潜入的每一种方式。这种规划过程被称为威胁建模。你会绘制城堡的地图(架构图),并列出窃贼可能闯入的每一种方式(威胁)。

大问题在于:你怎么知道你的列表是完整的?通常,你会请一位专家保安来审视你的列表,然后说:“干得好,你没漏掉任何事。”但如果这位专家累了,或者他们的观点与你不同呢?很难确定。

本文介绍了一种测试这些安全计划的巧妙新方法:“诱捕屋”测试

“诱捕屋”实验

研究人员没有仅仅询问专家,而是构建了两个数字“诱捕屋”(易受攻击的应用程序):

  1. AzureGoat:一个旨在存在特定已知安全漏洞的云端设置。
  2. VulnBank:一个旨在充满漏洞的假银行应用程序,其中包括一些与人工智能相关的棘手漏洞。

这些“房屋”拥有一份精确标注漏洞位置的“记分卡”。研究人员并未告知安全工具漏洞在哪里;他们只是向工具提供了蓝图(地图),并问道:“找出威胁。”

竞争者

研究人员让两位不同的“安全侦探”相互较量:

  • 老手(MTMT):微软威胁建模工具。这是一款知名且传统的工具,遵循一套严格、既定的规则(称为 STRIDE)来发现威胁。可以将其想象为一位经验丰富的侦探,擅长发现经典的撬锁和破窗方法。
  • 新人(ThreMoLIA):一款由大型人工智能(LLM)驱动的新工具。这位侦探很聪明,会阅读蓝图,并利用庞大的知识库来推测坏家伙可能在哪里下手,包括像人工智能操纵这样的现代伎俩。

结果:谁发现了更多的漏洞?

研究人员统计了每个工具在“诱捕屋”中发现了多少已知的“漏洞”。

  • 在云端房屋(AzureGoat)中:

    • ThreMoLIA(人工智能):发现了 100% 的漏洞(7 个中的 7 个)。它抓住了所有漏洞。
    • MTMT(老手):仅发现了 57%(7 个中的 4 个)。它漏掉了一些。
  • 在银行房屋(VulnBank)中:

    • ThreMoLIA:即使仅凭基本蓝图,它也发现了 73% 的漏洞。当研究人员提供一点额外上下文(例如再次查看文档)时,它发现了 92% 的漏洞。至关重要的是,它发现了所有与人工智能相关的安全漏洞。
    • MTMT:仅发现了 55% 的漏洞。它在老式银行问题(如登录问题)上表现出色,但完全漏掉了所有与人工智能相关的漏洞。

这意味着什么?

该论文得出结论,使用这些“诱捕屋”是测试安全工具的好方法,因为你拥有已知的答案键。你无需猜测工具是否可靠;只需统计命中次数即可。

主要结论是,人工智能辅助工具(ThreMoLIA) 在发现漏洞方面优于传统工具,尤其是在系统涉及人工智能等现代技术时。传统工具对于经典问题仍然有效,但在面对新旧安全风险交织的新复杂局面时,它显得力不从心。

注意事项(“细则”)

作者谨慎地指出了几点:

  • 召回率与精确度:此测试衡量的是发现了多少真实漏洞(召回率),而非发出了多少虚假警报。人工智能工具发现了更多真实漏洞,但论文并未声称它从不发出误报(尽管它表示其系统会过滤掉这些误报)。
  • “合并”分数:人工智能工具的最佳分数来自结合两次不同的尝试。这就像让人工智能将谜题求解两次,然后从两次结果中选取最佳答案。这比传统工具的单一运行需要更多的工作量。
  • 范围有限:他们仅测试了两个特定应用程序。虽然结果令人鼓舞,但他们尚未在现实世界的庞大电信网络上对此进行测试(尽管那是他们的下一个目标)。

简而言之:如果你想知道一个安全工具能否发现真实的弱点,不要仅仅询问专家。给它一个破损的建筑,看看它能否找到所有的裂缝。在这次测试中,人工智能驱动的侦探比传统侦探发现了更多的裂缝。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →