Structured but Fragile: On the Limits of LLMs in Cybersecurity Decision-Making
本文表明,尽管大型语言模型在提供显式攻击图结构的情况下可以近似结构化网络安全推理,但其决策能力是脆弱的,对提示词框架高度敏感,并且与形式化优化基准相比,无法随复杂度的增加而实现稳健扩展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在网络安全这个高风险的世界里,组织面临着一场持续不断的、无形的战争。攻击者不断探测网络的弱点,寻找可以绕过防御并窃取数据或破坏服务的途径。防御者必须决定如何分配他们有限的资源来阻止这些行为。他们无法用最坚固的盾牌保护一切;他们必须选择安装哪些锁、设置哪些警报以及加固哪些门。这是一个关于策略的问题,而不仅仅是技术问题。它需要绘制出攻击者可能采取的每一条可能的路径,并弄清楚哪些特定的障碍能阻断最危险的路线。几十年来,专家们一直使用复杂的数学模型来解决这个难题,将网络视为一张地图,将防御视为一场博弈,其中防御者先行移动,试图预判攻击者的最佳反应。
最近,一种新型工具进入了这个领域:大语言模型。这些是强大的人工智能系统,能够编写代码、回答问题和总结海量文本。它们在几乎所有的公开互联网信息上进行了训练,包括无数的安全报告和技术手册。由于它们掌握了大量的相关知识,许多人希望它们能充当专家顾问,帮助防御者更快地做出更好的选择。但一个关键问题仍然存在:这些系统是真的理解攻击的逻辑,还是仅仅在识别熟悉的词汇并根据以前读过的内容进行猜测?如果防御者依赖一个仅能模仿专业知识而无法理解威胁底层结构的 AI,后果可能会非常严重。
一个研究小组旨在通过一项受控实验来测试这个问题。他们没有要求 AI 写一首关于黑客攻击的诗或总结一篇新闻文章。相反,他们将模型置于一个严谨的决策场景中。他们向 AI 展示了七个不同的、基于真实事件的现实攻击场景,例如勒索软件活动、供应链破坏以及针对工业控制系统的攻击。对于每个场景,研究人员都提供了一张详细的网络地图,展示了攻击者如何从初始入口点移动到关键目标。AI 被给予了一份可用安全控制措施的列表,例如防火墙或多因素身份验证,每种措施都有特定的成本和有效性评分。任务简单但困难:选择一组符合特定预算的控制措施组合,同时最大限度地降低攻击者成功的概率。
为了了解 AI 是否做得很好,研究人员将其选择与一个“金标准”进行了对比。这个标准是由数学家构建的一个专门计算机程序,用于为任何给定的地图找到绝对最佳的防御方案。这个程序不靠猜测,它通过计算每一种可能性来找到提供最多保护的单一策略。研究人员随后要求 AI 模型充当评判员,对不同的防御策略进行评分,包括它们自己的策略、数学程序的策略以及一些刻意设计得很差的策略。他们还测试了 AI 是否能从头开始编写自己的计算机代码来解决这个问题。
结果呈现出一幅“有条件的胜任力”图景。当研究人员给出一个清晰、结构化的攻击路径地图时,模型通常能产生非常接近数学完美解的策略。它们似乎理解,封锁攻击路径中间的一个关键节点比修补起始位置的一个微小漏洞更有价值。在这些受控设置中,AI 似乎是在通过逻辑推理解决问题,而不仅仅是回忆事实。然而,这种能力是非常脆弱的。一旦研究人员改变了问题的呈现方式,AI 的表现就会变得不稳定。
研究发现,AI 的判断高度依赖于选项是如何标记的。在一个引人注精的测试中,研究人员拿出了一个刻意设计的弱防御策略——一种会让网络处于不设防状态的策略——并简单地将其重命名为“最优策略”。当 AI 评估员看到这个标签时,它们经常将这个糟糕的防御方案评为最佳选项之一,其得分甚至往往高于真实的、数学上的完美解。相反,当一个强有力的策略被赋予负面标签时,其得分就会下降。这表明 AI 并没有深入分析防御的安全逻辑,而是在对描述其内容的暗示性词汇做出反应。模型很容易受到框架效应的影响,优先考虑标签而非实际内容。
研究人员还发现,随着网络复杂度的增加,AI 会表现得力不从心。随着地图变得越来越大,可能的攻击路径数量也随之倍增,AI 寻找最佳解的能力便逐渐消失。在某些情况下,模型开始完全忽略地图的具体结构。它们不再观察攻击者可以采取的独特路径,而是退回到通用知识,选择那些在行业内著名的控制措施(如加密或多因素身份验证),而不论这些控制措施是否真的能阻断该场景中的特定路径。当研究人员移除地图,仅根据文本描述让 AI 选择防御措施时,模型完全放弃了结构化推理。它们只是选择了那些具有最高通用有效性评分的控制措施,忽略了独特的拓扑结构。
即使被要求编写自己的计算机代码来解决问题,AI 也表现出了理解与执行之间的差距。模型可以生成看起来正确且使用了正确高层方法的代码,但当在更大的网络上进行测试时,这些代码运行速度太慢,无法投入使用。AI 生成的程序寻找解决方案的时间明显长于专门的数学求解器,并且在处理最大的地图时,AI 的代码往往无法完成任务。AI 可以模仿解决方案的逻辑,但无法构建一个能够大规模执行的稳健引擎。
这些发现表明,虽然大语言模型可以近似模拟专业安全分析师的行为,但它们并不具备进行高风险决策所需的可靠、结构化推理能力。当问题定义明确且背景简单时,它们可以产生不错的答案,但其表现会在压力、歧义或误导性标签面前崩溃。它们尚未达到能够取代人类专家或正式数学工具的水平。相反,它们最适合作为能够提供建议的助手,前提是这些建议必须经过严格、结构化分析的检查。研究结论指出,在网络安全这个错误可能导致大规模入侵的世界里,我们不能仅仅依赖 AI 的直觉。我们必须确保我们使用的工具是基于攻击路径的硬逻辑,而非仅仅基于具有说服力的标签所展现出的软实力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。