SCOPE: Rethinking Attack Analysis as Uncertainty-Aware Security Reasoning under Incomplete Observations
本文介绍了 SCOPE,这是一个感知不确定性的免训练框架,通过整合以行为为中心的分组、分布式的 TTP 映射以及 Top-K Viterbi 序列推理,在不完整观测条件下重构连贯的攻击行为,从而在准确性和鲁棒性方面超越了现有基准。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,安全团队不断受到来自计算机和服务器的数据流的轰炸。这些日志记录了机器采取的每一个动作:一个文件的打开、一个程序的启动、一个连接的建立。多年来,网络安全的追求一直是将这些零散的笔记拼凑在一起,以观察攻击的全貌。挑战在于,这些笔记通常是不完整的。攻击者擅长掩盖踪迹、删除日志或打乱事件顺序。此外,单个计算机动作根据上下文可能意味着许多不同的含义;一个程序的启动可能是一次无害的更新,也可能是窃取行为的开始。传统方法试图通过将特定模式与已知威胁进行匹配来解决这个问题,但在证据混乱或攻击者以新的、意想不到的方式使用熟悉工具时,这些方法往往会失效。
韩国高成大学(Gachon University)的研究团队提出了一种思考此问题的新方法。他们将该系统称为 SCOPE。SCOPE 不再试图将每一条日志条目强行塞进僵化的框框里,而是将分析视为一个在不确定性下进行推理的过程。它接受接收到的数据是有缺陷且不完整的,并构建了一个能够处理缺失部分而不至于崩溃的模型。研究人员使用一组已记录真实事件序列的三十五个已知攻击场景对该系统进行了测试。他们发现,即使在丢失一半数字证据的情况下,SCOPE 重构攻击整体路径的准确度也远高于现有方法。更重要的是,只要这些模式是由已知的构建模块以新的顺序排列而成的,该系统就能识别出从未见过的复杂攻击模式。
分析这些日志的核心难点在于,单个事件过于微小,无法独立讲述故事。一条日志条目可能显示一个文件的创建,但它并不解释原因。为了解决这个问题,研究人员首先将相关的事件组合成更大的、有意义的块。他们寻找在时间上接近发生、涉及相同计算机进程、或触及相同文件和网络连接的事件。这创造了一个“行为组”(behavior group),代表了攻击中的一个连贯步骤,例如黑客试图窃取密码,而不仅仅是一系列孤立的文件变更列表。这种分组设计得非常稳健;如果中间的某些事件丢失或被删除,系统仍能通过剩余部分的共享上下文将其识别出来。
一旦形成了这些组,系统面临的下一个挑战是:决定每个组实际上代表了什么。过去,系统会尝试为一组行为分配一个单一的标签,比如“密码窃取”。如果该标签错误,整个分析就会崩溃。SCOPE 通过同时保留多种可能性来避免这个陷ap。对于每个行为组,它会生成一个带有不同可能性程度的潜在标签列表。它不会立即做出最终决定。相反,它将这些选项保持在一种不确定的状态,允许系统在定论之前考虑全局情况。这种方法承认了同一个动作根据后续发生的事情可能看起来像不同的事物。
最后一步是将这些组连接成一条完整的链条。研究人员使用一种方法,根据两个主要因素来评分:一个行为跟随另一个行为的逻辑流向以及它们之间的物理连接。他们知道某些类型的动作通常按特定顺序发生,比如在窃取数据之前先获得系统的访问权限。他们还寻找物理链接,例如在前一个步骤中创建的文件在下一步中被使用。通过结合这些逻辑和物理线索,系统可以填补证据缺失处的空白。如果某个步骤缺失,系统不会停止;它只是连接幸存的步骤,承认这一跳跃比平时大,但仍然是可能的。这使得系统即使在部分时间线被抹除的情况下,也能重构出一个连续的故事。
研究人员使用一个包含精确发生过程的“地面真值”(ground-truth)记录的三十五个攻击场景数据集对该方法进行了测试。他们将 SCOPE 与其他几种领先的方法进行了对比,包括寻找特定模式的基于规则的系统、映射连接的基于图的系统,以及使用大语言模型来推测故事的系统。SCOPE 表现优于所有这些方法。在查看前五个猜测时,它能正确识别出攻击中使用的特定技术,准确率约为 84%。在衡量其重构整个事件序列的能力时,它达到了 0.68 的得分,显著高于次优方法。
或许最重要的发现是该系统处理缺失数据的能力。研究人员模拟了一种随机移除高达 50% 日志事件的情况,以模拟攻击者成功删除其踪迹的场景。当数据消失时,其他系统的性能大幅下降,而 SCOPE 保持稳定。即使丢失了一半的证据,它仍能保持约 0.57 的重构得分,这仍然高于其他任何方法在拥有完整数据时的最高得分。这表明,该系统通过对不确定性进行推理并连接幸存证据的能力,使其在面对现实世界的资料丢失时具有更强的韧性。
该系统还展示了识别新颖攻击组合的能力。在网络安全领域,攻击者经常采用已知工具并以新的方式使用它们。传统系统往往在此失败,因为它们仅针对特定的、已知的序列进行训练。然而,SCOPE 并不依赖于记忆特定的序列。相反,它理解不同攻击步骤之间的兼容性。在测试中,它成功重构了从未在训练数据中共同出现的已知技术之连贯链条。它实现了 0.83 的“连贯新颖”(coherent-novel)率,这意味着在这些新组合出现的情况下,它能在 83% 的案例中正确识别并链接它们。这表明,只要单个组件是熟悉的,该系统就可以将其知识泛化到未见的威胁中。
SCOPE 的一个关键设计选择是它如何使用人工智能。研究人员使用了一种能够理解自然语言的大型语言模型,但仅将其用于一个特定任务:用纯文本描述行为组。该模型并不对攻击是什么或这些部分如何组合做出最终决定。这些决定是由一个确定性的、数学化的过程完成的,该过程会对步骤之间的连接进行评分。这种分离确保了系统不会“幻觉”或发明不受数据支持的细节。语言模型仅充当翻译器,将原始计算机日志转化为评分系统可以理解的描述,而评分系统则是最终链条的严格裁判。
研究人员承认,他们的工作是基于一个受控数据集,而现实世界的企业环境要复杂得多。他们指出,该系统并不是低层检测触发器的替代品,而是一个用于使这些触发器产生的数据变得有意义的工具。该系统旨在应对真实日志中不完整且多噪的特性,提供一种即使在证据碎片化的情况下也能恢复攻击叙事的方法。通过将攻击分析视为一个关于不确定性下的推理问题,而非简单的模式匹配问题,研究人员创建了一个对攻击者掩盖踪迹手段更具鲁棒性的框架。结果表明,攻击分析的未来可能不在于寻找更多的数据,而在于如何更有效地利用现有的数据进行推理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。