On fair and realistic performance evaluations for graph-based lateral movement detectors
本文批判了现有横向移动检测基准测试中存在的不一致的预处理和标注实践,提出了旨在确保公平且真实评估的标准方法论,并证明了在这些新策略下重新评估既有的检测方法会产生显著不同的性能结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一座巨大且繁忙的城市,其中的每一台计算机都是一栋建筑,每一个数据包都是一辆送货卡车。在这座城市里,保安(网络安全专家)时刻在监视着麻烦。通常情况下,他们寻找的是试图从外部破门而入的人。但最狡猾的小偷不仅会破门而入,一旦他们进入了一栋建筑,就会开始在房间之间跳跃,窃取钥匙,并打开通往最珍贵保险库的大门。这种在城市内部进行的隐秘跳跃行为被称为“横向移动”(lateral movement)。为了抓住这些数字窃贼,研究人员构建了“侦探”——即通过观察城市的流量日志,试图识别出小偷在建筑间移动的异常模式的计算机程序。
多年来,这些研究人员一直在竞相打造最好的侦探。为了看谁在领先,他们使用“训练场”:即模拟了一个已知有窃贼在运行的城市的巨型预制数据集。其原理很简单:如果你的侦探能在训练场中发现窃贼,那么它就是优秀的。但问题在于,这些训练场非常混乱。有些研究人员通过丢弃“无聊”的流量来清理日志,而另一些人则将窃贼采取的每一步都标记为犯罪。这就像是通过给一个已经帮你隐藏了所有困难线索、并明确告诉你坏蛋在哪里的测试来评判侦探的技能。如果不同研究人员之间的测试规则各不相同,你就无法真正判断出谁才是最优秀的侦探。
这正是论文《论基于图结构的横向移动检测器的公平且真实的性能评估》所研究的内容。作者科伦廷·拉罗切(Corentin Larroche)扮演着裁判的角色,他决定去检查过去几次大型竞赛的计分卡。他观察了两个著名的训练场(称为 LANL 和 OpTC 的数据集),并发现研究人员在准备数据和标记“犯罪”时使用了截然不同的规则。有些人通过过滤掉无辜的人来降低测试难度,而另一些人则将无害的流量计为恶意行为。该论文指出,这些不一致的规则使得研究结果看起来比实际情况要好得多。
随后,拉罗切提出了一套全新的、更严格的规则来准备这些数据集。他建议我们应该保留测试中的所有流量,而不只是那些“有趣”的部分,并且在定义什么是“横向移动”时应当非常谨慎。当他使用这套更公平的新规则重新测试三种著名的检测方法时,结果发生了剧变。在旧测试中看起来像超级英雄的侦探,在面对这些更公平的规则时,表现突然变得逊色许多。例如,有一种方法此前声称拥有接近完美的得分,但在被迫处理这些混乱且真实的数据时,得分大幅下降。论文总结道,虽然横向移动检测仍然是一个非常困难的问题,但如果我们想要构建一个能在现实世界中运作的系统,我们就必须停止在测试中使用带有偏见的调整。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。