Advanced Persistent Threats (APT) Attribution Using Deep Reinforcement Learning
本文提出了一种用于高级持续性威胁归因的深度强化学习模型,该模型通过迭代式的架构与算法优化,实现了从 7% 到接近 98% 的大幅准确率提升,展示了其识别并归因恶意软件活动的强大能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,数字世界就像一座繁忙、繁华的大都市,每个人都相互连接。在这座城市里,存在着一些被称为“黑客”的隐形窃贼。有时,这些窃贼只是寻找容易突破之窗的投机分子;但除此之外,还有“高级持续性威胁”(APT)。把它们想象成顶级间谍或组织严密的犯罪集团。它们不仅仅是破门而入然后逃跑,而是潜入其中,在墙壁里躲藏数年,缓慢地窃取秘密,且不留任何指纹。弄清楚这些间谍究竟是“谁”——无论是敌对国家、犯罪团伙还是特定的黑客组织——被称为“归因”。这就像是通过观察一个物体在房间里移动的方式来识别一个幽灵一样。由于这些间谍使用各种技巧来掩盖踪迹,比如戴上面具或通过秘密隧道,这变得异常困难。
为了解决这个谜题,科学家们开始使用一种特殊的计算机大脑,称为“深度强化学习”(DRL)。你可以将 DRL 想象成一个通过反复玩游戏来学习的视频游戏角色。与只遵循严格规则手册的普通计算机程序不同,这个角色会尝试不同的动作,在做得好时获得分数(奖励),并从错误中学习。随着时间的推移,它会变得非常擅长发现人类可能忽略的模式。研究人员提出的核心问题是:我们能否教会这个数字侦探,通过观察病毒混乱、隐藏的行为,然后说出:“啊哈!这绝对是 X 组织所做的”?
这篇论文采用了这个想法并对其进行了测试。研究人员收集了大量的数字“指纹”——超过 3,500 个来自 12 个不同 APT 组织的恶意软件样本。他们不仅观察了这些文件的外观,还在一个安全的、隔离的沙盒(一个病毒的虚拟监狱)中观察了它们的行为。他们使用了一个名为 Cuckoo Sandbox 的工具,来观察这些病毒如何移动、更改文件以及与其他计算机通信。
随后,他们训练了这个 DRL “侦探”来分析这些行为。他们设置了一个游戏,让 AI 必须猜出是哪 12 个组织中的哪一个创建了每个病毒。如果它猜对了,就得一分;如果猜错了,就扣一分。AI 玩了这个游戏数千次,学习识别每个组织细微且独特的习惯。结果令人印象深刻:该 DRL 模型在处理新的、未见过的病毒时,准确率达到了 89.27%。
为了验证这个新侦探是否真的比旧的侦探更出色,研究人员将其与五种其他标准的计算机方法(如决策树和支持向量分类器)进行了比较。旧的方法表现尚可,准确率在 71% 到 82% 之间,但 DRL 侦探显然优于它们所有人,达到了 89.27% 的水平。论文指出,这种方法特别擅长处理这些网络攻击中棘手且多变的特性,而在这些情况下,旧的规则往往会失效。
然而,作者谨慎地表示,这并不是什么万能灵药。他们指出,这个超级智能的 AI 是一个“资源饥渴者”;它需要大量的计算能力和海量的数据才能有效地学习。他们还注意到,虽然该模型非常擅长识别输入数据的模式,但现实世界是混乱的。论文总结道,虽然 DRL 是捕捉这些数字间谍的强大新工具,但我们仍需使其更加高效,并处理使用 AI 进行安全防护时的伦理问题。这是一个充满希望的进步,表明通过让 AI 从坏人的行为中学习,我们或许终于能够比以往任何时候都更快、更准确地揭开他们的面具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。