Proactive Ransomware Family Detection from Pre-Encryption API Behavior Using ANN–LightGBM Stacking
本研究表明,一种利用 23 个加密前 Windows API 指标的异构 ANN–LightGBM 堆叠模型在分类勒索软件家族和良性软件方面能够实现高准确率(95.20%),提供了一种优于独立神经网络架构的主动防御机制,同时也强调了进一步外部验证的必要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,一种被称为勒索软件(ransomware)的特定恶意软件正扮演着数字绑架者的角色。一旦它渗透进计算机,就会锁住用户的文件,并以此索要赎金。多年来,安全专家一直试图通过寻找已知恶意程序的独特数字指纹来阻止这些攻击。然而,犯罪分子不断改变这些指纹,使得旧的方法逐渐失效。一种更现代的方法涉及观察程序在启动瞬间的行为表现。在勒索软件开始执行加密文件的破坏性工作之前,它必须首先执行一系列准备步骤,例如检查计算机设置或寻找其他程序。这些早期的动作会留下数字足迹,可以在造成任何损害之前揭示程序的真实本质。挑战在于如何将这些可疑的早期步骤与每个计算机程序每天都会进行的正常、无害的行为区分开来。
本莎大学(Benha University)的一个研究小组致力于解决这一问题,他们开发了一个能够根据这些极早期行为来识别不同勒索软件家族的系统。他们专注于一个特定的时间窗口:即在实际文件加密开始之前的时刻。为此,他们收集了 3,432 个计算机程序,其中包括五种不同类型的勒索软件和一组安全的良性程序。研究人员对每个程序在启动时采取的 23 个特定动作进行了分析。这些动作涉及程序询问有关其自身名称的信息、检查网络、查看注册表或尝试访问内存。研究人员将这些观察结果转化为一个简单的“是或否”指标列表,为每个程序创建了一个紧凑的特征轮廓。
研究人员随后测试了几种不同类型的人工智能模型,以观察哪一种能最好地从这些简短的动作列表中进行学习。他们尝试了五种不同的神经网络设计——这些是受人类大脑启发的计算机系统,其中一些通常用于处理像语音或文本这样的长序列数据。他们还测试了一种移除少量次要动作的方法,以观察较短的列表是否能让人工智能变得更聪明。结果显示,对于这种特定类型的短小、简单的数据,最直接的神经网络设计本身表现得最好,能够正确识别程序类型的准确率约为 94%。有趣的是,那些为长序列设计的复杂模型并没有提供显著的优势,这表明对于这项特定任务,更简单的方法反而更有效。
为了进一步提高准确性,该团队将两种不同类型的人工智能模型结合成一个单一的分层系统。他们使用那个直接的神经网络对程序的身份进行初步判断,然后将该判断传递给第二个强大的基于树的模型,以优化最终决策。这种被称为“堆叠”(stacking)的组合方法提升了系统的性能,将准确率提高到了 95% 以上。该系统在区分不同勒索软件家族方面表现尤为出色,每种特定类型的 AUC 分数在 0.92 到 0.99 之间。然而,系统仍然会犯一些错误,偶尔会将安全程序与某个勒索软件家族混淆,或者将两种不同的勒索软件类型相互混淆。
研究结论指出,观察这些早期、底层的动作是捕捉勒索软件并在其造成伤害前进行拦截的一种可行方法,并且结合不同的 AI 方法可以使检测更加可靠。然而,研究人员谨慎地指出,这一成功是在使用特定已知程序受控环境下取得的。该系统尚未针对新的、未见的勒索软件类型,或在繁忙的企业网络这种混乱的实时环境中进行测试。虽然结果令人鼓舞,但这项工作是作为一种强有力的概念验证,而非已准备好立即部署的成品。它证明了通过正确的数据和智能的工具组合,是有可能在第一个文件被锁定之前就察觉到数字攻击的微妙迹象的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。