EGAMA-MF: Evidence-Integrity Gating for Memory-Forensic Malware Triage
本文介绍了 EGAMA-MF,这是一个增强内存取证恶意软件分拣的中间件框架,它通过拦截由提取失败导致的结构有效但取证不可用的特征向量,从而防止假阴性并确保在多种故障场景下的证据完整性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字取证的高风险领域,调查人员通常依赖自动化工具来从网络攻击后的混乱局面中进行筛选。当计算机遭到入侵时,其内存保存着最直接且易失的线索:正在运行的程序、隐藏的连接以及文件扫描可能遗漏的注入代码。为了理清这些数据,研究人员使用专门的软件来提取特定的指标,将原始内存转化为机器学习模型可以分析的有结构数字列表。其目标是快速决定一个系统是安全的,还是需要人类专家的介入。然而,这一过程中存在一个关键缺陷:如果提取工具未能找到特定的证据,系统可能会简单地记录为一个零。对于计算机而言,零通常意味着“未发现任何内容”,但实际上,它可能意味着“工具未能进行查找”。这种歧义造成了一个危险的盲点,即缺失的信息被误认为是确认的缺位,从而可能导致受损的系统逃脱检测。
辛辛那提大学的一位研究人员通过一个名为 EGAMA-MF 的新系统解决了这一漏洞,该系统在进行任何自动化决策之前充当严格的守门员。该系统不再仅仅信任数字本身,而是检查数字背后的故事。它验证每一项所需的证据是否都已成功提取,用于寻找它们的软件工具是否在没有错误的情况下完成了工作,以及数据是否来自经过验证的来源。如果这一链条中的任何环节断裂,系统就会阻止该案例被自动接受,强制其由人类分析师进行审查。这种方法将证据本身的完整性视为一个独立的、不可逾越的条件,这与判断系统是否受感染的预测是截然不同的。
研究人员使用一个包含超过一万一千个已知计算机案例的大规模数据集对该守门员进行了测试,这些案例是他们此前为分析而准备的。为了模拟现实世界的故障,他们刻意以一百零七种不同的方式破坏了数据。他们损坏了提取状态、模拟了软件崩溃并引入了缺失字段,创造了超过一百万个错误的各种数据版本。随后,他们将这些错误的输入输入到这个新系统中,并将其结果与一个仅检查数字是否看起来正确的更简单系统进行了对比。结果非常显著。新的证据门控系统拦截了所有的一百一十四万零八百四十个错误输入,在它们到达决策阶段之前将其拦截。相比之下,那个仅检查数据形态的简单系统则让超过三十万个这些损坏的输入通过了,因为这些数字本身看起来仍然有效。
研究还通过使用来自 Digital Corpora(一个取证镜像集合)的一个已知案例,考察了该守门员在现实场景中的表现。在这个特定实例中,用于提取内存数据的软件由于一个深层的技术错误,未能检索到两个关键组件。由于新系统注意到了这些缺失的部分,它立即停止了自动化过程,并将案例路由至人工审查。这防止了系统基于不完整的信息做出自信的预测。研究人员发现,如果没有这个门控,他们测试集中的近百分之四十的案例本会被自动接受,尽管它们的证据是有缺陷的。通过执行这项检查,该系统确保了只有在证据完整且可靠时才进行自动化处理。
除了捕捉错误之外,研究人员还探讨了改变接受规则如何影响安全性。他们测试了不同的设置,以观察有多少案例可以被安全地自动化,而又有多少需要人工审查。他们发现,可以在不增加接受组中错误的情况下,将自动接受的案例比例从大约百分之三十二提高到接近百分之三十八。然而,当将接受率推高到百分之四十时,错误便出现了,这表明在不增加风险的情况下,自动化所能获得的信任是有极限的。该系统证明了其极高的速度,检查每个案例仅需不到一毫秒,这意味着它几乎不会给调查过程带来延迟。
这项工作既不是为了取代检测恶意软件的机器学习模型,也不是为了取代分析复杂案例的人类专家。相反,它位于数据提取与决策之间,充当质量控制过滤器。它确保模型仅使用已知完整的证据进行工作,并确保模型不必去猜测一个零究竟代表“安全”还是“损坏”。通过将“证据是否有效?”与“证据说明了什么?”这两个问题分开,研究人员为数字取证建立了一个更可靠的基础。研究结果表明,虽然自动化功能强大,但必须将其与对接收数据质量的严格检查相结合,以防止可能损害安全性的无声失败。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。