Evaluating Endpoint Detection Robustness Against Genetic Algorithm Driven Code Transformations
本文介绍了 ShellForge,这是一个由遗传算法驱动的框架,通过生成功能等效的入侵后代码变体,旨在系统性地评估并暴露现代杀毒软件及端点检测与响应(EDR)系统的鲁棒性差距,并最终提出一个用于改进防御监测的可复现基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名高科技大楼(即计算机)的保安。你的职责是阻止入侵者。你有两种主要的手段来做到这一点:
- “通缉令”名单(特征检测): 你将每个人的脸与已知坏蛋的名单进行比对。如果某人的长相与名单上的某人完全一致,你就拦住他。
- “可疑行为”观察(行为检测): 你观察人们的“所作所为”。如果有人试图撬锁、爬向屋顶或窃窃私语,即使你不认识他的脸,你也会阻止他。
问题所在:
坏蛋们(黑客)很聪明。他们知道你有这些名单和观察手段。所以,他们开始乔装打扮。他们可能会戴上假胡须、改变发色,或者走路时一瘸一腿。这些被称为“代码变换”。
如今大多数安全工具在识别“原始”坏蛋方面表现出色,但当坏蛋换上伪装时,它们往往会感到困惑。研究人员在这篇论文中想要测试的是:我们的保安在面对一个正在积极尝试改变外貌的坏蛋时,表现究竟如何?
解决方案:“ShellForge”(进化健身房)
作者构建了一个名为 ShellForge 的工具。请记住,它不是一种武器,而是一个训练模拟器。
ShellForge 并不是由人类来猜测如何伪装坏蛋,而是使用了一种“遗传算法”。想象一个健身房,这里有 25 名“受训者”(坏蛋的伪装)。
- 锻炼: 每位受训者都尝试溜过保安。
- 评分: 如果保安抓住了他们,得分就低;如果他们成功溜走,得分就高。
- 繁殖: 得分最高的受训者(最擅长潜行的人)会被配对产生“后代”(新的伪装)。这些后代会混合父母双方的最佳特征(例如:爸爸的假胡须 + 妈妈的瘸腿)。
- 变异: 有时会发生随机变化,比如宝宝突然戴上了一顶帽子。
- 重复: 这个过程不断重复(世代更迭),使伪装变得越来越聪明,越来越擅长潜行。
目标并不是真的要闯入大楼,而是为了观察安全系统有多容易被欺骗,以便防御者可以修复他们的盲点。
他们测试了什么
他们使用了一种常见的“坏蛋”行为,叫做反弹 Shell (Reverse Shell)。
- 类比: 想象一个入侵者闯入后,立即通过一条秘密电话线向他的老板汇报说:“我进来了,告诉下一步该做什么。”
- 他们拿这个“通话”作为基础,并使用 ShellForge 演化出数千个不同版本的它——在改变代码(伪装)的同时,确保这个“通话”功能依然有效。
他们将这些演化出的伪装与以下对象进行了对比测试:
- 静态扫描器: 即“通缉令”名单(如 VirusTotal 和 Windows Defender)。
- 行为扫描器: 即“可疑行为”观察(如一个观察代码行为的沙箱)。
结果:令人惊讶的发现
在仅仅运行了几轮(世代)模拟后,ShellForge 就发现了一个“超级伪装”。
- 旧方法: 使用预制伪装的工具(如 MsfVenom 或 Veil)会被几乎所有的保安抓获。它们就像是带着“我是罪犯”标牌的坏蛋。
- ShellForge 的方式: 演化出的伪装没有被任何一个测试过的 62 种杀毒引擎识别出来。
- 静态得分: 100%(“通缉令”名单完全无法识别它)。
- 行为得分: 高分(观察行为的保安感到困惑,无法判断它是坏还是好)。
- 功能性: 100%(给老板的“通话”依然完美运行)。
核心结论:
研究人员发现,你并不需要复杂的、疯狂的伪装来欺骗保安。那个“获胜”的伪装其实非常简单:它只是改变了代码的外观(使用简单的数学技巧,如 XOR 和 Base64),并且并没有尝试做任何花哨的事情来躲避“行为”观察。
这表明,目前的安全系统过于依赖“通缉令”名单。 如果一个坏蛋只是稍微改变一下外观,系统往往会完全漏掉他们。
为什么这很重要(根据论文所述)
作者强调,这纯粹是为了防御。他们并不是在教黑客如何入侵。相反,他们是在向安全公司展示:
“嘿,你们目前的保安漏掉了这些简单的伪装。你们需要更好地识别代码的‘行为’,而不只是将其与已知的坏蛋名单进行匹配。”
他们提议,未来的安全工具需要变得更聪明,去寻找代码行为中的模式和联系,而不是仅仅检查代码看起来是否像他们以前见过的东西。
简而言之: ShellForge 是一面镜子,它向安全团队展示了他们的盲点究竟在哪里,证明了简单的自动化改变就可以绕过当前的防御,并敦促他们升级检测方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。