Aray: Deterministic-First Synthesis of Benign Artifacts for YARA Validation
Aray 是一个确定性优先的系统,通过合成良性的、非恶意的伪造制品来验证 YARA 规则,在无需获取底层恶意软件样本的情况下,实现了在生成与原规则相匹配的测试用例方面高达 97.6% 的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在网络安全领域,防御者依靠数字指纹来识别危险软件。这些被称为“规则”的指纹描述了恶意程序中出现的特定字节模式——即微小的碎片数据。当计算机扫描文件并发现匹配项时,就会发出警报。然而,当安全团队需要测试这些规则时,一个显著的问题随之而来。为了证明一条规则有效,他们通常需要一个真实的恶意软件来触发它。但在互联网访问受阻或数据必须保存在隔离保险库中的安全环境中,存储和移动真实的恶意软件既危险又昂贵,甚至往往是不可能的。这造成了一个瓶颈:团队拥有可以捕捉威胁的规则,但由于担心引发其试图遏制的威胁本身,他们无法安全地测试这些规则。
一组研究人员开发了一种解决方案来打破这一循环。他们创建了一个名为 Aray 的工具,该工具充当安全、无害测试文件的构建器。Aray 并不试图重建病毒,而是读取病毒外观的描述,并构建一个仅包含该规则所寻找的特定模式的完全良性的文件。想象一下,一名保安需要检查金属探测器是否工作。与其带一把真实的枪来进行测试(这很危险且需要特殊许可),不如使用一个工具来制造一个能以完全相同方式触发警报的无害塑料复制品。Aray 对数字规则也是如此。它获取恶意软件特征的复杂指令,并组装出一个满足这些指令但不包含原始威胁的有害代码、持久化机制或危险行为的文件。
研究人员在 416 条公开安全规则的大型集合上测试了这种方法。他们想看看该工具是否能在不需要接触任何真实恶意软件的情况下,成功为每条规则构建测试文件。该过程涉及两个主要阶段。首先,系统分析规则以理解其需求。有些规则很简单,可以完全由计算机的标准代码处理。其他的规则则更为复杂,涉及难以捉摸的模式。对于这些复杂的规则,系统使用大型语言模型(一种人工智能)来建议如何将规则简化为可构建的形式。至关重要的是,研究人员设计了这样一个系统,确保 AI 永远不会编写最终文件或访问计算机的核心系统。AI 只提供建议,而计算机的标准代码会在构建任何内容之前验证每一项建议。这确保了 AI 不会意外创建危险内容或破坏系统的安全性。
测试结果非常成功。该系统成功为 416 条规则中的 406 条构建了有效的测试文件,成功率接近 98%。失败的十条规则并非由于工具出错,而是因为这些特定的规则要求了一些在数学上无法构建的东西,例如一个必须具有其全部内容特定加密哈希值的文件,这是无法伪造的。对于 406 个成功的案例,研究人员验证了这些新文件在被扫描时确实触发了原始安全规则。这证实了该工具创建的文件在测试目的上与危险文件功能等效,但却完全安全,可以用于存储、移动以及灾难恢复演练。
这项工作的特别之处在于它如何处理人工智能与最终输出之间的关系。在许多现代系统中,AI 被允许直接生成代码或文件,这可能导致不可预测或不安全的结果。Aray 采取了不同的路径。它将 AI 视为一个只能提出想法的顾问,而实际的构建工作是由遵循严格规则的、僵化且可预测的计算机程序完成的。研究人员甚至设置了一个安全检查,告知 AI 连接到一个不存在的服务器。如果 AI 尝试进行连接,测试将立即失败。系统完美通过了这项检查,证明了在整个过程中,AI 从未尝试绕过安全边界。这种职责分离使得系统既能利用 AI 的创造力来解决难题,又能将危险的部分置于严格的、确定性的控制之下。
其对安全运营的影响是务实且直接的。那些需要扫描上传到云存储文件的组织,或者需要测试其灾难恢复计划的组织,现在可以无需维护恶意软件库即可进行操作。他们可以按需生成一个安全测试文件,将其上传到测试环境,并验证其检测系统是否工作正常。如果系统未能检测到测试文件,团队就知道他们的规则或扫描器存在问题,并可以在真实攻击发生前进行修复。这消除了在每个测试环境中保留危险恶意软件的需求,降低了意外泄露的风险以及维护隔离实验室的成本。该工具并不声称能解决所有可能的安全问题或理解每种病毒的所有细微差别,但它提供了一种可靠、可审计的方式,将数字威胁描述转化为一个安全、可测试的对象。
研究人员非常谨慎地定义了他们工作的界限。他们并没有证明其工具可以处理现有的每一种类型的安全规则,也没有声称它生成的文件的版本是唯一的。相反,他们展示了对于绝大多数常见的规则,该工具可以可靠地产生一个“见证者”——即一个证明规则有效的单一文件。他们还表明,整个过程是透明的;从原始规则到最终文件的每一步都是可以追踪和验证的。通过让 AI 处于辅助角色并让标准代码驱动构建过程,他们创建了一个既强大又安全的系统。这种方法为网络安全测试提供了一条新的途径,使团队能够在无需接触其旨在阻止的危险人工制品的情况下,充满信心地验证其防御能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。