Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition
本文提出了一种结合自监督学习骨干网络、低秩自适应(LoRA)以及基于原型的分类头的混合框架,旨在解决灾难性遗忘问题,并在恶意数据包识别的少样本类增量学习任务中实现最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,安全系统扮演着常驻哨兵的角色,通过扫描流经我们网络的流量来识别恶意代码。多年来,这些系统依赖于大规模已知威胁库的训练,学习识别特定不良行为的模式。然而,网络威胁的格局并非静态,而是一个移动的目标。新的恶意软件家族不断涌现,通常在广泛传播之前以极少量出现。传统的安全模型在应对这一现实时显得力不从心,因为它们的设计初衷是同时学习海量数据。当被迫在不遗忘旧威胁的情况下学习新威胁时,这些系统往往会遭受被称为“灾难性遗忘”的现象,即新知识覆盖了旧知识,导致系统对之前的危险变得盲目。此外,严格的隐私和安全规则通常禁止组织保留已经见过的恶意代码副本,这使得利用过去的案例来辅助系统学习新威胁变得不可能。这创造了一个困难的谜题:如何让一个安全系统仅通过极少数示例就能学习新威胁,同时又不丢失对过去的记忆,并且永远不存储处理过的危险代码?
西佛罗里达大学和人类与机器认知研究所的研究人员通过开发一种识别恶意网络数据包的新方法,解决了这一挑战。他们的方法专注于一种被称为“少样本类增量学习”(few-shot class-incremental learning)的特定场景,即系统必须仅使用极少数标记示例来适应新的恶意软件类别,同时保留识别所有先前类别的能力。为了解决无法存储数据时的遗忘问题,该团队构建了一个依赖两步学习过程的框架。首先,他们使用自监督技术从头开始训练了一个深度学习模型。研究人员并没有向模型输入特定恶意软件类型的标记示例,而是让它研究数百万个网络数据包的原始结构,教它理解互联网流量的底层语言,而无需知道每个数据包代表哪种特定的攻击。这建立了一个稳健的基础,即对恶意数据形态的通用理解。
在建立这一基础后,研究人员引入了一种方法,在不改变已学核心知识的情况下教授系统新威胁。他们使用了一种称为“低秩自适应”(low-rank adaptation)的技术,这种技术允许系统通过添加小型、高效的调整层来学习新信息,而不是重写整个模型。想象一座图书馆,书本已经编写并装订完成;研究人员不是通过重写现有的卷册来增加新章节,而是简单地附上轻量级的索引卡片,引导读者找到新信息。在他们的系统中,模型的“核心大脑”保持冻结且不变,从而保护了对所有先前学习到的恶意软件家族的知识。当新威胁出现时,系统利用这个冻结的大脑从新威胁的极少数示例中提取特征,并为其创建一个简单的参考点,即“原型”。这使得系统可以通过将传入的数据与这些参考点进行比较来识别新威胁,同时保持原始知识完好无损。
团队在两个包含各种网络攻击样本的知名网络流量数据集上测试了这种方法。他们设置了一项严格的测试:系统首先学习一组常见的攻击,然后在随后的轮次中学习新的、截然不同的攻击类型,且每种新类型仅能看到五个示例。结果显示,该方法在处理此类任务时显著优于以往的方法。在最后一轮测试中,他们的系统在一个数据集上达到了超过 61% 的准确率,在另一个数据集上接近 59%,超过了次优方法八个百分点以上。或许更重要的是,该系统展现出了卓越的稳定性。虽然其他试图通过调整内部权重来学习新信息的模型往往会遗忘高达 22% 的既有知识,但这种新方法将遗忘率降低到了 9% 以下。这表明,通过保持核心模型冻结并仅进行小规模、有针对性的调整,系统可以在适应新威胁的同时,不会抹除对旧威胁的记忆。
研究人员还探讨了保留一小部分过去示例缓冲区是否会有所帮助,这是其他领域的一种常用策略。他们发现,虽然存储少量过去的示例可以让系统学习新威胁的速度稍快一些,但代价是沉重的:系统会显著更多地遗忘其先前的知识。更关键的是,存储即使是少量的实时恶意代码也会带来严重的安全性风险,因为这些代码可能会被意外执行或泄露。团队的研究结果表明,在数据留存风险极高的网络安全领域,一个静态且具有鲁棒预训练能力的系统优于依赖重放过去数据的系统。他们的工作证明,构建既能尊重隐私约束又能应对威胁快速演变的自适应安全系统是可能的,同时也证明了一个模型可以既具备学习新事物的灵活性,又具备铭记旧事物的稳固性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。