Evaluation Pitfalls and Multimodal Baselines for the \dataset{} IoT Malware Dataset
本文引入了针对 CIC-YNU-IoTMal2026 多模态物联网恶意软件数据集的首个系统性基准测试与评估协议,揭示了诸如随机划分导致的数据泄露、在无泄露条件下潜伏样本的高漏报率以及严重的跨架构脆弱性等关键陷阱,同时证明了协议选择而非模型选择最终主导了所报告的性能表现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,安全研究人员的角色就像是计算机的免疫系统医生。他们构建工具来识别恶意软件(或称 malware),以便在这些软件造成伤害之前将其发现。为了训练这些工具,他们需要庞大的数据库:包括记录计算机在健康状态下的行为,以及记录其在患病状态下的行为。训练数据的质量决定了最终生成的安全工具的表现如何。如果数据有缺陷,工具就会在现实世界中失效,往往会漏掉危险威胁或引发虚假警报。该领域的一个主要挑战是,确保研究人员将数据划分为训练组和测试组的方式不会意外引入偏差。如果一个计算机程序在训练期间见过某段特定的恶意软件,然后在测试期间又看到了完全相同的这段代码,那么它并不是真的在学习检测新威胁,而仅仅是在死记硬背答案。此外,研究人员必须决定,是根据工具捕捉单个可疑活动瞬间的能力来评判,还是根据其识别整个受感染程序的能力来评判,这两者之间是截然不同的任务。
来自塔里木大学的一个研究小组最近将注意力转向了一个名为 CIC-YNU-IoTMal2026 的新型且极其详尽的数据库。这个数据集对安全专家来说是一座宝库,因为它同时记录了数千个计算机程序的三种不同类型的信息:它捕捉了流入和流出的网络流量、类似 CPU 使用率的系统活动,以及程序向操作系统发出的特定指令列表。这些程序在四种不同类型的计算机芯片上运行,以观察安全工具是否能在不同硬件上工作。研究人员并没有构建新的安全工具;相反,他们扮演了审计员的角色。他们审计了这个数据集本身,以观察在这些数据上进行标准的安全性测试方法是否隐藏了严重的问题。他们想知道其他研究人员报告的高分是真实的,还是由于处理数据时的细微错误导致的。
审计首先从观察数据的划分方式开始。最常用的方法是提取所有记录的活动瞬间,并进行随机洗牌,将其中一部分放入训练堆,另一部分放入测试堆。研究人员发现,对于这个特定的数据集,这种方法存在根本性的缺陷。因为数据记录的是完整的程序,所以通过洗牌处理“瞬间”意味着测试堆中包含了已经存在于训练堆中的程序的瞬间。事实上,每一个测试瞬间都与其所属的父程序在训练集中存在重叠,并且一小部分测试瞬间甚至是训练瞬间的精确副本。这意味着任何以此方式测试的安全工具,本质上都是在针对它已经看过的答案进行考试。虽然这并没有在 particular 这个数据集上人为抬高分数,但这意味着这些结果无法被信任用于预测工具在面对真正全新的、未见的程序时的表现。研究人员得出结论,测试这些工具唯一公平的方法是将整个程序作为一个整体保留,确保没有任何一个程序同时出现在训练组和测试组中。
即使研究人员修正了数据划分方法,他们又发现了第二个更具欺骗性的问题。该数据集包含数千个微小的活动快照,许多安全工具是根据捕捉这些单个快照的能力来评判的。研究人员发现,这种方法掩盖了一种危险的失效模式。数据集中大约 16% 的恶意程序被安全工具完全漏掉了。这些被漏掉的程序并不复杂,它们只是处于“休眠”状态。它们虽然在测试环境中被执行了,但未能“醒来”并开始其恶意活动,因此看起来与无害程序完全一样。由于那些“醒来”了的恶意程序非常活跃且产生了数百个活动快照,它们主导了统计数据。那些安静的、处于休眠状态的程序被淹没了,使得安全工具看起来比实际情况要好得多。研究人员强调,要获得安全的真实图景,必须根据工具是否能捕捉到“整个程序”来进行评判,而不仅仅是那些嘈lıous(吵闹/活跃)的瞬间。
该研究还调查了工具在面对不同类型计算机芯片时的表现。数据集包含了在四种不同架构上运行的程序,研究人员测试了在一个架构上训练的工具是否能检测出第四种架构上的威胁。结果非常悬殊。当工具被测试在一种被称为 ARM 的特定芯片上时(ARM 在许多小型设备中很常见),它的表现崩溃了。该工具变得极其不可靠,几乎 80% 的时间会将无害程序标记为危险,同时仍能捕捉到几乎所有的恶意软件。这种失败并不是因为工具无法识别恶意软件,而是因为 ARM 芯片上的无害程序与其它芯片上的无害程序行为不同。工具学习到了错误的关于特定硬件上“正常”状态的模式。研究人员发现,这个问题可以通过非常廉价的方式解决。只需向工具展示该新芯片极小比例的无害程序——不到总数据的 1%——工具的表现就会立即恢复到接近完美的水平。这表明,跨芯片安全的解决方案不在于复杂的算法,而在于让工具接触到一些新环境的示例。
最后,研究人员查看了可用的不同类型数据:网络流量、系统活动和指令追踪。他们发现,在受控环境下,结合这三种类型的数据可以使安全工具趋于完美。然而,这种完美是非常脆弱的。当工具被迫仅依赖网络流量时,它们会漏掉那些休眠中的程序。当它们仅依赖指令追踪时,一旦芯片架构发生变化,它们就会彻底失效。事实证明,最稳健的组合是网络流量与系统活动的混合,这种组合避开了其他方法的特定弱点。研究人员还指出,用于构建工具的具体数学模型几乎无关紧要。无论使用的是简单的线性模型还是复杂的神经网络,结果几乎是相同的。这证明了成功的最大因素不在于工具的复杂程度,而在于关于如何划分数据、如何定义成功以及如何处理不同类型芯片的决策。
论文最后为任何使用该数据集的人提供了一套清晰的指南。他们建议在划分数据时始终将整个程序作为一个整体保留,报告结果应基于是否捕捉到了“整个程序”而非仅仅是“单个瞬间”,并对如何处理未知或未分类的程序保持透明。他们还敦促研究人员在不同的计算机芯片上测试其工具,并报告如果多次运行实验,结果会有多少变化。最重要的启示是,通往更好安全的路径不在于构建更复杂的模型,而在于提出更好的问题并使用更干净的数据。通过修复评估方法,业界可以确保所构建的工具在最需要它们的时候能够真正发挥作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。