想象一个城市的交通控制中心。多年来,安保人员一直试图通过查看过往车辆清单来识别危险司机(黑客)。他们知道车牌号、行驶路线以及耗油量。但他们缺失了拼图中的两个关键部分:车辆在道路上停留了多久,以及车辆连续到达的速度有多快。
本文旨在解决这一信息缺失的问题。
问题所在:“快照”与“电影”
作者指出,当前的安全系统往往将网络流量视为一系列静态快照。它们知道发生了什么,却错过了其中的节奏。
- 类比:想象试图在人群中识别一名窃贼。如果你只有一张窃贼静止站立的照片,很难将他与普通人区分开来。但如果你有一段视频,显示窃贼奔跑、停下,然后以特定模式冲刺逃离,识别他们就变得容易得多。
- 问题:研究人员使用的标准数据集(计算机安全系统的“培训手册”)就像那些静态照片。它们缺乏看清攻击“电影”所需的时间细节。
解决方案:"NF3"数据集
研究人员选取了四个用于训练安全系统的著名现有数据集,并对其进行升级。他们将这个新版本称为NF3。
- 他们添加了什么:他们添加了“时间特征”。简单来说,这意味着他们给每个数据包都加上了秒表和心跳监测仪。
- 流持续时间:连接持续了多久?(车辆是行驶了 5 秒还是 5 小时?)
- 包间到达时间(IAT):一个数据包与下一个数据包之间过去了多少时间?(车辆是稳定地连续到达,还是以混乱、急促的爆发式到达?)
他们将这些新的、升级后的数据集免费提供,供其他研究人员使用。
他们的发现:时间的“指纹”
一旦拥有了这些网络流量的新“电影”,他们便开始分析,以查看不同类型的攻击是否具有独特的时间模式。
连接的长度:
- 正常流量:通常短暂且迅速,就像一次快速的差事。
- 恶意流量:某些攻击,如“后门”(秘密入口),倾向于长时间保持开启,就像一辆车在车道上怠速数小时。其他攻击,如“DDoS"(淹没系统),则看起来像是一场巨大的、混乱的交通堵塞,车辆以巨大且不规则的爆发形式到达。
节奏(IAT):
- 研究人员观察了数据包之间的时间间隔。他们发现,不同的攻击具有不同的“节拍”。
- 类比:正常的对话具有自然的节奏。试图入侵系统的机器人可能会以机械的、完美定时的节奏敲击出信息,或者以狂乱、不规则的节奏敲击。论文发现,这些时间模式通常对攻击类型具有独特性,充当基于时间的指纹。
攻击的“声音”(时频分析):
- 作者借鉴了音乐和无线电工程中的一个技巧,称为时频分析。
- 类比:如果你观察声波,你会看到音量随时间的变化。但如果你使用声谱图(声音的视觉地图),你可以看到音高和频率随时间的变化。
- 他们将网络流量转化为这些视觉“声音地图”。他们发现,不同的攻击(如“蠕虫”与“漏洞利用”)在这些地图上会产生不同的视觉模式。这就像鼓点在声音可视化器上的样子与小提琴旋律不同一样。这表明计算机有可能通过“聆听”网络的节奏来更轻松地发现入侵者。
核心结论
本文并不声称已经构建了一个全新的、完美的安全系统。相反,它声称构建了一个更优质的训练数据库。
- 之前:研究人员试图仅凭照片教计算机识别窃贼。
- 现在:研究人员拥有一个视频库,展示了窃贼的速度、节奏和持续时间。
通过提供这些丰富的数据集,作者希望帮助下一代安全系统理解攻击的时机,使黑客更难隐藏在正常网络流量的噪音中。
以下是论文《网络入侵检测系统的 NetFlow 数据集时间分析》的详细技术摘要:
1. 问题陈述
尽管时间特征(例如数据包到达间隔时间、流持续时间)在检测复杂网络攻击方面发挥着关键作用,但现有的用于网络入侵检测系统(NIDS)的基于 NetFlow 的基准数据集却缺乏这些特定特征。
- 差距所在: 先前的研究对 NetFlow 数据集(如 UNSW-NB15、BoT-IoT、ToN-IoT、CSE-CIC-IDS2018)进行了标准化,以确保机器学习(ML)评估具有一致的特征集。然而,这些标准化版本省略了时间数据,导致它们无法适用于序列神经网络模型(如 LSTM)或时间序列分析。
- 后果: 缺乏时间特征使得机器学习模型无法有效学习攻击的时间动态(例如突发模式、低速慢速攻击或周期性信令),从而限制了对自适应和随时间演变的威胁的检测能力。
2. 方法论
作者通过双管齐下的方法解决了这一差距:数据集重构和全面的时间分析。
A. 数据集重构(NF3-Datasets)
作者将四个广泛使用的基准数据集转换为统一的第三代 NetFlow 格式(NF3-Datasets):
- 源数据集: UNSW-NB15、BoT-IoT、ToN-IoT 和 CSE-CIC-IDS2018。
- 转换工具: 使用 nProbe(Ntop)处理原始 PCAP 文件以生成 NetFlow v9 记录。
- 关键配置: 使用了
--dont-reforge-time 标志以保留 PCAP 文件中的原始时间戳,确保时间完整性。
- 特征增强: 作者在现有的 43 个特征集基础上增加了两类时间特征:
- 流时间: 每个流的精确开始和结束时间戳(以毫秒为单位)。
- 数据包到达间隔时间(IAT): 源到目的和目的到源两个方向上,连续数据包之间时间间隔的统计聚合值(最小值、最大值、平均值、标准差)。
- 标记: 通过将 5 元组标识符和时间戳与真实标签文件进行匹配,对流进行了重新标记,生成了二元(良性/恶意)和多类攻击标签。
B. 时间分析技术
作者对新数据集进行了多维度的分析:
- 分布分析: 检查流长度分布(FLD)和 IAT 直方图,以识别良性流量与恶意流量之间的不同模式。
- 时间序列可视化: 按分钟聚合流量量(字节/数据包)和分类特征(唯一 IP/端口),以可视化攻击的 onset(开始)、持续时间和终止。
- 时频分析(TFD): 应用频谱图(一种信号处理技术)将流量时间序列数据转换为时频表示。此举旨在测试不同的攻击类别是否在频域中表现出独特的“特征”。
3. 主要贡献
- NF3-Datasets 的公开发布: 创建并公开发布了四个增强的 NetFlow 数据集,包含 57 个特征,其中包括以往标准基准中缺失的关键时间指标。
- 全面的时间特征化: 详细分析了不同攻击类别(如 DDoS、后门、蠕虫)在流持续时间和数据包到达间隔方面表现出的独特时间行为。
- 时频探索: 创新性地将频谱图应用于 NetFlow 数据,假设并证明了不同攻击拥有独特的时频特征,这可能有助于机器学习分类。
- 标准化: 在四个主要数据集之间提供了一致的特征集,使得时间机器学习模型能够进行公平的跨数据集比较。
4. 主要结果与发现
- 流长度模式:
- 良性流量: 主要由短持续时间的流组成。
- 恶意流量: 表现出明显的偏差。例如,后门和蠕虫通常表现出更长的流持续时间(表明持久连接),而 DDoS/DoS 攻击则显示出广泛的分布,既有突发式的短流,也有持续较长时间的流。
- 数据包到达间隔时间(IAT):
- 不同类型的攻击显示出独特的 IAT 分布。例如,ToN-IoT 数据集中的 MITM 和 后门 攻击在特定间隔处显示出明显的峰值,这可能反映了周期性信令。
- DDoS/DoS 攻击表现出更宽的 IAT 分布,并在较高间隔处出现峰值,反映了不规则且具有破坏性的时间特征。
- 时间序列动态:
- 可视化显示,攻击通常以“波浪”形式发生(例如 NF3-BoT-IoT),或作为同时叠加出现(例如 NF3-UNSW-NB15),这为现实世界攻击场景的时间结构提供了见解。
- 分类分析表明,僵尸网络活动(BoT-IoT)涉及目的 IP 和端口的频繁变化,而良性流量则保持相对稳定。
- 时频特征:
- 对 NF3-UNSW-NB15 数据集的频谱图分析显示,虽然某些攻击具有相似性(例如 DoS 和蠕虫),但它们拥有独特的时频模式。
- 像 Fuzzers 这样的攻击显示出独特的特征,表明 TFD 表示法可能比仅依靠静态特征更有效地帮助机器学习模型区分攻击类别。
5. 意义与未来工作
- 意义: 这项工作弥合了静态 NetFlow 分析与动态、时间感知的入侵检测之间的差距。通过提供带有时间特征的数据集,它使得开发先进的机器学习模型(RNN、Transformer、CNN-LSTM)成为可能,这些模型能够检测细微的、依赖于时间的异常,如高级持续性威胁(APT)和低速慢速攻击。
- 未来方向:
- 专门优化机器学习模型以利用新的时间特征。
- 改进用于实时检测的时频分布(TFD)方法。
- 研究序列学习模型(RNN、Transformer),利用这些增强的数据集进一步提高攻击分类的准确性。
总之,该论文为下一代时间感知网络入侵检测系统提供了必要的数据基础设施和分析基础,超越了静态特征分析,转而理解网络威胁的动态演变。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。