Proactively Detecting Threats: A Novel Approach Using LLMs
本文首次对大型语言模型在主动从非结构化网络威胁情报中提取失陷指标方面的能力进行了系统性评估,结果表明 Gemini 1.5 Pro 在识别 479 份报告中的恶意威胁方面实现了完美的召回率和极高的精确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座规模宏大、繁忙拥挤的城市,而坏人(黑客)正不断试图闯入建筑物(您的公司电脑)。通常情况下,保安会在看到窃贼撬锁或砸碎窗户之后才打电话报警。这被称为“反应式”安全——即等待犯罪发生。
本论文提出了一种新方法:主动式安全。作者们不想只是等待破门而入,而是希望派出“侦察兵”,在犯罪发生之前去阅读当地的报纸、娱乐版和警方通报,寻找关于坏人是谁以及他们正在使用什么工具的线索。
以下是研究人员所做工作及发现的简单拆解:
问题所在:噪音太多,格式太乱
这座城市里的“报纸”是网络上发布的数以千计的网络安全报告。问题在于,它们的写法各不相同。一份报告可能将一个坏的计算机地址记录为一个数字,另一份记录为一个链接,第三份则是一个代码。这就像是在一本食谱书中寻找特定的食材,但有些食谱使用杯,有些使用克,有些甚至只写了“一撮”。
正因为这种混乱,安全团队不得不手动阅读这些报告,以寻找“入侵指标”(IOCs)——它们仅仅是坏人的数字指纹(例如恶意的 IP 地址或网站链接)。
解决方案:雇佣 AI “超级阅读者”
作者构建了一个机器人系统,能够自动从 15 个不同的来源抓取这些杂乱的报告。然后,他们要求六种不同类型的大语言模型(LLMs)——它们就像是在海量文本上训练过的超级聪明 AI 阅读者——来承担人类分析师的工作。
他们给 AI 下达了一个简单的任务:“阅读整个网页。这个特定的信息(比如一个网站链接或 IP 地址)是一个黑客计划发动攻击的线索,还是仅仅是正常的噪音?”
实验:试驾测试
他们利用 479 个网页中的 2,600 多个线索对该系统进行了测试。他们想看看哪种 AI 模型是最优秀的“侦察兵”。
- 目标: 抓住每一个坏线索(高召回率),同时不要误将无辜的事物标记为坏的(高精确度)。
- 竞争者: 他们测试了来自 Google (Gemini)、Alibaba (Qwen) 和 Meta (Llama) 的模型。
结果:谁赢得了比赛?
把结果想象成一场体育比赛,目标是接到球(坏线索),同时又不会被草坪绊倒(无辜数据)。
- 冠军 (Gemini 1.5 Pro): 这个模型表现最出色。它抓住了 100% 的实际坏线索(完美的召回率)。它也非常擅长识别哪些不是坏的,极少出错。它就像一个既不会错过窃贼,也极少对着无辜的快递员大喊“站住!”的保安。
- 挣扎者 (Qwen 32B): 这个模型漏掉了许多坏线索。它就像一个因为太忙于仰望天空而没看到小偷走过的保安。
- 喜忧参半 (Llama 70B): 这个模型抓住了所有的坏线索(和赢家一样),但它有点过于疑神疑鬼了。它会将一些无辜的东西标记为坏的,这会增加人类安全团队进行分类处理的工作量。
难点:为什么 AI 仍然会感到困惑
即使是最优秀的 AI 也会犯错,论文用一个很棒的比喻解释了原因:语境即一切(Context is King)。
想象一份新闻报道说:“反派‘Darkside’被发现在‘TrueSight’大楼附近出现。”
- 人类分析师知道“Darkside”是一个黑客组织,而“TrueSight”是一个安全工具,因此他们知道这是一个坏消息。
- AI 有时会感到困惑。如果它在 URL 中看到“Darkside”或“abuse”这样的词,它可能会认为整个网站都是邪恶的,即便该网站只是一个托管相关文件的图书馆。
研究发现,AI 在域名(网站地址)方面表现得最吃力。它往往无法区分一个“托管”坏文件的网站与网站本身是坏的情况。这就像一个保安看到了“披萨”招牌,就假设那家披萨店是犯罪现场,仅仅是因为曾经有个罪犯点过一份披萨。
核心结论
这篇论文证明了 AI 可以成为在杂乱、非结构化的新闻报告中主动寻找黑客线索的强大工具,从而节省安全团队手动阅读每一个字的时间。
然而,AI 目前还不完美。它需要更好地理解线索背后的“故事”,而不仅仅是线索本身。作者建议,在未来,这些 AI 侦察兵可以被教导去阅读 PDF、查看截图,并理解更复杂的威胁类型,从而在第一块砖头被扔出之前,让我们的数字城市变得更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。