Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting
本文介绍了 CyberTeam,这是一个基准框架,它将蓝队威胁狩猎标准化为由 30 个任务和 9 个操作模块组成的结构化、模块化工作流,以指导大语言模型,并证明与开放式推理策略相比,该方法显著提升了威胁分析性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正在试图破解一起复杂的犯罪案件。你拥有一位才华横溢的新助手:一个人工智能(AI),它能阅读数百万本书籍,并理解几乎任何语言。然而,如果你只是告诉这位 AI“找出是谁犯下了这起罪行并阻止他们”,它可能会感到困惑。它可能会猜错凶手,编造虚假证据,或者提出一个实际上行不通的解决方案。
本文介绍了一种名为CYBERTEAM的新工具,旨在帮助这些 AI 侦探更好地履行职责。以下是其工作原理的简明解释:
1. 问题:“开放式”陷阱
过去,研究人员通过仅提供诸如“分析此日志”之类的提示,让 AI 模型解决网络安全问题。这就像把一堆杂乱的文件交给侦探,然后说“解决这个”。
- 问题所在:AI 可能会产生幻觉(编造内容)、跳过重要步骤,或者搞错顺序。例如,它可能在尚未查明病毒类型之前,就建议修补计算机。
- 现实情况:真正的网络安全并非单一问题,而是一连串的事件。你必须先找出坏人,了解他们的行动路径,评估其危险程度,然后才能阻止他们。
2. 解决方案:“标准化工作流”
作者构建了 CYBERTEAM,它就像是为 AI 制定的一套严格、循序渐进的食谱。与其让 AI 自由漫游,不如强制其遵循特定路径。
不妨将其想象成一条工厂流水线:
- 步骤 1(传送带):AI 被赋予特定任务,例如“找出黑客的姓名”。在完成此任务之前,它无法进入下一步。
- 步骤 2(专用工具):AI 不会一次性“思考”所有事情。它会为每项工作使用特定的“工具”(称为操作模块):
- NER(名称查找器):仅用于查找姓名、日期和 IP 地址的工具。
- REX(模式扫描器):仅用于查找特定代码(如电子邮件地址或文件哈希值)的工具。
- RAG(图书管理员):在回答之前,会前往现实世界安全数据图书馆查找最新信息的工具。
- SUM(总结器):将冗长乏味的报告浓缩为简短清晰的项目符号的工具。
通过将这些工具串联起来,AI 被迫保持条理。它无法跳过“名称查找器”而直接跳到“解决方案”。
3. 测试:付诸实践
研究人员利用来自 MITRE 和 NIST 等来源的超过 450,000 个真实世界网络威胁案例构成的庞大库,将这条新的“流水线”与旧的“自由思考”方法进行了对比测试。
他们要求 AI 完成 30 项不同的任务,例如:
- 识别攻击者是谁。
- 查明他们是如何进入系统的。
- 判断威胁的紧急程度。
- 制定阻止攻击的计划。
4. 结果:结构制胜
结果显而易见:结构化的循序渐进方法(CYBERTEAM)远优于自由形式的方法。
- 错误更少:当 AI 必须按顺序使用特定工具时,其产生的“幻觉”(虚假事实)大大减少。
- 准确性更高:它在寻找正确的“行动指南”(阻止攻击的计划)以及建议正确的软件补丁方面表现更佳。
- 原因:研究发现,当允许 AI 仅仅“自由思考”(例如使用思维链方法)时,它往往会迷失方向或遗漏关键细节。但当它被迫遵循流水线时,其表现便如同一位经验丰富的专业人士。
5. 局限:噪声的影响
本文还测试了当 AI 面对“有噪声”或杂乱的数据(例如包含拼写错误或措辞混乱的报告)时会发生什么。
- 好消息:AI 能够很好地处理小的拼写错误(如缺失字母)。
- 坏消息:如果文本的含义被扭曲或令人困惑(语义噪声),即使有了新工具,AI 也会感到吃力。这表明,虽然这些工具有所帮助,但人类撰写报告的质量仍然至关重要。
总结
简而言之,本文认为,若要使 AI 在阻止网络攻击方面发挥作用,我们不能仅仅让它通过“聊天”来解决问题。相反,我们需要构建一个结构化、模块化的工作流,迫使 AI 像一位纪律严明的侦探那样行动:先收集事实,然后进行分析,最后提出解决方案。CYBERTEAM 正是构建这种纪律严明工作流的蓝图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。