CTIConnect: A Benchmark for Retrieval-Augmented LLMs over Heterogeneous Cyber Threat Intelligence
本文介绍了 CTIConnect,这是一个综合性的基准测试与评估框架,旨在系统地评估检索增强型大语言模型在九个异构网络威胁情报任务中的表现,并揭示了有效的性能表现需要特定领域的结构化干预,而非通用的检索改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解复杂犯罪案件的网络安全侦探。你拥有一个庞大的线索库,但这些线索是用五种完全不同的语言和格式编写的:有些是僵化的、技术性的电子表格(比如一个关于软件漏洞的数据库),而另一些则是由不同记者撰写的冗长且混乱的新闻文章,其中使用了大量的俚语和对同一犯罪分子的绰号。
这就是**网络威胁情报(CTI)**的世界。问题在于,信息量太大,任何人类都无法通过手动阅读并建立联系。
于是,**大语言模型(LLMs)**登场了。把这些 AI 模型想象成聪明、极速的侦探,他们几乎可以阅读并理解任何东西。但问题在于,这些 AI 有一个“记忆限制”。它们无法记住每天产生出的每一个新威胁报告。如果你问它们关于一种全新的病毒的问题,它们可能会猜错,因为它们还没有“读过”最新的报告。
为了解决这个问题,我们使用了检索增强生成(RAG)。这就像是给这位 AI 侦探一张神奇的图书馆借阅卡。当被问到一个问题时,AI 首先会跑向图书馆,抓取最相关的文档,然后再根据它刚刚读到的内容进行回答。
问题所在:“翻译丢失”的鸿沟
这篇论文的作者们发现,仅仅给 AI 一张图书馆借阅卡是不够的。这个图书馆一团糟。
- 词汇不匹配: 一份文档可能称某个黑客组织为“APT29”,而另一份称其为“Cozy Bear”,第三份则称其为“Nobelium”。如果你要求 AI 查找所有关于“APT29”的报告,标准的搜索可能会错过那些仅使用其他名称的报告。
- 格式不匹配: 一份文档可能会说“攻击者从内存中窃取了密码”,而一个技术数据库则将其列为“T1003.001 – LSASS Memory”。AI 可能意识不到它们指的是同一件事。
论文指出,标准的搜索工具(仅寻找相似词汇的工具)在这里会失效,因为它们无法弥合这些差距。它们就像是一个只懂得字面逐词翻译、却不懂得含义或绰号的翻译员。
解决方案:CTIConnect
团队构建了一个新的基准测试(标准化的测试)叫做 CTIConnect,用以观察 AI 侦探在必须在这样一个混乱、多语言的图书馆中进行搜索时表现如何。
他们创建了 1,860 个经过专家验证的问题,涵盖了三种主要的侦探工作类型:
实体链接(建立联系):
- 任务: “这个软件漏洞(CVE)是由哪种特定的弱点(CWE)引起的?”
- 类比: 将特定的汽车型号与其发动机类型进行匹配。AI 必须在两种不同的技术目录之间进行“翻译”。
- 解决方法: AI 需要在搜索之前,将问题“翻译”成数据库使用的精确技术术语。
实体归属(命名罪犯):
- 任务: “一份报告说‘坏人使用 .cuba 后缀加密了文件’。这描述了哪种具体的黑客技术?”
- 类比: 阅读目击者描述(“他戴着红帽子而且跑得很快”)并将之与警察档案进行匹配(“嫌疑人:约翰·多伊,以擅长奔跑著称”)。
- 解决方法: AI 必须将句子分解为微小的、原子级的动作,并将每一个动作翻译成官方的警察代码。
多文档综合(构建故事):
- 任务: “结合来自五个不同新闻机构的报告,为黑客组织‘APT29’建立一个画像。”
- 类比: 你有五个不同的证人在描述同一个派对。一个称主人为“Bob”,另一个称其为“Bobby”,还有一个称其为“老大”。AI 必须在开始阅读之前意识到他们都在谈论同一个人,并将他们的故事合并成一个时间线。
- 解决方法: AI 需要足够聪明,在开始阅读前就能意识到“Bob”=“Bobby”=“老大”。
他们的发现
研究人员使用这个新测试测试了 10 种不同的 AI 模型(包括免费/开源的和昂贵/专有的模型)。以下是他们的关键发现:
- 并非一种方案适用于所有场景: “一刀切”的搜索策略失败得很惨。寻找技术漏洞(实体链接)的最佳搜索方式,与寻找黑客绰号(多文档综合)的最佳搜索方式是完全不同的。
- 专业化工具胜出: 当他们给 AI 提供专门的策略(例如“先翻译问题”或“将句子拆分为部分”)时,AI 的性能大幅提升——有时甚至提升了 35%。而标准的搜索工具仅能带来微小的改进(1-5%)。
- 瓶颈发生了转移:
- 对于技术链接任务,问题在于搜索工具。一旦 AI 找到了正确的文档,即使是“较小”的 AI 也能正确回答。
- 对于命名和故事构建任务,问题在于 AI 的大脑。即使拥有正确的文档,AI 也需要非常聪明才能理解上下文并连接起各种别名。
- 智能搜索 > 更大的大脑: 对于某些任务,使用一个带有专门搜索工具的“较小”AI,效果比使用一个带有“基础搜索工具”的“庞大且昂贵”的 AI 更好。这意味着你并不总是需要最昂贵的 AI;你只需要正确的方式来寻找信息。
核心结论
论文得出结论,要构建有效的 AI 安全工具,我们不能仅仅依赖更大的 AI 模型或通用的搜索引擎。我们需要构建专门的检索系统,这些系统能够理解网络安全领域独特的“方言”和“绰号”。
可以这样想:你不需要一个更大的图书馆来破案;你需要一位知道如何找到正确书籍的图书管理员,即使书名是用你不懂的代码编写的。CTIConnect 为构建那位图书管理员提供了地图和测试方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。