← 最新论文
💻 computer science

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

本文提出了一种新颖的方法,将大语言模型与领域本体及 SHACL 约束相结合,构建一个 AI 智能体,从而显著提升从网络安全日志(尤其是蜜罐数据)中提取结构化且语义有效信息的准确性与可解释性。

原作者: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图侦破一起犯罪案件,但 handed 给你的不是清晰的警方报告,而是成千上万页杂乱无章的手写笔记、潦草字迹和未完成的句子。这正是网络安全专家在尝试解读系统日志时所面临的困境。这些日志是计算机的“日记”,记录了每一次操作,但它们往往是非结构化的、令人困惑的,并且充斥着专业术语。

本文介绍了一种名为OntoLogX的新工具,旨在帮助侦探(网络安全分析师)理清这种混乱。以下是其工作原理,拆解为几个简单概念:

1. 问题所在:“杂乱的房间”

传统解读这些日志的方法,就像试图仅凭手电筒和一份固定规则清单,在杂乱的房间里寻找某个特定玩具。如果玩具被埋在衣服堆下,或者贴着一个奇怪的标签,手电筒就会漏掉它。

  • 问题所在:计算机生成的日志是非结构化且模糊的。旧方法难以可靠地找出“坏蛋”(恶意事件)。
  • 新工具:作者使用了大型语言模型(LLMs)。将 LLM 想象成一位几乎读过互联网上所有内容、能理解自然语言的超级聪明实习生。然而,这位实习生有点“爱做梦”——有时他们会凭空捏造,或者因为不受严格规则约束而略微搞错事实。

2. 解决方案:“建筑师”与“检查员”

为了纠正实习生爱做梦的倾向,作者构建了一个名为OntoLogX的系统,增加了两个关键的控制层:

  • 建筑师(本体论):在实习生开始撰写之前,系统会提供一份严格的蓝图,称为本体(Ontology)。这就像一套特定的积木和规则手册。它规定:“你只能使用这些特定的积木(类)来建造房屋,并且必须按照这种特定方式(关系)将它们连接起来。”它迫使 AI 将杂乱的日志数据整理成一种整洁、结构化的格式,称为知识图谱
  • 检查员(SHACL 验证):一旦实习生构建好结构,一位严格的检查员(使用名为SHACL的工具)就会检查工作。检查员会问:“你用了正确的积木吗?你把屋顶和墙壁正确连接了吗?有没有缺少的门?”
    • 如果建筑有误,检查员会将其退回给实习生,并附注:“修正这里。”
    • 实习生再次尝试。这个循环持续进行,直到建筑完美无缺。

3. 过程:从示例中学习

该系统并非仅仅让实习生去猜测。它使用了一种名为**检索增强生成(Retrieval Augmented Generation)**的巧妙技巧。

  • 想象实习生拥有一个过往成功案例的图书馆。当新的杂乱日志出现时,系统会找出最相似的过往案例(示例)并展示给实习生。
  • 它会说:“看看我们之前是如何解决这个类似谜题的。用同样的风格来解决这个新问题。”
  • 这有助于实习生确切理解“建筑师”(本体)想要什么,从而带来更好的结果。

4. 结果:更高的准确率,而非速度

作者将该系统与“旧方法”(即仅让实习生撰写,没有建筑师或检查员)进行了测试对比。

  • 结果:新方法显著提高了准确率。它发现了更多的“坏蛋”(更高的召回率),并且减少了错误(更高的精确率)。
  • 权衡:论文明确指出,他们优先考虑质量而非速度。新方法耗时稍长,因为它需要检查工作、获取反馈并重新尝试。但最终结果是,这是一份关于网络威胁的更可靠、更可信的地图。
  • 优胜者:在测试的不同 AI 模型中,Claude 3.5 Sonnet表现最佳,尽管像Llama 3.3这样的开源模型也表现优异。

总结类比

如果将阅读网络安全日志比作试图将一本混乱的手写日记翻译成正式的法律文件:

  • 旧方法:你让一位聪明的翻译“尽力而为”。他们可能领会了意思,但格式会杂乱无章且不一致。
  • OntoLogX:你给翻译提供一份严格的法律模板(本体),向他们展示完美法律文件的示例(少样本示例),并让一位严格的律师(SHACL)审查每一份草稿。如果草稿不完美,律师就会将其退回修正。结果就是,每次都能得到一份 flawless 的法律文件,即使生产时间稍长。

核心要点:本文证明,将“智能 AI"与“严格规则”和“质量检查”相结合,能够创建一个更可靠的系统,将杂乱的计算机日志转化为关于网络威胁的清晰、可操作的智能情报。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →