OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models
OntoLogX 是一个自主 AI 智能体,它利用大型语言模型、检索增强生成以及本体引导的迭代修正,将非结构化的网络安全日志转化为连贯的、基于本体的知识图谱,以实现对 MITRE ATT&CK 战术的精准映射。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正试图侦破一起案件,但递到你面前的不是清晰的证人证词,而是来自数百名不同警员的堆积如山的碎纸笔记、潦草的收据和杂乱的无线电通讯。这正是网络安全专家在查看系统日志时所面临的状况。这些日志是计算机留下的数字足迹,但它们杂乱无章、非结构化,且常常使用一种令人困惑的简写方式,不同设备之间还各不相同。
本文介绍了一种名为OntoLogX的新型“自主 AI 侦探”,旨在清理这些混乱,将那些杂乱的笔记转化为清晰、有条理的事件发生地图。
以下是 OntoLogX 的工作原理,通过简单的类比进行解释:
1. 问题:那些“碎纸笔记”
系统日志就像一堆碎纸。它们包含关于黑客的宝贵线索(他们是谁、试图做什么以及如何做的),但信息分散、不一致且难以阅读。传统工具试图通过遵循僵硬的规则(如检查清单)来整理这些内容,但黑客富有创造力并会改变战术,因此检查清单往往失效。
2. 解决方案:“智能翻译器”(OntoLogX)
OntoLogX 是一个充当超级智能翻译器和组织者的 AI 代理。它的任务是将单个杂乱的日志条目转化为结构化的知识图谱。
- 知识图谱:将其想象成家谱或地铁线路图。它不是将信息呈现为一段文字,而是将特定的“点”(如用户、计算机、时间和操作)通过清晰的“线”连接起来,展示它们之间的相互关系。
- 本体(蓝图):为了确保地图绘制正确,OntoLogX 使用轻量级本体。想象这是一份严格的建筑蓝图或一套乐高积木说明书。它明确告知 AI 允许使用哪些类型的“积木”(节点)和“连接”(关系),确保最终生成的地图合乎逻辑并遵循规则。
3. 工作原理:三步流程
OntoLogX 并非凭空猜测,而是采用巧妙的三步流程来确保准确性:
第一步:“参考图书馆”(检索增强生成)
在 AI 尝试翻译新日志之前,它会查阅自己的记忆库(一个包含已解决日志的数据库),寻找类似的案例。这就像侦探查看过去的案件档案,以了解类似案件是如何记录的。这有助于 AI 理解上下文,避免重复造轮子。第二步:“起草阶段”(生成)
利用参考示例和严格的“乐高说明书”(本体),AI 生成一份草案地图。它试图提取关键细节:谁做的?何时做的?使用了什么工具?第三步:“检查员”(迭代修正)
这是最重要的安全网。一旦草案完成,一位数字检查员(使用名为SHACL的工具)会对照蓝图对其进行核查。- 如果 AI 犯了错误(例如连接了错误的点或遗漏了必需的组件),检查员会将草案退回给 AI,并附注:“修正此处。”
- AI 会再次尝试。它会重复这一循环,直到地图完美无缺且符合所有规则。如果尝试几次后仍无法修复,它会承认失败并将该条目留空,而不是生成虚假的地图。
4. 全局视角:连接各个点
一旦 OntoLogX 清理了成千上万个独立的日志条目,它会将它们分组为“会话”(例如,将某次特定入侵尝试的所有笔记归为一组)。随后,它会最后一次利用 AI 纵观全局,回答一个高层问题:“黑客的目标是什么?”
它将这些活动映射到MITRE ATT&CK框架,这就像一本黑客战术的通用词典。OntoLogX 不再仅仅说“黑客运行了一条命令”,而是能够指出:“这是一次初始访问尝试,随后进行了权限提升。”这将原始数据转化为安全团队实际可用的可操作情报。
5. 论文发现
作者在两类数据上测试了 OntoLogX:
- 公共数据集:以确保其在标准、已知日志上的有效性。
- 真实世界的蜜罐:这些是专门设置用来吸引黑客的虚假服务器。来自这些蜜罐的日志纯粹是“坏人”的活动记录。
结果:
- 准确性:该系统成功将杂乱的日志转化为干净、符合规则的地图。
- 辅助效果更佳:当系统使用其“参考图书馆”(检索)和“检查员”(修正)时,效果最佳。若缺少这些,AI 会犯更多错误。
- 模型至关重要:并非所有 AI 大脑都同等有效。该系统在使用擅长遵循严格指令的模型(如专注于代码的模型)时表现最佳,而非那些更擅长创造性叙事的模型。
- 战术检测:在预测黑客意图时,OntoLogX 在识别复杂的多步骤攻击方面,远优于直接读取原始日志的系统。
总结
简而言之,OntoLogX 是一种工具,它将计算机日志中令人困惑、混乱的语言,转化为清晰、结构化且经过验证的网络攻击地图。它利用严格的规则手册,从过往案例中学习,并反复核查自身工作,以确保最终的情报足够可靠,供安全专家据此采取行动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。