✨ 要点🔬 技术摘要
想象你是一名侦探,试图侦破一起犯罪案件,但 handed 给你的不是清晰的警方报告,而是成千上万页杂乱无章的手写笔记、潦草字迹和未完成的句子。这正是网络安全专家在尝试解读系统日志 时所面临的困境。这些日志是计算机的“日记”,记录了每一次操作,但它们往往是非结构化的、令人困惑的,并且充斥着专业术语。
本文介绍了一种名为OntoLogX 的新工具,旨在帮助侦探(网络安全分析师)理清这种混乱。以下是其工作原理,拆解为几个简单概念:
1. 问题所在:“杂乱的房间”
传统解读这些日志的方法,就像试图仅凭手电筒和一份固定规则清单,在杂乱的房间里寻找某个特定玩具。如果玩具被埋在衣服堆下,或者贴着一个奇怪的标签,手电筒就会漏掉它。
问题所在 :计算机生成的日志是非结构化且模糊的。旧方法难以可靠地找出“坏蛋”(恶意事件)。
新工具 :作者使用了大型语言模型(LLMs) 。将 LLM 想象成一位几乎读过互联网上所有内容、能理解自然语言的超级聪明实习生。然而,这位实习生有点“爱做梦”——有时他们会凭空捏造,或者因为不受严格规则约束而略微搞错事实。
2. 解决方案:“建筑师”与“检查员”
为了纠正实习生爱做梦的倾向,作者构建了一个名为OntoLogX 的系统,增加了两个关键的控制层:
建筑师(本体论) :在实习生开始撰写之前,系统会提供一份严格的蓝图,称为本体(Ontology) 。这就像一套特定的积木和规则手册。它规定:“你只能使用这些特定的积木(类)来建造房屋,并且必须按照这种特定方式(关系)将它们连接起来。”它迫使 AI 将杂乱的日志数据整理成一种整洁、结构化的格式,称为知识图谱 。
检查员(SHACL 验证) :一旦实习生构建好结构,一位严格的检查员(使用名为SHACL 的工具)就会检查工作。检查员会问:“你用了正确的积木吗?你把屋顶和墙壁正确连接了吗?有没有缺少的门?”
如果建筑有误,检查员会将其退回给实习生,并附注:“修正这里。”
实习生再次尝试。这个循环持续进行,直到建筑完美无缺。
3. 过程:从示例中学习
该系统并非仅仅让实习生去猜测。它使用了一种名为**检索增强生成(Retrieval Augmented Generation)**的巧妙技巧。
想象实习生拥有一个过往成功案例的图书馆。当新的杂乱日志出现时,系统会找出最相似的过往案例(示例)并展示给实习生。
它会说:“看看我们之前是如何解决这个 类似谜题的。用同样的风格来解决这个 新问题。”
这有助于实习生确切理解“建筑师”(本体)想要什么,从而带来更好的结果。
4. 结果:更高的准确率,而非速度
作者将该系统与“旧方法”(即仅让实习生撰写,没有建筑师或检查员)进行了测试对比。
结果 :新方法显著提高了准确率。它发现了更多的“坏蛋”(更高的召回率 ),并且减少了错误(更高的精确率 )。
权衡 :论文明确指出,他们优先考虑质量而非速度 。新方法耗时稍长,因为它需要检查工作、获取反馈并重新尝试。但最终结果是,这是一份关于网络威胁的更可靠、更可信的地图。
优胜者 :在测试的不同 AI 模型中,Claude 3.5 Sonnet 表现最佳,尽管像Llama 3.3 这样的开源模型也表现优异。
总结类比
如果将阅读网络安全日志比作试图将一本混乱的手写日记翻译成正式的法律文件:
旧方法 :你让一位聪明的翻译“尽力而为”。他们可能领会了意思,但格式会杂乱无章且不一致。
OntoLogX :你给翻译提供一份严格的法律模板(本体),向他们展示完美法律文件的示例(少样本示例),并让一位严格的律师(SHACL)审查每一份草稿。如果草稿不完美,律师就会将其退回修正。结果就是,每次都能得到一份 flawless 的法律文件,即使生产时间稍长。
核心要点 :本文证明,将“智能 AI"与“严格规则”和“质量检查”相结合,能够创建一个更可靠的系统,将杂乱的计算机日志转化为关于网络威胁的清晰、可操作的智能情报。
以下是论文《实现透明的网络威胁情报:结合大语言模型与领域本体》(Cotti 等人著)的详细技术总结。
1. 问题陈述
网络威胁情报(CTI)依赖于从网络安全系统日志中提取可操作的见解。然而,当前的方法论面临重大挑战:
非结构化数据: 日志条目通常是非结构化的,句法不一致且语义模糊,使得自动化解释变得困难。
传统方法的局限性: 基于规则或启发式的方法缺乏对不断演变的威胁行为和新型攻击模式的适应性。
大语言模型(LLMs)的局限性: 虽然大语言模型(LLMs)在自然语言处理方面展现出前景,但它们往往缺乏特定领域上下文中的精确性,容易产生幻觉,且生成的输出缺乏结构连贯性或未能严格遵守网络安全模式。
透明度缺口: 现有的 AI 驱动提取通常作为“黑盒”运行,缺乏人类分析师信任并验证提取的威胁指标所需的可解释性。
所解决的具体挑战是:需要一种能够准确、透明且语义化地将非结构化日志数据(特别是来自蜜罐的数据)结构化,转化为适合自动化推理和查询格式的方法。
2. 方法论:OntoLogX
作者提出了OntoLogX ,这是一种集成领域本体 和**大语言模型(LLMs)**的 AI 代理方法论,旨在从原始日志生成结构化知识图谱(KGs)。其工作流程如下:
A. 核心组件
自定义日志本体: 设计了一个轻量级、扁平的本体,专门用于解析自由文本日志。与 STIX 或 UCO 等假设数据已预结构化的复杂标准不同,该本体直接从原始文本中捕获核心实体(事件、用户、应用程序、文件、网络地址、来源、URL)和关系。
SHACL 约束: 该本体与形状约束语言(SHACL)规范配对,以强制生成图谱的结构和语义有效性(例如,基数、数据类型、必需属性)。
AI 代理流水线:
检索(少样本学习): 当新的日志事件到达时,系统查询向量存储,使用**最大边际相关性(MMR)**检索语义相似且先前生成的 KGs。这确保了示例的多样性同时保持相关性。
生成: 向 LLM 提示原始日志、上下文、检索到的示例以及源自本体的严格规则。LLM 被指示以特定的 JSON 格式生成 KG。
修正(迭代反馈): 系统采用验证循环。如果生成的输出违反 SHACL 约束或本体模式,则发送定制的修正提示回 LLM 以修复特定错误。此循环重复(最多 3 次),直到生成有效图谱或放弃尝试。
B. 技术实现
框架: 使用 Python 和 LangChain 构建。
存储: 带有向量索引的 Neo4j 图数据库,用于语义检索。
输出控制: 使用结构化输出工具(Pydantic)强制 LLM 遵守严格模式,减少格式错误。
3. 主要贡献
新颖的混合架构: 本文介绍了一种将提示驱动的 LLM 与刚性本体驱动约束及 SHACL 验证相结合的新方法,创建了一个用于 CTI 提取的“自修正”代理。
轻量级本体设计: 创建了一个专门针对非结构化 日志解析的专用、最小化本体,弥合了原始文本与复杂 CTI 标准(如 STIX/SEPSES)之间的差距。
透明 AI 流水线: 通过使用自然语言提示指导提取并允许迭代修正,该方法增强了 AI 决策过程的可解释性和可审计性。
迭代修正机制: 包含一个反馈循环,系统根据 SHACL 约束验证其自身输出并请求特定修正,与单次生成相比,显著提高了数据质量。
4. 实验结果
该方法使用AIT-LDS 数据集 (70 条多样化的日志条目)在五个不同的 LLM(包括 Claude 3.5、Llama 3.3、Mistral Large 和 Qwen 2.5 Coder)上进行了评估。
比较: 将 OntoLogX 与基线 (仅提示方法,无检索或修正)进行了比较。
性能指标: 精确率、召回率、F1 分数、G-Eval(语义忠实度)和 SHACL 违反率。
主要发现:
卓越的准确性: OntoLogX 在几乎所有模型和指标上始终优于基线。
召回率与精确率: 观察到精确率(减少幻觉)和召回率(更完整的提取)均有显著改善。例如,在 OntoLogX 下,Claude 3.5 Sonnet 实现了最高的 F1 分数(0.859)和 G-Eval 分数(0.767)。
鲁棒性: 该方法显著减少了 SHACL 违反,确保输出在结构上有效。
模型差异: 虽然大多数模型有所改进,但Mistral Large 是一个例外,其在某些指标上基线表现略好,表明它可能与所使用的特定结构化提示或工具辅助工作流兼容性较差。
效率: 该方法优先考虑提取质量而非速度,每条日志条目的处理时间从 1.4 秒(Llama 3.3)到 9.8 秒(Mistral Large)不等。
5. 意义与未来工作
对 CTI 的影响: 研究表明,将语义约束与 LLM 相结合,可以创建一个稳健、透明且高度准确的系统,用于将嘈杂的日志数据转化为可操作、可查询的情报。这对于主动威胁狩猎和自动化响应至关重要。
可扩展性: 使用轻量级本体使系统能够处理多样化的日志来源(蜜罐、审计日志等),而无需复杂预处理的开销。
未来方向:
人机回环: 开发交互式界面,供分析师验证和细化 KGs。
自适应学习: 实施机制,使系统能够从分析师反馈中学习,以适应新的对抗战术。
标准对齐: 规范化自定义本体与既定标准(SEPSES、UCO、MISP)之间的映射,以确保与现有 CTI 平台的互操作性。
专用模型: 探索任务专用 LLM(例如像 Qwen 3 这样的代码生成模型),以实现更好的图谱生成和修正能力。
总之,OntoLogX 代表了迈向使 AI 驱动的网络威胁情报既准确 又可解释 的重要一步,超越了“黑盒”提取,走向可验证的、本体引导的情报流水线。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。