✨ 要点🔬 技术摘要
想象一下,互联网就像一座巨大且混乱的图书馆,其中的每一本书都是关于电脑被黑客攻击的故事。多年来,安全专家一直试图通过阅读这些故事来预测下一次大规模劫案,但这些书是用杂乱无章的手写体写成的,而且故事散落在数百万个不同的书架上。这就是网络威胁情报(CTI)的世界:一个关于坏人如何入侵系统的海量线索集合。为了理清这些混乱,专家们使用 攻击图(Attack Graphs) ,它们就像是详细的藏宝图。它不仅仅是列出一个撬锁工具,而是展示整个旅程:“从前门开始,溜进厨房,爬上阁楼的梯子,最后打开保险箱。”在汽车领域,这些地图至关重要,因为现代汽车基本上是装了轮子的电脑;如果黑客能从收音机跳转到刹车系统,整辆车都会陷入危险。研究人员一直在问的一个大问题是:我们能否教会一台超级聪明的电脑去阅读所有那些杂乱的图书馆书籍,并自动为我们绘制出这些藏宝图,甚至对于它从未见过的车型也能做到?
于是有了 GARAGE ,这是研究人员创造的一种新工具,它扮演着一个不知疲倦、组织极其严密的图书管理员兼绘图员的角色。团队通过向它喂入 12,786 个已知的软件漏洞(称为 CVE)和 140 个真实的汽车被黑案例,构建了一个庞大的数字大脑。他们并没有只是简单地倾倒数据;他们将数据组织成一个结构化的“知识库”,该知识库使用一种名为**检索增强生成(RAG)**的系统,使用汽车安全的特定语言进行交流。把 RAG 想象成一个安全网:当电脑尝试绘制地图时,它会被迫先在图书馆中查阅事实,而不是仅凭记忆进行猜测。这有助于防止电脑产生“幻觉”,或者编造出并不存在的假锁和假钥匙。
研究人员通过一场“猜猜攻击路径”的游戏对 GARAGE 进行了测试,使用了四个真实的汽车黑客事件(例如著名的 Jeep Cherokee 和 BMW i3 事件)。他们隐藏了目标车辆的具体细节,迫使电脑只能依靠从其他汽车中学到的知识。结果既有令人印象深刻的成功,也有明显的局限性。当攻击遵循某种通用模式时——比如“黑掉收音机以控制引擎”——这台电脑表现得像颗明星,在表现最好的模型中,约 60% 的时间内能成功绘制出地图。它甚至可以在不同汽车品牌之间转移知识,意识到在奔驰上使用的技巧也可能适用于宝马。
然而,论文中划定了一条非常清晰的分界线。当攻击需要特定的、细枝末节的细节时,比如特定硬件内部的精确代码或特定汽车硬盘上的唯一文件路径,电脑就会表现得极其吃力。在这些情况下,电脑的“猜测”经常失败,研究人员发现生成的地图中有 76.9% 包含至少一个编造的元素。这引出了该论文最重要的发现:存在一个自动化边界 。GARAGE 非常擅长识别“大局观”策略(战术模式),但它还无法取代人类专家处理精细细节(实现细节)。研究人员建议,使用这个工具的最佳方式是将其作为“人机协同(Human-in-the-loop)”的助手:让电脑绘制藏宝图的草稿,然后让人类安全专家检查具体的步骤,以确保梯子是真的,且保险箱确实存在。
这项研究还观察了运行这些数字图书管理员的成本。他们测试了八种不同的 AI 模型,范围从昂贵的顶级“专有”模型到更便宜的开源模型。他们发现,虽然最昂贵的模型最准确,但一些较便宜的模型在成本和性能之间提供了很好的平衡。例如,其中一个开源模型可以用极低的价格完成不错的工作。最终,论文得出结论:虽然我们目前还无法实现汽车安全的完全自动化,但像 GARAGE 这样的工具可以帮助专家更快地工作并捕捉更多威胁,前提是我们必须记住,电脑是一个得力的学徒,而非大师级匠人。
技术摘要:GARAGE —— 表征基于大语言模型(LLM)的攻击图生成的自动化边界
问题陈述
现代车辆安全依赖于有效的网络威胁情报(CTI)综合,然而目前的自动化工具在处理非结构化数据以及应对汽车特定架构细微差别方面表现乏力。传统的威胁分析与风险评估(TARA)通常局限于单个电子控制单元(ECU),无法捕捉那些利用跨多个组件、操作系统及车载网络(如 CAN/以太网)的链式漏洞的安全关键型攻击。构建端到端的攻击路径需要跨领域的专业知识,而人类分析师很难系统性地获取这些知识。虽然大语言模型(LLM)为聚合分布式技术知识提供了潜力,但其在汽车领域的应用面临着私有且碎片化数据,以及需要在非结构化报告中保持因果逻辑和逐步链式关系的挑战。此外,现有的基于图的方法往往缺乏语义上下文,而基于向量的检索则无法维持结构化的连通性。
方法论
作者引入了 GARAGE (具有基于 RAG 的攻击图引擎的生成式 AI),这是一个旨在将碎片化的 CTI 转换为特定领域知识库(KB),并自动生成车辆级攻击图的端到端框架。
1. 知识库构建
GARAGE 综合了一个包含 12,786 个 CVE 和 140 份安全事件报告 (源自 AutoSec-Timeline、技术博客和报告)的数据集。构建流程包括:
实体提取: 使用四种 LLM(Gemini 3.0 Flash, GPT-5.2, Claude 4.5 Sonnet, DeepSeek-V3.2)从非结构化文本中提取 12 种预定义的实体类型(例如 component、target_ecu、vulnerability、network_domain)。
归一化: 应用基于嵌入的聚类来解决语义冗余问题(例如,合并“CAN”和“Controller Area Network”),并在 Neo4j 图中创建规范节点。
关系提取: 基于 9 种预定义的关系类型(例如 HAS_VULNERABILITY、CONNECTED_TO)生成主-谓-宾(SPO)三元组,最终形成一个包含约 8,824 个节点和 9,265 条边的知识图谱(KG)。
事件与技术映射: 提取结构化的安全事件,并使用微调后的分类器将其映射到 Auto-ISAC 汽车威胁矩阵(ATM) 技术。
重写: 将结构化的三元组转换回自然语言摘要,以提高向量库中的检索质量。
2. 混合检索增强生成 (Hybrid RAG)
推理流水线采用双重检索策略,以减轻幻觉并确保结构的有效性:
上下文感知向量检索: 根据车辆规格进行动态查询生成,并结合 ATM 指导的查询构建,随后通过交叉编码器重排序来检索相关的非结构化 CTI 证据。
结构化 KG 遍历: 从种子节点(ECU、协议)开始遍历 Neo4j 图,以提取高置信度的结构化证据(例如 ECU → Component → Vulnerability),遍历深度最高为 2 跳。
混合合成: LLM 合成来自向量库和 KG 的证据,以推断多阶段攻击路径。系统遵循保守原则:除非向量证据明确指出了特定的车辆品牌/型号并产生矛盾,否则 KG 中记录的漏洞均被假定存在。
3. 评估框架
作者提出了一个双指标评估框架 ,用于分别评估 LLM 的能力:
实际可行性 (Practical Feasibility, PF): 从红队视角评估攻击路径的可行性,采用“级联失效”原则。如果某一步骤无效,则后续所有步骤均计为失败。它衡量链条的完整性、逻辑转换的有效性,并惩罚物理或逻辑上的不可能情况。
知识重构 (Knowledge Reconstruction, KR): 独立于链条完整性来衡量安全知识的深度,对实体识别、结构化知识和知识精确度进行评分(惩罚幻觉)。
核心贡献
特定领域知识库: 构建并公开了一个与 STIX 2.1 和 Auto-ISAC ATM 对齐的汽车网络安全知识库,该知识库源自 12,786 个 CVE 和 140 份事件报告。
双指标评估: 提出了一种将攻击路径可行性(PF)与安全知识深度(KR)分离的新型评估框架,实现了对 LLM 性能的细粒度分析。
经验性的自动化边界: 通过针对四个真实案例(Jeep Cherokee, Mercedes-Benz W177, Nissan Leaf, BMW i3)和八种 LLM 进行的 320 次留一法(LOO)实验 ,研究确定了 LLM 可以有效地生成高层战术威胁场景,但在底层实现细节方面需要人工干预。
成本-性能分析: 为在专用模型和开源权重模型层级中部署 GARAGE 提供定量指导,分析了成本与分析深度之间的权衡。
结果
推理能力: 在 LOO 条件下,专用模型达到了 59.0/100 的平均实际可行性(PF)得分,而开源权重模型平均为 39.2/100 。性能与 KB 匹配率 (即 ground truth 抽象与 KB 覆盖范围之间的重叠度)高度相关。例如,BMW 案例(匹配率为 88.8%)在各模型中均表现出高分,而 Jeep 案例(匹配率为 38.8%)则显示出显著的模型性能差异。
自动化边界: 研究确定了一个清晰的边界:
高覆盖度: 诸如初始访问(Initial Access, 95%)、权限提升(Privilege Escalation, 82.5%)和影响车辆功能(Affect Vehicle Function, 98.8%)等战术,在跨车辆知识迁移方面得到了良好的支持。
低覆盖度: 需要目标特定实现细节的战术,如执行(Execution, 15%)和命令与控制(Command and Control, 32.5%),表现出性能大幅下降,表明自动化迁移在这些阶段是不充分的。
一致性: 专用模型展现出更高的稳定性(变异系数约为 33%),而开源权重模型约为 50%,尽管这种差异很大程度上是由 PF 指标的级联失效特性驱动的。
成本-性能: 在专用模型中,Gemini 3.0 Flash 提供了最优的性价比(以 Claude 1/10 的成本实现了其 87% 的性能)。在开源权重模型中,Qwen3-coder 在性能和成本之间取得了最佳平衡。
意义与主张
本文将 GARAGE 定位为 Human-in-the-loop(人机协同) 工作流中的可扩展 TARA 支持工具 ,而非完全取代人类分析师的自主工具。作者主张:
自动化在战术模式上是可行的: GARAGE 可以根据架构规范有效地枚举威胁场景并生成初始攻击路径,涵盖了分析师经常忽略的切入点和影响场景。
实现细节需要人工干预: 该框架无法可靠地推断目标特定的固件或软件内部细节(例如特定的缓冲区溢出或协议特性),这确立了一个必须由专家验证的结构性边界。
知识质量至关重要: 消融研究表明,底层 KB 的质量和覆盖范围是决定推理性能的主导因素,其重要性超过了具体的检索方式(图检索 vs 向量检索)。
合规性: 通过将生成的攻击路径锚定在检索到的源制品(CVEs, CTI 报告)中,GARAGE 提供了 UN R155 和 ISO/SAE 21434 等监管标准所要求的证据可追溯性,这是纯参数化记忆方法无法保证的。
研究结论指出,虽然 GARAGE 显著加速了威胁建模的初始阶段,但其部署必须根据威胁类型的具体特征(战术级 vs 实现级)以及所选的模型层级来进行引导,以平衡成本、准确性和监管合规性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。