← 最新论文
🤖 AI

Traceable LLM-Generated Hazard Scenarios for Operational Safety Analysis of Aviation Systems Using ASRS Reports

本文提出了一种人工智能辅助框架,该框架通过利用 NASA 的 ASRS 报告,并采用经进化溯因增强的大语言模型来生成结构化假设和叙述性事件序列,从而为航空运行安全分析生成具有可追溯性和合理性的危险场景。

原作者: Cristian Mascia, Roberto Pietrantuono, Daniel Rodriguez, Stefano Russo

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Cristian Mascia, Roberto Pietrantuono, Daniel Rodriguez, Stefano Russo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图预测下一场大风暴。你不能仅仅靠猜测;你需要观察过去风、气压和温度是如何共同起舞并最终引发混乱的。这就是航空领域“安全性分析”的核心。这不仅仅是在引擎冒烟后去修理损坏的部件,而是利用一个由数据构成的“水晶球”来追问:“如果飞行员感到困惑、天气变得冰冷,且计算机同时发生故障,会发生什么?”其目标是在这些危险组合发生之前找到它们,以便工程师能够制造出足以应对这些情况的飞机。几十年来,人类一直通过头脑风暴和检查旧事故报告来完成这项工作,但可能的“如果……会怎样”的情景数量如此庞大,以至于就像试图在沙滩上寻找一颗特定的沙粒一样困难。现在,科学家们在问:我们能否教会一台超级智能的计算机来替我们进行这种头脑风暴?

本文介绍了一种名为 HaGen(Hazard Generator,危险生成器)的新型人工智能工具,它充当了安全工程师的“创意写作伙伴”。HaGen 不仅仅是列出枯燥的事实,它阅读了来自 NASA 数据库的数千份真实的、历史性的事故报告,并学习了航空灾难的“语法”。当工程师问道:“给我展示一个飞机在晴朗天气着陆时受损的情景”时,HaGen 不仅仅会吐出一份随机的错误列表。它会构建一个完整的场景:它会挑选特定的、现实的诱因(例如某种特定类型的天气、特定的飞行阶段以及人为失误),然后写出一个生动且具有技术性的叙述,详细描述这些因素是如何结合在一起并导致麻烦的。

研究人员将这一工具与以往更僵化的数学方法进行了对比测试。他们发现,虽然 AI 非常擅长编写故事,但有时会在逻辑上出错,创造出不可能发生的事件组合。然而,他们发现了一个聪明的解决方法:他们创建了一个混合版本,称为 HaGen+。在这个版本中,另一个高度逻辑化的 AI 首先构建事故的“骨架”(即诱因列表),而 HaGen 仅负责填充“血肉”(即故事内容)。这种组合被证明是最可靠的,它生成的场景不仅真实可信,而且具有一致性,且没有逻辑错误。该论文指出,这种混合方法可以成为安全专家的强大助手,帮助他们发现可能遗漏的危险情况,前提是必须由人类专家对最终成果进行复核。

HaGen 的故事:教 AI 如何构思灾难(且安全地构思)

航空安全有点像是在玩一场“如果……会怎样?”的游戏,但其赌注之高如同天空本身。为了确保飞机的安全,工程师必须想象飞行可能出错的所有方式。他们查阅旧的事故报告——比如存储在 NASA 庞大的 ASRS 数据库中的报告——以寻找规律。通常,一次坠毁并非由单一因素引起,而是一个连锁反应。也许是天气恶劣、飞行员疲劳,且传感器失效,所有这些恰好在同一时刻发生。

长期以来,人类必须手动进行这些连锁事件的头脑风暴。这是一项艰苦的工作,由于变量(天气、飞行员行为、飞机部件、空中交通管制指令)太多,很容易遗漏某些奇特但危险的组合。这就是论文作者提出的新思路:让我们使用大语言模型(LLM)——也就是那些能写诗和回答问题的同类 AI——来为我们生成这些“如果……会怎样”的情景。

神奇工具:HaGen

作者构建了一个名为 HaGen 的工具。可以将 HaGen 想象成一位读过历史上每一份航空事故报告的创意作家。当你给出一个具体目标时——例如,“写一个关于飞机在晴朗天气进行最后进场时受损的故事”——HaGen 会做两件事:

  1. 构建骨架: 它会挑选一组符合航空规则的特定类别因素(如“夜间”、“结冰”、“沟通中断”)。
  2. 编写故事: 它会生成一段详细的叙述,描述这些因素如何在现实生活中展开,并使用飞行员和管制员使用的专业术语。

论文测试了 HaGen 使用的三种不同 AI 模型(Llama、Ministral 和 Phi)以及两种不同的提问方式(Zero-Shot,即直接提问;以及 Few-Shot,即先给 AI 提供几个例子)。

问题所在:AI 幻觉

这里有一个陷阱。虽然 HaGen 很擅长写作,但它有时会弄错事实。在实验中,AI 偶尔会生成一些不可能发生或不符合规则的情景。例如,它可能会建议一架飞机在“晴朗天空”下坠毁,但故事描述的却是暴风雪;或者它可能会发明一个并不存在的飞机零件。

研究人员发现,仅仅要求 AI “发挥创意”(Zero-Shot)会导致很多错误。然而,当他们先给 AI 提供几个优秀的案例(Few-Shot prompting)时,错误率显著下降。事实上,转向这种“Few-Shot”方法后,生成的结构准确性比单纯提问提高了约 52%

有趣的是,他们尝试对 AI 进行“微调”(即针对其数据集进行专门教学)以使其表现更好,但这反而让某些模型的表现变差了,导致失败频率更高。最好的结果来自于使用 Llama 模型配合 Few-Shot 方法,并且不进行微调。

解决方案:HaGen+(结合两者的优势)

作者意识到,虽然 AI 擅长讲故事,但它并不总是具备构建事故“骨架”所需的严密逻辑。因此,他们创建了 HaGen+

请将 HaGen+ 想象成一个团队:

  1. 建筑师 (EVA): 这是一个专门的、较传统的算法,非常严谨且富有逻辑。它构建完美的事故骨架,确保所有因素在一起都是合理的。它使用一种称为“进化溯因”(evolutionary abduction)的方法,这是一种数字进化过程,通过测试数千种组合来找到最合理的组合。
  2. 讲述者 (HaGen): 一旦建筑师构建好了骨架,HaGen 就会接手,围绕着它编写叙述。

这种混合方法解决了最大的问题。因为建筑师保证了骨架的有效性,讲述者就无需担心编造不可能的事实。结果如何?“HaGen+”工具生成的场景与表现最好的纯“结构化方法”一样真实,但其无效结构的比例为 。它还使故事更加一致,将现实感方面的波动性降低了 83%

为什么这很重要

论文并未声称 AI 可以取代人类安全工程师。相反,它指出 AI 可以成为循环中的强大“助手”。它可以快速生成数百个人类可能永远想不到的、合理的、详细的情景,帮助工程师发现隐藏的危险。

研究人员将他们的工具与用于生成结构化事故数据的尖端方法(特别是基于进化搜索和因果结构发现的方法)进行了对比,发现他们 AI 生成的结构化情景在统计学上与这些专门的非 AI 方法所创建的情景没有区别。此外,该系统通过将每个生成的场景链接到最相似的历史 ASRS 报告,提供了可追溯性,证明了该场景是基于现实世界的模式而非随机发明。

然而,论文谨慎地指出,这是一个用于“探索”的工具,而不是预测的“水晶球”。AI 生成的是“候选”情景,必须由人类专家进行审核。作者建议,若要将其用于现实世界的认证(获得如 FAA 或 EASA 等机构的官方批准),AI 需要成为“人机协同”(Human-in-the-Loop)系统的一部分,即人类始终拥有最终决定权。

简而言之,论文表明,通过将传统算法的逻辑严密性与现代 AI 的创意叙事能力相结合,我们可以为天空构建一个更好的安全网。这并不是要取代飞行员或工程师;而是为他们提供一个超能力的助手,帮助他们在危险真正发生之前就洞察到那些隐形的威胁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →