Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge
本文介绍了“Pre-Flight”,这是一个由专家编写的包含300道多项选择题的开源基准测试,旨在评估大语言模型在航空运行知识方面的表现,研究揭示了即使是最先进的模型目前在专家级可靠性方面也存在显著差距,并强调了在航空领域进行领域特定评估对于负责任的人工智能部署的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,航空业就像一座庞大且极其复杂的图书馆。在这座图书馆里,有数以百万计的书籍:有些是闪亮的数字化新手册,有些则是20世纪60年代尘封的纸质手写日志。这座图书馆包含了飞机如何在地面移动、如何与空中交通管制员沟通以及如何保障乘客安全的规则。
长期以来,我们一直试图教会计算机(特别是大型语言模型,即 LLMs)阅读这座图书馆并担任得力的助手。但问题在于,我们一直在用通用的常识性问题来测试这些计算机,比如“谁是第一任总统?”或者“法国的首都是哪里?”
问题所在:“通用知识”陷阱
本文作者认为,通过通用的常识测试并不意味着一台计算机已经准备好在机场投入工作。这就像是通过让一名飞行员背诵流行歌曲的歌词来测试其飞行能力一样。他们可能完美地记住了歌词,但这并不代表他们能够应对风暴或机械故障。在航空领域,错误的答案不仅仅意味着成绩不好,它可能会造成经济损失、声誉受损,甚至更严重的后果。
解决方案:“Pre-Flight”(预检)
为了解决这个问题,作者创建了一个名为 Pre-Flight 的新测试。你可以把它看作是一个专门针对机场地面运行的“驾驶考试”。
- 测试内容: 由300道选择题组成。
- 来源: 这些题目源自真实的官方规则手册(如国际民航组织 ICAO 的国际标准和美国联邦航空管理局 FAA 的法规)以及真实飞行员和地面人员使用的安全手册。
- 评分者: 这些题目由真正的航空专家编写并审核——这些人曾实际管理过空中交通、驾驶过飞机或在停机坪上工作过。
结果:“专家差距”
作者选取了目前最智能的 AI 模型(截至 2026 年中期)并让他们参加了这项测试。以下是他们的发现:
- 人类基准: 当一小部分真实的航空专业人士参加类似的测验时,他们的得分约为 95%。这是可靠性的“金标准”。
- AI 表现: 最优秀的 AI 模型仅获得了 82.7% 的分数。
- 差距: AI 与人类专家之间存在显著差距。尽管 AI 的得分正在提高,但进步非常缓慢。这就像一个学习了两年、终于从 75% 提升到 83% 的学生,但仍然没有达到毕业所需的 95% 优等生水平。
为什么会这样?
论文提出了几个可能的原因:
- 美国法规很棘手: AI 模型在处理特定的美国规则(FAA)时表现得最为吃力。这可能是因为与国际规则相比,这些特定细节在 AI 训练所用的通用互联网数据中出现的频率较低。
- 推理与记忆的区别: AI 擅长记忆事实(例如“限速是多少?”),但当它必须进行多步逻辑推理时(例如“如果正在下雪且跑道较短,我们应该使用哪个登机口?”),它就会感到困惑。
- 过度自信: 有时 AI 会对错误的答案表现得非常自信,这在航空这种高风险领域是非常危险的。
“离群值”与“困难模式”
- 其中一个模型(ALLaM 2 7B)仅得了 25.3%,这基本上是在随机猜测。这表明一个模型可能在其他方面表现出色,但在面对航空特定规则时却会完全失败。
- 作者还提到,他们正在构建一个难度更高的“困难模式”版本。目前他们对此保持私密,以便随着 AI 变得越来越聪明,他们可以持续进行测试,而不至于让 AI 通过从互联网上“背诵”答案来“作弊”。
核心结论
论文得出结论:在我们允许 AI 处理航空领域重要的非安全性关键任务(如调度或客户服务)之前,我们必须证明它能够通过这个特定的 “Pre-Flight” 测试。目前,AI 还没有达到这个水平。它像是一个很有前途的学生,但还没准备好成为船长。
本文并未提及的内容:
- 它并没有说 AI 应该用于安全性关键的任务(如实际驾驶飞机或做出紧急决策)。
- 它并不声称 AI 即将取代人类飞行员或地面人员。
- 它并未建议目前的 AI 得分足以在现实世界的运营中进行即时的、无人监管的部署。
其核心信息很简单:我们需要专门针对航空业的测试,而目前,AI 尚未达到人类专家的水平。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。