Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance
本文介绍了 DGEval,这是首个用于评估大语言模型在国际海运危险货物规则(IMDG Code)方面表现的基准测试,研究揭示了尽管模型在多项选择题和结构化查询方面可以超越人类,但其在积载与隔离等安全关键领域的不可靠性,使得在部署前必须保持持续的人类监督。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
海洋是一种巨大且强大的力量,在海上运输货物需要一套严格的规则,以确保船舶、船员和环境的安全。当公司运输化学品、电池或易燃液体等危险材料时,必须遵守一本庞大的国际规则手册,即《国际海运危险货物规则》。这份文件并非一份简单的清单;它是一个复杂的指令网络,规定了每一件物品必须如何进行分类、包装、贴标以及在船上的摆放位置。一旦出错,可能会导致火灾、爆炸或有毒物质泄漏,而这些问题一旦在海上发生,几乎无法修复。几十年来,负责这些决策的人员一直依赖于自身的培训和细致的人工检查来确保合规。然而今天,许多专业人士正转向一种新型工具:被称为大语言模型的人工智能系统。这些计算机程序可以阅读并以人类语言回答问题,为快速获取数千页的法规提供了可能。但由于该领域的错误可能会以生命为代价,问题不仅在于这些工具是否聪明,更在于它们是否足够安全,足以让人们信任其做出的最关键决策。
一组研究人员为了回答这个问题,建立了一个专门为海事安全设计的严谨测试。他们创建了一个名为 DGEval 的基准测试,将其作为人工智能的“期末考试”。该测试由海运专业人员使用的真实世界培训材料和官方危险货物清单构建而成。它包含近 1,700 个问题,涵盖了从识别化学品的正确名称到确定特定集装箱应放置在船上的什么位置以避免灾难等方方面面。研究人员评估了来自六家主要科技公司的十三种不同人工智能模型。他们通过多种方式对这些模型进行了测试,要求它们回答多项选择题、撰写自由文本解释、查找特定数据,并准确指出规则手册中包含答案的具体部分。他们还测试了让模型通过互联网搜索信息是否能帮助它们表现得更好。
结果揭示了这些模型能力与局限性之间的明显分歧。表现最好的模型是来自谷歌的一个大型系统,它在正确回答多项选择题方面的频率高于平均水平的受训人类专业人员。它擅长检索直观的事实,例如化学品的官方名称或其基本危险类别。然而,研究发现,这些模型在对安全至关重要的领域表现显著较弱。当问题涉及复杂的运营决策时——特别是关于如何隔离不相容货物或将其停放在船舶何处——模型便显得力不从心。即使是表现最好的系统,在这些高风险领域也会频繁出错。研究人员还发现,模型在指出规则手册中可以找到答案的具体章节方面表现极差,而这项技能对于人类验证人工智能的工作至关重要。
研究还观察了不同类型的提问如何影响性能。当模型被要求仅仅从列表中选择正确答案时,它们的表现尚可。但当被要求在没有任何选项的情况下从头生成答案时,其准确率就会下降。这表明,模型在识别呈现给它们的信息时表现良好,但在自主产生这些信息方面则不够可靠。研究人员发现,给予模型访问互联网搜索答案的权限,在查找特定数据时能显著提高其表现,但在处理复杂推理任务时并无帮助。有趣的是,一个经过海事法规专门训练的模型并没有比标准的通用模型表现得更好,这表明仅仅在训练数据中增加更多关于船舶的文本并不能解决问题。
或许最重要的发现是,这些模型具有不一致性。一个系统可能答对了一个简单的实事,却在一条能够预防火灾的安全关键规则上失误。研究人员注意到,模型经常拒绝回答有关爆炸物或有毒气体等危险物质的问题,将合法的安全查询视为有害请求。这种无法区分安全问题与安全威胁的能力,意味着这些工具目前在处理工作中最高危的部分时是不可靠的。研究得出结论,虽然这些人工智能工具可以作为帮助专业人士快速查找信息的工具,但它们尚未准备好独立做出安全决策。研究人员强调,人工监督仍然至关重要。专业人员在做出最终决定之前,必须始终根据官方规则手册核实人工智能的工作。这项研究并非一次性的定论,而是一种持续安全保障的工具,它提醒业界,随着这些计算机系统的演进,必须对其进行不断的测试,以确保它们在关键时刻不会失效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。