← 最新の論文
🤖 AI

Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

本論文は、国際海上危険物規程(IMDGコード)に関する大規模言語モデルの評価を行う初のベンチマークであるDGEvalを紹介し、モデルが多肢選択問題や構造化された検索において人間を上回る性能を示す一方で、積載や隔離といった安全に関わる重要領域における信頼性の欠如から、導入前には継続的な人間の監視が必要であることを明らかにしている。

原著者: Alexander Thomas, Hubert P. H. Shum, Darren Nellis, Manli Zhu, Phatpicha Yochum, William Bartle, Daniel Wrightson

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Alexander Thomas, Hubert P. H. Shum, Darren Nellis, Manli Zhu, Phatpicha Yochum, William Bartle, Daniel Wrightson

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

海洋は広大で強力な力であり、その上での物資の輸送には、船、乗組員、そして環境の安全を守るための厳格な一連の規則が必要です。化学薬品、電池、引火性液体などの危険物を輸送する場合、企業は「国際海上危険物規程(IMDGコード)」と呼ばれる膨大な国際規則に従わなければなりません。この文書は単なるリストではありません。あらゆる品目がどのように分類され、梱包され、ラベルを貼られ、船上のどこに配置されるべきかを規定する、複雑な指示の網の目なのです。これに失敗すれば、一度船が海に出てしまえば修復がほぼ不可能な火災、爆発、あるいは毒性物質の放出を招く恐れがあります。数十年にわたり、これらの決定に責任を持つ人々は、自らの訓練と注意深い手作業によるチェックに頼ってきました。しかし今日、多くの専門家が新しい種類のツール、すなわち「大規模言語モデル」として知られる人工知能システムへと目を向けています。これらのコンピュータプログラムは、人間の言葉で読み、質問に答えることができ、膨大なページの規制事項への即時アクセスという約束を提供しています。しかし、この分野における間違いは命に関わるため、問題はこれらのツールが賢いかどうかだけでなく、最も重要な決定を任せるのに十分なほど安全であるかどうかという点にあります。

研究チームは、海洋安全に特化して設計された厳格なテストを構築することで、この問いに答えるべく取り組みました。彼らは、人工知能のための最終試験として機能する「DGEval」というベンチマークを作成しました。このテストは、海運の専門家が使用する実世界のトレーニング教材と、公式の危険物リストに基づいて構築されました。そこには、化学品の正しい名称の特定から、特定のコンテナが災害を引き起こすことなく船のどこに配置できるかの判断に至るまで、約1,700の質問が含まれています。研究者たちは、6つの主要なテクノロジー企業による13種類の異なる人工知能モデルを評価しました。彼らは、多肢選択式の質問への回答、自由記述形式の説明、特定のデータの検索、そして回答の根拠となる規則書の正確な箇所を特定させるなど、さまざまな方法でモデルをテストしました。また、インターネットにアクセスして情報を検索させることが、モデルのパフォーマンス向上に役立つかどうかもテストしました。

結果は、これらのモデルができることとできないことの間に、明確な隔たりがあることを明らかにしました。最も優れた性能を示したGoogleの大型システムは、多肢選択式の質問において、平均的な訓練を受けた人間の専門家よりも高い正解率を示しました。このモデルは、化学品の公式名称や基本的な危険クラスといった、単純な事実の検索において優れていました。しかし、研究によれば、モデルは安全性において最も重要な領域では著しく弱いことが判明しました。質問が複雑な運用上の決定、具体的には「相容れない物品の分離方法」や「本船への積載場所」に関するものであった場合、モデルは苦戦しました。トップクラスのシステムであっても、こうした高リスクな領域では頻繁にエラーが発生しました。また、研究者たちは、モデルが回答の根拠となる規則書の特定のセクションを指し示す能力が極めて低いことも発見しました。これは、人間がAIの作業を検証するために不可欠なスキルです。

研究はまた、質問の種類がパフォーマンスにどのように影響するかについても調査しました。モデルにリストの中から正しい答えを選ばせる形式の場合、彼らはまずまずの成績を収めました。しかし、選択肢を与えずにゼロから回答を生成させるよう求めると、その正確性は低下しました。これは、モデルが提示された正しい情報を認識することには長けているものの、その情報を自ら生成することに関しては信頼性に欠けることを示唆しています。研究者たちは、特定のデータを検索するためにモデルにインターネットへのアクセス権を与えることは、特定のデータ検索においては大幅な助けになるものの、複雑な推論タスクには役立たないことを発見しました。興味深いことに、海事規制に特化して学習させたモデルであっても、標準的な汎用モデルよりも優れた性能を示すことはありませんでした。これは、単に船に関するテキストを学習データに追加するだけでは、問題の解決には不十分であることを示しています。

おそらく最も重要な発見は、モデルに一貫性がなかったことです。あるシステムは単純な事実を正しく答えられる一方で、火災を防ぐための安全に直結する規則については失敗することがありました。研究者たちは、モデルが爆発物や毒性ガスなどの危険な物質に関する質問に対し、正当な安全上の問い合わせをあたかも有害な要求であるかのように扱い、回答を拒否することが多いと指摘しました。このような「安全に関する質問」と「安全に対する脅威」を区別できない能力の欠如は、現在のこれらのツールが最も危険な業務において信頼できないことを意味しています。研究は、これらの人工知能ツールは専門家が情報を素早く見つけるための助けにはなり得るものの、まだ自律的に安全上の決定を下す準備はできていないと結論付けました。研究者たちは、人間の監視が依然として不可欠であることを強調しました。最終的な決定を下す前に、専門家は必ずAIの作業を公式の規則書と照らし合わせて確認しなければなりません。この研究は一度限りの判定ではなく、継続的な安全確保のためのツールであり、コンピュータシステムが進化したとしても、最も重要な局面で失敗しないよう、常にテストされ続けなければならないということを業界に再認識させるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →