Polish-English medical knowledge transfer: A new benchmark and results
本論文は、最先端のLLMを人間のパフォーマンスと比較評価するために、24,000問を超える免許および専門医試験の問題から派生した新しいポーランド語・英語医学ベンチマークを紹介し、トップレベルのモデルが人間と同等の水準に近づいている一方で、言語横断的な翻訳およびドメイン固有の理解において重大な課題が依然として残っていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能は、しばしば人間の会話に匹敵するほどの流暢さで読み書きすることを学習してきました。大規模言語モデルとして知られるこれらのシステムは、インターネット、書籍、記事から得られる膨大な量のテキストを用いて訓練されており、質問に答えたり、物語を要約したり、問題を解決したりすることを可能にしています。しかし、その知識は均等に分布しているわけではありません。学習に使用されるデータの大部分が英語圏のソースから来ているため、これらのモデルは他の言語よりも英語をはるかに良く理解する傾向があります。これは、ガイドラインや疾患、治療法が国によって異なる可能性がある医学のような専門分野にこの技術を応用する場合、重大な格差を生み出します。もしポーランドの医師が、主にアメリカやイギリスの医学データで訓練されたAIに頼った場合、その助言は現地の現実には適合せず、診断や治療における誤りにつながる可能性があります。
ポーランドの研究者たちは、これらの人工的な知性が、ポーランドの医師のように考えるよう求められた際に、正確にどの程度のパフォーマンスを発揮するかを測定しようと試みました。彼らは、ポーランドで診療を行うために医学部生や専門医が合格しなければならない実際の試験に基づいた、新しいテスト環境を構築しました。これらの試験は厳格であり、基礎的な解剖学から複雑な外科手術に至るまで多岐にわたり、ポーランド語で作成されています。研究チームは、プロによって英語に翻訳されたものを含む、これら実世界のテストから22,000問以上の質問を集めました。これらの質問を様々なAIモデルに投入することで、機械が人間の学生と同じハードルを越えられるのか、そして質問の言語によって結果が変わるのかどうかを確認することができました。
結果は、これらのモデルがどのような状況にあるのかを明確に示しました。最も高度な人工知能システム、特にGPT-4oとして知られるものは、一般的な医師免許試験において、回答の約90パーセントを正解するという驚くべき成果を上げました。このスコアは、典型的な医学部生と共にテストに合格できるほど高いものです。しかし、質問がより難解になったり、専門的になったりすると、話は変わります。研究者が歯科学生向けの試験や専門医向けの高度なテストを実施したところ、スコアは大幅に低下しました。最高性能のAIであっても歯科試験では苦戦し、専門医試験においては、テストされた医学分野の3割以上で平均的な人間の医師を上回ることができませんでした。一部の特定の領域、例えば聴覚学や耳鼻咽喉科においては、AIは、その年の試験を受けたすべての人間よりも低い成績を記録しました。
研究の極めて重要な部分は、モデルが同じ質問をポーチ語と英語の両方でどのように扱うかを比較することでした。研究者たちは、ほとんどのモデルにおいて、言語が大きな違いを生むことを発見しました。質問が英語で行われた場合、AIは全く同じ質問がポーランド語で行われた場合よりも、正解する可能性がはるかに高かったのです。このことは、モデルが医学的概念を普遍的な方法で真に理解しているのではなく、代わりに英語のテキストから学んだパターンに依存していることを示唆しています。モデルがより大きく強力になるにつれて、この言語間の格差は縮まり始めましたが、完全には消失しませんでした。ポーランド語に特化して設計された一つのモデルは、英語の質問よりもポーランド語の質問に対して優れたパフォーマンスを示しましたが、それでも、英語で尋ねられた際の最大級の汎用モデルの生の力を凌駕することはできませんでした。
また、この研究は、多肢選択式のテストに合格することが、有能な医師であることと同義ではないことも強調しました。この研究で使用された試験は、選択肢のリストから正しい答えを選ぶ記述式のテストです。しかし、実際の医療現場では、患者と対話し、彼らの話を聞き、身体を診察し、唯一の正解がない状況で意思決定を行うことが求められます。研究者たちは、これらのAIツールは素晴らしいものであるものの、病院で必要とされる人間同士の相互作用や複雑な判断力を、まだ代替できるものではないと強調しました。モデルは情報の整理やレポートのドラフト作成を支援する有用な助手にはなり得ますが、免許を持つ医師の代わりを務める準備はできていません。
結局のところ、この研究は、医療技術の未来に対する警告と指針としての役割を果たしています。それは、人工知能が医学的な質問に答える能力を高めている一方で、特に言語や特定の医学分野が変わる場合には、盲目的に信頼するにはまだ信頼性に欠けることを示しています。これらの知見は、これらのツールがクリニックで使用される前に、それらが使用される特定の言語や文脈において厳格にテストされなければならないことを示唆しています。英語とポーランド語のパフォーマンスの差は、あるデータセットで訓練されたモデルが、別のデータセットでも完璧に機能すると単純に想定することはできないという事実を証明しています。技術が進歩し続ける中で、目標は、単に賢いだけでなく、人々がどのような言語を話していようとも、公平で正確なシステムを作り出すことです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。