← 最新の論文
💬 NLP

Prompting language influences diagnostic reasoning and accuracy of large language models

この研究は、臨床現場における大規模言語モデルの診断推論と精度にプロンプト言語が重大な影響を及ぼすことを示しており、評価された5つのモデルの4つにおいて英語がフランス語を上回る傾向が見られ、これは公平な世界的展開に対する重要な障壁を浮き彫りにしている。

原著者: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

5 人の天才的な医学部生がチームにいると想像してください。彼らは驚くほど頭が良く、数百万冊の医学書を読み込み、複雑なパズルを解くことができます。しかし、一つだけ問題があります。彼らはすべて異なる国で学校に通っており、思考の「母語」が英語なのです。

この論文は、これらの学生に英語フランス語で医療ケースを解くよう求めた際、どの程度パフォーマンスを発揮するかをテストする成績表のようなものです。研究者たちは、質問に用いられる言語が回答の質を変えるかどうかを確認したかったのです。

以下に、彼らが発見した内容を簡単な比喩を用いて解説します。

1. 設定:「医療パズル」テスト

研究者たちは180 個の医療パズル(ビニエットと呼ばれる)を作成しました。これらは単なる多肢選択問題ではなく、実際の診療所で医師が遭遇するのと同様の、症状を伴う患者に関する短い物語です。

  • テスト: これらのパズルを 5 つの異なる AI モデル(「学生」)に与えました:o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1、BioMistral
  • ひねり: 各学生に同じパズルを 2 回出題しました。1 回は英語で、もう 1 回はフランス語でです。
  • 採点者: 2 人の実際の医師が教師役を務めました。彼らは最終的な答えが正しいかどうかだけでなく、思考プロセス全体(推論)を 0 から 18 のスケールで評価しました。彼らが注目したのは以下の点です:
    • 学生はすべての手がかりに気づいたか?
    • 論理は妥当だったか?
    • 他の可能性を考慮したか?
    • 最終的な診断は正確だったか?

2. 結果:「英語優位」

5 人の学生のうち 4 人にとって、結果は明確でした:英語で話すとき、彼らは著しく良いパフォーマンスを発揮しました

  • 格差: これらのモデルはフランス語を流暢に話せますが、その「脳」は英語の方がよく機能しました。まるで、フランス語で曲を演奏できるミュージシャンが、英語で演奏するときは指の動きが速く、リズムもより完璧になるようなものです。
  • スコア: 平均して、英語での回答は明らかな差(18 点満点で 0.37 から 0.91 点)で優れていました。
  • 格差が生じた場所: この違いは最終的な答えだけではありませんでした。学生たちはフランス語で思考を強要されると、論理的なミスをより多く犯し、より多くの手がかりを見落とし、推論が弱まりました。
    • 比喩: 探偵が謎を解くと想像してください。英語では、彼らは手がかりの痕跡を完璧に追跡します。フランス語では、気が散ったり、手がかりを見逃したり、証拠に完全に合致しない結論に飛びついたりするかもしれません。最終的に正しい名前を当てたとしてもです。

3. 例外:「スーパー学生」

o3という 1 つのモデルだけが、英語とフランス語の間に差がないことを示しました。

  • なぜか: この論文は、このモデルに高度な推論能力という特別な「超能力」があると示唆しています。AI が頭の中で複雑な数学の問題を解くように、段階的に問題を考え抜く能力が高まるにつれて、言語の壁は消え始めるようです。まるで、パズルの論理をこれほどまでに完璧にマスターした学生なら、指示がどの言語で書かれていても関係ないかのようです。

4. これがなぜ重要なのか(論文によると)

この論文は、言語は AI の単なる包装紙ではなく、AI が思考する方法の一部であると主張しています。

  • 「トレーニングの食事」の問題: これらの AI のほとんどは、膨大な量の英語データ(英語の教科書しか読まない学生のような)でトレーニングされました。フランス語を翻訳できても、医療推論の「筋肉の記憶」は英語のパターンに基づいて構築されています。
  • リスク: フランス語圏の病院で医師がこれらのツールを使用する場合、AI は英語圏の医師に対して与えるよりも、わずかに精度の低い診断や、より乱雑な説明を提供する可能性があります。
  • 結論: この論文は、AI がどこでも真に公平で有用であるためには、英語だけに頼ることはできないと結論付けています。これらのモデルが英語と同等にフランス語(および他の言語)でも鋭く機能することを保証する必要があります。

まとめ

これらの AI モデルを多言語のシェフだと考えてください。レシピを英語で与えれば、彼らは素晴らしい料理(診断)を作ることができます。同じレシピをフランス語で与えれば、5 人のシェフのうち 4 人はまだ良い料理を作りますが、味付けが少し物足りなかったり、盛り付けが少しずれたりするかもしれません。1 人のシェフ(o3)だけが、レシピの言語に関係なく、全く同じ完璧な料理を作ります。

この論文は警告しています。「言語バイアス」を修正するまで、非英語圏の環境でこれらのツールに依存することは、わずかに質の低い結果を得ることを意味するかもしれないと。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →