← 最新の論文
💬 NLP

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

本論文は、多言語LLMにおける高リソース言語と低リソース言語の間の見かけ上の性能差は、主にMGSMベンチマークにおける翻訳エラーと回答抽出の不整合による人工的なものであり、これらのデータ品質の問題を修正すると消失することを明らかにしている。

原著者: Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、異なる言語を話す生徒たちのクラスのために、数学のテストの採点を行おうとしている教師だと想像してください。あなたは、英語、フランス語、スワヒリ語、あるいはベンガル語を話しているかどうかにかかわらず、生徒たちが等しく数学が得意であるかどうかを知りたいと考えています。

この論文は、本質的には、私たちがどのようにこれらのテストを採点してきたかについての成績表であり、ある衝撃的な間違いを明らかにしています。私たちは、壊れたテスト用紙と欠陥のある採点機に基づいて、生徒たちを採点していたのです。

以下は、研究者たちが発見した内容を、分かりやすく分解したものです。

1. 最初(誤った)結論

研究者たちは、MGSMと呼ばれる人気の数学テストを調査することから始めました。このテストは、250個の単純な算数の問題(例:「もしリンゴを5個持っていたら……」など)を作成し、それを10の異なる言語に翻訳するものです。

彼らがAIモデル(「生徒」)をこのテストに通したところ、結果は非英語話者にとって非常に悲惨なものに見えました。

  • 例え: それは、フランス語を話す生徒が数学のテストで60%を取り、英語を話す生徒が98%を取るようなものでした。
  • 当初の考え: 全員が、AIはフランス語やスワヒリ語で話すとき、数学において「賢くない」のだと思い込みました。AIが他の言語で推論を行う際に、大きな「言語の壁」があると考えていたのです。

2. 調査:「待て、テスト用紙が壊れている!」

研究者たちは、探偵が問題文を詳しく調べるように、調査を進めることにしました。そして、スコアを台無しにしていた2つの大きな問題を発見しました。

問題 A:「翻訳による紛失」エラー
テストを作成した人間の翻訳者が、微妙なミスをしていました。

  • 比喩: 数学の問題に「火曜日に、私は月曜日の6倍の距離を歩きました」とあるとします。しかし、ドイツ語の翻訳では、誤って「火曜日」が「木曜日」に変わってしまいました。
  • 結果: 非常に論理的なAIモデルは、問題を見てこう言いました。「待て、曜日が一致しないぞ! これでは解けない!」。そのため、答えを間違えてしまいました。しかし、それはAIの数学の能力の問題ではなく、壊れた問題のせいだったのです。

問題 B:「欠陥のある採点機」
たとえAIが正しい答えを出したとしても、その答えを読み取るコンピュータプログラムが硬直的すぎました。

  • 比喩: AIが答えを「2.000」(ヨーロッパで一般的な、桁区切りとしてのドットを使用)と書いたとします。英語のスタイルを想定している採点機は、そのドットを見て、「おっと、これは小数点だ! つまり2.000……いや、2だ」と判断してしまいます。あるいはさらに悪く、カンマを見て混乱してしまうこともあります。
  • 結果: AIは問題を正しく解いていたのですが、「採点機」が異なる国での数字の書き方を理解していなかったために、不正解として扱ってしまったのです。

3. 修正:混乱を片付ける

研究者たちは2つのことを行いました。

  1. 問題を修正した: 彼らはテスト全体を見直し、翻訳エラー(「火曜日 vs 木曜日」の取り違えのようなもの)を見つけ出し、修正しました。
  2. 採点機を修正した: 数字の読み方についてより賢いコンピュータプログラムへと更新しました。フランス語におけるカンマが小数点の可能性があったり、ドイツ語におけるドットが桁区切りであったりすることを学習させました。

4. 新しい結果:格差は消滅した

修正された問題と、より賢くなった採点機を用いてテストを再度実施したところ、結果は一変しました。

  • 例え: それは、フランス語の生徒も実際には98%を取っていたのに、私たちは単に彼らの答案を読み間違えていただけだった、と気づいたようなものでした。
  • 結果: 英語と他の言語との間の巨大なパフォーマンスの格差は、ほとんど消失しました。最も強力なAIモデルにおいては、フランス語、ロシア語、あるいはスワヒリ語においても、英語と同じくらい優れたパフォーマンスを発揮しました。

大きな教訓

この論文は、最も優れたAIモデルにとって、言語による「数学の格差」は存在しないと結論付けています。モデルはどの言語でも問題なく数学を行うことができます。

私たちが格差があると考えてしまった理由は、以下の通りです。

  1. テスト問題の翻訳が不十分だったこと。
  2. 採点ツールが、現地の数字形式を理解していなかったこと。

まとめ:
AIが「他の言語での数学が苦手」だと責める前に、テストが実際に公平であること、そして採点ツールが正しく機能していることを確認する必要があります。研究者たちは、誰もが未来を測るための公平な定規として使えるよう、修正されたテストを公開しました。

この論文が述べて「いない」こと:

  • AIがすべての言語において完璧であると言っているわけではありません(より小さく、弱いモデルは依然として多少の苦戦が見られます)。
  • 他の言語でのテストをやめるべきだと言っているわけではありません。
  • すべてのベンチマークが壊れていると主張しているのではなく、この特定のベンチマーク(MGSM)にこれらの特定の問題があったと述べているだけです。

要するに、問題はAIではなく、テストの方でした。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →