mmPISA-bench: Do LLMs Reason Equally Well Across 43 Languages?
本論文は、43言語にわたるPISAから派生した多言語推論ベンチマークであるmmPISA-benchを紹介するものであり、現代のLLMが機械翻訳による劣化を最小限に抑えつつ人間と同等の推論性能を達成していることを示す一方で、言語間での正確性と推論コストにおける著しい差異を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超スマートな学生がいて、その学生はほぼあらゆる言語を話せると想像してみてください。あなたはこう知りたいと思っています。「この学生は、フランス語でテストを受けるときも、英語で受けるときと同じくらい賢いのだろうか?」 あるいは、もし彼らが知らない言語(ただしロボットによって翻訳されたもの)で書かれたテストを与えられた場合、それでも正解にたどり着けるのだろうか?
mmPISA-bench と呼ばれるこの論文は、世界で最も高度な2つのAI「学生」(具体的にはOpenきOpenAIとAnthropicのモデル)に対する、大規模で多言語な成績表のようなものです。ここでは、日常的な例えを用いて、研究者たちが発見した内容を解説します。
1. テストの内容:グローバルな算数と読解の試験
研究者たちは、単にランダムな問題を作ったわけではありません。彼らは、世界中の15歳の生徒が、算数の問題を解いたり読解力を証明したりするために受ける有名な国際テストである PISA試験 から、25の実際の問題を抜き出しました。
- セットアップ: 彼らはこれら25の問題を取り、43の異なる言語に翻訳しました。
- ひねり: すべての言語において、2つのバージョンを用意しました。
- 「公式」バージョン: 人間の専門家(プロの翻訳者のような人)によって翻訳されたもの。
- 「ロボット」バージョン: Google 翻訳(機械翻訳)によって翻訳されたもの。
- 目的: AIがこれら43の言語すべてで論理パズルを解けるかどうか、そして、翻訳が人間によるものかロボットによるものかが重要であるかどうかを確認することです。
2. 結果:AIの学生はどこでも等しく賢いのか?
良いニュース: はい、ほとんどの場合そうです。
AIモデルは、すべての43言語において非常に優れたパフォーマンスを示しました。実際、その正確さは、聡明な15歳の人間が期待されるレベルと同等のことが多々ありました。アイスランド語やタイ語になったからといって、AIが突然算数のやり方を「忘れて」しまうことはありませんでした。
注意点: 完全に平等というわけではありませんでした。
- 「方言」の影響: 人間が、第二言語よりも母国語で物語を読む方が少し楽だと感じるように、AIも言語によってわずかに正確さが異なる場合がありました。
- 「ロボット」翻訳の神話: 「もし問題がロボットによって翻訳されていたら、AIは混乱してしまうのではないか」と思うかもしれません。しかし、論文によれば 答えはノー です。AIは、「人間」による翻訳を用いたときと同じ頻度で、「ロボット」による翻訳を用いても正解にたどり着きました。これは、新しい言語でAIをテストする際、必ずしも高価な人間の翻訳者を必要としないことを意味しており、非常に重要なことです。つまり、優れた機械翻訳があれば十分なのです。
3. 隠れたコスト:「思考」の価格設定
ここからが、この論文の本当に興味深い部分です。単に 正解にたどり着くこと だけでなく、そこに到達するためにどれだけのコストがかかるか も問題なのです。
2人の学生がテストを受けているところを想像してください。
- 学生A (Claude): すべての回答に対して、非常に長く詳細な説明を書きます。
- 学生B (GPT): 短い説明を書きます。
研究者たちは、特定の言語において、AIが正解を得るためにずっと「深く考え」(より多くのテキストを生成し)なければならず、その結果、テストを実行するのが**より高く(高価に)**なったことを発見しました。
- 「高価で不器用な」言語: 特定の言語(あるモデルにとってはタイ語、別のモデルにとってはギリシャ語など)では、AIが単純な問題を解くために膨大な量のテキストを生成しなければなりませんでした。それはまるで、角のコンビニに行くためだけに高級タクシーを支払っているようなものです。
- 結果: これらの「高価な」言語では、AIは実際に正確さが低くなり、同時にコストも高くなりました。これはダブルパンチです。より多くの支払いを強いられる一方で、結果はより悪くなるのです。
4. 秘密の言語スイッチ
研究者たちは、AIがどのように考えているのか、その「裏側」を覗き見ました。すると、驚くべきことが分かりました。
- 時には、AIがカザフ語で質問されたとき、単にカザフ語や英語で考えているのではなく、実は答えをカザフ語で返す前に、ロシア語で算数や論理を展開していたのです。
- これは、スペイン語と英語を話す人が、難しい数学の問題に直面したとき、自分の「数学脳」があるフランス語に無意識に切り替えて考えるようなものです。AIも同様に、「ピボット言語(媒介言語)」を使用して問題を解決していたのです。
まとめ:これが何を意味するのか?
- AIは言語に習熟している: 現代のAIは、43の異なる言語で、人間のティーンエイジャーとほぼ同等のレベルで論理パズルを解くことができます。
- 機械翻訳は十分機能する: AIをテストするために完璧な人間の翻訳は必要ありません。ロボットによる翻訳でも十分に機能します。
- 言語はコストに影響する: いくつかの言語は、AIにとって「処理が難しい」ものです。それらの言語では、AIがもっと多く喋るようになり(コストが増大し)、時にはミスも増えてしまいます。
- より深く見る必要がある: AIがどれほど優れているかを真に理解するためには、単に最終的なスコアを見るだけでは不十分です。そのスコアを得るためにどれだけの「努力」(そしてお金)が必要だったのか、そしてAIが密かにどの言語で考えていたのかまでを見なければなりません。
要するに、AIは多言語を操る天才ですが、依然として、少しつまずいたり、仕事をこなすためにお小遣いを使いすぎてしまったりする「方言」を持っているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。