M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models
本論文は、カンガルー数学コンテストに由来する、初の超多言語・マルチモーダル数学的推論データセットであるM3Kangを紹介するものであり、これは108言語にわたって最先端の視覚言語モデルを人間のパフォーマンスと比較ベンチマークし、基礎的な数学および図形に基づく推論における現在の限界を明らかにするものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
「カンガルー数学コンテスト」と呼ばれる、巨大でグローバルな数学コンテストを想像してみてください。毎年、90カ国以上から18歳未満の600万人以上の子供たちが参加しています。彼らはトリッキーな数学パズルを解きますが、中には言葉だけで構成されているものもあれば、答えを導き出すために図形、形、絵を見る必要があるものも多くあります。
ここで、Qualcomm AI Researchの研究チームが、このコンテストを人工知能(AI)のための巨大なテストに変えようと決めた場面を想像してください。彼らはM3Kangと呼ばれる新しいツールを作り上げました。M3Kangは、いわば「万能な翻訳機であり、数学の先生」を一つにまとめたデータセットのようなものです。
以下に、彼らが何を行い、何を発見したのかを簡単に解説します。
1. 大プロジェクト:究極の数学テストの構築
研究者たちは、元の数学の問題(主にカタルーニャ語と英語)を取り出し、それを108の異なる言語に翻訳しました。
- 規模: 彼らは単に言葉を翻訳しただけではありません。問題に付随する図やダイアグラムもそのまま保持しました。その結果、111,000件以上のユニークな数学問題が作成されました。
- 目的: 彼らは、AIモデル(チャットボットや画像生成機の背後にある「脳」)が、英語以外の言語で数学の問題を解けるのか、そして単にテキストを読むだけでなく、図形を実際に「見て」理解できるのかどうかを確認したいと考えました。
2. 構築方法(組み立てライン)
これほど大きなデータセットを作成することは、工場の組み立てラインを作るようなものです。
- ステップ1: 元の数学コンテストのPDFを取り込み、テキストを含むクリーンな画像へと変換しました。
- ステップ2: AIを使用して、まず問題を英語に翻訳し、その際、翻訳によって数学的な論理が壊れていないかをダブルチェックしました。
- ステップ3: 他の108言語に対しては、巧妙な「バックトランスレーション(逆翻訳)」のトリックを使用しました。例えば、スペイン語から英語に文章を翻訳し、その後すぐに英語からスペイン語へ翻訳し直す場面を想像してください。もし結果が元の文章と異なっていれば、その翻訳は不完全です。彼らはこの方法を用いて、質の低い翻訳を自動的に排除しました。
3. 結果:AIはどうだったのか?
彼らは、利用可能な最もスマートなAIモデル(無料のオープンソースモデルと高価なクローズドモデルの両方)を、この新しいテストで検証しました。そこで以下の発見がありました。
- 「英語の優位性」は実在する: 英語だけで勉強してきた学生がフランス語の教室で苦戦する可能性があるのと同様に、AIモデルも英語で解く数学問題の方がはるかに得意でした。インターネット上での出現頻度が低い言語(スワヒリ語やマルタ語など)になると、AIのパフォーマンスは著しく低下しました。まるで、言語が変わった途端にAIが数学のやり方を忘れてしまったかのようです。
- サイズが重要(ただし、すべてにおいてではない): 一般的に、より大きなAIモデルほど優れた成績を収めました。しかし、たとえ最大級で最も賢いモデルであっても、基本的な論理や図形については苦戦しました。
- 「盲点」の問題: これが最も驚くべき発見でした。人間がテストを受けるとき、実は図形がある問題の方が、テキストだけの問題よりも解きやすいと感じます。しかし、AIの場合はその逆です!AIモデルは、図形が含まれていると、パフォーマンスが大幅に低下しました。これは、文章題を読むのは得意だが、グラフを見なければならなくなるとフリーズしてしまう学生のようなものです。AIは、テキストと画像の間にある「点と点をつなぐ」ことに苦労しているようです。
- AI vs 人間: 彼らは、AIのスコアを68,000人の人間の生徒の実際のスコアと比較しました。
- 最強のAI(Gemini-1.5-Pro)は、英語においてはトップクラスの学生並みの成績を収めましたが、リソースの少ない言語においては「平均的」または「平均以下」の成績にまで落ち込みました。
- 興味深いことに、AIは数学が難しくなるにつれて、人間と同じように成績が上がっていくわけではありませんでした。時には、AIが最も難しい問題を完璧に解いたかと思えば、簡単な問題で失敗することもありました。これは、AIが人間の子どもとは異なる種類の推論を行っているか、あるいは「推測」していることを示唆しています。
4. 解決策はあるのか?
研究者たちは、AIが他の言語をより上手く話せるようにするための「トレーニングのコツ」をいくつか試しました。
- 「翻訳者」のトリック: もしAIに対して、「まず、頭の中でこの問題を英語に翻訳し、それを解いてから、答えを出しなさい」と指示すると、AIは他の言語での問題解決能力が大幅に向上することを発見しました。これは、テストの直前に辞書を渡される学生のようなものです。
- 「ステアリング(操舵)」のトリック: AIの内部的な思考プロセスを、たとえ他の言語を話していても「英語に近い」状態になるよう誘導する試みを行いました。これは多少の効果はありましたが、「翻訳者」のトリックの方が勝っていました。
まとめ
論文は次のように結論付けています。AIは信じられないほど賢くなっていますが、依然として大きな弱点を持っています。それは、異なる言語間で「読む」「見る」「考える」というプロセスを組み合わせることに苦労しているという点です。
研究者たちは、他の科学者がこの「カンガルー・テスト」を使用して、より優れた、より包括的なAIを構築できるように、すべてのデータとコードを公開(オープンソース化)しました。彼らは、英語を話すだけでなく、どんな言語でも、図形の有無にかかわらず数学ができる、真にグローバルで公平なAIを作るための助けとなることを願っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。