✨ 要約🔬 技術概要
大規模言語モデル(LLM)が、世界の図書館にあるほぼすべての本を読み込んだ秀才の学生だと想像してみてください。長年にわたり、私たちは彼らの数学力を、すべて英語で書かれた試験でテストしてきました。これは、学生に英語だけで運転免許試験を受けさせ、その試験に合格したという理由だけで、彼らがあらゆる言語で完璧に運転できると想定するのと同じです。
論文「MATH-PT」は、このアプローチには大きな盲点があると主張しています。この論文は、これらの AI 学生が言語が変わった際に実際に数学を扱えるかどうかを確認するために、特にポルトガル語(ヨーロッパポルトガル語とブラジルポルトガル語の両方)で書かれた新しい「運転試験」を導入します。
以下に、彼らの発見を簡単な比喩を用いて解説します。
1. 問題点:「英語のみ」の図書館
ほとんどの数学ベンチマーク(MATH や MathVista など)は、すべての本が英語で書かれた図書館のようなものです。研究者が他の言語をテストしようとしても、単に英語の本を翻訳するだけです。著者たちは、これが不公平だと指摘しています。なぜなら、それが AI が数学の概念を本当に理解しているのか、それとも単に英語のパターンを暗記しているだけなのかを判断できないからです。彼らは、ポルトガル語とブラジルの数学オリンピックや学校試験から取られた、ポルトガル語で「生まれ」た数学問題の図書館を構築したいと考えていました。
2. 新しい試験:MATH-PT
チームは「MATH-PT」というデータセットを作成し、1,729 問の問題を含めました。
出所: 彼らは単に翻訳したのではなく、Olimpíadas Portuguesas da Matemática (ポルトガル数学オリンピック)やブラジルのOBMEP (ブラジル中等教育数学オリンピック)などの競技の原本アーカイブを掘り起こしました。
多様性: この試験は、5 年生向けのパズルから大学進学前の課題まで、あらゆるレベルを網羅しています。
形式: 選択式問題(バブルシート形式)と、答えをゼロから記述する自由記述式問題の両方が含まれています。重要なのは、多くの問題に図形や図(幾何学的な形状など)が含まれており、チームがコードを使用してこれらを慎重に保存し、AI がそれら「見る」ことができるようにした点です。
3. 結果:「賢い」学生と「苦労する」学生
彼らは、最も強力な「最先端」モデル(スーパー天才)から、小規模なオープンソースモデル(平均的な学生)まで、13 種類の異なる AI モデルをテストしました。
選択式の利点: 選択式問題を「違いを見つけよう」というゲームだと考えてみてください。AI モデルはこの分野が非常に得意でした。小規模なモデルでさえ、正しい文字(A、B、C、D、E)を正しく推測できることがよくありました。
自由記述式の苦戦: 試験が AI が自ら答えを生成する自由記述式に切り替わると、スコアは大幅に低下しました。これは、並んだ写真から顔を見分けることと、記憶からその顔を描くことの違いに似ています。AI は、単に選ぶのではなく、「考え」、自分で答えを書く必要がある場合に、より苦労しました。
「画像」の問題: これが最大の障壁でした。問題に図(画像)が含まれている場合、AI のパフォーマンスは急落しました。最も賢いモデルでさえ、テキスト alongside 視覚的な形状を解釈する際に混乱しました。これは、学生に目隠しをしながら幾何学の問題を解くように求めるようなものです。彼らは言葉は読めますが、形状を「見る」ことができないのです。
4. 勝者と敗者
チャンピオン: 「最先端」モデル(GPT-5 や Qwen3-235B など)が明確な勝者でした。特に選択式問題において、彼らはポルトガル語の数学をうまく処理しました。
苦労する者たち: 小規模なオープンソースモデル(Llama-3 や Gemma-3 など)は、数学を非常に困難だと感じました。問題が難しくなったり、画像が含まれたりすると、その精度は急激に低下しました。
スケーリング効果: 論文によると、Qwen 系列のモデルにおいては、モデルを大きくする(より多くの「脳力」を追加する)ことが大きく役立ちました。これは、自転車からスポーツカーに乗り換えるようなもので、より大きなモデルは、より小さなモデルよりもはるかに複雑な推論タスクを処理できました。
結論
この論文は、AI が数学において非常に上達している一方で、まだ「言語バイアス」を持っており、試験が難しくなる(自由記述式)または視覚的(図形)になると苦労すると結論付けています。このポルトガル語データセットを公開することで、著者たちは研究者たちに、英語以外の言語で AI が実際にどれだけ考えられるかを測定するための、より公平な新しい物差しを渡しています。彼らは AI がすでに完璧だと言っているのではありません。「AI がまだどこで学習しているかを正確に示す新しい試験をここに提示します」と言っているのです。
以下は、「MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese(MATH-PT:ヨーロッパポルトガル語およびブラジルポルトガル語のための数学推論ベンチマーク)」という論文の詳細な技術的サマリーです。
1. 問題提起
現在の数学的推論における大規模言語モデル(LLM)の評価環境は、英語に極端に偏っています。既存のベンチマーク(MATH、MathVista、MathBench など)は、英語のみで構成されているか、英語のデータセットを翻訳したものに依存しています。これにより言語的バイアス が生じ、数学的推論能力が言語間で真に転移するものなのか、それともモデルが単に英語固有のパターンを利用しているだけなのかを判断することが困難になっています。さらに、既存のポルトガル語 NLP ベンチマークは、一般タスク、毒性、あるいは常識推論に焦点を当てており、ヨーロッパポルトガル語(pt-PT)およびブラジルポルトガル語(pt-BR)の両変種における数学的推論の評価 には完全な空白が存在します。
2. 手法
データセット作成(MATH-PT)
著者らは、翻訳によるアーティファクトを避けるため、ネイティブのポルトガル語のコンテストおよび試験から収集された1,729 問の数学問題 からなる新しいデータセットをキュレーションしました。
ソース:
ヨーロッパポルトガル語(pt-PT): *ポルトガル数学オリンピック(OPM)*から収集されました。データセットには、1997 年から 2025 年の学年を網羅する、コンテスト主催者から直接提供された LaTeX ソースファイルが含まれています。
ブラジルポルトガル語(pt-BR): OBMEP(公立学校) 、OMIF(連邦機関) 、ELLM 、および*ITA(空軍研究所)*を含む主要な国内コンテストから収集されました。これらの LaTeX ソースが利用できなかったため、著者らは gpt-5-mini を使用して PDF を解析し、質問をセグメント化し、LaTeX 数式表記を含む構造化された JSON 表現を再構築する自動抽出パイプライン を開発しました。
構造:
レベル: 5 年生から大学入学前(レベル 1〜5)を網羅しています。
質問形式: **多肢選択(MC)と 自由回答(OE)**の両方の質問形式が含まれています。
視覚的要素: 重要なサブセット(316 問)には図形(幾何学、図表)が含まれています。pt-PT では、picture、PStricks、array を使用した元の LaTeX コードが保持されています。pt-BR では、テキスト/LaTeX で信頼性高く表現できない複雑な画像は破棄されましたが、単純な表は保持されました。
統計: データセットには 1,057 問の MC 質問と 672 問の OE 質問が含まれています。
評価プロトコル
テスト対象モデル: 13 種類の最先端およびオープンソース LLM。これには、クローズドモデル(GPT-5、Gemini 2.5 Flash、Claude Haiku 4.5)とオープンウェイトモデル(Qwen3 シリーズ、Gemma3、LLaMa3、DeepSeek)が含まれます。
プロンプト戦略:
ゼロショット設定: チェーン・オブ・ソートや数ショットの例は提供されませんでした。
言語の特定性: プロンプトは、特定の方言(pt-PT 対 pt-BR)に合わせて調整されました。
出力制約: モデルには、最終回答を \boxed{} コマンド内に出力するよう指示されました。MC の場合は、選択肢の文字(A〜E)のみが必要とされ、OE の場合は数値または代数の結果が求められました。
スコアリング:
MC: 抽出された文字と正解との完全一致。
OE: LLM ジャッジ(Kimi K2 Thinking)を使用して、モデルの最終回答とゴールドソリューションを比較し、文字列の完全一致ではなく数学的同等性を確認しました。
3. 主な貢献
初のネイティブポルトガル語ベンチマーク: ヨーロッパポルトガル語とブラジルポルトガル語の両方でネイティブにキュレーションされ、幅広い難易度レベルを網羅する、数学的推論のための最初のデータセットである MATH-PT の導入。
包括的なベンチマーク評価: 13 種類の最先端モデルの評価を通じて、最先端モデルとオープンウェイトモデルがポルトガル語の数学タスクでどのように機能するかに関する初の比較分析の提供。
実証的知見: 特定の失敗モードの特定、特に MC と OE の質問間の性能ギャップ、および視覚的要素(図形)が関与する際の性能の大幅な低下の特定。
4. 主要な結果
全体的な性能
最先端モデル対オープンモデル: 最先端モデル(GPT-5、Gemini 2.5 Flash、Claude Haiku 4.5、Qwen3-235B)は、中規模およびオープンウェイトモデルを大幅に上回りました。GPT-5 は、ほぼすべての設定で最高精度を達成しました。
オープンソースのスケーリング: Qwen3 ファミリーは強力なスケーリング特性を示し、235B パラメータモデルはクローズドの独自モデルと同等の性能を発揮しました。一方、Llama-3.3-70B と Gemma-3-27B は、限られた数学的推論能力を示しました。
質問形式と難易度
MC と OE のギャップ: すべてのモデルは、自由回答(OE)よりも多肢選択(MC)の質問で著しく高い性能を示しました。このギャップは、難易度が上がるにつれて拡大し(多くの場合 10〜20 パーセントポイント以上)、
観察: 最先端モデル(GPT-5 など)は MC-OE のギャップが小さく維持されており、より安定した推論を示しているのに対し、中規模モデルは OE 性能で大幅な低下を遂げました。
難易度レベル: 精度は一般的に、学年レベルが上がるにつれて低下しました。GPT-5 と Qwen3-235B はレベル 5(大学入学前)でも堅牢さを保ちましたが、他のモデルは急激な低下を示しました。
視覚的要素(図形)の影響
性能低下: 図形(幾何学的図表、表)の存在は「難易度の急上昇」をもたらしました。
図形を含む質問の性能は、最先端モデルであっても10〜20 ポイント 低下しました。
弱いベースラインモデルは最大56 ポイント の低下を被りました。
これは、コードを解析できるテキストのみのモデルであっても、マルチモーダル推論 (LaTeX コードで表現された視覚データの解釈)が依然として重要なボトルネックであることを示唆しています。
方言の違い
データセットは pt-PT と pt-BR の間で性能のばらつきを示しましたが、ばらつきの主な要因は方言そのものではなく、質問形式 (MC 対 OE)と視覚的コンテンツ でした。
5. 意義
言語的バイアスの是正: MATH-PT は、英語の習熟度が普遍的な数学的推論を意味するという仮定に挑戦します。モデルが数学を真に理解しているのか、それとも単に英語の構文のパターンマッチングを行っているのかを評価するための必要なツールを提供します。
リソースの可用性: データセットとモデル出力を公開することで、著者らは再現可能な研究と、より優れたポルトガル語固有の数学モデルの開発を可能にします。
今後の方向性: 結果は、最先端モデルが強力である一方で、自由回答推論 と視覚 - 数学の統合 において改善の余地が大きいことを浮き彫りにしました。このベンチマークは、視覚的要素を含む複雑なネイティブ言語の数学的問題を処理できるモデルの開発を促進する触媒として機能します。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×