← 最新の論文
💬 NLP

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

本論文は、ネイティブのコンテストおよび試験から収集された欧州ポルトガル語およびブラジルポルトガル語の1,729の数学的問題からなる新たなベンチマークデータセットMath-PTを紹介し、最先端のLLMは多肢選択問題では良好に機能するものの、視覚的および自由記述型のタスクにおいては能力が低下することを明らかにする。

原著者: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

公開日 2026-04-30
📖 1 分で読めます☕ さくっと読める

原著者: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)が、世界の図書館にあるほぼすべての本を読み込んだ秀才の学生だと想像してみてください。長年にわたり、私たちは彼らの数学力を、すべて英語で書かれた試験でテストしてきました。これは、学生に英語だけで運転免許試験を受けさせ、その試験に合格したという理由だけで、彼らがあらゆる言語で完璧に運転できると想定するのと同じです。

論文「MATH-PT」は、このアプローチには大きな盲点があると主張しています。この論文は、これらの AI 学生が言語が変わった際に実際に数学を扱えるかどうかを確認するために、特にポルトガル語(ヨーロッパポルトガル語とブラジルポルトガル語の両方)で書かれた新しい「運転試験」を導入します。

以下に、彼らの発見を簡単な比喩を用いて解説します。

1. 問題点:「英語のみ」の図書館

ほとんどの数学ベンチマーク(MATH や MathVista など)は、すべての本が英語で書かれた図書館のようなものです。研究者が他の言語をテストしようとしても、単に英語の本を翻訳するだけです。著者たちは、これが不公平だと指摘しています。なぜなら、それが AI が数学の概念を本当に理解しているのか、それとも単に英語のパターンを暗記しているだけなのかを判断できないからです。彼らは、ポルトガル語とブラジルの数学オリンピックや学校試験から取られた、ポルトガル語で「生まれ」た数学問題の図書館を構築したいと考えていました。

2. 新しい試験:MATH-PT

チームは「MATH-PT」というデータセットを作成し、1,729 問の問題を含めました。

  • 出所: 彼らは単に翻訳したのではなく、Olimpíadas Portuguesas da Matemática(ポルトガル数学オリンピック)やブラジルのOBMEP(ブラジル中等教育数学オリンピック)などの競技の原本アーカイブを掘り起こしました。
  • 多様性: この試験は、5 年生向けのパズルから大学進学前の課題まで、あらゆるレベルを網羅しています。
  • 形式: 選択式問題(バブルシート形式)と、答えをゼロから記述する自由記述式問題の両方が含まれています。重要なのは、多くの問題に図形や図(幾何学的な形状など)が含まれており、チームがコードを使用してこれらを慎重に保存し、AI がそれら「見る」ことができるようにした点です。

3. 結果:「賢い」学生と「苦労する」学生

彼らは、最も強力な「最先端」モデル(スーパー天才)から、小規模なオープンソースモデル(平均的な学生)まで、13 種類の異なる AI モデルをテストしました。

  • 選択式の利点: 選択式問題を「違いを見つけよう」というゲームだと考えてみてください。AI モデルはこの分野が非常に得意でした。小規模なモデルでさえ、正しい文字(A、B、C、D、E)を正しく推測できることがよくありました。
  • 自由記述式の苦戦: 試験が AI が自ら答えを生成する自由記述式に切り替わると、スコアは大幅に低下しました。これは、並んだ写真から顔を見分けることと、記憶からその顔を描くことの違いに似ています。AI は、単に選ぶのではなく、「考え」、自分で答えを書く必要がある場合に、より苦労しました。
  • 「画像」の問題: これが最大の障壁でした。問題に図(画像)が含まれている場合、AI のパフォーマンスは急落しました。最も賢いモデルでさえ、テキスト alongside 視覚的な形状を解釈する際に混乱しました。これは、学生に目隠しをしながら幾何学の問題を解くように求めるようなものです。彼らは言葉は読めますが、形状を「見る」ことができないのです。

4. 勝者と敗者

  • チャンピオン: 「最先端」モデル(GPT-5 や Qwen3-235B など)が明確な勝者でした。特に選択式問題において、彼らはポルトガル語の数学をうまく処理しました。
  • 苦労する者たち: 小規模なオープンソースモデル(Llama-3 や Gemma-3 など)は、数学を非常に困難だと感じました。問題が難しくなったり、画像が含まれたりすると、その精度は急激に低下しました。
  • スケーリング効果: 論文によると、Qwen 系列のモデルにおいては、モデルを大きくする(より多くの「脳力」を追加する)ことが大きく役立ちました。これは、自転車からスポーツカーに乗り換えるようなもので、より大きなモデルは、より小さなモデルよりもはるかに複雑な推論タスクを処理できました。

結論

この論文は、AI が数学において非常に上達している一方で、まだ「言語バイアス」を持っており、試験が難しくなる(自由記述式)または視覚的(図形)になると苦労すると結論付けています。このポルトガル語データセットを公開することで、著者たちは研究者たちに、英語以外の言語で AI が実際にどれだけ考えられるかを測定するための、より公平な新しい物差しを渡しています。彼らは AI がすでに完璧だと言っているのではありません。「AI がまだどこで学習しているかを正確に示す新しい試験をここに提示します」と言っているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →