← 最新の論文
💬 NLP

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

本論文は、9 言語にわたる数学的推論の堅牢性を評価するために複数の桁数変化インスタンスを生成する GSM-Symbolic ベンチマークの多言語拡張である MGSM-Pro を紹介し、低資源言語における顕著な性能低下と、そのような摂動に対するモデルの耐性のばらつきを明らかにする。

原著者: Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、さまざまな国から来た生徒たちを前にして数学のテストを行う教師だと想像してください。あなたは、誰が本当に数学に優れているのか、そして誰が単に練習問題集から答えを暗記しているだけなのかを知りたいのです。

この論文は、大規模言語モデル(AI)の数学問題に対する能力をテストする、新しくより厳しい方法であるMGSM-Proを紹介しています。彼らが発見したことを、わかりやすく説明します。

問題:「練習問題集」の罠

長い間、AI モデルは数学の文章題を解く能力を向上させてきました。しかし、研究者たちはある不審な点に気づきました。AI は実際に数学を「考えて」いるのではなく、トレーニング中に目にしたテスト問題の具体的な詳細を暗記している可能性があるのです。

まるで、特定の文章題の答えを暗記した生徒のようです。「ジョンがリンゴを 5 個持っていて、さらに 3 個買った場合…」という問題の答えが 8 であることをその生徒は知っています。しかし、質問を「サラがオレンジを 5 個持っていて、さらに 3 個買った場合…」と変えると、最初のものを暗記しただけの生徒は混乱するかもしれません。

最近、研究者たちは、英語であっても、数学問題の名前や数字を少し変えるだけで、多くの AI モデルが失敗することを発見しました。彼らは、AI がこれらの小さな変化に対応できるかどうかをチェックしていなかったため、従来のテストは甘すぎたと気づきました。

解決策:MGSM-Pro(「シャッフル」テスト)

著者たちは、MGSM-Proと呼ばれる新しいデータセットを作成しました。彼らは 250 個の数学問題を、それぞれ 5 バージョンずつ作成し、1,240 個の問題に増やしました。

彼らは以下のようにデッキをシャッフルしました:

  1. 名前の変更:「ジョン」を「ザイナブ」や「カルラ」に置き換える。
  2. 数字の変更:「リンゴ 5 個」を「リンゴ 7 個」に置き換える。
  3. 注意散漫要素の追加:一見重要そうだが実際には無意味な文を追加する(例:「空は青いので、ジョンはリンゴを 5 個買った」)。

これらを、英語や中国語のように広く話されている言語から、スワヒリ語、ヨルバ語、イボ語のようにデジタルリソースが少ない言語まで、9 つの異なる言語で行いました。

大きな発見:「低リソース」言語との格差

テストを実行したところ、「高リソース」言語(英語など)と「低リソース」言語(トウィ語やイボ語など)の間には、大きな格差があることがわかりました。

  • 高リソースの生徒たち:英語や中国語で名前や数字を変えても、AI モデルのスコアはわずかに低下しましたが、概ね軌道に乗っていました。彼らは、実際に数学の概念を理解している生徒のようでした。
  • 低リソースの生徒たち:トウィ語やイボ語などに対して同じシャッフルを行った場合、AI モデルは崩壊しました。スコアは急落しました。まるで、教師が果物の名前を別のものに変えただけで、生徒が突然数え方を忘れたかのようでした。

比喩:英語では数学が得意だが、母国語では数学が苦手な生徒を想像してください。教師が英語でひねりを加えた質問をすると、その生徒は解きます。しかし、教師が全く同じひねりを加えた質問を、その生徒の母国語で尋ねると、生徒は凍りついてしまいます。この論文は、AI モデルも同じことをしていることを発見しました。つまり、データがあまり見られていない言語では、AI モデルははるかに「ロバスト(信頼性が高い)」ではないということです。

合格したのは誰で、不合格だったのは誰か?

この論文は、さまざまな AI モデル(大手テック企業が作ったものもあれば、オープンソースのものもあります)をテストしました。

  • ロバストなモデルGemini 3.0 ProGPT-OSS 120Bのような、新しく賢いモデルは、変化をうまく処理しました。数字や名前が変わってもパニックになりませんでした。
  • 脆弱なモデル:古いモデルや小規模なモデル(Gemma 3 4BLlama 3など)は崩壊しました。彼らは「ひねり」に対処できませんでした。
  • サイズの神話:より大きな脳(より多くのパラメータ)を持つことが、常に賢い生徒を意味すると考えるかもしれません。しかし、論文はこれが真実ではないと発見しました。時には巨大なモデルが惨めに失敗する一方で、わずかに小さいモデルが成功することもあります。重要なのはサイズだけではありません。モデルがどのようにトレーニングされたかです。

教訓:一度だけテストしてはいけない

最大の教訓は、将来 AI をどのようにテストすべきかという点にあります。

現在、多くのリーダーボード(最高の AI のランキング)は、モデルを問題の1 つのバージョンだけでテストしています。著者たちは、これは生徒に単一の練習問題を与え、それが正解であれば彼らを天才と呼ぶようなものだと言います。

彼らの提案:AI が本当に数学に優れているかどうかを知るためには、同じ問題の少なくとも 5 つの異なるバージョン(名前や数字を変えたもの)でテストする必要があります。AI がその 5 つすべてを正解して初めて、それは本当に賢いと言えます。もし最初の 1 つだけ正解するなら、それは単に暗記しているだけです。

まとめ

この論文は、簡単なテストに合格したからといって、AI を完璧なものとして扱うのをやめる必要があると主張しています。さまざまな言語の数学問題における名前や数字をシャッフルすることによって、彼らは以下のことを示しました:

  1. AI はデジタルデータが少ない言語でははるかに弱い。
  2. 多くの現在のランキングは、この「シャッフル」をテストしていないため、誤解を招くものである。
  3. AI の数学スキルを真に把握するためには、単一のバージョンだけでなく、同じ問題の複数のバリエーションでテストする必要がある。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →