← 最新の論文
💬 NLP

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

本論文は、英語のGSM-Plusデータセットから派生したベンガル語の数学的推論に関する新たな摂動ベースのベンチマークであるGSM-Plus-BNを導入し、6つの大規模言語モデルの堅牢性と推論能力を評価するとともに、低リソース言語の文脈に内在する重大な性能格差と課題を浮き彫りにするものである。

原著者: Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに数学の問題を解く方法を教えているところを想像してみてください。単に「2 + 2」を計算させるのではなく、なぜ答えが4になるのかという「理由」を本当に理解しているのか、それとも単に「2たす2は常に4である」ということを暗記しているだけなのかを知りたいはずです。これが、人工知能の世界における大きな問いです。大規模言語モデル(LLM)――チャットボットの背後にある超スマートなコンピュータの脳――は、本当に「考えて」いるのでしょうか? それとも、単に文章の次の単語を予測するのが非常に上手いだけなのでしょうか?

これを知るために、科学者たちはこれらのロボットを数学の文章題でテストしています。しかし、ここに落とし穴があります。もしロボットに全く同じ質問を1,000回繰り返したら、答えを丸暗記してしまうかもしれません。本当に賢いかどうかを見極めるには、ロボットを「騙す」必要があります。数字を変えたり、言葉を入れ替えたり、あるいは混乱させるような余計な詳細を加えたりして、ロボットが依然として正しい答えに辿り着けるかを確認するのです。これは「摂動(perturbation)」と呼ばれます。それは、生徒に「リンゴが3個あって、1個食べたら、残りはいくつですか?」と聞き、その直後に「リンゴが300個あって、100個食べたら、残りはいくつですか?」と聞くようなものです。賢い生徒は、数学の本質は同じだと理解しています。しかし、最初の答えを暗記しただけのロボットは、混乱してしまうかもしれません。

さて、このすべてのテストを、ロボットが最も多く学習している言語である英語ではなく、2億3,000万人以上の人々が話すベンガル語で行うことを想像してみてください。これまで、これらのAIの脳がベンガル語での数学のトリックを扱えるかどうかをテストする方法は、ほとんど存在しませんでした。この論文は、その巨大な空白を埋めるべく、「これらのAIモデルはベンガル語で本当に推論できるのか、それとも言葉が変わると躓いてしまうのか?」という問いに挑みます。


この研究の背後にいる研究者たち(バングラデシュの大学のチーム)は、AIのための巨大でトリッキーな遊び場、GSM-PLUS-BNを構築することに決めました。これは、ベンガル語向けに特別に設計された「数学の障害物競走」のようなものです。彼らは、1,000個の標準的な数学問題(「シード」となる問題)からスタートし、巧妙なレシピを用いて、より難易度の高い8,000個の新しいバージョンを作成しました。

どのようにしてこれらのトリックを作ったのでしょうか? 彼らは、手品師がデッキの中のカードを変えるように、8種類の異なる「歪み(distortions)」を使用しました。

  1. 数字の変更: 「3」を「4」に変えたり、小さな数字を巨大な数字(例えば2を2,000に)に変えたりすること。
  2. 数学的構造の変更: 問題に新しいステップを追加したり、質問の方向を逆にしたりすること(例:「合計はいくらですか?」と聞く代わりに、「合計がXの場合、元の数はいくらでしたか?」と聞く)。
  3. 言葉の変更: 文章の意味は同じだが、響きが全く異なるように書き換えること。
  4. 「レッド・ヘリング(偽の情報の提示)」: 重要そうに見えるが実際には無意味な一文を加えること。例えば、シャツが何枚必要かを聞いているだけの問題に対して、シャツの価格について言及するなど。
  5. 「欠落したピース」: 決定的な情報を削除し、ロボットが「分からない」と認めるのか、それとも単に推測してしまうのかを確認すること。

彼らは6つの異なるAIモデルをこのコースでテストしました。中には、小型で高速なもの(賢い電卓のようなもの)もあれば、巨大で複雑なもの(スーパーコンピュータの脳のようなもの)もありました。彼らは、2つの方法でロボットに問題を解かせました。一つは直接答えを出すだけで、もう一つは「ステップ・バイ・ステップで考える」(Chain-of-Thoughtと呼ばれる手法で、ロボットに計算過程を見せるもの)です。

結果はどうだったのでしょうか?

結果は、「すごい!」と「おっと……」が入り混じったものでした。

まず、「ステップ・バイ・ステップで考える」というテクニックは、一部のロボットには劇的な効果をもたらしましたが、他のロボットには逆効果となりました。Qwen3-32Bモデルは、先生から「計算過程を見せなさい!」と言われるまでは数学が苦手な生徒のようでしたが、その指示を受けると、スコアが悲惨な13.98%から、堅実な76.25%へと跳ね上がりました。このモデルには知性のポテンシャルがありましたが、それを引き出すためのちょっとした後押しが必要だったようです。

しかし、最大のロボットが必ずしも最大の恩恵を受けたわけではありません。GPT-OSS-20B(200億パラメータのモデル)は、追加の助けなしで標準的な問題を解く能力が最も高く、96.08%の正解率を叩き出しました。ところが、「ステップ・バイ・ステップで考える」ことを強制されると、実際には少し悪化し、87.80%に低下しました。一方で、巨大なGPT-OSS-120Bは、標準的な問題で88.03%という強いスタートを切りましたが、やはり計算過程を示すよう求められると、わずかに低下しました。これらの巨人は、直接答えを推測することに長けすぎていたため、追加の指示がかえって混乱を招いたようです。

最も驚くべき発見は、ロボットたちが「クリティカル・シンキング(批判的思考)」の罠をいかに困難に感じたかということです。研究者が重要な情報を削除し、「これを解けますか?」と尋れたとき、ほとんどすべてのモデルが惨敗しました。最も優れたモデルでさえ、正解率は約33%に過ぎませんでした。これは、これらのAIモデルがパターンの追随には優れているものの、問題が解けない状態であることを認識する能力にはまだ課題があることを示唆しています。彼らは「情報が足りない」と言う代わりに、とにかく推測してしまう傾向があります。

もう一つの大きな発見は、言語に関わらず、AIにとって数学は依然として難しいということです。たとえ最高のモデルであっても、数字の書き方を変えたり(整数を分数に変えるなど)、数学的なステップを追加したりする問題には苦戦しました。この論文は、これらのモデルが、頭の中で実際の数学を行っているのではなく、テキスト内のパターンを認識することに頼りすぎている可能性を示唆しています。

最後に、チームは、AIモデルが英語と比較してベンガル語において非常に脆弱であることを発見しました。質問が少し変わるだけで、ロボットのスコアは大幅に低下しました。これは、AIが進化しているとはいえ、人間のようにベンガル語などの言語で数学を真に「理解」できるようになるまでには、まだ長い道のりがあることを物語っています。

要約すると、この論文は単に新しいテストを作っただけではありません。AIは数学において驚くほど有能になることもある一方で、特に英語ほど習熟していない言語においては、トリックに対して非常に脆いという事実を私たちに示したのです。「ステップ・バイ・ステップで考える」というテクニックは一部には有効ですが、すべてを解決する魔法の杖ではありません。ロボットは進化していますが、究極の数学的天才になる準備はまだ整っていないようです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →