← 最新の論文
💬 NLP

ArithmAttack: Evaluating Robustness of LLMs to Noisy Context in Math Problem Solving

本論文は、LLM が数学問題解決において句読点などのノイズを含むプロンプトに対して脆弱であることを示す評価手法「ArithmAttack」を提案し、8 つのモデルを用いた実験でノイズの増加が性能低下を招くことを明らかにしています。

原著者: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

公開日 2026-03-17
📖 1 分で読めます☕ さくっと読める

原著者: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI(大規模言語モデル)が数学の問題を解くとき、文の中に『不要な記号』が混ざると、どれだけ弱くなるのか?」**という不思議な実験について書かれています。

タイトルは『ArithmAttack(算数攻撃)』。少し怖い響きですが、実はとてもシンプルで面白い実験です。

🍪 クッキーのレシピと「いたずら」な記号

想像してください。あなたが AI に「クッキーのレシピ」を渡して、正確に計算してもらおうとしています。

  • 普通の状態(クリーンなデータ):
    「ティファニーは 8 個のブラウニーを焼きました。パーティーには 17 個必要です。1 個に 8 カップの小麦粉を使うなら、あと何カップ必要でしょう?」
    → AI はすらすらと「72 カップ」と答えられます。

  • 実験の状態(ノイズのあるデータ):
    ここに、誰かが**「いたずら」**をして、文の中に意味のない記号(?!;:など)をランダムに散りばめました。
    「?ティファニーは 8 個のブラウニーを焼きました、!パーティーには 17 個!必要です;。1 個に 8 カップの小麦粉を使うなら?;あと何カップ必要でしょう?」
    言葉や数字は一つも変わっていません。 意味も全く同じです。ただ、記号がうるさいだけです。

この「いたずら」をした状態で AI に解かせてみると、なんと多くの AI がパニックを起こして、間違った答えを出してしまうことがわかりました。

🔍 実験の正体:ArithmAttack

研究者たちは、この「記号のいたずら」を**「ArithmAttack(算数攻撃)」**と名付けました。

  • なぜこの攻撃が怖いのか?
    従来の攻撃は、意味を完全に変えるもの(例:「悪い」を「良い」に変える)が多かったのですが、この攻撃は**「意味はそのままなのに、AI の脳みそ(思考プロセス)を混乱させる」**という、とても巧妙な方法です。
    人間なら「あ、記号が変だなぁ」と気に留めつつも、意味を理解して答えられますが、AI は「?!;」というノイズに邪魔されて、論理のつなぎ目が崩れてしまうのです。

🏆 実験結果:どの AI が一番強かった?

研究者たちは、8 種類の有名な AI(Llama3, Mistral, DeepSeek など)に、この「記号だらけ」の数学問題(GSM8K と MultiArith というテスト)を解かせました。

  1. 全体的な結果:
    どの AI も、ノイズが増えるほど(記号が混ざるほど)、正解率がガクンと下がりました。

    • ノイズ 10% → 少し落ちる
    • ノイズ 30% → かなり落ちる
    • ノイズ 50% → ほぼ壊滅的な状態に
  2. 優勝者:
    **「Llama3.1」**というモデルが、他の AI よりもノイズに強く、最も高い正解率を維持しました。数学に特化した「Mathstral」というモデルも、普通の「Mistral」より強かったです。

  3. 最下位:
    「Zephyr」というモデルは、ノイズが入るとすぐに壊れてしまい、非常に弱かったようです。

💡 この実験から何がわかった?

この研究は、**「AI は完璧な人間のように、うるさい情報の中から本質をすくい上げるのが苦手」**であることを示しています。

  • 言葉を変えなくても、形(記号)を崩すだけで、AI は論理破綻する。
  • 数学の問題が難しいほど、ノイズの影響は大きくなる。
  • 将来、もっと賢い AI を作るには、「うるさい情報」に強くなるトレーニングが必要だ。

🎯 まとめ

この論文は、**「AI に『?!;』というノイズを混ぜるだけで、賢いはずの数学の天才がバカになる」**という、意外で重要な発見を伝えています。

まるで、静かな図書館で本を読んでいるのに、突然誰かが周りで「カチャカチャ、ピヨピヨ」と大きな音を立て始めたら、集中力が切れて読めなくなってしまうようなものです。AI も、実はそんな「集中力」の弱さを持っているのかもしれません。

今後の AI 開発では、この「記号のいたずら」に負けない、もっとタフな頭脳を作ることが課題になりそうです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →