← 最新の論文
💬 NLP

TEMPER: Testing Emotional Perturbation in Quantitative Reasoning

この論文は、数値情報を保持したまま感情的な表現を加えることで大規模言語モデルの推論精度が低下することを示し、感情を中立化することで性能回復が可能であることを実証した「TEMPER」ベンチマークと評価手法を提案しています。

原著者: Atahan Dokme, Benjamin Reichman, Larry Heck

公開日 2026-04-10
📖 1 分で読めます☕ さくっと読める

原著者: Atahan Dokme, Benjamin Reichman, Larry Heck

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI(大規模言語モデル)が数学の問題を解くとき、問題文に『感情』が混じっていると、なぜかバカになるのか?」**という面白い疑問に迫った研究です。

タイトルは**「TEMPER」**(感情を揺さぶるテスト)。
以下に、専門用語を排して、わかりやすい例え話で解説します。


🧠 1. 研究のきっかけ:「イライラした生徒」と「冷静な先生」

普段、私たちが AI に「100 円のお菓子を 3 つ買ったらいくら?」と聞くと、AI は冷静に「300 円」と答えます。これは AI が訓練されている「教科書のような、感情のない問題文」だからです。

でも、現実世界ではどうでしょうか?
イライラした生徒がこう言うかもしれません。

「うっさい!先生は最悪だ!最初のテストで 70 点、次のテストで 45 点なんてひどい!宿題の平均は 90 点なのに、全部で 70 点以上ないとこのクソみたいなクラスに合格できないんだ。じゃあ、最後のテストで何点取ればいいんだよ!?」

数字や計算のロジックは全く同じなのに、「怒り」や「絶望」の言葉で包まれています。
この研究は、**「数字はそのままなのに、言葉のトーン(感情)が変わるだけで、AI の計算能力は落ちるのか?」**を調べました。

🔧 2. 実験方法:感情を「翻訳」する魔法の機械

研究者たちは、**「感情翻訳機」という新しい AI を作りました。
この機械は、普通の数学の問題を、
「怒り」「悲しみ」「喜び」「恐怖」「嫌悪」「驚き」**の 6 つの感情モードに書き換えることができます。

  • 元の文: 「リンゴが 3 つあります。さらに 2 つ増えました。全部で何個?」
  • 怒りモード: 「なんてこった!リンゴが 3 つしかないなんて!さらに 2 つ増えたって、一体どうしろって言うんだ!全部で何個だ!」

重要なのは、数字(3 と 2)や計算のルールは一切変えていないことです。ただ、言葉の「色」だけを変えています。

📉 3. 驚きの結果:感情があると、AI は 2〜10% もバカになる!

18 種類の異なる AI モデル(小さいものから超高性能なものまで)を使って実験したところ、感情が入っただけで、正解率が 2%〜10% 下がりました。

  • 特にダメだった感情: 「嫌悪(Disgust)」と「恐怖(Fear)」。
    • 例:「うっさい、このグロテスクな計算!」と言われた AI は、計算ミスをしやすい。
  • 一番マシだった感情: 「喜び(Joy)」と「驚き(Surprise)」。
    • 例:「やった!リンゴが増えた!」と言われた AI は、あまり影響を受けませんでした。

なぜ?
AI は、感情の言葉(「うっさい」「グロテスク」など)に気を取られて、肝心の「数字」や「計算手順」を見失ってしまうようです。まるで、**「怒っている人から話を聞くと、肝心な数字を聞き逃してしまう」**人間の心理と似ています。

🛡️ 4. 解決策:感情を「中和」する魔法の薬

では、このバカぶりを治す方法はあるのでしょうか?
研究者たちは、**「感情を消す翻訳機」**も作ってみました。
怒りの言葉で書かれた問題を、また元の「冷静な言葉」に戻すのです。

  • 怒りの問題中和(翻訳)冷静な問題

すると、失われた正解率の約 70% が回復しました!
これは、**「AI がバカになったのは、問題の内容(数字)が悪かったからではなく、感情という『ノイズ』が邪魔をしていたから」**であることを証明しました。

🔍 5. 裏付け:AI の「頭の中」を見てみる

さらに、AI の内部(隠れ層)を覗いてみました。

  • 冷静な問題を解いているとき:AI の脳内パターンは、元の状態に近い。
  • 感情の問題を解いているとき:AI の脳内パターンは、3〜4 倍も大きく歪んでしまう

これは、感情という「ノイズ」が、AI の思考回路そのものを物理的に(数式的に)ずらしてしまっていることを示しています。単なる言い換え(パラフレーズ)では、ここまで歪みは起きません。

💡 6. この研究が教えてくれること(まとめ)

  1. AI は「感情」に弱い: 数字が同じでも、感情的な言葉が入ると、AI の推理能力は低下します。特に「怒り」や「嫌悪」は危険です。
  2. 感情は「ノイズ」: 問題は内容ではなく、トーン(話し方)が原因で失敗しています。
  3. 対策は可能: 感情を消して冷静な言葉に戻すだけで、AI の性能は大幅に回復します。

日常への応用:
もしあなたが AI に複雑な計算や重要な判断を頼むなら、「感情的な言葉」は避けて、冷静で簡潔な言葉で頼むのがベストです。逆に、AI がイライラしたユーザーからの質問に正しく答えられないのは、AI のせいだけでなく、「感情というノイズ」が計算を狂わせているからかもしれません。

この研究は、AI がもっと人間らしく、かつタフに働くために、「感情という要素」をどう扱うべきかを考える重要な一歩となりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →