From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks
この論文は、大規模言語モデルが文字数カウントなどの単純な記号タスクで失敗する原因が、情報の欠如ではなく、後続の層(特に最終層のMLP)における正解信号を抑制する「負の回路」による構造的な干渉にあることを示し、モデルの推論プロセスが正解と誤答の競合と抑制によって成り立っていることを明らかにしたものです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
天才が「リンゴ」の文字数を数えられない理由:AI の「隠れた悩み」を解き明かす
この論文は、現代の巨大な AI(大規模言語モデル)が、なぜ人間にとって簡単な「リンゴ(apple)の中に p が何個あるか?」といった文字数のカウント問題で、なぜか失敗してしまうのかを、AI の「頭の中」を覗き込んで解き明かした興味深い研究です。
結論から言うと、**「AI は答えを知っているのに、あえて間違える」**という現象が起きていることがわかりました。
以下に、専門用語を排して、身近な例え話を使って解説します。
1. 問題:なぜ天才が簡単な計算でつまずく?
AI は小説を書いたり、複雑なプログラミングをしたりする天才ですが、**「単語の中に特定の文字が何回出てくるか」**を数えるような、小学生でもできるような単純なタスクになると、なぜかボロを出します。
- リンゴ(apple)の中に「p」は 2 個ある。
- イチゴ(strawberry)の中に「r」は 3 個ある。
これらを AI に聞くと、多くの場合、間違った答え(「1 個」や「3 個」など)を返してきます。なぜでしょうか?
2. 調査:AI の「頭の中」を覗いてみた
研究者たちは、AI がどう考えているかを探るために、以下のような「手術」を行いました。
A. 「答えは最初からわかっていた!」
AI の内部(隠れ層)を調べると、「リンゴ」の文字を処理している瞬間には、すでに「p が 2 個ある」という正しい情報が、AI の頭の中にしっかり刻み込まれていることがわかりました。
- 例え話: 料理人が野菜を切っている最中に、「この野菜は 2 切れだ」と正確に認識している状態です。
B. 「しかし、最後の瞬間に裏切られた」
問題は、その情報が**「出力(答えを言う)」の直前で消されてしまう点にあります。
AI の最後の数段(層)にある特定の部品が、「正しい答え(2)」を無視して、間違った答え(1 や 3)を強く押し出してしまう**のです。
- 例え話:
料理人が「2 切れ」と正確に認識しているのに、「お皿に盛る直前」に、別の誰かが「いや、1 切れだ!」と大声で叫んで、料理人の口を塞いでしまうような状態です。
料理人(AI の前半部分)は正しい知識を持っていますが、最後の発表者(AI の後半部分)が、より「確からしい(頻出する)」間違った答えを選んでしまうのです。
3. 発見:AI の「悪の回路」
研究チームは、この「正しい答えを消し去る」働きをする部品を**「ネガティブ・サーキット(悪の回路)」**と呼びました。
- どこにいる? 主に AI の「最後の数段」にいます。
- 何をしている? 正しい情報を「弱める」か、逆に「1」という簡単な答えを「強くする」ように働いています。
- なぜ? AI は過去の学習データ(本やネット記事)で、「1 個」という答えが最も多いことに慣れてしまい、複雑に数えるよりも「とりあえず 1 個」と答える方が確率的に楽だと学習してしまったようです。
4. 驚きの事実:大きくしても、教訓しても直らない
- サイズを大きくしてもダメ: 20 億パラメータの小さなモデルから、90 億パラメータの大きなモデルまで試しましたが、「答えを知っているのに消してしまう」という癖は、モデルが大きくなっても直りませんでした。
- 教えてもダメ: 人間のように「丁寧に教えて(インストラクションチューニング)」も、この癖は消えませんでした。むしろ、AI は「1 と 2 を交互に言う」という新しい間違った癖をつけてしまいました。
5. この研究が教えてくれること
この研究は、AI の失敗は「知識不足」や「頭が小さいから」ではなく、「正しい情報を処理する仕組み」と「それを出力する仕組み」の間に、邪魔をする回路があるからだと示しています。
- 重要な教訓:
AI は、単に「答えを覚える」だけでなく、「答えを信じて出力する」ことにも失敗しています。
これまでの AI 開発は「もっと大きくすれば良くなる」という考えでしたが、この研究は**「AI の内部構造そのものを見直さないと、単純なミスは直らない」**という警鐘を鳴らしています。
まとめ
AI は、「リンゴの p は 2 個だ」という事実を、最初から最後までしっかり理解しているのに、最後の瞬間に「いや、1 個だ!」と嘘をついてしまうのです。
これは、AI が「計算できない」のではなく、**「計算した結果を、自分の信じる(間違った)直感に押しつぶされてしまう」**という、人間にはない独特の「脳の歪み」を持っていることを意味します。
この発見は、より信頼性の高い AI を作るために、単に大きくするだけでなく、**「正しい情報を出力まで届けるための道筋」**を設計し直す必要があることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。