← 最新の論文
🤖 machine learning

Attention Drift: What Autoregressive Speculative Decoding Models Learn

本論文は、未正規化の残差経路により注意機構がプロンプトから生成トークンへシフトする自動回帰的推測デコーディングモデルにおける主要な限界として「注意の漂移」を特定し、ポストノームや隠れ状態ごとの RMSNorm といったアーキテクチャの修正を提案し、これにより多様なタスクおよびコンテキスト長にわたって受入長を大幅に改善することを示している。

原著者: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Doğaç Eldenk, Payal Mohapatra, Yigitcan Comlek, Kaan Oktay, Hongyang Zhang, Stephen Xia

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いけれど遅い図書館司書(ターゲットモデル)が物語を書いていると想像してください。時間を節約するために、司書が確認する前に次の数語を推測する、速いが経験の浅いアシスタント(ドラフター)を雇います。アシスタントの推測が正しければ、司書は「よくやった」と言って次の作業に進み、その言葉を考えて出すという遅い作業をスキップします。これをスペキュレイティブデコーディングと呼びます。

しかし、この論文は、これらのアシスタントの動作に奇妙な不具合があることを発見しました。著者たちはこれを**「アテンションドリフト」**と呼んでいます。

問題:アシスタントが自己陶酔に陥る

図書館司書がドラゴンについての物語を語っていると想像してください。アシスタントは、次の言葉を推測するために、司書の指示(プロンプト)に注意を向けるべきです。

しかし、アシスタントが「ドラゴン」、「飛んだ」、「越えた」、「その」、「山」といった長い単語の連鎖を推測しようとするにつれて、以下のようなことが起こります。

  1. 開始時:最初、アシスタントは司書の指示を見ています。
  2. ドリフト:アシスタントが自分の言葉を推測し始めると、すぐに気が散ります。司書の元の指示を見るのをやめ、自分がたった今書いた言葉に凝視し始めます。
  3. 結果:アシスタントは自分の最近の出力に執着するようになります。物語の文脈を忘れます。物語の導入方法を変更する(「テンプレート摂動」)か、物語を非常に長くすると、アシスタントは完全に混乱し、正しく推測しなくなります。

論文はこの現象をアテンションドリフトと呼んでいます。アシスタントの焦点は、元々の資料から「ドリフト」して、自分の最近の思考に固着してしまいます。

なぜこれが起こるのか?「音量ノブ」の比喩

著者たちは、なぜこれが起こるのかを数学的に追求しました。その結果、アシスタントの脳(内部データ状態)に隠れた「音量ノブ」の問題が見つかりました。

  • 現在の設計(プレノーム):アシスタントには、言葉を発するたびに音量が大きくなるマイクがあると想像してください。
    • 1 語目:通常の音量。
    • 2 語目:少し大きい。
    • 10 語目:叫んでいる。
    • 20 語目:耳を劈くほど大きい。

アシスタントの内部の「音量」(隠れ状態の大きさ)が推測するたびに増大し続けるため、司書の上に複雑な層を積み重ねているように感じ始めます。単純な推測者として振る舞うのをやめ、以前の推測を「洗練」しようとする、全く新しい、より深いモデルとして振る舞い始めます。この音量の増大により、バランスを失い、元の指示を忘れることになります。

解決策:「リセットボタン」(ポストノーム)

著者たちは、ポストノームという簡単な解決策を提案しました。

これは、アシスタントが推測するたびに「音量リセット」ボタンを追加するようなものです。

  • アシスタントが次の言葉を推測する前に、システムは内部の音量をチェックし、標準レベルに正規化します。
  • これにより、「音量」が耳を劈くほど大きくなるのを防ぎます。
  • アシスタントは地に足をつけ、以前の推測の混沌とした積み重ねではなく、それぞれが独立した新しい予測として扱われるように強制されます。

また、アシスタントが推測を開始する前に、司書からのデータに対しても同様の「リセット」を追加し、開始信号があまりに大きすぎたりバランスを崩したりしないようにしました。

結果:より堅牢なアシスタント

これらの「リセットボタン」(ポストノーム)を追加することで、アシスタントは仕事をする上で格段に良くなりました。

  • 気が散りにくい:元の指示からドリフトしなくなりました。
  • より堅牢:物語の形式を変更しても(特定のタグを削除したり、挨拶を変更したりしても)、アシスタントはクラッシュしません。これらの変化に対して、旧バージョンの2 倍うまく対応しました。
  • 長い物語:混乱することなく、はるかに長い物語を扱えるようになりました。
  • 高速な学習:アシスタントがより安定していたため、短いシーケンスで学習させるだけで、後で長いシーケンスでもうまく機能するようになりました。

大きな教訓

この論文は、これらのアシスタントが現実世界の厄介な状況で失敗する理由は、単に彼らが「愚か」だからではないと主張しています。彼らが作業するにつれて「大声」になり、自己陶酔に陥るような内部設計が原因なのです。内部の音量を一定に保つために、単に正規化ステップを追加するだけで、彼らは信頼性が高く、一貫性があり、大規模モデルの執筆を助けるのにはるかに速くなります。

要約すると:この論文は、AI ドラフターが自分の作業に気が散る理由は、内部の「音量」が上がり続けるためであることを発見しました。単純なアーキテクチャの修正でその音量を下げることで、彼らの仕事ぶりは格段に良くなります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →