← 最新の論文
💬 NLP

PaTH Attention: Position Encoding via Accumulating Householder Transformations

本論文は、累積的なハウスホルダー変換に基づく柔軟でデータ依存的な位置エンコーディング手法であるPaTHを紹介するものであり、これは言語モデリングタスクにおいて標準的なRotary Position Encoding (RoPE) を凌駕すると同時に、効率的な並列学習と事前学習済みRoPEモデルの変換機能を提供する。

原著者: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

公開日 2026-02-05
📖 1 分で読めます☕ さくっと読める

原著者: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題: 「盲目的な」記憶

あなたが今話しているような大規模言語モデルを、質問に答えるために長い本を読んでいる非常に賢い司書だと想像してみてください。物語を理解するためには、司書は単に「どんな言葉があるか」だけでなく、「それらが本のどこに現れるか」を知る必要があります。

現在のモデルは、単語の位置を記憶するために RoPE(回転式位置エンコーディング)と呼ばれるシステムを使用しています。RoPEを、固定された、あらかじめ印刷された定規だと考えてください。

  • もし単語がページ1からページ2に移動しても、定規は決まった量だけそれをずらします。
  • 欠点: この定規は内容に対して「盲目」です。単語が「リンゴ」であっても「ロケット」であっても、同じ場所にさえあれば、全く同じように扱います。その場所が果物についての話なのか、宇宙船についての話なのかは気にしません。このため、複雑なステップ・バイ・ステップの論理(例えば、長いリストの中で誰がどのアイテムを所有しているかを追跡するようなこと)が必要な物語において、司書は時々混乱してしまいます。

解決策: PaTH (「スマートな」定規)

著者らは、位置を記憶するための新しい方法として PaTH を導入しました。固定された定規ではなく、PaTHは、読んでいる物語に基づいて形を変える動的で、形を変える定規のようなものです。

  • 仕組み: 司書が各単語を読む際、PaTHは前の単語の記憶に対して、特別な数学的な「ひねり」(ハウスホルダー変換と呼ばれます)を加えます。
  • 例え: あなたが鏡のある廊下を歩いているところを想像してください。
    • RoPE: 鏡は固定されています。あなたが何を身に着けていても、あなたの反射(映り込み)は同じに見えます。
    • PaTH: 鏡はスマートです。もしあなたが赤い帽子を被っていれば、鏡はあなたの反射をある方向にひねります。もし青い帽子を被っていれば、別の方向にひねります。「ひねり」は、あなたが持っている実際のコンテンツ(帽子)に依存します。

これにより、モデルは処理している特定のデータに適応する「記憶の経路(パス)」を構築することができ、変数(プログラミングコード内の変数の値など)の状態を追跡する必要があるパズルを解く能力が大幅に向上します。

魔法のトリック: 素早く実行する

通常、単語ごとに形が変わる定規を作ることは、非常に低速で計算コストがかかる作業になります。それは、一歩歩くたびに廊下全体の鏡の角度を再計算しようとするようなものです。

この論文の第二の主要な貢献は、高速化アルゴリズム(FlashAttentionと呼ばれるものに似ています)です。

  • 例え: 毎回廊下全体を再計算する代わりに、著者らは賢い近道を見つけました。鏡を小さなブロックにグループ化できることに気づいた彼らは、コンパクトな数学的公式を使用して、ブロック全体の「ひねり」を一度に計算することができます。
  • 結果: 彼らは、古い固定された定規(RoPE)と同じくらい速く動作しながら、新しいシステムの「スマートで変化する」恩恵を維持できるシステムを構築しました。

彼らは何を証明したのか?

著者らは、この新しいシステムを2つの方法でテストしました。

  1. 合成パズル(「補助輪」としてのテスト):
    彼らはモデルに、スイッチが最後に切り替えられたタイミングを覚えなければならない「フリップフロップ」ゲームや、複雑な数学ルールを含む「文章題」ゲームなどの単純な論理ゲームを与えました。

    • 結果: 古いモデル(RoPE)は、シーケンスによって混乱し、これらのパズルで失敗することがよくありました。新しいPaTHモデルは、他のモデルよりも「脳」の層が少ない場合でも、ほぼ完璧にこれらのパズルを解きました。
  2. 実際の言語タスク:
    彼らは、実際のテキスト(本、コード、会話)でモデルを訓練しました。

    • 結果: PaTHモデルは、長いコンテキスト(非常に長い本を読みながら最初の方を忘れないこと)を理解することに長けており、特にコーディングや数学における推論タスクで優れたパフォーマンスを発揮しました。
    • ボーナス: 既存の「固定された定規」(RoPE)で訓練されたモデルを、ゼロからやり直すことなく、わずかな追加訓練だけで「スマートな定規」(PaTH)を使用するように変換できることを示しました。

まとめ

PaTH は、AIが単語の順序を記憶するための新しい方法です。画一的なシステムを使う代わりに、単語そのものに基づいて変化する柔軟なシステムを使用します。著者らは、この柔軟なシステムを実用的な速度で動作させる方法を見出し、その結果、AIモデルが論理、長期的な情報の追跡、および複雑なシーケンスの理解においてより優れたものになりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →