Position Encoding in Transformers: From Absolute and Relative Methods to Rotary Position Embeddings and Long-Context Scaling
このテクニカルサーベイは、絶対的および相対的なアプローチから回転式位置埋め込み(RoPE)に至るまで、Transformerにおける位置エンコーディング手法を理解するための統一的なフレームワークを提供すると同時に、それらの計算特性、長文脈スケーリング技術、および長さ外挿能力と信頼できる長文脈汎化能との決定的な違いを分析するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはロボットに物語を理解させる方法を教えようとしていると想像してください。あなたには、人間のように一単語ずつ読むのではなく、文章内のすべての単語を同時に見ることができる超高速の脳があります。これが、現代のAIの背後にあるエンジンであるTransformerの魔法です。しかし、一つ問題があります。この脳はすべてを一度に見るため、どの単語が最初で、二番目で、最後なのかを知りません。もし文章の単語をバラバラに混ぜてしまったら、この脳は、混ぜられたバージョンも元のバージョンと同じくらい素晴らしいものだと判断してしまうでしょう。これを修正するために、私たちはAIに、文章のどこに各単語が位置しているかを知る方法を与えなければなりません。私たちはこれを**位置エンコーディング(Position Encoding)**と呼んでいます。これは、すべての単語にユニークな名前タグや座席番号を与えるようなものだと考えてください。これがないと、AIはパーティーのゲストが、誰の顔も見えているものの、誰が隣に立っているのか、あるいは誰が最初に到着したのかさえ分からない状態と同じになってしまいます。
この論文は、私たちが長年にわたってAIのために発明してきた様々な「名前タグ」システムの深掘り調査です。それは、単純な座席番号から、複雑な回転する時計へ、そして最後に、AIが何十万語もの長い本を混乱せずに読めるようにする新しい世代のトリックへと、その歴史を辿っています。著者は単にこれらの手法を列挙しているのではなく、それらを巨大な物語を扱うために拡張しようとしたとき、実際にどれが機能するのかを解明しており、単にシステムが長い入力を受け入れられるからといって、それが実際に理解しているとは限らないという警告を発しています。
AIの「座席番号」の進化
最初は、単語に座席番号を与える最も単純な方法は、辞書で単語を調べることでした。これは**学習済み絶対位置(Learned Absolute Position)**と呼ばれます。先生がリストを配り、「単語1」には特定の色、「単語2」には別の色を割り当てる様子を想像してください。これは短い物語には非常にうまく機能しますが、もし小説を読もうとして、先生が最初の500語分のリストしか作っていなかった場合、AIは501語目に到達したときに迷子になってしまいます。
次に、**正弦波エンコーディング(Sinusoidal Encoding)**が登場しました。静的なリストの代わりに、AIは数学的な波のパターン(サイン波のようなもの)を使用して座席番号を生成します。これは、異なる速度で回転する一連の時計だと考えてください。ある時計は、単語1と単語2の違いを区別するために速く刻み、別の時計は、単語1と単語1,000の違いを区別するためにゆっくりと刻みます。これは巧妙です。なぜなら、AIは見たことがない位置であっても、座席番号を計算できるからです。しかし、論文では、計算が可能だからといって、AIが非常に長い距離においてそれを使いこなせるとは限らないことが指摘されています。
次に、研究者たちは、言語においては絶対的な座席番号よりも、単語間の「距離」こそが重要であることが多いということに気づきました。「それ(it)」はそれが参照している名詞に近いでしょうか?これが相対位置エンコーディング(Relative Position Encoding)へとつながりました。 「私は席番号50にいます」と言う代わりに、AIは「私はあなたから3席離れています」と言うことを学びます。これは、正確な椅子の番号ではなく、誰が自分の隣に座っているかだけを気にする椅子取りゲームのようなものです。T5やTransformer-XLといった手法は、単語間の隙間に焦点を当てることで、長いテキストを扱うためにこれを利用しています。
主役:RoPE
この論文は、多くの大規模AIモデルにおける現在のチャンピオンとして、RoPE(Rotary Position Embedding:回転式位置埋め込み)と呼ばれる第三世代の手法を強調しています。RoPEは、単語のデータに数値を加算したり距離を計算したりする代わりに、単語のデータを「回転する矢印」として扱います。単語が列を進むにつれて、その矢印は回転します。AIが2つの単語を比較するとき、それらの矢印の間の角度をチェックします。矢印が近ければ、それらの単語は物語の中で近くにあり、矢印が離れていれば、単語も離れています。
RoPEの素晴らしさは、別途ルックアップテーブルを用意することなく、自然に単語間の「距離」を扱える点にあります。これは、パーティーの全員が、到着した時間に基づいて回転する時計を身に着けているようなものです。二人が話すとき、彼らは時計の針の違いを見るだけで、どれくらい離れているかを知ることができます。
長文コンテキストの挑戦:物語を伸ばす
これらのシステムにおける最大の課題は、通常、短い物語(例えば4,000語程度)で訓練されていることです。これらを巨大な文書(128,000語以上など)で使用しようとすると、「時計」や「回転する矢印」が、AIが見たことのないパターンへと回転し始めてしまいます。これは、街中の道路用に設計された車で高速道路を走ろうとするようなものです。エンジンは動いているかもしれませんが、ハンドリングが違和感のあるものになります。
論文では、これを修正するためのいくつかの「引き伸ばし(stretching)」技術を調査しています。
- 位置補間(Position Interpolation: PI): 長い物語を、AIが知っている短いスペースの中に押し込みます。これは、10時間の映画を2時間に圧縮するようなものです。AIは視聴できますが、細部がぼやけてしまい、近くにある単語同士の微妙な違いを見逃してしまう可能性があります。
- NTK-aware Scaling: これはよりスマートです。「速い時計」(近くの詳細を扱うもの)は通常の速度で回転させ続け、一方で「遅い時計」は長い距離をカバーするために速度を落とします。これは、遠くまで到達しながらもローカルな詳細を鮮明に保つための妥協案です。
- Dynamic NTK: この手法は、現在の物語の長さに応じて引き伸ばす係数を変化させます。物語が短ければ、全く引き伸ばしません。長ければ、引き伸ばします。しかし、論文では、これが過去の単語の記憶を混乱させる可能性があるため、リアルタイムでの管理が難しい場合があると警告しています。
- LongRoPE と LongRoPE2: これらは最も高度な手法です。全員に単一のルールを適用するのではなく、AIの脳の各部分に対して最適な引き伸ばし係数を探索します。さらに、短編と長編の両方の物語を混ぜて訓練することで、AIが両方を扱えるように学習させます。著者は、これが最も有望な道であると示唆していますが、注意深いチューニングと特定のデータが必要であるとしています。
大きな警告:適合しても、機能するとは限らない
この論文における最も重要な発見は、現実を突きつけるものです。AIモデルが100,000語の入力を「受け入れる」ことができるからといって、それを「理解できる」とは限りません。著者は、多くのモデルが「干し草の中の針(Needle in a Haystack)」テスト(巨大なテキストの中から特定の事実を見つけ出すテスト)に失敗したり、たとえ高度な「長文コンテキスト」設定がオンになっていても、長い距離にわたる推論に苦戦したりすることを指摘しています。
彼らは、実効コンテキスト長(effective context length)(AIが実際に使用している量)は、公称コンテキスト長(nominal context length)(技術的に保持できる最大単語数)よりもはるかに短いことが多いと強調しています。また、単に長い数値を扱うために数学を変更するだけでは不十分であり、AIがそれらを実際に使いこなせるようになるためには、これらの新しい設定を用いて再訓練または微調整(ファインチューニング)を行う必要があると指摘しています。
結論
論文は、単純な座席番号から複雑な回転する矢印へと驚異的な進歩を遂げてきたものの、私たちはまだ長文コンテキストの理解という問題を解決できていないと結論づけています。単一の「魔法の弾丸(特効薬)」は存在しません。最善のアプローチは、スマートなスケーリング(LongRoPEのような)、短編と長編の両方の例を用いた注意深い訓練、そしてAIが物語の最初と最後だけでなく、全体に本当に注意を払っているかを確認するための厳格なテストを組み合わせることにあるようです。
これらのAIモデルを構築したり使用したりするすべての人にとって、教訓は明確です。マーケティング上の数字をただ信じてはいけません。もしAIに小説一冊を読ませたいのであれば、そのAIが本を丸ごと飲み込めるかどうかではなく、物語の中盤にあるプロットの急展開を見つけ出せるかどうかを確認する必要があります。真の長文コンテキストAIへの旅はまだ続いており、その道のりには、単に数字を大きくすること以上のもの、つまりAIの注意力を維持するためのよりスマートな方法が必要なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。