← 最新の論文
⚡ electrical engineering

Beyond Sinusoids: A Morlet Wavelet Framework for Transformer Positional Encoding

本論文は、正弦波型および回転型位置エンコーディングを学習可能なウェーブレットに基づくアプローチの極限ケースとして統一する新しいフレームワークであるMorlet Positional Encoding (MoPE) を導入し、ウェーブレットの許容境界へと収束させながら、位置と局所性を同時にエンコードすることで、トランスフォーマーモデルにおける性能向上を実証するものである。

原著者: Athanasios Zeris

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Athanasios Zeris

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:「どこ」か vs 「どれくらい離れているか」

本を読んでいる場面を想像してみてください。標準的なAIモデル(Transformer)には、文章の中の単語が「どこ」にあるかを知るための仕組みが組み込まれています。これらは「位置エンコーディング(Positional Encoding)」と呼ばれるものです。

現在、最も普及している2つのシステム(SinusoidalとRoPE)は、完璧で無限に続く定規のように機能します。それらはAIに対して、「この単語は5番目の単語です」「この単語は100番目の単語です」と伝えます。しかし、これらはすべての位置を全く同じように扱います。つまり、ある単語の影響力は永遠に続くものだと想定しているのです。

著者は、これは言語においては間違っていると主張しています。物語の中で、「彼(he)」という言葉は2文前に登場したキャラクターを指しているかもしれませんが、2章前に登場したキャラクターを指している可能性は低いでしょう。標準的な定規は、単語の影響力がどこまで届くべきかを知りません。ただ「ここにあります」と言うだけなのです。

解決策:「懐中電灯」(MOPE)

著者は、**Morlet Positional Encoding(MOPE)**と呼ばれる新しいシステムを提案しています。

無限に続く定規の代わりに、MOPEは懐中電灯のように機能します。

  • 光のビーム(位相/Phase): 旧来のシステムと同様に、単語の正確な角度や「位相」をAIに伝えます(例:「あなたはダンスの5ステップ目にいます」)。この部分は、人気の高いRoPEシステムと同一です。
  • 光の広がり(振幅/Amplitude): これが新しい部分です。懐中電灯の光は、中心から離れるほど暗くなります。MOPEでは、位置の信号の「明るさ」は、シーケンスの開始点から離れるにつれて減衰していきます。

比喩:

  • 旧システム(RoPE/Sin-cos): すべての座席が明るく一定の光で照らされているスタジアムを想像してください。1番席のファンは、10,000番席のファンと同じくらいアナウンサーから「見えて」います。
  • 新システム(MOPE): スポットライトを想像してください。中央にいる人は非常に明るいです。後方の列に移動するにつれて、光は柔らかくなり、やがて消えていきます。これはAIに対して、「近くの単語には注意を払いなさい。遠くの単語は今はそれほど重要ではありません」と伝えているのです。

「魔法」のような繋がり

この論文は、非常に興味深い事実を証明しています。旧来のシステム(Sin-cosとRoPE)は、実はこの新しい懐中電灯システムの壊れたバージョンに過ぎないということです。

  • もし懐中電灯のビームを無限に広く(決して暗くならないように)すれば、旧来のRoPEシステムになります。
  • もしビームを無限に広くし、回転を取り除けば、旧来のSin-cosシステムになります。

つまり、MOPEは単なる新しいアイデアではなく、旧来のアイデアの「親」なのです。MOPEは、AIの脳の各部分において、懐中電灯のビームをどの程度の幅にすべきかをデータから学習します。

実験では何が起きたのか?

著者は、シェイクスピアの数千語という非常に小さなデータセットを用いてテストを行いました。その結果、以下のことが判明しました。

  1. コンボが最強: この新しい「懐中電灯(MOPE)」を、別のツールである「Energy-Gated Attention」(どの単語が重要かを判断する門番のような役割)と組み合わせたとき、AIの次単語予測能力は大幅に向上しました。どちらか一方のツールを使うよりも、両方を組み合わせた方が優れた結果を出しました。
  2. 「スイートスポット」の発見: AIは、懐中電灯の幅をどれくらいにするかを学習する必要がありました。驚くべきことに、AIの脳内にある128個の「懐中電灯」のすべてが、特定の数学的限界値に調整されました。それらはすべて、狭すぎず広すぎず、ちょうど良い「文字対単語」のスケールに合わせてビーム幅を決定しました。
    • これは128台のラジオをチューニングするようなものです。 それぞれ異なる局に合わせるのではなく、信号が最もクリアになる正確な周波数にすべてがロックされたのです。
  3. 「開始点」のバイアス: 現在のMOPEには一つの癖があります。それは、懐中電灯の「中心」が常にテキストの冒頭(単語#1)にあると想定していることです。つまり、たとえ物語がこれから始まるとしても、単語#5は単語#200よりも自然に「明るく」なります。著者はこれを制限事項として認めており、将来のバージョンでは、AIが懐中電灯の「中心」をどこに置くべきかを学習できるようにすべきだと示唆しています。

まとめ

この論文は、単語の位置を追跡するために硬直した無限の定規を使うのではなく、賢い、減衰するスポットライトを使うべきだと提案しています。このスポットライトは、その影響力がどこまで届くかを学習します。

  • 従来の方法: 「私はここにいて、永遠に重要です」
  • 新しい方法(MOPE): 「私はここにいて、短距離の間は重要ですが、その後は消えていきます」

実験によれば、この「減衰」アプローチを他のスマートなアテンション・ツールと組み合わせることで、AIは従来のメソッドよりも言語の局所的な構造(文やフレーズなど)をはるかに良く理解できることが示されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →