← 最新の論文
🤖 machine learning

Journey Operators for Structured Multi-Axis Composition

本論文は、Rotary Position Embeddingsをコンテンツ適応的な設定へと一般化する「ジャーニー・オペレーター」を用いた構造化された多軸データ構成のための理論的枠組みを導入し、可換性を経路独立性の条件として確立し、これらの帰納バイアスを活用して視覚、言語、および長さの汎化タスクにおける性能を向上させるためのJoFormerモデルを提案する。

原著者: Mahesh Godavarti

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Mahesh Godavarti

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で魔法のような図書館を築こうとしていると想像してください。そこでは、すべての本が、棚のどこに収まるべきかを正確に知っています。人工知能の世界、特に文章を読んだり画像を見たりする種類のAIの世界において、これらの「本」は、単語やピクセルといったデータの断片です。長い間、コンピュータはそれらの断片が「何であるか」(内容)を理解することには長けていましたが、それらが互いに「どこに」あるのか(相対的な位置関係)については、少し苦労してきました。これは「位置エンコーディング(positional encoding)」と呼ばれます。これはデータのGPSのようなものだと考えてください。これがないと、コンピュータは文章の中に「犬」と「男」があることは分かっても、「犬が男を噛んだ」のか、それとも「男が犬を噛んだ」のかを判断できません。

これを解決するために、科学者たちは数学を用いて、あらゆるデータの断片に対して、その場所に基づいた、ごくわずかで目に見えない「回転」を与えます。コンパスの針を、右に一歩進むごとに少しずつ回転させ、下へ一歩進むごとにまた別の回転を加える様子を想像してみてください。もし右に行ってから下に行った場合、針は「下に行ってから右に行った」場合と同じ位置に止まっていなければなりません。このように、空間を移動しながら方向を把握するというアイデアが、これから探求する論文の基礎となっています。この論文は、シンプルですが深い問いを投げかけています。「これらの『回転』を完璧に連携させることができれば、テキストの列であれ、ピクセルの格子であれ、3次元のボリュームであれ、コンピュータに世界の構造を理解させることができるだろうか?」


データの旅路

「Journey Operators for Structured Multi-Axis Composition」と題されたこの論文は、AIの中でデータがどのように動き、混ざり合うかについての新しい考え方を導入しています。著者の一人である Mahesh Godavarti 率いる研究チームは、すべてのデータが単なる内容(「猫」という言葉や赤いピクセルなど)だけでなく、あらゆる方向に移動するための微小な「変換」または「回転」を携えているというフレームワークを提案しています。

遊び心のある比喩を使ってみましょう。すべてのデータポイントを、バックパックを背負った旅人と想像してください。標準的なAIモデルでは、バックパックには旅人の持ち物が入っているだけです。しかし、この新しいフレームワークでは、すべての旅人は、あらゆる方向(上、下、左、右)へ歩くための特別な「コンパス」を携えています。二人の旅人が出会って物語を組み合わせる時(これはAIがデータを処理する際に行われることです)、最初の旅人は、二人が合流する前に、二番目の旅人のバックパックを回転させるために自分のコンパスを使用します。この回転は、最初の旅人がどこに立っているかに応じて、二番目の旅人の物語の語られ方を変えてしまうのです。

このプロセスを論文では「ジャーニー(旅路)」と呼んでいます。もし、点Aにあるデータと点Bにあるデータの関係を知りたいなら、AからBまで歩いた時に得られるトータルの回転、すなわち「ジャーニー・オペレーター」を計算します。

大きな発見: 「平坦な」世界 vs 「曲がった」世界

この論文の最もエキサイティングな部分は、これらの「旅路」が成立するかどうかを決定するルールの発見です。著者たちは、AIが「右に行ってから下に行くこと」と「下に行ってから右に行くこと」が同じであると理解するためには(これは経路独立性と呼ばれる性質です)、コンパス(回転)が**可換(commute)**でなければならないことを発見しました。

数学的に言えば、「可換」とは演算の順序が重要ではないことを意味します。紙を右に90度回転させてから下に90度回転させると、先に下へ回転させてから右へ回転させた場合とは異なる結果になります。ただし、それらの回転が特殊なものである場合を除きます。論文は、もし回転が「平坦」であれば(つまり、X軸とY軸を独立して回転させるように、データに対して干渉しない別々の部分に作用する場合)、その旅路は一貫性を持つことを証明しています。しかし、もし回転が「曲がった」状態であれば(つまり、互いに干渉し合っている場合)、旅路は通った正確な経路に依存してしまい、AIを混乱させてしまいます。

この論文は、これらのAIモデルを構築する最善の方法は、「平坦な」領域に留まることであると示唆しています。これが、既存の手法である RoPE (Rotary Position Embedding) がなぜこれほど上手くいっているのかを説明しています。RoPEは、自然にこれらの可換で平坦な回転を使用しているからです。論文は、もしより複雑で絡み合った回転(密な回転)を使用しようとすれば、一貫した方向感覚を失い、位置構造が崩壊してしまうことを示しています。

新しいモデル: JoFormer

この理論に基づき、著者らは JoFormer (Journey-based Transformer) と呼ばれる新しいモデルを設計しました。ここでの鍵となる革新は、JoFormerが単に「一つの単語が他の単語にどれだけ注意を向けるべきか」をスコアリングするために回転を使用する(これは古いモデルが行っていたことです)だけでなく、それらの回転を使用して、結合される前の「実際のデータ(値)」自体を**変換(変形)**する点にあります。

次のように考えてみてください。古いモデルでは、AIは「『吠える』という言葉の近くに『犬』があるので、興味がある」と言うかもしれません。しかし、JoFormerでは、AIは「私は『犬』という言葉に興味がある。そして、私との距離に応じて『犬』の意味を回転させ、現在の文章に完璧に適合するように調整する」と言うのです。

論文は、JoFormerを3つの異なるタイプのタスクでテストしました。

  1. ビジョン(画像): CIFAR-100 と ImageNet でテストを行いました。結果は、この「値の回転(データの回転)」を加えることが、モデルの視覚能力を向上させることを示唆しています。例えば、CIFAR-100 では、特定のバージョンの JoFormer は標準的な手法と比較して精度が約2%向上しました。ImageNet では、より小さいながらも一貫した 0.40% の向上が見られました。
  2. 言語(テキスト): Wikipedia 言語モデルを用いてテストを行いました。結果は、新しいモデル(特に、回転がテキストの内容に依存する「投影型」バージョン)が、次の単語を予測する能力をより良く学習し、標準的なモデルよりも低い「パープレキシティ(モデルがどれだけ驚いたかを示す指標)」を達成したことを示唆しています。
  3. 長さの汎化(Length Generalization): これは面白いテストです。モデルを短い文章(512単語)で訓練し、その後、非常に長い文章(最大4096単語)を読ませました。標準的なモデルは非常に混乱し、パフォーマンスが急落しました。しかし、JoFormer は長いテキストをはるかにうまく扱いました。標準モデルの性能が大幅に低下したのに対し、JoFormer の性能低下はわずかでした(比率は 1.02倍)。

この論文が「していない」こと

この論文が主張して「いない」ことを明確にしておくことは重要です。著者たちは、これらの結果は「シングルシードによる妥当性確認(single-seed sanity checks)」であると非常に慎重に述べています。これは、彼らが一度限りの特定のランダムな開始点を用いて実験を行い、アイデアが原理的に機能するかどうかを確認したものであり、世界最高のAIを構築したと主張しているわけではないことを意味します。彼らは、自分たちの結果がまだ「最先端(state-of-the-art)」のベンチマークとしての主張ではないことも認めています。

また、彼らは特定のアイデアを否定しています。例えば、単純な平坦な回転ではなく、フルで複雑な回転システム(完全な直交群 O(d)O(d))を使用しようとすると、AIは位置感覚を完全に失うことを彼らは証明しています。それは、街路標識がすべてバラバラで混乱した方向を指している街をナビゲートしようとするようなもので、モデルは位置を知ることを諦めてしまうのです。

まとめ

簡単に言えば、この論文は、AIに構造を理解させるための秘訣は、単にデータを増やしたりコンピュータを大きくしたりすることではなく、どの方向に回転しても同じように機能する、一貫した数学的な「コンパス」をデータに与えることであると主張しています。これらのコンパスが互いに衝突しない(可換である)ことを保証し、ネットワーク内を移動する際に実際にデータを回転させることで、著者らは AI が画像、テキスト、および長いシーケンスを扱うための、より堅牢な方法を示唆するモデル(JoFormer)を作り上げました。

この論文はすべてを解決したと主張しているわけではありませんが、なぜ特定の手法が機能するのかという理論的な地図を提供し、画像、テキスト、または長いシーケンスを扱うための、よりスマートで構造化された AI システムを構築するための、有望で新しい道を提示しています。実験は、このアプローチが、特に長い入力や複雑な視覚的パターンを扱う際に、現実的で観察可能な利益をもたらすことを示唆していますが、その潜在能力を完全に理解するための旅はまだ始まったばかりです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →