← 最新の論文
🤖 machine learning

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

Jet-Longは、RoPEのスケーリング係数を動的に適応させることで短文脈の忠実度と長文脈の外挿のバランスをとり、効率的なバイフォーカル・アテンション機構を通じて最小限の推論オーバーヘッドで長文脈ベンチマークにおける最先端の性能を達成する、チューニングフリーかつゼロショットのメソッドである。

原著者: Haozhan Tang, Zerui Wang, Yuxian Gu, Song Han, Han Cai

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Haozhan Tang, Zerui Wang, Yuxian Gu, Song Han, Han Cai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、ある一定の長さ(例えば32,000単語)までの物語を読むように訓練された、超スマートなロボットの脳(大規模言語モデル)を持っています。さて、あなたは、その4倍の長さがある小説や膨大なコードのリポジトリを読ませたいと考えています。ただ長いテキストを渡してしまうと、ロボットは混乱してしまいます。それは、ページ番号が100から突然1,000,000に跳ね上がる本を読んでいるようなものです。ロボットの内部コンパス(RoPEと呼ばれます)は激しく回転し、ロボットは幻覚を見たり、物語の中盤を忘れてしまったりします。

しばらくの間、科学者たちは、ロボットの視野を広げるための「一つの魔法の数字」を選んで修正しようと試みてきました。しかし、これは負け戦でした。本の最後まで見えるように視野を広げすぎれば、ロボ本は最初の方を忘れてしまいます。逆に、最初の方をしっかり覚えるために視野を狭く保てば、最後まで見ることができません。

そこで登場したのが、ロボットの目に動的な二焦点レンズとして機能する新しい手法、Jet-Longです。

二焦点メガネのトリック

ロボットに本全体に対して一つの引き伸ばされた視界を強制する代わりに、Jet-Longは同時に二組のメガネを与えます。

  1. 近距離レンズ: テキストの最初の塊(「ローカルウィンドウ」)に対して、ロボットは訓練された通りにすべてを正確に捉えます。引き伸ばしも歪みもありません。これにより、ロボットは直近の過去に対する記憶を鮮明に保つことができます。
  2. ズームアウトレンズ: 残りのテキスト(「リモートウィンドウ」)に対して、ロボットは特別なトリックを使います。単に視野を引き伸ばすのではなく、ページを動的にグループ化します。本が長くなるにつれて、ロボットはどれだけのページを一つの「スーパーページ」としてグループ化するかを自動的に調整します。

魔法の鍵は、このグループ化の係数が固定されていないことです。これは、現在のテキストの長さに応じてリアルタイムで変化します。テキストが短いときは、ロボットはすべての単語を個別に認識します。テキストが膨大になると、ロボットの内部コンパスが落ち着いた状態を保ち、制御不能にならないよう、単語をちょうどいい具合にグループ化します。つまり、ロボットは短いタスクでは完璧な精度を維持しつつ、途中で迷うことなく巨大な文書を読み進めることができるのです。

「フリーランチ」のスピード

通常、二つの異なる計算(近くを見ることと遠くを見ること)を同時に行うと、ロボットは通常より2倍遅くなります。しかし、この論文の著者たちは、これらの計算を統合する巧妙な方法を見つけ出しました。彼らは、両方のレンズの計算を一度のパスで行う特別なエンジン(「融合カーネル」)を構築したのです。

これは、普段は野菜を刻み、次に茹で、次に炒めるという3つのステップを別々の鍋で行っているシェフのようなものです。Jet-Longは、味を損なうことなくこれら3つのステップを一度に行う魔法の鍋のようなものです。

  • 結果: ロボットが128,000トークンの巨大なコンテキストを読み取る際、Jet-Longは標準的な手法(FlashAttention-2)と比較して、H100チップ上での開始時(「プリフィル」フェーズ)において1.39倍高速です。
  • 代償: ロボットが新しいテキストを一度に一単語ずつ生成しているとき、標準的な手法よりも約4%遅くなります。しかし、パンフレットではなく図書館全体の蔵書を読めるようになることを考えれば、これは極めて小さな代償です。

テスト内容(およびテストしなかったこと)

チームは、3つの異なるサイズのロボットの脳(17億、40億、80億パラメータ)でテストを行い、Jet-Longが従来の最高の手法を一貫して上回っていることを発見しました。

  • RULERと呼ばれるテスト(テキストの干草の中に隠された針を見つける能力をチェックするもの)において、Jet-Stormは最小のモデルで競合他社より4.79ポイント高く、最大のモデルでも2.03ポイント高くスコアを記録しました。
  • HELMET-RAG(現実世界の検索タスクをシミュレートしたもの)というテストでは、最高の総合精度を達成しました。
  • PG-19(古い書籍の読解)においては、他の手法ではテキストが長くなるにつれて混乱(パープレキシティ)が急増したのに対し、Jet-Longは混乱を最低レベルに抑え続けました。

重要な注意点: 本論文は、ロボットを機能させるためにゼロから再学習させる必要があるという考えを明確に否定しています。Jet-Longは「ゼロショット」モデルで動作します。つまり、学習済みのロボットを取り出し、そこにこのレンズを差し込むだけでよいのです。ただし、論文では、Jet-Longは「回転するコンパス」の問題は解決しますが、「アテンション拡散(ロボットが多すぎる選択肢に圧倒されてしまう現象)」という別の問題は解決しないことも指摘しています。その問題は、単にレンズを追加することではなく、ロボットのアーキテクチャ自体を変更することで解決されるものです。

結論

Jet-Longは、ロボットを無限に賢くする魔法の杖ではありませんが、既存のロボットが記憶を失うことなく最大128,000トークンまでのテキストを扱えるようにする、非常に効率的でチューニング不要なツールです。短期的記憶を完璧に保ちながら、長期的視野を動的に調整し、なおかつ標準的な手法とほぼ同等の速度で動作します。著者らはこれを実機(H100 GPU)で測定し、異なるモデルサイズや、異なるタイプのアテンションを組み合わせたハイブリッドなロボットの脳においても機能することを確認しました。これは、AIに長文を読ませようとしている人々にとって、堅実で証明されたアップグレードです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →