← 最新の論文
💻 computer science

One Vector Is All You Need for O(1) Self-Attention: The Ocean State

本論文では、標準的な自己注意機構を単一の永続的なベクトルに置き換えることで、計算量およびメモリ複雑度をO(1)にしつつ、優れた学習安定性と1,000万ステップのコンテキストにおいても忘却の兆候が見られないことを実証する手法「Ocean State」を導入する。

原著者: SHUYUAN YU

公開日 2026-09-04
📖 1 分で読めます☕ さくっと読める

原著者: SHUYUAN YU

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能は、テキストの作成、言語の翻訳、質問への回答といったタスクの標準となっている「トランスフォーマー」と呼ばれる特定の種類のコンピュータプログラムに依存していることが多い。これらのプログラムは、一連の単語を読み取り、次にどの単語が来るかを決定することで機能する。これを正確に行うためには、プログラムはすでに見た単語を覚えておく必要がある。現在の設計では、プログラムが長い文章や本全体を読み進めるにつれて、これまでに処理したすべての単語を含む増え続けるリストを保持し続ける。このリストは、記憶バンクとして機能し、新しい単語ごとに拡大していく。これは短いテキストにはうまく機能するが、非常に長いテキストに対しては重い負担となる。コンピュータは、関連する情報を見つけるために、絶えず増え続けるこのリストをスキャンし続けなければならず、それには膨大な計算能力とメモリが必要となる。テキストが長くなるにつれて、それを読み取るために必要な時間とエネルギーはテキスト自体の長さよりもはるかに速く増大し、最終的には非常に長い文書を効率的に処理することが不可能になる。

Yu Shuyuanという研究者が、このメモリの問題に対処するための異なる方法を提案した。すべての単語を保持する増え続けるリストを持つ代わりに、新しい手法は、単一の要約ベクトル、著者が「オーシャン・ステート(海洋状態)」と呼ぶものを保持することを提案している。この状態を、プログラムがこれまで読んできたすべてのものの本質を保持する、単一の密なコンテナだと想像してほしい。プログラムが新しい単語を読み込む際、この単一のコンテナに新しい情報を含めるように更新し、古い要約を新しいものへと置き換える。そして、プログラムはこの単一のコンテナを使用して、次の単語の予測を助ける。このアプローチは問題の根本的な数学を変えるものである。努力の増大はテキストの長さに依存するのではなく、テキストがどれほど長くなっても一定に保たれる。プログラムは、百万単語を読み込む際も、単語あたりの作業量は変わらず、テキストの長さに依存せず、常に一定の極めて小さなメモリを使用する。

この研究の核心となるアイデアは、単純な問いに基づいている。「もし、ある文章の最終的な要約を、次の単語を予測するために使用した後に捨ててしまわないとしたらどうだろうか?」ということである。標準的なプログラムでは、この要約は計算された後に破棄される。新しい手法では、これを保持し、一つのステップから次のステップへと流れる持続的なメモリとして扱う。プログラムは現在の単語とこの単一の要約ベクトルを読み込み、それらを組み合わせ、新しい要約を生成する。このプロセスがテキスト内のすべての単語に対して繰り返される。決定的なのは、プログラムがこの単一のベクトルを読み取り、更新する方法を完全に自律的に学習することである。情報を一つの場所に圧縮する方法を教えられたわけではない。設計によってそれが可能になったため、トレーニング中に自然と学習したのである。研究者たちは、この単一のベクトルが驚くほど有能であることを発見した。それは、情報の損失なしに、一千万ステップのシーケンスからの情報を保持することができる。テストにおいて、プログラムは一千万ステップのシーケンスの最初の方にある特定の単語を、最初の数ステップからと同じ精度で想起することができ、忘却の兆候は見られなかった。

研究者たちは、大規模なテキストデータセットを用いて、このアイデアを標準的な手法と比較検証した。両方のバージョンを、文章内の次の単語を予測するように訓練した。結果は、一つのベクトルのみを使用する新しい手法が、増え続けるリストを保持する標準的な手法よりも一貫して優れた性能を示すことを示した。この優位性は偶然ではなく、モデルのサイズやテキストの長さが異なる多くの異なる設定において現れた。実際、新しい手法は非常に安定しており、標準的な手法がそのわずかな一部を処理することさえ不可能であったとしても、一千万ステップのシーケンスをエラーの増加なしに処理することができた。研究者たちはまた、長い遅延の後に特定の単語を繰り返す必要があるという特定のタスクについてもテストを行った。新しい手法は、誤差0.0006でその単語を再現したが、標準的な手法は完全に失敗した。

このような圧縮されたメモリに関する懸念の一つは、時間が経つにつれて詳細が失われ、読み取れなくなったり「霧がかかった」状態になったりして、良い予測を行うために必要な詳細を失ってしまうのではないか、ということである。しかし、実験はそれとは逆の結果を示した。単一のベクトルは鋭く明瞭なままであり、数百万ステップを経た後でも特定の情報を想起することができた。研究者たちはまた、この手法を実際のコンピュータ上でいかに高速化するかについても調査した。新しい手法は、単語を厳格な順序に従って一つずつ処理するため、多くの単語を同時に処理できる標準的な手法と比較して、単一の機械でのトレーニングは遅くなる可能性がある。これを解決するために、研究者たちはプログラムの異なるレイヤー間で作業を分割する方法を開発し、複数のステップを同時に処理できるようにした。このエンジニアリング上の変更により、高いパフォーマンスを維持したまま、モデルのトレーニングに必要な時間を大幅に短縮することができた。

この研究は、固定された量のメモリと計算能力を用いて、膨大な量の情報を記憶するシステムを構築することが可能であることを示している。研究者たちは、プログラムが特別な指示を受けることなく、情報を効率的に整理する方法を学習することを示した。現在の実験は特定のデータセットと比較的小さなモデルで行われており、現実世界の規模での挙動はまだテストされていないが、結果は基礎となる原理が堅牢であることを示唆している。この手法は、プログラムが自身の内部状態を扱う方法を再定義することにより、破棄されるはずの要約を持続的なメモリへと変えることで機能する。この変化は、AIシステムが扱えるテキストの長さを制限してきた構造的なコストを取り除く。これらの知見は、このアプローチによって、コンテキストの長さの制限がもはや障壁ではなくなり、あらゆるサイズの文書を一定の速度と精度で読み取り、理解できるシステムが可能になることを示している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →