← 最新の論文
💬 NLP

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

本論文は、明示的な位置エンコーディングを排除するために因果的状態空間方程式を統合して自己注意機構の前に逐次的な情報を暗黙的に符号化する、研究および教育目的のための完全なエンドツーエンドのトレーニングパイプラインを提供するオープンソースの小型言語モデル、ZetaGPTを紹介するものである。

原著者: Róisín Luo

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Róisín Luo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに物語の読み方を教えようとしている場面を想像してみてください。長い間、これを教えるための最善の方法は、ロボットが読むすべての単語に対して特別な「ステッカー」を与えることでした。もしロボットが「cat(猫)」という単語を見つけたら、それが「最初の単語」であることを示す「第1単語」ステッカーが付いていましたし、「dog(犬)」を後で見つけた場合は「第5単語」ステッカーが付いていました。もしこれらのステッカーがなければ、ロボットは混乱してしまい、「The cat chased the dog(猫が犬を追いかけた)」と「The dog chased the cat(犬が猫を追いかけた)」を、単なる材料の混ざり合った塊として同じものだと判断してしまうでしょう。このように単語にラベルを貼る手法は「位置エンコーディング(positional encoding)」と呼ばれ、今日私たちが使用しているほぼすべてのスマートな言語モデルの標準的なルールブックとなってきました。

しかし、もしロボットにステッカーが全く必要なかったらどうでしょう?もし、ラベルを見る代わりに、ロボットが物語を読む中でその順序を「感じ取る」ことができたら?それが、この論文が投げかける大きな問いです。この論文は、そのような「ステッカーなし」で読む言語モデルを構築する新しい方法を探求しています。その代わりに、読み進めるにつれて自然に更新される「メモリ・ループ」を使用します。これは、単語の順序を明示的に教えられなくても、モデルが自律的に順序を理解できる仕組みを構築できる可能性があるため重要です。これにより、モデルをより賢く、効率的に、そして長い物語の中で迷うことなく扱えるようにできるかもしれません。

この論文の核心的なアイデア:ZetaGPT

この論文の著者は、まさにそれを実行しようとする小さなオープンソース言語モデル、ZetaGPTを紹介しています。主な発見は、モデルのアテンション・メカニズムの直前に特別な「因果的状態空間モジュール(causal state-space module)」を配置することで、モデルが自身の内部ダイナミクスを通じて単語の順序を暗黙的に学習できるということです。

標準的な言語モデルを、テストを受けている学生に例えてみましょう。その学生は、「問題1」「問題2」などと書かれた参照シート(位置エンコーディング)を見ることが許可されています。一方、ZetaGPTは、これまでの物語の記憶に完全に頼らなければならない学生のようなものです。学生が各単語を読み進めるにつれ、その内部状態が変化し、その瞬間の物語に対するユニークな「指紋(フィンガープリント)」を作り出します。論文は、この内部的な指紋があれば、外部からの助けを借りずとも、「おい、この単語はあの単語の後に来るんだよ」とモデルに伝えるのに十分であることを示唆しています。

その仕組み:メモリ・ループ

ZetaGPTがどのようにこれを実現しているのかを理解するために、リレーレースを想像してみてください。通常のレースでは、バトンが渡され、全員がただ走ります。ZetaGPTのバージョンでは、ランナー(モデル)は、通り過ぎた場所に応じて形や重さが変わる特別なバックパック(状態空間モジュール)を背負っています。

  1. バックパック(状態空間モジュール): モデルが文のつながりを理解するために全体を見渡すプロセス(「自己アテンション」と呼ばれるプロセス)を行う前に、まず単語をこのバックパックに通します。このバックパックは「回帰的(recurrent)」なシステムであり、過去を記憶しています。新しい単語が入ってくるたびに、バックパックは前の単語に基づいて内部状態を更新します。
  2. 進化: 論文は、このバックパックがトレーニングを通じて、異なる「メモリ・ホライゾン(記憶の地平線)」を発展させることを学習することを示しています。バックパックの一部は直前の数単語だけを記憶し(短期記憶)、他の部分は物語の長い範囲を記憶します(長期記憶)。
  3. 結果: 単語がバックパックを出てメインのアテンション層に入る頃には、それはもはや単なる生の単語ではありません。「位置を認識した」単語となっています。それは、文の中のどこにいたかという履歴を携えています。論文では、トレーニング中にモデルがこれらの異なるメモリ・タイムスケールを使用してシーケンスをエンコードすることを自然に学習し、他のモデルで使用されている「ステッカー(位置エンコーディング)」の必要性を事実上代替していることが観察されています。

論文が否定したもの、そして見出したもの

この論文は、機能する言語モデルを構築するために、明示的な位置エンコーディング(前述の「ステッカー」のようなもの)を必ず使用しなければならないという考えに明確に反対しています。位置情報は、外部から注入される「アーキテクチャ的に獲得された能力」であるという概念を拒絶しています。代わりに、この情報はモデル自身のダイナミクスの「固有の特性」になり得ると提案しています。

著者は、ZetaGPTが機能することを見出しました。彼らは、それぞれ3,440万1億5,920万4億7,990万のパラメータを持つ3つのバージョンのモデル(Small, Medium, Large)を訓練しました。彼らは、これらのモデルが、位置エンコーディングを一度も与えられることなく、文章の次の単語を予測することを学習できることを示しました。

しかし、論文は自身の自信について慎重です。彼らは、言語モデリングの問題を「解決した」とも、ZetaGPTがビッグテック企業が使用している巨大なモデルよりも優れているとも主張していません。実際、著者は自分たちのモデルが小さく、比較的限定的なデータセット(WikiText-103コーパス)で訓練されたものであることを認めています。モデルが小さいため、訓練されたコンテキストも短かった(256、512、1024トークン)と述べています。論文は、このアーキテクチャがこれらの小規模なスケールでは機能するものの、一度に数百万語を読む巨大なモデルでも同様に機能するかどうかはまだ分かっていないことを示唆しています。

全行程:ゼロからの構築から推論まで

この論文の最も遊び心に満ちた完全な部分の一つは、単にモデルを示すだけでなく、それを構築するための「レシピ」のすべてを示している点です。著者は、生のバイトから始まり、語彙を50,259個のシンボルへとマージしていく、ゼロからの「トークナイザー(テキストを数字に変換する翻訳機)」を含む、完全なオープンソースのパイプラインを提供しています。

  • トークナイザー: まず、生のバイトから始めて、50,259個のシンボルの語彙へと統合していく「トークナイザー」をゼロから構築しました。
  • トレーニング: 次に、モデルを事前学習し、次に指示に従うように微調整(ファインチューニング)を行い、さらにAIが人間からのフィードバックから学ぶのを助けるための「報酬モデル(reward model)」を訓練しました。
  • 「アハ体験」の瞬間: 最後に、Group Relative Policy Optimization(GRPO)という手法を用いて、モデルに「思考の連鎖(Chain-of-Thought)」による推論を教えました。これは、モデルが事前にステップを明示的に示されることなく、人間が数学の問題を解くときのように、ステップ・バイ・ステップで考えることを学ぶプロセスです。論文は、この推論能力が強化学習を通じて直接「創発(emerge)」できることを示唆しています。

限界

著者は、自身の研究の境界線について非常に正直です。彼らは、主な限界はモデル自体の欠陥ではなく、計算リソースによるものであると述べています。無限のパワーを持つスーパーコンピュータを利用できなかったため、現代の巨大なモデルが使用するような大規模なデータセット(数兆トークン)で訓練することができませんでした。その結果、彼らのモデルはそれらの巨大なシステムが持つ広大な世界知識は持っていません。

また、非常に長いテキストで訓練できなかったため、この「ステッカーなし」のアプローチが極めて長い物語に対して同様に機能するかどうかは、まだ十分にテストされていないことも指摘しています。論文は、ZetaGPTが「コンパクトなリファレンス実装」であり、位置情報がどのように暗黙的に学習され得るかを研究するための概念実証およびプレイグラウンド(実験場)であり、世界の巨大なAIモデルに取って代わる準備ができている完成品ではない、と結論づけています。

要約すると、ZetaGPTは、一言一言、旅路を記憶させることで、物語の順序を理解するように機械を教えられることを証明する、小さな「ステッカーなし」のロボットです。これは小さな一歩ですが、次世代の言語モデルをどのように構築できるかという新しい扉を開くものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →