非常に難しいパズルを解こうとしている場面を想像してみてください。標準的なコンピュータプログラム(一般的なAIなど)は、指示を一行ずつ読み、厳格に単一の経路に従ってパズルを解こうとします。パズルが難しくなると、プログラムは単に読み取る速度を上げたり、より多くのメモリを使用したりしますが、簡単な部分で時間を無駄にすることなく、難しい部分に対して異なる方法で「立ち止まって考える」ことはできません。
この論文は、Thoughtbubblesと呼ばれる新しい手法を紹介しています。その仕組みを、簡単な比喩を用いて説明します。
1. 問題点:「一律対応」の工場
標準的なAIモデルを、工場の組立ラインだと考えてみてください。すべてのアイテム(文章の中のあらゆる単語)がラインを通り、同じ数の機械(レイヤー)を通過して進んでいきます。
- 問題点: 単純なアイテム(「the」のような単語)もあれば、複雑なアイテム(トリッキーな数学の問題など)もあります。工場はこれらを全く同じように扱います。簡単な単語に対しても、難しい単語に対しても、同じ時間とエネルギーを費やしてしまうのです。これは非効率的です。
2. 解決策:「バブル(泡)」による並列思考
著者らは、AIの動作における新しい方法を提案しています。単一のラインではなく、AIが思考プロセスを**フォーク(分岐)**できると想像してください。
- フォーク(分岐): AIが難しい単語や概念に遭遇したとき、単に前に進むだけではありません。思考プロセスを複数のコピーに「分岐」させます。その特定の思考を複数のコピーに分割し、それらが同時に、並行して問題を解くようにします。
- バブル(泡): これらのコピーは、ネットワークの中央で「バブル」と呼ばれる追加の思考力を形成します。それは、特定の難しいパズルを解くために集まった専門家チームのようなものです。
- プルーニング(枝刈り): もし思考が単純すぎる場合(「the」のように)、AIはバブルを作らず、そのまま通過させます。もし思考が複雑すぎたり役に立たなかったりする場合、AIは重要なもののためのスペースを作るために、それらのコピーを「削除」することができます。
3. 学習方法(「スコアカード」システム)
最も素晴らしい点は、AIがいつ分割したり統合したりするかを誰かが具体的に指示することなく、トレーニング中に自律的にこれを学習するという点です。
- スコア: すべての思考には、その重要性や難易度に基づいた隠れた「スコア」が付与されます。
- 決定: もしある思考のスコアが高ければ(難しい場合)、AIは「もっと長く考えるために、コピーを増やそう!」と判断します。スコアが低ければ、「これにエネルギーを浪費する必要はない。コピーは1つのままでいい」と判断します。
- 結果: AIは自然に、文章の中で混乱している部分や不確実な部分に対して、より多くの「脳の力」を使うことを学習します。
4. 「マージ(統合)」
これらすべてのコピーがバブルの中で追加の思考を終えた後、彼らは再び一つに集まります。AIはそれらの答えを平均化して、一つの最終的な結果を導き出します。それは、探偵グループが手がかりについて議論し、最終的な結論に合意するようなものです。
なぜこれが大きな意味を持つのか?
論文は、主に3つの勝利を主張しています。
- 自己学習型: AIに「ステップバイステップで考えて」といった具体的な手順を人間が書き起こす必要のある他の手法とは異なり、Thoughtbubblesはテキストを読むだけで、このスキルを自動的に学習します。
- 効率的: 研究者らは様々なサイズのモデルでこの手法をテストしました。彼らは、この手法が標準的なモデルと同等、あるいはそれ以上の性能を解決できる一方で、**半分のアドバイス(学習データ)**しか必要としなかったことを発見しました。それは、半分の燃料で走るフェラーリのエンジンを手に入れるようなものです。
- 集中すべき場所を知っている: AIは、テキストが混乱していたり不確実であったりする場所に正確に「バブル」を作成することを学習しました。簡単な単語に時間を浪費することなく、難しい部分に余剰のエネルギーを集中させたのです。
まとめ
Thoughtbubblesは、AIの新しい思考方法です。一列に並んで行進する代わりに、AIは難しい問題に取り組むために一時的にクローンのチームへと分裂し、その後再び統合することができます。AIはこれを自動的に学習するため、追加の人間による指示なしに、よりスマートかつ効率的に進化することができるのです。
技術要約:Thoughtbubbles
問題提起
現在のTransformerアーキテクチャは、固定された計算予算とワーキングメモリという根本的な限界に直面しています。Chain-of-Thought(CoT)のような手法は、複雑な問題をステップごとに分解することを可能にしますが、これらは逐次的に生成される自然言語トークンに依存しており、非効率的であるだけでなく、事前学習中に適用することもできません。「ポーズ・トークン」や追加の残差ストリームを挿入する代替アプローチも存在しますが、それらは手動のデザインを必要としたり、全レイヤーに一様に適用されたり(適応性に欠ける)、標準的な言語モデリングを超えた明示的な教師信号に依存したりすることが多々あります。モデルが明示的なステップバイステップの指示なしに、困難なトークンに対してより多くの「思考」を行えるよう、潜在空間において並列的な計算を動的に、かつ教師なしで割り当てることができるアーキテクチャが求められています。
手法:Thoughtbubbles
著者らは、潜在空間における並列的な適応計算をネイティブに行うTransformerの変種であるThoughtbubblesを提案しています。コアとなるメカニズムは、フォワードパス中に残差ストリームを動的に「フォーク(分岐)」または削除することを学習することです。
コアメカニズム
フォークと残差ストリーム:
- モデルは、Transformerレイヤー間で「フォーク(分岐)」操作を導入します。各残差ストリーム xi(k) に対して、モデルは「キープ・スコア(保持スコア)」と「フォーク・スコア(分岐スコア)」を計算します。
- これらのスコアは、前のレイヤーから伝播してきた「累積スコア」によって乗算され、そのストリームの重要度を決定します。
- これらのスコアに対してトップk選択が適用され、どのストリームを保持し、どれをフォーク(複製)するかを決定します。ストリームがフォークされた場合、新しい残差ストリームが作成され、その特定のトークンのための潜在計算の「バブル(泡)」が形成されます。
- 予測のためのソースを維持するため、最も右側の元のトークンは常に保持されるよう強制されます。
スコア減衰(Score Attenuation):
- 重要なストリームに高いスコアを割り当てるようモデルを訓練するために、著者らはアテンション機構と残差更新の両方を累積スコアを用いて減衰させます。
- 具体的には、アテンション・ロジットとバリュー・ベクトルがスコアによって変調されます。これにより、モデルは重要と判断したストリーム(高いスコア)にはより強く依存し、削除しようとしているストリーム(低いスコア)には依存しないよう強制されます。これは、困難なトークンが自然に計算リソースを蓄積していくという自己強化ループを生み出します。
位置エンベディング(Positional Embeddings):
- 変動するフォークの数に対処するため、著者らは回転位置エンベディング(RoPE)を修正しています。フォークされたトークンに対して、フォークの数に比例した「部分的な回転」を適用することで、同じトークンのフォークが位置空間において互いに「近く」留まるようにしています。
出力集約:
- 最終レイヤーにおいて、モデルは各残差ストリームを個別にデコードします。
- 最終的な出力分布は、累積スコアによって決定される重み付き平均となります。
- 1.9Bパラメータ規模のモデルにおける効率性のために、より安価な近似が使用されます。すなわち、最終的なソフトマックス投影を適用する前に、残差ベクトル自体を平均化します。
推論戦略:
- 著者らは、自己回帰的な生成のための**動的フォーク(dynamic forking)**を導入しています。推論予算(κ)は、短いシーケンスが長いシーケンスと比較して過度にフォークしてしまうという分布シフトを防ぐため、入力シーケンス長に比例してスケールされます。
主な貢献
- 教師なし適応計算: Thoughtbubblesは、教師なしで動的な潜在並列計算の割り当てを可能にする初のアーキテクチャです。これは標準的なデコーダーのみの言語モデルとして、追加の教師信号や明示的な推論トレースなしに、言語モデリング損失のみを用いて訓練されます。
- 性能の効率性: この手法は、1.9Bスケールにおいて、標準的なデコーダーや非適応的な並列計算のベースライン(例:複製されたフィラー・トークン)と比較して、半分の訓練トークン予算のみを使用しながら、優れた性能を達成しています。
- スケーラビリティ: 150Mから1.9Bパラメータの範囲のモデルサイズにわたって、一貫した性能向上を示しています。特筆すべきは、319MのThoughtbubblesモデルが、パープレキシティにおいて772Mのベースラインを上回っている点です。
- 解釈可能性: モデルは、不確実性が高い領域(高い事後エントロピー)に対して計算を割り当てることを自律的に学習しており、「困難なトークンにはより多くの『思考』が必要である」という仮説と一致しています。
結果
- ゼロショット評価: 一連のゼロショットベンチマーク(LAMBADA, HellaSwag, BLiMP, AI2-ARC, PIQA)において、Thoughtbubblesはパラメータ数および計算量が一致するベースラインを一貫して上回っています。
- GSM8K推論: ベースラインの半分のトークン予算を使用しながら、1.9BのThoughtbubblesモデルは数学推論データセットであるGSM8Kにおいて競争力のある結果を達成しています。
- パープレキシティ: モデルは、すべての評価において最も低いパープレキシティを達成しており、一部のケースではより大きなベースラインモデルをも凌駕しています。
- アブレーション研究:
- アテンション・マスキング(減衰)を取り除くと性能が著しく低下し、フォーク/キープの決定を訓練するためのスコアベースの変調の必要性が確認されました。
- フォークされたトークンのロジットを単純に平均化する手法は、右端のトークンのみを保持する手法よりも優れた性能を示し、並列ストリームの有用性を裏付けました。
- フォークをすべてのレイヤーに拡張しても、わずかな利得しか得られず、初期レイヤーでのフォークがほとんどのタスクにおいて十分であることを示唆しています。
重要性と主張
本論文は、Thoughtbubblesが訓練時とテスト時のスケーリング挙動を統一する重要なステップであると主張しています。CoTが事前学習中にステップごとの指示への露出を必要とするのに対し、Thoughtbubblesは標準的な事前学習フェーズ中に、適応的な計算を暗黙的に行うことを学習します。
著者らは、この手法がTransformerにおける**入力適応性(input-adaptivity)**を解き放つものであると考えています。これにより、モデルは特定のトークンに対してワーキングメモリと計算の深さを動的に拡張することで、複雑で多段階の問題を解決できるようになります。この研究は、潜在的な適応計算が、固定予算のアーキテクチャや明示的な逐次推論トレースの限界を超え、言語モデルの事前学習における標準的かつ統合されたコンポーネントとなる未来を示唆しています。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録