On the Infinite Width and Depth Limits of Predictive Coding Networks
本論文は、予測符号化ネットワークの無限の幅および深さの極限を調査し、学習の爆発を防ぐ安定したパラメータ化を導出し、さらに、広範なネットワークにおいて予測符号化の勾配がバックプロパゲーションの勾配に収束することを実証することで、深いアーキテクチャに対する生物学的に妥当な局所学習メカニズムを提示するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で多層的なロボットのチームに、パズルを解く方法を教えようとしている場面を想像してみてください。人工知能の世界では、この標準的な方法は「バックプロパゲーション(誤差逆伝播法)」と呼ばれています。それは、組み立てラインの最後尾に立つ厳格なマネージャーのようなものです。マネージャーは最終的なミスを確認すると、最初まで一気に遡って戻っていき、個々のロボットに対して、具体的にどのように間違えたのかを指示として叫びます。これはコンピュータにとっては非常に効果的ですが、自然界の仕組みとは異なる手法です。実際の脳には、時間を遡って指示を叫ぶ中央のマネージャーは存在しません。代わりに、個々のニューロンは隣接するニューロンが何をしているかしか知らないのです。
ここで「予測符号化(Predictive Coding)」という理論が登場します。これは、脳がまるで天気を予想しようとする友人たちのグループのように学習するという考え方です。各個人(ニューロン)は、隣人が言ったことに基づいて予測を行い、もし自分の予想が外れると、わずかな「誤差」を感じ、よりうまく適合するように自身の活動を調整します。全員が議論をやめて穏やかな合意(平衡状態)に達すると、彼らは次回の精度を高めるために、自分たちの接続をわずかに微調整します。この手法は、全員が隣人としか会話しないため、生物学的に現実的です。しかし、長らく科学者たちは、この手法が現代のAIに必要な大規模で深いネットワークを扱えるのかどうか確信を持てずにいました。このローカルで賑やかな手法は、スーパーコンピュータ級の規模にスケールアップできるのでしょうか、それとも崩壊してしまうのでしょうか?
本論文は、ネットワークを無限に広く(横方向に大量のニューロンを追加)、かつ無限に深く(垂直方向に大量の層を追加)した場合に何が起こるかを検証することで、まさにその問いに切り込んでいます。研究者のフランチェスコ・イノチェンティ、エル・メディ・アチュール、ラファル・ボガッツは、予測符号化ネットワークの「つまみ」を調整することで、今日私たちが使っている標準的なバックプロパゲーション・ネットワークと同様に、安定して効果的に学習させることができるのかを調べました。
彼らの調査は、驚くべき展開を明らかにしました。予測符号化が大規模に機能するためには、標準的なバックプロパゲーションと同じ設定とスケーリング規則を使用しなければならないという事実です。もし、多くの人がPyTorchなどのソフトウェアで使用している「標準的な」設定を使おうとすれば、予測符号化ネットワークの出力は、スピーカーに近づけすぎたマイクのように、広がるにつれて混沌とした爆発を起こしてしまいます。しかし、特定の数学的に精密なルール(「平均場」または「最大更新」パラメータ化として知られるもの)に切り替えれば、ネットワークは安定します。
この安定した条件下では、ネットワークが極めて広くなるにつれて、予測符号化の学習方法はバックプロパゲーションとほとんど区別がつかなくなることが示されています。実際、ネットワークが深さよりもはるかに広い場合(背の高い細い塔というよりも、幅広で浅いパンケーキのような場合)、予測符号化の「ローカルな」更新は、バックプロパゲーションの「グローバルな」更新と完璧に一致します。著者らは、単純な線形ネットワークを用いてこれを数学的に証明し、畳み込みニューラルネットワーク(CNN)やTransformerのような複雑な非線形モデルを用いた実験によってもこれを確認しました。
また、本研究はいくつかの刺激的な可能性についても否定しています。一部の研究者が、幅よりも深いネットワークにおいて古い設定を用いた際に見た「学習速度の速さ」は、実は不安定さによって引き起こされた錯覚であったことを示唆しています。それらの設定は、ネットワークが成長するにつれて崩壊してしまうのです。さらに、脳がバックプロパゲーションと同等の力を達成するために、予測符号化に似たローカルな学習規則を用いている可能性がある一方で、これは脳が「幅が深さよりもはるかに広い」場合にのみ効率的に機能するという仮説を述べており、これは現在の皮質に関する生物学的理解とも一致しています。
結局のところ、この研究は単に「予測符号化は機能する」と言っているだけではありません。それが「どのように」機能するかについて、厳格な境界線を引いています。この生物学的に妥当な手法を現代のAIの規模までスケールアップさせるためには、単にランダムに調整するのではなく、標準的なAIを機能させているのと同じ厳密な数学的スケーリングを採用しなければならない、ということを教えてくれます。これは、私たちの脳が、今日のグローバルなバックプロパゲーションで訓練されたコンピュータが解いているのと同じ複雑な問題を、ローカルでエネルギー最小化を目指すダンスを通じて解決しているのだということを示唆する、重要な一歩なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。