← Neueste Arbeiten
🤖 machine learning

On the Infinite Width and Depth Limits of Predictive Coding Networks

Diese Arbeit untersucht die unendlichen Breiten- und Tiefenlimits von Predictive Coding Networks, leitet stabile Parametrisierungen ab, die Trainingsexplosionen verhindern, und zeigt auf, dass die Gradienten des Predictive Coding in breiten Netzwerken gegen die Backpropagation-Gradienten konvergieren und somit einen biologisch plausiblen lokalen Lernmechanismus für tiefe Architekturen bieten.

Ursprüngliche Autoren: Francesco Innocenti, El Mehdi Achour, Rafal Bogacz

Veröffentlicht 2026-08-11
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Francesco Innocenti, El Mehdi Achour, Rafal Bogacz

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem riesigen, vielschichtigen Roboterteam beizubringen, ein Rätsel zu lösen. In der Welt der künstlichen Intelligenz ist die Standardmethode hierfür als „Backpropagation“ bekannt. Es ist wie ein strenger Manager, der am ganz Ende des Fließbandes steht, den finalen Fehler betrachtet und dann ganz zurück zum Anfang rennt, um jedem einzelnen Roboter lautstark Anweisungen zu brüllen, wie genau er versagt hat. Das funktioniert für Computer unglaublich gut, aber es ist eine Methode, die sich von der Art und Weise unterscheidet, wie die Natur operiert. Echte Gehirne haben keinen zentralen Manager, der Anweisungen rückwärts durch die Zeit brüllt; stattdessen weiß jeder Neuron nur, was seine unmittelbaren Nachbarn tun.

Hier kommt die „Predictive Coding“-Theorie ins Spiel, die suggeriert, dass Gehirne eher wie eine Gruppe von Freunden lernen, die versuchen, das Wetter vorherzusagen. Jeder Mensch (Neuron) stellt eine Vorhersage basierend auf dem, was seine Nachbarn sagen, verspürt einen kleinen „Fehler“, wenn seine Vermutung falsch ist, und passt seine eigene Aktivität an, um besser dazuzupassen. Sobald alle aufhören zu streiten und eine ruhige Einigung (Gleichgewicht) erreichen, passen sie ihre Verbindungen leicht an, um es beim nächsten Mal besser zu machen. Diese Methode ist biologisch realistisch, weil jeder nur mit seinen Nachbarn spricht, aber lange Zeit waren sich Wissenschaftler nicht sicher, ob sie die massiven, tiefen Netzwerke bewältigen könnte, die für moderne KI benötigt werden. Könnte diese lokale, gesprächige Methode tatsächlich auf die Größe eines Supercomputers skalieren, oder würde sie in sich zusammenbrechen?

Diese Arbeit befasst sich mit genau dieser Frage, indem sie untersucht, was passiert, wenn man diese Netzwerke unendlich breit (indem man Unmengen an Neuronen nebeneinander anordnet) und unendlich tief (indem man Unmengen an Schichten übereinander stapelt) macht. Die Forscher Francesco Innocenci, El Mehdi Achour und Rafal Bogacz wollten wissen: Können wir die „Regler“ dieser Predictive-Coding-Netzwerke so abstimmen, dass sie stabil bleiben und effektiv lernen, genau wie die Standard-Backpropagation-Netzwerke, die wir heute verwenden?

Ihre Untersuchung offenbart eine überraschende Wendung. Sie fanden heraus, dass Predictive Coding auf einer massiven Skala funktionieren muss, wenn es exakt dieselben Einstellungen und Skalierungsregeln wie die Standard-Backpropagation-Methode verwendet. Wenn man versucht, die „Standard“-Einstellungen zu verwenden, die die meisten Menschen in Software wie PyTorch nutzen, wird der Output des Predictive-Coding-Netzwerks mit zunehmender Breite in ein Chaos explodieren, ähnlich wie ein Mikrofon, das zu nah an einem Lautsprecher platziert wurde. Wenn man jedoch zu einem spezifischen, mathematisch präzisen Satz von Regeln wechselt (bekannt als „Mean-Field“- oder „Maximal Update“-Parametrisierung), stabilisiert sich das Netzwerk.

Unter diesen stabilen Bedingungen zeigt die Arbeit, dass die Art und Weise, wie Predictive Coding lernt, wenn das Netzwerk unendlich breit wird, fast ununterscheidbar von Backpropagation ist. Tatsächlich sind für Netzwerke, die viel breiter als sie tief sind (denken Sie an einen breiten, flachen Pfannkuchen statt eines hohen, schmalen Turms), die „lokalen“ Updates von Predictive Coding perfekt mit den „globalen“ Updates von Backpropagation abgestimmt. Die Autoren haben dies mathematisch für einfache lineare Netzwerke bewiesen und es mit Experimenten an komplexen, nicht-linearen Modellen wie Convolutional Neural Networks (CNNs) und Transformern bestätigt.

Die Studie schließt auch einige spannende Möglichkeiten aus. Sie deutet darauf an, dass die „schnelle“ Lerngeschwindigkeit, die einige Forscher bei tieferen-als-breiten Netzwerken mit älteren Einstellungen beobachteten, eigentlich eine Illusion war, die durch Instabilität verursacht wurde; diese Einstellungen brechen zusammen, wenn das Netzwerk wächst. Darüber hinaus legt das Paper zwar nahe, dass das Gehirn eine lokale Lernregel ähnlich wie Predictive Coding verwenden könnte, um die Kraft von Backpropagation zu erreichen, merkt aber an, dass dies nur effizient funktioniert, wenn das Gehirn „viel breiter als tief“ ist – eine Hypothese, die mit dem aktuellen biologischen Verständnis des Kortex übereinstimmt.

Letztendlich sagt diese Arbeit nicht nur „Predictive Coding funktioniert“, sondern zieht eine strikte Grenze darum, wie es funktionieren kann. Sie sagt uns, dass wir, um diese biologisch plausible Methode auf die Größe moderner KI zu skalieren, nicht einfach wahllos an den Reglern drehen können; wir müssen dieselbe rigorose mathematische Skalierung übernehmen, die auch die Standard-KI erfolgreich macht. Dies ist ein entscheidender Schritt nach vorn, der darauf hindeutet, dass das Gehirn tatsächlich einen lokalen, energie-minimierenden Tanz nutzen könnte, um dieselben komplexen Probleme zu lösen, die unsere global durch Backpropagation trainierten Computer heute lösen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →