← Neueste Arbeiten
🔬 condensed matter

Criticality in Neural Network Function Space through Wilsonian Fixed Points and Finite-Width Corrections

Dieses Paper schlägt einen Wilsonschen Rahmen vor, der endliche neuronale Netze als interagierende Quantenfeldtheorien interpretiert, die aus einem Gaußschen Fixpunkt hervorgehen, wobei Kritikalität durch endliche Breite-Korrekturen entsteht, die nicht-Gaußsche Wechselwirkungen einführen, und somit die Netzwerkarchitektur und Trainingsdynamik mit dem Entstehen von Komplexität, Expressivität und phasenähnlichen Verhaltensweisen im Funktionsraum verknüpft.

Ursprüngliche Autoren: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

Veröffentlicht 2026-08-24
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Deep Learning hat die Art und Weise transformiert, wie Maschinen sehen, sprechen und schlussfolgern, doch die mathematische Mechanik hinter diesen Systemen bleibt für die meisten eine Black Box. Im Zentrum dieses Mysteriums steht eine grundlegende Frage: Was geschieht eigentlich in einem neuronalen Netzwerk, während es lernt? Traditionell haben Wissenschaftler diese Systeme als riesige Sammlungen anstellbarer Zahlen, oder Parameter, betrachtet, bei denen das Ziel darin besteht, diese Zahlen zu optimieren, um Fehler zu minimieren. Eine abstraktere Perspektive ist jedoch entstanden, die nahelegt, dass ein neuronales Netzwerk besser verstanden werden kann, nicht durch seine internen Einstellungen, sondern durch die Wahrscheinlichkeitsverteilung der Funktionen, die es erzeugen kann. In dieser Sichtweise ist das Netzwerk ein Generator von Möglichkeiten, und sein Verhalten wird durch die Form der Funktionen definiert, die es erschafft, statt durch die spezifischen Knöpfe, an denen es dreht. Dieser Perspektivwechsel ermöglicht es Forschern, Werkzeuge aus der statistischen Physik und der Quantenfeldtheorie anzuwenden, um zu verstehen, wie sich diese Systeme organisieren, insbesondere wenn sie extrem breit sind oder an die Grenze der Stabilität getrieben werden.

Ein Team von Forschern der Macquarie University und der Charles Sturt University hat diese abstrakte Sichtweise übernommen und einen neuen Rahmen entwickelt, um zu erklären, warum neuronale Netzwerke sich so verhalten, wie sie es tun. Sie schlagen vor, dass das Verhalten dieser Netzwerke durch die Linse der „Kritikalität“ verstanden werden kann – ein Zustand, den man in physikalischen Systemen findet, in dem Materie zwischen Ordnung und Chaos positioniert ist. In ihrer Analyse behandeln sie das idealisierte, unendlich breite neuronale Netzwerk als eine einfache, vorhersehbare Basislinie, vergleichbar mit einer ruhigen, flachen Landschaft. Sie untersuchen dann, was passiert, wenn das Netzwerk eine endliche Größe besitzt, was kleine, komplexe Interaktionen einführt, die diese Einfachheit stören. Die Forscher argumentieren, dass diese Effekte endlicher Größe nicht bloß technische Fehler sind, die ignoriert werden sollten, sondern tatsächlich die Quelle der Fähigkeit des Netzwerks sind, komplexe Muster zu lernen und reiche Verhaltensweisen auszudrücken.

Der Kern ihrer Arbeit beinhaltet die Neuinterpretation der Beziehung zwischen der Größe eines Netzwerks und seiner Komplexität. Jahrelang war die vorherrschende Intuition auf diesem Gebiet, dass das Hinzufügen von mehr Parametern ein System komplexer und schwerer kontrollierbar macht. Die Autoren stellen dies in Frage, indem sie zeigen, dass im Sinne des Funktionsraums das Breiterwerden eines Netzwerks dessen Verhalten vereinfacht. Wenn das Netzwerk unendlich breit wird, wird sein Output perfekt vorhersagbar und folgt einer einfachen statistischen Regel, bekannt als Gauß-Prozess, bei dem alle komplexen Interaktionen verschwinden. In diesem unendlichen Limit ist das Netzwerk im Wesentlichen „frei“ und verfügt nicht über die komplizierten Verbindungen, die nötig sind, um schwierige reale Probleme zu modellieren. Die Forscher legen nahe, dass die wahre Kraft eines neuronalen Netzwerks aus der endlichen Breite seiner Schichten resultiert, welche diese notwendigen Interaktionen wieder einführt.

Um dies begreiflich zu machen, nutzen die Autoren eine aus der Physik entlehnte Methode namens Wilson-Ansatz, der untersucht, wie sich Systeme verändern, wenn man sie aus verschiedenen Skalen betrachtet. Sie identifizieren das unendlich breite Limit als einen Fixpunkt – einen stabilen Zustand, dem das System zustrebt. Die endliche Breite realer Netzwerke wirkt dabei als Perturbation, ein kleiner Stoß weg von dieser perfekten Stabilität. Die Forscher klassifizieren diese Stöße in drei Kategorien: Einige verblassen, wenn das Netzwerk breiter wird, einige wachsen an, um das System zu dominagen, und andere liegen auf einer empfindlichen Grenze, wo sie fein abgestimmt werden können, um kritisches Verhalten zu erzeugen. Sie finden heraus, dass die interessantesten und nützlichsten Eigenschaften neuronaler Netzwerke – wie ihre Fähigkeit, aus begrenzten Daten zu generalisieren und komplexe Strukturen zu lernen – entstehen, wenn das Netzwerk nahe dieser kritischen Grenze operiert.

Die Arbeit liefert mehrere konkrete Wege, um dieses Verhalten zu messen. Die Forscher zeigen, dass mit zunehmender Breite der Unterschied zwischen dem tatsächlichen Output und der idealisierten unendlich breiten Vorhersage auf eine vorhersagbare Weise schrumpft, indem er einer spezifischen mathematischen Abnahme folgt. Sie demonstrieren, dass die „verbundenen“ Teile des Netzwerks, die komplexe, nicht-lineare Interaktionen zwischen verschiedenen Inputs repräsentieren, schwächer werden, wenn die Breite zunimmt. Dies bestätigt, dass Überparametrisierung, die oft als das Hinzufügen von Komplexität missverstanden wird, eigentlich ein Prozess ist, der diese Interaktionen unterdrückt und das System in Richtung eines einfacheren, Gaußschen Zustands bewegt. Umgekehrt behält ein Netzwerk mit endlicher Breite diese Interaktionen bei, was ihm ermöglicht, sich von einfachen statistischen Regeln zu lösen und die Nuancen realer Daten zu erfassen.

Ein zentrales Ergebnis der Studie ist die Neudefinition des „Randes des Chaos“ (Edge of Chaos), ein Konzept, das die Grenze zwischen einem Netzwerk, das zu starr zum Lernen ist, und einem, das zu chaotisch zur Kontrolle ist, beschreibt. Die Autoren bilden diese Grenze auf ihren Rahmen ab und zeigen, dass sie einer kritischen Oberfläche entspricht, auf der Korrelationen zwischen Inputs und Outputs über viele Schichten hinweg bestehen bleiben, ohne zu kollabieren oder zu explodieren. In diesem nahezu kritischen Regime ist das Netzwerk empfindlich genug, um neue Muster zu lernen, aber stabil genug, um das Gelernte zu bewahren. Sie argumentieren, dass das Training eines neuronalen Netzwerks effektiv ein Prozess der Deformation seiner zugrunde liegenden statistischen Struktur ist, indem man es von einem zufälligen Startpunkt hin zu einer Region bewegt, in der diese kritischen Interaktionen ausbalanciert sind.

Die Forscher befassen sich auch mit dem Rätsel der Generalisierung, also der Frage, warum große Netzwerke oft besser bei ungesehenen Daten abschneiden, obwohl sie mehr Parameter als Trainingsbeispiele besitzen. Ihr Rahmenwerk legt nahe, dass Generalisierung eintritt, wenn das Training die spezifischen, verrauschten Interaktionen unterdrückt, die den Trainingsdaten zu eng folgen, während die breiteren, stabilen Strukturen bewahrt werden, die auf die reale Welt anwendbar sind. Overfitting hingegen geschieht, wenn das Netzwerk diese spezifischen, instabilen Interaktionen verstärkt. Indem sie das Netzwerk durch die Linse der effektiven Feldtheorie betrachten, bieten die Autoren einen Weg, zwischen nützlicher Komplexität und schädlichem Rauschen zu unterscheiden, und legen nahe, dass die leistungsfähigsten Netzwerke jene sind, die in einem kontrollierten, kritischen Regime liegen, in dem Effekte endlicher Breite stark genug sind, um expressiv zu sein, aber nicht so stark, um Instabilität zu verursachen.

Letztendlich bietet diese Arbeit ein neues Vokabular für das Verständnis neuronaler Netzwerke, indem sie den Fokus von der Anzahl der Parameter auf die Struktur der Funktionen verschiebt, die sie produzieren. Sie legt nahe, dass die Magie des Deep Learning nicht daraus besteht, mehr Regler zum Drehen zu haben, sondern den richtigen Ausgleich zu finden, bei dem das System komplex genug ist, um zu lernen, aber einfach genug, um zu generalisieren. Die Autoren schlagen vor, dass sich die zukünftige Forschung darauf konzentrieren sollte, diese kritischen Eigenschaften direkt zu messen, indem man untersucht, wie sich Korrelationen und Interaktionen während des Trainings entwickeln, anstatt lediglich die Loss-Funktion zu verfolgen. Indem sie neuronale Netzwerke als interagierende physikalische Systeme behandeln, eröffnet dieser Ansatz die Tür zu einem systematischeren Verständnis, wie künstliche Intelligenz lernt, und bietet einen Pfad zum Design besserer Architekturen und Trainingsmethoden basierend auf den fundamentalen Prinzipien der Kritikalität und Skalierung.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →