← Nieuwste papers
🔬 condensed matter

Criticality in Neural Network Function Space through Wilsonian Fixed Points and Finite-Width Corrections

Dit artikel stelt een Wilsoniaans kader voor dat neurale netwerken met een eindige breedte interpreteert als interagerende kwantumveldentheorieën die voortkomen uit een Gaussisch vast punt, waarbij kritikaliteit ontstaat door correcties van de eindige breedte die niet-Gaussische interacties introduceren, waardoor de netwerkarchitectuur en trainingsdynamiek worden gekoppeld aan het ontstaan van complexiteit, expressiviteit en fase-achtige gedragingen in de functieruimte.

Oorspronkelijke auteurs: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

Gepubliceerd 2026-08-24
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Deep learning heeft de manier waarop machines zien, spreken en redeneren getransformeerd, maar de wiskundige machinerie achter deze systemen blijft voor de meesten een zwarte doos. In het hart van dit mysterie ligt een fundamentele vraag: wat gebeurt er eigenlijk binnen een neuraal netwerk wanneer het leert? Traditioneel hebben wetenschappers deze systemen beschouwd als enorme collecties aanpasbare getallen, of parameters, waarbij het doel is om deze getallen af te stemmen om fouten te minimaliseren. Echter, een meer abstract perspectief is opgekomen dat suggereert dat een neuraal netwerk beter begrepen kan worden, niet door zijn interne instellingen, maar door de waarschijnlijkheidsverdeling van de functies die het kan produceren. In dit visie is het netwerk een generator van mogelijkheden, en wordt het gedrag bepaald door de vorm van de functies die het creëert in plaats van door de specifieke knoppen waar het aan draait. Deze verschuiving in perspectief stelt onderzoekers in staat om instrumenten uit de statistische fysica en kwantumveldentheorie toe te passen om te begrijpen hoe deze systemen zichzelf organiseren, met name wanneer ze extreem breed zijn of wanneer ze tot de rand van stabiliteit worden gedreven.

Een team van onderzoekers aan Macquarie University en Charles Sturt University heeft dit abstracte visie genomen en een nieuw kader ontwikkeld om te verklaren waarom neurale netwerken zich zo gedragen als ze doen. Zij stellen voor dat het gedrag van deze netwerken begrepen kan worden door de lens van "criticaliteit", een staat die wordt aangetroffen in fysieke systemen waarbij materie gepositioneerd is tussen orde en chaos. In hun analyse behandelen zij het geïdealiseerde, oneindig brede neurale netwerk als een simpel, voorspelbaar basisniveau, vergelijkbaar met een kalm, vlak landschap. Vervolgens onderzoeken zij wat er gebeurt wanneer het netwerk een eindige omvang heeft, wat kleine, complexe interacties introduceert die deze eenvoud verstoren. De onderzoekers betogen dat deze effecten van eindige grootte niet louter technische fouten zijn die genegeerd moeten worden, maar dat ze juist de bron zijn van het vermogen van het netwerk om complexe patronen te leren en rijke gedragingen uit te drukken.

De kern van hun werk omvat het herinterpreteren van de relatie tussen de omvang van een netwerk en de complexiteit ervan. Jarenlang was de heersende intuïtie in het veld dat het toevoegen van meer parameters een systeem complexer en moeilijker te controleren maakt. De auteurs dagen dit uit door te laten zien dat in de taal van de functieruimte het breder maken van een netwerk het gedrag juist vereenvoudigt. Naarmate het netwerk oneindig breed wordt, wordt de output perfect voorspelbaar en volgt het een eenvoudige statistische regel bekend als een Gaussisch proces, waarbij alle complexe interacties verdwijnen. In deze oneindige limiet is het netwerk in essentie "vrij" en mist het de ingewikkelde verbindingen die nodig zijn om moeilijke, echte problemen te modelleren. De onderzoekers suggereren dat de ware kracht van een neuraal netwerk voortkomt uit de eindige omvang van de lagen, die deze noodzakelijke interacties opnieuw introduceert.

Om dit begrijpelijk te maken, gebruiken de auteurs een methode geleend uit de natuurkunde genaamd de Wilsoniaanse benadering, die bestudeert hoe systemen veranderen wanneer men ze vanuit verschillende schalen bekijkt. Zij identificeren de oneindige breedte-limiet als een vast punt, een stabiele staat waar het systeem naar neigt. De eindige breedte van echte netwerken werkt als een perturbatie, een kleine duw weg van deze perfecte stabiliteit. De onderzoekers classificeren deze duwen in drie categorieën: sommige vervagen naarmate het netwerk breder wordt, sommige groeien om het systeem te domineren, en andere bevinden zich op een delicate grens waar ze afgestemd kunnen worden om kritiek gedrag te creëren. Zij vinden dat de meest interessante en nuttige eigenschappen van neurale netwerken — zoals hun vermogen om te generaliseren van beperkte data en hun capaciteit om complexe structuren te leren — ontstaan wanneer het netwerk opereert nabij deze kritieke grens.

Het artikel biedt verschillende concrete manieren om dit gedrag te meten. De onderzoekers tonen aan dat naarmate een netwerk breder wordt, het verschil tussen de werkelijke output en de geïdealiseerde oneindige breedte-voorspelling op een voorspelbare manier afneemt, volgens een specifieke wiskundige vervalcurve. Zij demonstreren dat de "geconnecteerde" delen van het netwerk, die complexe, niet-lineaire interacties tussen verschillende inputs vertegenwoordigen, zwakker worden naarmate de breedte toeneemt. Dit bevestigt dat overparameterisatie, vaak gedacht als het toevoegen van complexiteit, in feite een proces is van het onderdrukken van deze interacties en het bewegen van het systeem naar een simpelere, meer Gaussische staat. Daarentegen behoudt een netwerk met een eindige breedte deze interacties, waardoor het kan ontsnappen aan eenvoudige statistische regels en de nuances van echte data kan vangen.

Een belangrijke bevinding van de studie is de herdefinitie van de "rand van chaos", een concept dat de grens beschrijft tussen een netwerk dat te rigide is om te leren en een netwerk dat te chaotisch is om te controleren. De auteurs brengen deze grens in kaart binnen hun kader, en laten zien dat dit overeenkomt met een kritiek oppervlak waar correlaties tussen inputs en outputs persistent blijven over vele lagen zonder in te storten of te exploderen. In dit nabij-kritieke regime is het netwerk gevoelig genoeg om nieuwe patronen te leren, maar stabiel genoeg om wat het heeft geleerd vast te houden. Zij betogen dat het trainen van een neuraal netwerk effectief een proces is van het vervormen van de onderliggende statistische structuur, waarbij het netwerk beweegt van een willekeurig startpunt naar een regio waar deze kritieke interacties in balans zijn.

De onderzoekers adresseren ook het mysterie van generalisatie, oftewel waarom grote netwerken vaak beter presteren op ongeziene data ondanks het hebben van meer parameters dan trainingsvoorbeelden. Hun kader suggereert dat generalisatie optreedt wanneer training de specifieke, ruisende interacties onderdrukt die de trainingsdata te nauwkeurig aanpassen, terwijl de bredere, stabiele structuren die van toepassing zijn op de echte wereld behouden blijven. Overfitting daarentegen gebeurt wanneer het netwerk deze specifieke, onstabiele interacties versterkt. Door het netwerk te bekijken door de lens van effectieve veldentheorie, bieden de auteurs een manier om onderscheid te maken tussen nuttige complexiteit en schadelijke ruis, waarbij zij suggereren dat de best presterende netwerken diegenen zijn die zich in een gecontroleerd, kritiek regime bevinden waar effecten van eindige breedte sterk genoeg zijn om expressief te zijn, maar niet zo sterk als om instabiliteit te veroorzaken.

Uiteindelijk biedt dit werk een nieuw vocabulaire voor het begrijpen van neurale netwerken, waarbij de focus verschuift van het aantal parameters naar de structuur van de functies die zij produceren. Het suggereert dat de magie van deep learning niet voortkomt uit het hebben van meer knoppen om aan te draaien, maar uit het vinden van de juiste balans waarbij het systeem complex genoeg is om te leren, maar simpel genoeg om te generaliseren. De auteurs stellen voor dat toekomstig onderzoek zich moet richten op het direct meten van deze kritieke eigenschappen, door te kijken naar hoe correlaties en interacties evolueren tijdens de training, in plaats van alleen de loss function te volgen. Door neurale netwerken te behandelen als interagerende fysieke systemen, opent deze benadering de deur naar een meer systematisch begrip van hoe kunstmatige intelligentie leert, en biedt het een pad naar het ontwerpen van betere architecturen en trainingsmethoden gebaseerd op de fundamentele principes van criticaliteit en schaal.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →