← Nieuwste papers
🤖 machine learning

Coarse-Graining Hidden Representations: Unsupervised Neuron Selection via Mapping Entropy

Dit artikel stelt een ongesuperviseerde methode voor voor het selecteren van essentiële neuronen in overgeparameteriseerde neurale netwerken door het minimaliseren van mapping-entropie, een metriek gebaseerd op statistieken van verborgen activaties die effectief informatieve subnetwerken identificeert en de voorspellende prestaties onder sterke compressie verbetert zonder afhankelijk te zijn van labels of gradiënten.

Oorspronkelijke auteurs: Margherita Mele, Andrea Castagna, Roberto Menichetti, Raffaello Potestio, Alessandro Ingrosso

Gepubliceerd 2026-09-07
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Margherita Mele, Andrea Castagna, Roberto Menichetti, Raffaello Potestio, Alessandro Ingrosso

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne systemen van kunstmatige intelligentie, in het bijzonder de diepe neurale netwerken die alles van beeldherkenning tot vertaling van taal aandrijven, zijn gebouwd met een overschot aan onderdelen. Om een taak te leren, bevatten deze systemen vaak veel meer interne verwerkingseenheden, neuronen genoemd, dan strikt noodzakelijk is. Deze overvloed is geen fout; het is een kenmerk dat het netwerk in staat stelt om complexe patronen te leren en te generaliseren naar nieuwe situaties. Deze overvloed creëert echter een puzzel: als het netwerk zoveel extra onderdelen heeft, welke ervan doen dan eigenlijk het werk, en welke zijn louter redundant? Het begrijpen van dit onderscheid is cruciaal voor het efficiënter, sneller en begrijpelijker maken van deze systemen. De uitdaging ligt in het uitzoeken welke neuronen essentieel zijn zonder naar het uiteindelijke antwoord te kijken dat het netwerk produceert of gebruik te maken van de labels die het netwerk vertellen wat het goed of fout heeft gedaan. In plaats daarvan vragen onderzoekers zich af of de interne activiteit van het netwerk zelf — hoe de neuronen vuren en met elkaar interageren — het geheim bevat om de belangrijkste componenten te identificeren.

Een team van onderzoekers van de Universiteit van Trento en de Radboud Universiteit heeft deze vraag aangepakt door de interne staat van het netwerk te behandelen als een landschap dat vereenvoudigd kan worden. Ze richtten zich op de verborgen laag van een neuraal netwerk, het middelste gedeelte waar ruwe gegevens worden getransformeerd in abstracte kenmerken. Hun doel was om een manier te vinden om een kleinere groep neuronen uit deze grote menigte te selecteren die nog steeds het verschil tussen verschillende inputs even goed zou kunnen aangeven als de volledige groep. Om dit te doen, ontwikkelden ze een methode gebaseerd op een concept genaamd mapping-entropie. Stel je voor dat je een complexe scène probeert te beschrijven aan iemand die slechts een paar pixels tegelijk kan zien; als je de verkeerde pixels kiest, verlies je het vermogen om een kat van een hond te onderscheiden. De onderzoekers gebruikten een wiskundige maatstaf om precies te kwantificeren hoeveel informatie er verloren gaat wanneer een specifieke set neuronen wordt verwijderd. Door te zoeken naar de specifieke combinatie van neuronen die dit informatieverlies minimaliseert, konden zij de meest informatieve subset identificeren zonder ooit te hoeven weten wat het netwerk bedoeld was te classificeren.

De onderzoekers testten deze aanpak op twee verschillende manieren. Eerst gebruikten ze een gecontroleerde opstelling waarbij ze precies wisten hoe het netwerk georganiseerd moest zijn. In dit scenario definieerde een "leraar"-netwerk de juiste manier om informatie te verwerken, en probeerde een "student"-netwerk dit te leren. Wanneer het student-netwerk de leraar perfect kopieerde, identificeerde de methode succesvol de kleinste mogere groep neuronen die nog steeds de volledige structuur van de taak vastlegde. Echter, wanneer het student-netwerk geen perfecte kopie was en enkele extra, licht afwijkende variaties bevatte, selecteerde de methode automatisch een grotere groep neuronen om die extra variabiliteit op te vangen. Dit toonde aan dat de techniek gevoelig is voor de werkelijke statistische structuur van de data, en niet alleen voor een vooraf ingesteld idee van wat het antwoord zou moeten zijn.

In een tweede, complexere experiment trainden de onderzoekers een netwerk om twee soorten patronen van elkaar te onderscheiden die verschilden in de manier waarop hun onderdelen gecorreleerd waren. Terwijl het netwerk leerde, verdeelden de neuronen zich van nature in twee duidelijke groepen: sommige richtten zich op specifieke, gelokaliseerde delen van de input, terwijl andere reageerden op een breder, oscillerend patroon over de gehele input. De onderzoekers ontdekten dat de methode niet zomaar een willekeurige mix van deze twee groepen koos. In plaats daarvan koos de methode aan het begin van de training bijna uitsluitend de gelokaliseerde neuronen. Naarmate de training vorderde, verschoof de voorkeur van de methode en selecteerde zij uiteindelijk de oscillerende neuronen als de meest informatieve groep voor een grotere subsetgrootte. Dit toonde aan dat de techniek in staat is om bij te houden hoe de interne organisatie van het netwerk in de loop van de tijd verandert, door te identificeren welke vorm van representatie op dat moment de meest efficiënte manier was om de data te beschrijven.

Om te zien of deze geselecteerde groepen neuronen daadwerkelijk nuttig waren, hebben de onderzoekers de netwerken gesnoeid (pruning), waarbij ze alleen de door hun methode gekozen neuronen behielden en de rest verwijderden. Ze testten vervolgens hoe goed deze kleinere, ingekorte netwerken presteerden op de oorspronkelijke taken. De resultaten waren duidelijk: de netwerken die met deze methode waren gesnoeid, presteerden consequent beter dan netwerken waarbij neuronen willekeurig werden verwijderd. Dit voordeel was het meest uitgesproken wanneer het netwerk zwaar werd gecomprimeerd, wat betekende dat slechts een klein deel van de oorspronkelijke neuronen overbleef. Onder deze strikte omstandigheden maakte het vermogen van de methode om de juiste neuronen te vinden het verschil tussen een netwerk dat nog steeds patronen kon herkennen en een netwerk dat faalde. De studie paste deze techniek ook toe op een standaard beeldherkenningsopgave waarbij handgeschreven cijfers betrokken waren, waarbij het netwerk getraind werd om het verschil te zien tussen de cijfers één en zeven. Zelfs in deze realistische setting presteerde de methode beter dan willekeurige selectie, vooral wanneer het netwerk gedwongen werd te opereren met zeer weinig neuronen.

De bevindingen suggereren dat de statistische patronen van hoe neuronen vuren voldoende informatie bevatten om de meest kritieke delen van een neuraal netwerk te identificeren, zonder dat daarvoor naar de uiteindelijke output of de juiste antwoorden hoeft te worden gekeken. Dit biedt een nieuwe, volledig ongesuperviseerde manier om kunstmatige intelligentie te begrijpen en te comprimeren. Het impliceert dat de "intelligentie" van een netwerk niet alleen zit in de uiteindelijke beslissing, maar in de specifieke manier waarop de interne onderdelen zijn gerangschikt om onderscheid te maken tussen verschillende mogelijkheden. Hoewel de methode niet garandeert dat de absoluut beste reductie voor elke enkele taak wordt bereikt, biedt het een betrouwbare gids voor het vinden van efficiënte subsets van neuronen. Deze aanpak kan waardevol zijn voor het creëren van kleinere, snellere modellen die kunnen draaien op apparaten met beperkte rekenkracht, en het biedt een nieuw perspectief voor wetenschappers om te begrijpen hoe deze complexe systemen zichzelf organiseren om problemen op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →