← Nieuwste papers
🔬 materials science

Pre-registered tests of solid-state-physics-inspired LLM compression: a cluster-level negative result at small-language-model scale

Deze vooraf geregistreerde studie, die gebruikmaakt van autonome onderzoeksagenten en een strikte 3-sigma beslissingspoort, stelde vast dat door de vaste-stoffen-fysica geïnspireerde compressie-afbeeldingen, waaronder die gebaseerd op Kohn-nabijheid en tensor-train-embeddings, er niet in slaagden kleine taalmodellen te comprimeren, maar in plaats daarvan onthulden dat hun aandachtmechanismen kritische of glasachtige gedragingen vertonen in plaats van de voorspelde isolator-achtige eigenschappen.

Oorspronkelijke auteurs: Jun-qiang Lu

Gepubliceerd 2026-09-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jun-qiang Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter de moderne kunstmatige intelligentie, in staat om met verbazingwekkende vloeiendheid te schrijven, te redeneren en te vertalen. Toch zijn deze systemen massief, met miljarden getallen, of parameters, die hun gedrag dicteren. Deze enorme omvang maakt ze duur in gebruik en moeilijk op te slaan, wat wetenschappers een fundamentele vraag doet stellen: hoeveel van deze complexiteit is eigenlijk noodzakelijk? Een populaire theorie suggereert dat deze modellen verborgen redundanties zouden kunnen bevatten, vergelijkbaar met een kristalrooster in een vast materiaal waar atomen in een voorspelbaar, geordend patroon zijn gerangschikt. In de natuurkunde maakt deze orde wetenschappers in staat om berekeningen te vereenvoudigen door aan te nemen dat interacties snel afnemen met de afstand, een concept dat bekend staat als een "area law" (oppervlaktewet). Als taalmodellen zich vergelijkbaar zouden gedragen, hoopten onderzoekers dat ze deze drastisch konden comprimeren door verre verbindingen af te snijden of hun interne structuren te vereenvoudigen zonder hun vermogen om taal te begrijpen te verliezen.

Een onderzoeker zette zich uit om deze specifieke idee met rigoureuze precisie te testen. Hij behandelde het taalmodel niet als een black box, maar als een fysisch systeem dat mogelijk dezelfde regels volgt als isolatoren in de vaste-stoffysica. Zijn hypothese was dat de verbindingen tussen woorden in een model exponentieel zouden afnemen, wat betekent dat een woord alleen een sterke invloed heeft op zijn directe buren, en dat de interne gewichten van het model geroteerd zouden kunnen worden naar een eenvoudigere, ijlere vorm. Om ervoor te zorgen dat zijn resultaten betrouwbaar en vrij van de bias van de hoop op een specifieke uitkomst waren, pre-registreerde hij zijn volledige plan. Dit betekende dat hij zijn voorspellingen, de modellen die hij zou testen en de exacte criteria voor succes of falen opschreef voordat hij ooit de data inzag. Vervolgens gebruikte hij een autonome computeragent om vijf verschillende tests uit te voeren op basis van deze natuurkundig geïnspireerde ideeën, waarbij hij controleerde of de modellen zich werkelijk gedroegen als de ordelijke isolatoren die zij werden verwacht te zijn.

De resultaten waren een duidelijke en onverwachte inversie van de initiële hypothese. De onderzoeker stelde vast dat de taalmodellen zich niet gedroegen als de ordelijke isolatoren die hij had voorspeld. In plaats van dat de verbindingen snel en voorspelbaar vervaagden, volgde de aandacht tussen woorden een veel complexer patroon. Wanneer hij mat hoe de invloed van één woord afnam naarmate de afstand tot een ander woord toenam, paste de data niet op de eenvoudige exponentiële curve die kenmerkend is voor een isolator. In plaats daarvan nam de invloed af op een manier die leek op een machtswet (power law), een patroon dat vaak wordt geassocieerd met kritische systemen of glasachtige materialen waar orde rommelig is en langetermijnverbindingen blijven bestaan. Sterker nog, toen hij probeerde verre verbindingen af te snijden om ruimte te besparen, stortte de prestatie van het model in, wat aanzienlijk slechter was dan wanneer hij simpelweg alle verbindingen had behouden. Het model negeerde verre woorden niet; het vertrouwde op hen op een manier die een eenvoudige fysieke afkorting niet kon repliceren.

Het onderzoek keek ook naar de vraag of de interne getallen van het model vereenvoudigd konden worden door ze te herschikken in een efficiëntere vorm, vergelijkbaar met hoe een natuurkundige een complex rooster van atomen kan vereenvoudigen. De onderzoeker testte of de vocabulaire en gewichtsmatrices van het model gecomprimeerd konden worden met behulp van geavanceerde wiskundige structuren ontworpen voor eendimensionale ketens. Hij stelde vast dat deze modellen geen dergelijke eendimensionale structuur hadden om te exploiteren. De interne getallen waren niet gerangschikt op een manier die eenvoudige compressie mogelijk maakte; ze waren in essentie willekeurig en vol informatie die niet weggegooid kon worden zonder de functie van het model te vernietigen. Wanneer hij probeerde het model in deze vereenvoudigde vormen te dwingen, was het resultaat niet een kleiner bestand, maar een groter bestand, omdat het wiskundige formaat meer ruimte vereiste om dezelfde hoeveelheid informatie op te slaan. Dit bleef ook waar toen hij grotere modellen testte, wat suggereerde dat de complexiteit een fundamenteel kenmerk is van hoe deze systemen werken, en niet slechts een eigenaardigheid van kleine modellen.

Misschien wel de meest significante bevinding was dat de methode van de onderzoeker erin slaagde de idee dat deze modellen eenvoudige, isolator-achtige systemen zijn, uit te sluiten. Door zich aan zijn pre-geregistreerde regels te houden, vermeed hij de verleiding om de data te herinterpreteren om deze in de theorie te laten passen. Toen de data lieten zien dat de modellen zich niet gedroegen zoals voorspeld, legde hij het falen eerlijk vast. Hij ontdekte dat de modellen opereren in een regime dat veel complexer is dan een eenvoudige kristal, en eerder lijkt op een complexe, kritische staat waarbij elk deel diep verbonden is met elk ander deel op een niet-lineaire manier. Dit betekent dat de hoop om deze modellen te comprimeren door simpelweg verre verbindingen af te snijden of hun interne structuur te herschikken, waarschijnlijk onjuist is. De complexiteit van het model is geen artefact van de omvang, maar een noodzakelijk kenmerk van de intelligentie.

De studie concludeert dat hoewel de droom om taalmodellen te comprimeren met principes uit de vaste-stoffysica een aantrekkelijke is, de realiteit is dat deze modellen die specifieke natuurwetten niet volgen. De onderzoeker vond geen manier om de modellen te verkleinen zonder hun kracht te verliezen. In plaats daarvan bood hij een duidelijke kaart van wat de modellen niet zijn: ze zijn geen eenvoudige isolatoren, en ze hebben geen verborgen, ijle structuren die ontdekt wachten te worden. Zijn werk dient als een gedisciplineerde correctie voor het vakgebied, waarbij wordt aangetoont dat de weg naar het begrijpen van deze systemen nieuwe fysieke analogieën vereist die rekening kunnen houden met hun rommelige, kritische en hoogst onderling verbonden natuur. De les is dat de intelligentie van deze modellen verweven is in het weefsel van hun complexiteit, en dat het proberen weg te strippen van die complexiteit om ze kleiner te maken, wellicht onmogelijk is zonder te breken wat hen laat werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →