← Nieuwste papers
💬 NLP

Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models

Dit artikel daagt de effectiviteit van entropie-gebaseerde pruning uit voor het comprimeren van Chain-of-Thought-redeneringen, waarbij wordt aangetoond dat dergelijke heuristieken geen voordeel bieden ten opzichte van willekeurige selectie en dat taalkritische informatie verspreid is over de gehele redeneerketen in plaats van geconcentreerd in specifieke tokens die identificeerbaar zijn door entropiemetrieken.

Oorspronkelijke auteurs: Sara Candussio, Daniel Scalena, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

Gepubliceerd 2026-08-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sara Candussio, Daniel Scalena, Luca Bortolussi, Elisabetta Fersini, Malvina Nissim, Gabriele Sarti

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar praatzieke robot probeert te leren hoe hij een lastige puzzel moet oplossen. Om het juiste antwoord te krijgen, spuwt de robot niet zomaar een oplossing uit; hij praat eerst met zichzelf door een lange lijst met gedachten, berekeningen en "aha!"-momenten op te schrijven. Deze interne monoloog wordt "Chain-of-Thought" genoemd. Het is alsof een detective elke aanwijzing opschrijft, zelfs de aanwijzingen die overduidelijk lijken, voordat hij de crimineel vangt. Hoewel deze methode de robot veel slimmer maakt, maakt het hem ook erg traag en hongerig naar computergeheugen, omdat de lijst met gedachten ongelooflijk lang kan worden. Wetenschappers proberen nu uit te vogelen hoe ze deze lijst kunnen inkorten zonder het genie van de detective te verliezen. Ze willen weten: kunnen we gewoon de saaie delen van het verhaal verwijderen en alleen de opwindende, belangrijke stukjes bewaren?

Een tijdje dachten veel onderzoekers dat ze een magisch filter hadden gevonden. Ze dachten dat ze door te kijken naar hoe "verrast" de robot was door zijn eigen volgende woord (een concept genaamd "entropie"), konden bepalen welke gedachten cruciaal waren en welke slechts opvulling waren. Het idee was dat als de robot heel zelfverzekerd was over wat hij daarna zou gaan zeggen (lage verrassing), dat deel waarschijnlijk gewoon saaie herhaling was en kon worden weggehaald. Als de robot onzeker was (hoge verrassing), was dat het moment van echt nadenken en moest dat worden bewaard. Het klonk als een perfecte manier om het dagboek van de robot in te krimpen tot een paar pagina's terwijl alle goede stukjes behouden bleven. Maar is dit magische filter werkelijkheid, of is het slechts een gelukkige gok?

Dit artikel is een reality check voor dat idee. De auteurs, een team van nieuwsgierige wetenschappers, besloten dit "entropie-filter" te testen tegenover een veel simpelere, dommere methode: gewoon willekeurig gedachten verwijderen. Ze behandelden de lange redeneringsketens van de robot als een rommelige kamer en probeerden deze op te ruimen met twee verschillende strategieën. De eerste strategie was de "slimme" strategie, waarbij het entropie-filter werd gebruikt om te kiezen wat behouden moest blijven. De tweede was de "willekeurige" strategie, waarbij ze gewoon een handvol zinnen of woorden pakten om te bewaren, zonder rekening te houden met de inhoud. Ze testten dit op een verscheidenheid aan robots (verschillende AI-modellen) en gaven ze verschillende soorten huiswerk, inclusief wiskundeproblemen, logische puzzels en wetenschappelijke vragen.

De resultaten waren een behoorlijke plotwending. Toen de wetenschappers naar hele zinnen keken, was het "slimme" entropie-filter niet beter dan de willekeurige gok. Sterker nog, de willekeurige methode deed vaak net zo goed, of zelfs beter, aan het behouden van de hoge prestaties van de robot. Het blijkt dat de "verrassingsgraad" van een zin geen betrouwbare kaart is naar waar de belangrijke informatie zich verbergt. De auteurs suggereren dat de reden waarom eerdere studies dachten dat entropie werkte, was dat ze voorn{%}rlijk wiskundeproblemen testten, waarbij de "belangrijke" woorden vaak gewoon getallen zijn.

Toen ze inzoomden om naar individuele woorden (tokens) te kijken in plaats van naar hele zinnen, kwam er een vreemd patroon aan het licht. Bij wiskundetoetsen leek het behouden van de woorden met een lage verrassing inderdaad te helpen. Maar de auteurs groeven dieper en realiseerden zich dat dit niet kwam omdat die woorden "denk"-woorden waren. Het was omdat, in wiskundeproblemen, de woorden met een lage verrassing bijna altijd getallen waren (zoals "2", "7" of "5"). Omdat getallen voorspelbaar zijn in de wiskunde, hebben ze een lage entropie. Het filter vond niet de "slimme" delen; het koos per ongeluk gewoon de getallen. Wanneer de wetenschappers de getallen uit de mix verwijderden, stopte het lage-entropie-filter met werken en werd het net zo slecht als de willekeurige gok.

Om dit te bewijzen, gebruikten ze een speciale truc genaamd "activation patching". Stel je voor dat je de hersenactiviteit van de robot uit de volledige, lange versie van het verhaal neemt en deze in de korte, gecomprimeerde versie plakt. Dit laat hen zien of de ontbrekende context daadwerkelijk het probleem was. Ze ontdekten dat zelfs met deze brein-versterkende truc, het entropie-filter het willekeurige method niet kon verslaan, tenzij het specifiek de getallen in wiskundeproblemen behield. Bij niet-wiskundige taken, zoals logische puzzels, faalde het entropie-filter volledig en presteerde het niet beter dan bij toeval.

Dus, wat is de belangrijkste les? Het artikel suggereert dat het idee om "verrassing" (entropie) te gebruiken om automatisch de belangrijkste delen van het denkproces van een robot te vinden en te bewaren, grotendeels een mythe is. De semantische inhoud — de werkelijke betekenis en logica van de redenering — is niet geconcentreerd in een paar speciale, laag-entropie woorden die een simpele regel kan vinden. In plaats daarvan is de belangrijke informatie verspreid over de hele redeneerketen. Hoewel het behouden van getallen helpt bij wiskunde, is er geen universeel "magisch filter" dat de redeneerketen van een robot kan comprimeren zonder de intelligentie te verliezen. De beste manier om de lijst in te korten is misschien gewoon om meer ervan te bewaren, of om een slimmere manier te vinden om te snijden die niet afhankelijk is van het raden welke woorden saai zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →