← Nieuwste papers
🤖 machine learning

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

Het artikel introduceert ChainPrune, een nieuwe methode die lang Chain-of-Thought-redeneren optimaliseert door zelf gegenereerde paden te consolideren in een boomstructuur voor selectie op basis van meerdere criteria en het toepassen van DPO-gebaseerd voorkeursleren, waardoor redundantie en computationele overhead effectief worden verminderd terwijl de nauwkeurigheid gelijk blijft of wordt verbeterd.

Oorspronkelijke auteurs: Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

Gepubliceerd 2026-08-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn opmerkelijk bekwaam geworden in het oplossen van complexe problemen, maar ze doen dit vaak op een manier die aanvoelt als het kijken naar iemand die te lang nadenkt over een eenvoudige beslissing. Wanneer deze kunstmatige intelligentiesystemen worden gevraagd een wiskundig probleem op te lossen of code te schrijven, genereren ze vaak een lange, kronkelende reeks gedachten voordat ze tot een antwoord komen. Dit proces, bekend als chain-of-thought reasoning (redeneren via een keten van gedachten), bootst na hoe mensen moeilijke taken opdelen in kleinere stappen. Hoewel deze methode de nauwkeurigheid van AI heeft verbeterd, is er een nieuw probleem ontstaan: de modellen denken te veel na. Ze produceren buitensporige hoeveelheden tekst, herhalen zichzelf, controleren hun werk onnodig en nemen veel meer stappen dan nodig is. Dit "overdenken" verspilt rekenkracht en vertraagt het systeem, waardoor het minder praktisch is voor gebruik in de echte wereld. Onderzoekers proberen nu deze modellen te leren hoe ze beknopt kunnen zijn zonder hun vermogen om diep na te denken te verliezen.

Een team van onderzoekers heeft een nieuwe aanpak ontwikkeld genaamd ChainPrune om dit probleem van excessief nadenken op te lossen. Ze ontdekten dat het simpelweg vertellen van een model om minder woorden te gebruiken vaak averechts werkt. Wanneer modellen alleen worden beloond voor korte tekst, hebben ze de neiging hun logica op te delen in kleine, gefragmenteerde stukjes. Dit creëert een situatie waarin het totale aantal woorden laag is, maar het aantal stappen hoog blijft, waardoor het redeneerpad lang en inefficiënt is. De onderzoekers noemen dit "pseudo-beknoptheid". Het is alsof je probeert tijd te besparen door in hele kleine, snelle stapjes te lopen; je neemt misschien minder stappen per seconde, maar je loopt nog steeds een lange afstand af. Het doel was volgens hen om zowel het aantal woorden als het aantal stappen tegelijkertijd te verminderen, zodat het redeneren helder en logisch bleef.

Om dit te bereiken, bouwden de onderzoekers een systeem dat de gedachten van het model behandelt als een vertakkende boom. Wanneer het model meerdere verschillende manieren genereert om hetzelfde probleem op te lossen, zoekt het systeem naar stappen die hetzelfde betekenen, zelfs als ze anders geformuleerd zijn. Bijvoorbeeld, als één pad zegt "tel honderd op bij het totaal" en een ander zegt "verhoog de som met honderd", dan herkent het systeem deze als identieke acties. Het voegt deze dubbele stappen vervolgens samen tot een enkele, schone knoop, waardoor de boom van redundante takken effectief wordt gesnoeid. Dit proces creëert een compacte kaart van de redenering die alle noodzakelijke logica behoudt, maar de herhaling verwijdert.

Zodra het systeem over deze gestroomlijnde kaart beschikt, selecteert het de beste versie van het redeneerpad. Het kiest niet zomaar het kortste pad; het zoekt naar het pad dat zowel kort is in woorden als kort in stappen, terwijl het nog steeds correct is. Als een pad te lang is of fouten bevat, wordt het weggegooid. De onderzoekers gebruiken deze hoogwaardige, efficiënte data vervolgens om het model opnieuw te trainen. Ze combineerden een methode die het model leert om de voorkeur te geven aan betere antwoorden met een techniek die ervoor zorgt dat het model niet zijn vermogen om correct te redeneren verliest terwijl het probeert beknopt te zijn. Deze training helpt het model om gedachten te genereren die van nature beknopt en gestructureerd zijn, in plaats van alleen maar woorden uit een lange zin te knippen.

De resultaten van deze training waren significant. Wanneer getest op moeilijke wiskundige problemen en programmeeruitdagingen, losten de met ChainPrune getrainde modellen problemen net zo nauwkeurig op als voorheen, maar deden ze dit met veel minder inspanning. De onderzoekers ontdekten dat de modellen het aantal redeneerstappen met bijna zevenentwintig procent verminderden en de totale hoeveelheid tekst met meer dan achtentwintig procent inkortten. Belangrijker nog, de kwaliteit van het denken verbeterde. De modellen maakten minder logische fouten, stopten onnodig met het reflecteren op hun werk en elimineerden redundante stappen met meer dan zestig procent in vergelijking met hun ongetrainde versies. Dit suggereert dat door te focussen op de structuur van de redenering in plaats van alleen op de lengte van de tekst, het mogelijk is om kunstmatige intelligentie tegelijkertijd slimmer en efficiënter te maken.

De studie benadrukte ook een kritiek gebrek in eerdere pogingen om AI sneller te maken. Veel eerdere methoden probeerden modellen te dwingen korter te zijn door hen te straffen voor het gebruik van te veel woorden. De onderzoekers toonden aan dat deze aanpak vaak leidde tot het probleem van "pseudo-beknoptheid", waarbij het model kort leek maar eigenlijk inefficiënt was. Daartegenover bewees ChainPrune dat echte efficiëntie voortkomt uit het begrijpen van de betekenis van de stappen en het verwijderen van duplicaten, en niet alleen van het tellen van woorden. Deze bevinding biedt een duidelijkere weg voorwaarts voor de ontwikkeling van AI-systemen die diep kunnen nadenken zonder te blijven hangen in onnodige details, wat ze nuttiger maakt voor dagelijkse taken waar snelheid en helderheid belangrijk zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →