← Nieuwste papers
💬 NLP

SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute

Het artikel introduceert Self-Verifying Refinement (SVR), een oracle-vrij reinforcement learning-framework dat taalmodellen in staat stelt om test-tijd rekenkracht dynamisch toe te wijzen door te leren interne zelfverificatiesignalen (juistheidsoordelen en betrouwbaarheidsscores) te gebruiken om te beslissen wanneer de verfijning van antwoorden moet stoppen, waarmee een superieure nauwkeurigheid met minder inferentiebeurten wordt bereikt in vergelijking met bestaande baselines.

Oorspronkelijke auteurs: Hongyu Chen, Liang Lin, Guangrun Wang

Gepubliceerd 2026-07-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hongyu Chen, Liang Lin, Guangrun Wang

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een echt lastige puzzel probeert op te lossen, zoals een complex wiskundig probleem of een raadsel. Je hebt een superintelligente vriend (laten we die een AI noemen) die erg goed is in het oplossen van zaken, maar soms blijft diegene steken of maakt diegene een stomme fout. In het verleden, als je wilde dat je vriend harder nadacht, zei je gewoon: "Ga door! Probeer het nog eens!" een vast aantal keren, zeg tien keer. Maar hier zit de crux: sommige puzzels zijn makkelijk en je vriend lost ze in één poging op, terwijl andere zo moeilijk zijn dat ze tien pogingen nodig hebben. Als je hen dwingt om door te blijven gaan bij de makkelijke puzzels, verspil je tijd en energie. Als je te vroeg stopt bij de moeilijke puzzels, kunnen ze opgeven voordat ze het juiste antwoord hebben gevonden.

Dit is de wereld van "test-time computation" voor kunstmatige intelligentie. Het is het idee dat het geven van meer tijd en hersencapaciteit aan een AI om na te denken terwijl het een vraag beantwoordt, een AI slimmer kan maken. Maar er is een groot probleem: hoe weet een AI wanneer hij moet stoppen met denken? Meestal hebben we een mens of een apart "controleprogramma" nodig om de AI te vertellen: "Hé, je hebt het goed, stop!" of "Nee, probeer het opnieuw." Maar wat als we geen controleprogramma hebben? Wat als de AI zijn eigen baas moet zijn en zelf moet beslissen wanneer hij klaar is op basis van zijn eigen onderbuikgevoel?

Dit is precies wat de onderzoekers in dit artikel wilden oplossen. Ze hebben een nieuwe methode ontwikkeld genaamd SVR (Self-Verifying Refinement). Denk aan het leren van een AI om zijn eigen strenge leraar te zijn. In plaats van te wachten tot een mens het werk nakijkt, leert de AI na elke poging even te pauzeren en zichzelf twee vragen te stellen: "Is mijn antwoord correct?" en "Hoe zeker ben ik?" Als de AI zegt: "Ja, het is correct" en "Ik ben zeer zeker", dan stopt hij en dient hij het antwoord in. Als de AI onzeker is of denkt dat het fout is, blijft hij verder nadenken en probeert hij het te verbeteren. Het coole eraan is dat de AI deze vaardigheid helemaal zelf leert door oefening, zonder dat een mens hem tijdens de eigenlijke test de juiste antwoorden hoeft te vertellen.

De onderzoekers hebben dit getest op zeven verschillende wiskundige uitdagingen, variërend van eenvoudige rekenkunde tot moeilijke problemen op wedstrijdniveau. Ze kwamen tot de conclusie dat SVR een gamechanger is. Gemiddeld lost de AI problemen 56,3% van de tijd correct op, wat beter is dan andere methoden die ofwel slechts één keer gokken of blindelings tien keer proberen. Nog beter is dat het geen tijd verspilt. Terwijl andere methoden de AI dwongen om voor elk probleem tien beurten (of stappen) te nemen, ontdekte SVR dat de meeste problemen gemiddeld slechts ongeveer 3 beurten nodig hebben. Het bespaarde een enorme hoeveelheid "thinking tokens" (de digitale brandstof die de AI verbruikt) door precies te stoppen wanneer het klaar was, in plaats van zich aan een rigide schema te houden.

De paper waarschuwt ons echter dat dit geen magie is. De AI is niet perfect. Soms is de AI overmoedig en stopt hij te vroeg met een fout antwoord, of gaat hij juist door terwijl hij zou moeten stoppen. De onderzoekers lieten zien dat als je de AI simpelweg vertelt om na een vast aantal beurten te stoppen (zoals 10), het eigenlijk slechter gaat omdat het een correct antwoord kan verpesten door het opnieuw te willen "verbeteren". Het vermogen van SVR om te luisteren naar zijn eigen interne "vertrouwensmeter" is wat het zo goed laat werken. Het is alsof je een student leert om op zijn eigen oordeel te vertrouwen na het studeren, in plaats van alleen maar een regel te onthouden die zegt: "studeer precies 30 minuten." De resultaten suggereren dat wanneer AI leert om het eigen werk te verifiëren, het niet alleen slimmer wordt, maar ook veel efficiënter; het bespaart energie terwijl het betere resultaten behaalt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →