← Nieuwste papers
💻 computer science

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

Het artikel stelt REVES voor, een tweestaps iteratief framework dat de training augmentatieert door tussenliggende "near-miss" stappen uit succesvolle hersteltrajecten om te zetten in gedecoupleerde revisie- en verificatieprompts, waardoor efficiënt off-policy leren mogelijk wordt dat standaard multi-turn RL en evolutionaire zoekmethoden aanzienlijk overtreft bij codering-, wiskundige en constraint-satisfactie-taken.

Oorspronkelijke auteurs: Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

Gepubliceerd 2026-06-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Waarom "Eerste Poging" Niet Genoeg Is

Stel je voor dat je een moeilijk examen maakt. De meeste mensen krijgen het antwoord niet bij de allereerste poging goed. In plaats daarvan denken ze: "Wacht, dit lijkt niet te kloppen," controleren hun werk, vinden een fout en proberen het opnieuw.

Huidige AI-modellen (Large Language Models) zijn geweldig in het beantwoorden van vragen, maar ze zijn vaak getraind om "one-shot" denkers te zijn. Ze worden geleerd om direct hun beste antwoord te geven en dan te stoppen. Het probleem is dat wanneer deze modellen in de echte wereld worden ingezet, ze hun antwoorden vaak moeten herzien op basis van feedback (zoals een compilerfout bij coderen of een logische controle bij wiskunde).

De auteurs van dit paper stellen dat het trainen van een model om een "one-shot genie" te zijn, het geen goede "revisie-expert" maakt. Je kunt iemand niet leren een geweldige redacteur te zijn door ze alleen een test te geven waarbij ze de essay in één keer perfect moeten schrijven.

Het Probleem: De "Blinde" Coach

Het paper wijst op een gebrek in de manier waarop we AI momenteel trainen om zijn werk te herzien.

De Analogie: De Marathonloper
Stel je voor dat je een hardloper traint voor een marathon.

  • Standaard Training: Je laat de hardloper de hele 26 mijlen rennen. Als hij finisht, geef je hem een trofee. Als hij bij mijl 10 struikelt, maar doorgaat en toch finisht, geef je hem ook die trofee.
  • Het Gebrek: De hardloper denkt: "Geweldig! Struikelen bij mijl 10 maakte deel uit van de winnende strategie!" Hij leert niet dat struikelen een fout was. Hij weet alleen dat het eindresultaat goed was.

In AI-termen wordt dit trajectory-level credit genoemd. Als een model drie foute gokken doet en dan bij de vierde poging het juiste antwoord geeft, geeft standaard training "credit" aan alle drie de foute gokken omdat ze deel uitmaakten van het pad naar succes. Dit verwart het model.

De Oplossing: REVES (De "Drill Sergeant" Aanpak)

De auteurs stellen een nieuwe methode voor genaamd REVES. In plaats van naar de hele race te kijken, breken ze het proces af in individuele stappen.

De Analogie: De Sportoefening (Drill)
REVES verandert de training van "Ren de hele race" naar "Oefen specifieke drills."

  1. Vang de Fout: De AI probeert een probleem op te lossen. Het komt vast te zitten of maakt een "near-miss" fout (bijna goed, maar fout).
  2. Stop en Isoleer: In plaats van de AI door te laten gaan om te zien of hij uiteindelijk geluk heeft, stopt REVES het proces direct op dat punt.
  3. De Tweeledige Drill:
    • De Revisie-Drill: De AI krijgt de fout te zien en krijgt de vraag: "Hoe los je deze specifieke fout op?"
    • De Verificatie-Drill: De AI krijgt de fout te zien en krijgt de vraag: "Is dit antwoord correct of incorrect? Waarom?"

Op deze manier leert de AI twee duidelijke vaardigheden:

  1. Hoe je een specifieke fout herstelt (Revision).
  2. Hoe je een fout herkent (Verification).

Hoe het Werkt (De Tweefasen-Loop)

Het paper beschrijft een cyclus die steeds opnieuw wordt doorlopen:

  • Fase 1: De Simulatie (Data Augmentatie)
    De AI probeert veel problemen op te lossen. Wanneer de AI na een paar pogingen slaagt, slaat het systeem de "near-miss" momenten op. Het verandelt deze momenten in nieuwe oefenvragen: "Hier is een fout antwoord; fix het," en "Hier is een fout antwoord; vertel me dat het fout is."
  • Fase 2: De Training (Single-Turn RL)
    De AI wordt getraind op deze nieuwe oefenvragen met behulp van standaard, eenvoudige trainingsmethoden. Het leert fouten te herstellen en ze te herkennen.
  • Herhalen: De AI wordt beter, waardoor de "near-miss" fouten moeilijker worden. Het systeem genereert nieuwe, moeilijkere oefeningen, en de cyclus gaat door.

De Resultaten: Wat Hebben Ze Gevonden?

De auteurs hebben dit getest op drie belangrijke soorten uitdagingen:

  1. Coderen: De AI moest computerprogramma's schrijven. REVES hielp het om bugs veel beter te repareren dan eerdere methoden, waarbij het significant hoger scoorde op standaard coding benchmarks.
  2. Wiskunde: De AI loste complexe wiskundige problemen op. Het leerde zijn eigen logische fouten effectief te corrigeren.
  3. Puzzels & "Circle Packing": Ze testten de AI op een zeer moeilijk geometrisch probleem genaamd "circle packing" (het passen van cirkels in een vierkant).
    • De Verrassing: Een relatief klein AI-model (4 miljard parameters) getraind met REVES presteerde net zo goed als enorme, supercomplexe systemen die gebruikmaken van enorme evolutionaire zoekmethoden (die duizenden willekeurige variaties proberen).
    • Generalisatie: Hoewel de AI alleen getraind was op wiskunde en coderen, werd hij veel beter in het oplossen van logische puzzels (zoals Sudoku en N-Queens) die hij nog nooit had gezien. Dit suggereert dat de vaardigheid om "fouten te herstellen" een algemene superkracht is, en niet alleen voor wiskunde geldt.

De Kernboodschap

Het paper beweert dat het verbeteren van het vermogen van een model om een enkele stap te herzien, automatisch de capaciteit verbetert om elke complexe strategie te gebruiken die controle en correctie inhoudt (zoals tree searches of evolutionary algorithms).

Kortom: Leer de AI niet alleen om het juiste antwoord te geven. Leer het hoe het moet herkennen wanneer het fout zit en hoe het dat kan herstellen. Door "near-miss" mislukkingen om te zetten in specifieke oefeningen, wordt de AI een veel slimmer, zelfcorrigerend denkend systeem.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →