← Nieuwste papers
🤖 AI

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning

Het artikel introduceert Pyligent, een trainingsframework dat de redeneerprestaties verbetert bij taken die vereisen dat er wordt hersteld van vertraagde fouten door gevalideerde zoekbomen om te zetten in gesuperviseerde doelen voor voortzet-, voltooiings- en terugtrekacties, waarmee het standaard supervised fine-tuning over diverse gestructureerde domeinen heen overtreft.

Oorspronkelijke auteurs: Dmitry Beresnev, Vladimir Makharev, Roman Khalikov, Ivan Oseledets, Petr Anokhin

Gepubliceerd 2026-07-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dmitry Beresnev, Vladimir Makharev, Roman Khalikov, Ivan Oseledets, Petr Anokhin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een doolhof op te lossen.

De Oude Manier: De "Perfecte Toerist"-aanpak
Traditioneel, wanneer we AI leren redeneren, laten we het een video zien van een mens die een doolhof perfect oplost. We zeggen: "Kijk, ze gingen linksaf, toen rechtsaf, en vonden toen de uitgang. Doe precies dat." Dit wordt "Gold-Only" training genoemd.
Het probleem? De robot ziet alleen het succesvolle pad. Het ziet nooit de momenten waarop de mens een doodlopende weg insloeg, besefte dat hij een fout had gemaakt, terugliep naar de laatste kruising en een andere weg probeerde. Dus wanneer de robot zelf een doodlopende weg tegenkomt, raakt hij in paniek. Hij blijft rechtuit lopen tegen de muur aan, of hij komt vast te zitten, omdat hij nooit heeft geleerd hoe hij moet zeggen: "Oeps, verkeerde afslag," en terug moet gaan.

De Nieuwe Manier: Pyligent (De "Gedienstige Leerling")
Dit artikel introduceert een nieuw trainingsframework genaamd Pyligent. In plaats van de robot alleen het perfecte pad te laten zien, laat Pyligent de robot verkennen, falen en leren van die fouten.

Denk aan Pyligent als een videogame-coach die de speler observeert:

  1. De Verkenner: De robot probeert de puzzel op te lossen. Hij maakt zetten.
  2. De Scheidsrechter (Validator): Een strenge scheidsrechter kijkt naar elke zet. Als de robot een zet doet die op het eerste gezicht oké lijkt, maar later tot een doodlopende weg leidt, zegt de scheidsrechter niet alleen "Game Over". Ze stoppen het spel, wijzen naar het exacte moment waarop de robot fout ging, en zeggen: "Je had hier terug moeten keren."
  3. De Les: De robot krijgt vervolgens een replay te zien van zijn eigen fout. Hij ziet de doodlopende weg, hoort de reden ("Je liep tegen een muur aan"), en krijgt expliciet de opdracht geleerd: <backtrack>. Dit commando vertelt de robot om het foutieve pad uit te wissen en terug te keren naar de laatste veilige plek om het opnieuw te proberen.

De Drie Bewegingen
Pyligent leert de robot drie specifieke acties, in plaats van alleen maar "doorgaan":

  • Continue (Doorgaan): "Dit pad ziet er goed uit, ga zo door."
  • Finish (Voltooien): "Ik heb de oplossing gevonden, hier is het antwoord."
  • Backtrack (Terugkeren): "Wacht, dit pad is een doodlopende weg. Laten we teruggaan naar de laatste keuze en iets anders proberen."

De Experimenten: Hoe goed werkte het?
De onderzoekers testten dit op drie verschillende "games" om te zien of de robot daadwerkelijk leerde te herstellen van fouten.

  1. Het Verborgen Doolhof (Hidden Directed Graph):

    • De Opzet: De robot kan alleen de directe volgende stap zien, niet de hele kaart. Hij moet raden welke kant hij op moet gaan.
    • Het Resultaat: De oude methode (Gold-Only) faalde bijna 100% van de tijd. De robot liep doodlopende wegen in en bleef gewoon doorlopen. De Pyligent-robot loste echter 76% van de doolhoven op. Hij leerde de doodlopende weg te herkennen, op de "backtrack"-knop te drukken en een ander pad te proberen.
  2. Mini Sudoku (4x4 Raster):

    • De Opzet: Een kleine getallenpuzzel waarbij het invullen van één getal de rest van de puzzel onmogelijk kan maken.
    • Het Resultaat: Pyligent loste aanzienlijk meer puzzels op dan de oude methode. Zelfs wanneer de puzzels erg moeilijk waren, was de Pyligent-robot veel beter in het beseffen van: "Ik vulde hier een 3 in, maar dat overtreedt later de regels," en die zet ongedaan te maken om een ander getal te proberen.
  3. Blocksworld (Blokken Stapelen):

    • De Opzetten: Een robotarm moet blokken van één stapel naar een andere verplaatsen. Als de robot het verkeerde blok oppakt, loopt het hele plan in de soep.
    • Het Resultaat: De oude methode kon bijna niets oplossen. Pyligent verdubbelde het succespercentage. Het leerde dat je soms een blok moet neerleggen en een ander moet oppakken, in plaats van koppig te proberen een plan af te dwingen dat niet werkt.

Het Geheime Ingrediënt: "Traced Recovery"
Een van de coolste functies is iets dat Traced Recovery wordt genoemd.
Wanneer de robot een doodlopende weg tegenkomt en "backtrack" kiest, wist de oude methode gewoon alles door. Maar Pyligent laat een klein briefje achter: "Je ging dit pad op, maar het mislukte vanwege X."
Het is alsoals een wandelaar die verdwaald is, omkeert en een klein bordje achterlaat met: "Ga hier niet verder, dit is een moeras." Dit briefje helpt de robot om niet precies dezelfde fout twee keer te maken wanneer hij het opnieuw probeert.

De Kernboodschap
Dit artikel betoogt dat slim zijn niet alleen gaat over het weten van het juiste antwoord; het gaat erom weten hoe je je fouten herstelt. Door AI te trainen om expliciet doodlopende wegen te herkennen en te oefenen met "backtracking", kunnen we hen veel veerkrachtigere probleemoplossers leren. Het is het verschil tussen een robot die opgeeft als hij een muur raakt en een robot die zegt: "Mijn fout, laten we een andere deur proberen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →