← Nieuwste papers
🤖 machine learning

HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

HindSearch introduceert een hindsight self-distillatieprocedure voor zoekversterkte reinforcement learning die de kritieken van een bevroren rechter op mislukte trajecten benut om hulpbronnen van on-policy signalen te leveren, wat de prestaties aanzienlijk verbetert ten opzichte van eerdere baselines door het gouden antwoord te gebruiken om zoekfouten te diagnosticeren.

Oorspronkelijke auteurs: Haowei Liu, Jiamian Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

Gepubliceerd 2026-08-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haowei Liu, Jiamian Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een mysterie op te lossen. Je geeft het een vraag en de robot begint het internet af te zoeken naar aanwijzingen. Soms vindt hij het antwoord, en soms raakt hij verdwaald in een doolhof van foute wendingen. In de wereld van kunstmatige intelligentie wordt dit "Search-Augmented Learning" genoemd. De robot is een Large Language Model (LLM), een superintelligent computerbrein dat tekst leest en schrijft. Om moeilijke problemen op te lossen, gokt hij niet zomaar; hij gebruikt een zoekmachine om feiten op te zoeken, stukje bij beetje, zoals een detective die bewijsmateriaal verzamelt.

Een lange tijd was de manier waarop we deze detective-robots trainden een beetje als het spelen van een spelletje "warm of koud" met een zeer strikte scheidsrechter. De robot zou zijn hele onderzoek doorlopen, en aan het einde zou de scheidsrechter simpelweg zeggen: "Je hebt het goed!" of "Je hebt het fout!" Als de robot het antwoord fout had, was de enige feedback die hij kreeg een grote, vlakke "0". Hij wist dat hij gefaald had, maar hij had geen idee waarom. Had hij de verkeerde vraag gesteld? Had hij het verkeerde artikel gelezen? Was hij in de war geraakt door een lastige naam? Zonder te weten het "waarom", moest de robot zelf raden hoe hij zichzelf kon verbeteren, wat is als proberen te leren autorijden door alleen te horen "crash" of "geen crash" na elke rit. Het is frustrerend, traag, en leidt vaak tot het aanleren van slechte gewoontes.

Dit is waar een nieuw idee genaamd HindSearch om de hoek komt kijken, voorgesteld door onderzoekers Liu, Wang, Wu, Tao en Fang. Ze realiseerden zich dat wanneer een robot faalt, we eigenlijk een referentie hebben: het juiste antwoord. In plaats van alleen maar "falen" te zeggen, besloten ze dit juiste antwoord te gebruiken om een kort, nuttig briefje te schrijven dat precies uitlegt wat de robot anders had moeten doen. Ze noemen dit een "hindsight critique" (een kritiek achteraf).

Zo werkt het in de praktie: Stel je voor dat de robot probeert uit te zoeken wie de regisseur is van de film Brazil (de sciencefictionfilm uit 1985, niet het land). Hij raakt in de war en zoekt op "Brazil director", waardoor hij pagina's over de regering van het land vindt. Hij faalt. Op de oude manier stopt de training daar met een "0". Maar met HindSearch kijkt een bevroren "Judge" (een superintelligente, vooraf getrainde AI die zelf niets leert) naar de rommelige zoekgeschiedenis van de robot en het juiste antwoord (Terry Gilliam). De Judge schrijft vervolgens een klein, éénzinnig briefje: "Je hebt de film verward met het land! Je had moeten zoeken naar 'director of Brazil 1985 film'."

Dit briefje wordt vervolgens gebruikt als een speciale "hint" om de robot te onderwijzen. De robot krijgt het briefje te zien en krijgt de vraag: "Als ik deze hint had gekend, wat zou ik dan gezocht hebben?" De robot leert zijn zoekgewoonten aan te passen aan het advies van de Judge. Dit gebeurt na elk mislukt poging, waardoor elke fout verandert in een gedetailleerde les in plaats van een doodlopende weg.

De onderzoekers testten deze methode op een standaardset van zeven moeilijke vraag-antwoord uitdagingen, met behulp van een model genaamd Qwen2.5-3B-Instruct. Ze ontdekten dat deze simpele truc van het toevoegen van een "hindsight critique" een enorm verschil maakte. De nieuwe methode, HindSearch, bereikte een gemiddeld succespercentage van 39,4% op deze tests. Dit is aanzienlijk beter dan de vorige beste methoden, die rond de 33,6% schommelden. De verbetering was consistent over alle verschillende soorten vragen, van eenvoudige feiten tot complexe puzzels die het verbinden van meerdere stukjes informatie vereisen.

Cruciaal was dat het team er zeker van wilde zijn dat de verbetering echt voortkwam uit het "hindsight"-gedeelte — het feit dat de Judge het antwoord wist. Om dit te bewijzen, voerden ze een test uit waarbij ze de toegang van de Judge tot het juiste antwoord verwijderden. Wanneer de Judge moest raden wat er misging zonder de oplossing te kennen, verdween de verbetering bijna volledig en daalde de score terug naar 34,7%. Dit suggereert dat de magie niet alleen zit in het hebben van een tweede AI die naar het werk kijkt; het is specifief in het feit dat die tweede AI het juiste antwoord gebruikt om een precieze, corrigerende les te geven.

Het onderzoek verkende ook hoe deze training zich in de loop van de tijd gedraagt. De prestaties van de robot stegen gestaag over 300 stappen van training, waarbij een piekscore tijdens de training van bijna 50% werd bereikt en een validatiescore van 39,4% aan het einde. De training was stabiel, wat betekent dat de robot niet in de war raakte of vreemd begon te doen, wat een veelvoorkomend probleem is bij het trainen van AI met complexe beloningen.

Een interessant detail is dat deze methode werkt door de robot specifiek te leren hoe hij moet zoeken, en niet hoe hij het uiteindelijke antwoord moet geven. De "critique" beïnvloedt alleen de woorden die de robot gebruikt wanneer hij de zoekmachine om hulp vraagt. Dit houdt de robot gefocust op zijn taak: het verzamelen van de juiste aanwijzingen. De onderzoekers ontdekten ook dat het gebruik van een veel groter "Teacher"-model (7 miljard parameters) om de hints te geven de boel juist verslechterde, wat leidde tot een instorting van de training. Het blijkt dat een leraar die te veel verschilt van de leerling verwarrend kan zijn; een leraar die vergelijkbaar maar bevroren is, werkt het best.

Kortom, HindSearch suggereert dat de beste manier om een zoek-robot te onderwijzen niet alleen is om te vertellen wanneer hij het fout heeft, maar om het antwoord te laten zien en te vragen: "Gegeven dat je het antwoord weet, wat was het ene ding dat je anders had moeten doen?" Door elke fout in een specifieke, actiegerichte les te veranderen, leert de robot een veel betere detective te zijn, die veel vaker de juiste aanwijzingen vindt dan voorheen. De code voor deze methode is beschikbaar voor anderen om te proberen, en de resultaten suggeren dat deze "hindsight"-benadering een krachtig nieuw hulpmiddel kan zijn voor het trainen van AI-agenten die de wereld moeten verkennen om antwoorden te vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →