← Nieuwste papers
💬 NLP

EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

EviSD is een op bewijs geconditioneerd zelf-distillatieframework dat zoekversterkte taalagenten optimaliseert door gebruik te maken van instantie-niveau bewijs en gouden antwoorden als geprivilegieerde informatie om actie-niveau credit assignment tijdens de training te verfijnen, waardoor superieure prestaties over meerdere benchmarks worden bereikt zonder het gedrag tijdens de inferentie te wijzigen.

Oorspronkelijke auteurs: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang

Gepubliceerd 2026-08-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert om een detective te zijn. In de wereld van kunstmatige intelligentie wordt deze robot een "search-augmented agent" genoemd. Zijn taak is om lastige vragen op te lossen door na te denken, het internet af te zoeken naar aanwijzingen, opnieuw na te denken en weer te zoeken, totdat hij eindelijk het antwoord vindt. Om hier beter in te worden, gebruiken we een trainingsmethode die "reinforcement learning" wordt genoemd. Denk hierbij aan een videogame waarbij de robot pas aan het einde van het spel een "winst" of "verlies" signaal krijgt. Als hij het mysterie oplost, krijgt hij een hoge score; als hij faalt, krijgt hij een nul.

Het probleem met deze "winst-of-verlies" aanpak is dat het een beetje is als het beoordelen van een student enkel op basis van hun eindexamencijfer zonder naar hun huiswerk te kijken. Als de robot het juiste antwoord krijgt, weten we dat de hele reis goed was, maar we weten niet welke specifieke zoekopdracht briljant was en welke een verspilling van tijd. Vond de eerste zoekopdracht de gouden aanwijzing? Of had de robot gewoon geluk met de laatste gok? Omdat de robot het verschil niet kan zien, kan hij steeds slechte zoekopdrachten blijven uitvoeren in de hoop dat ze uiteindelijk tot een overwinning leiden. Dit artikel pakt het rommelige middendeel van de reis van de detective aan, en probeert de robot precies te leren welke zetten nuttig waren en welke afleidingen, zodat hij een slimmere, snellere onderzoeker kan worden.

Maak kennis met EviSD, een slimme nieuwe trainingsmethode die fungeert als een "geprivilegieerde coach" voor de robot. De onderzoekers realiseerden zich dat de robot, terwijl hij leert, toegang heeft tot een referentieblad waar hij geen toegang toe heeft wanneer hij daadwerkelijk in de echte wereld werkt. Dit referentieblad bevat het "gouden antwoord" (de juiste oplossing) en het "ondersteunende bewijs" (de specifieke paragrafen tekst die bewijzen dat het antwoord juist is).

Zo werkt EviSD, met behulp van een speelse analogie: Stel je voor dat de robot een student is die een toets maakt.

  1. De Student (De Robot): De student maakt de toets met alleen de informatie die hij op dat moment tot zijn beschikking heeft. Hij schrijft zijn zoekopdrachten en zijn definitieve antwoord op.
  2. De Coach (De Leraar): Nadat de student klaar is, zet hetzelfde robotmodel een "Coach-hoed" op. De Coach kijkt naar de antwoorden van de student, maar mag in het referentieblad spieken (het bewijs en het juiste antwoord).
  3. De Feedbackloop: De Coach vergelijkt wat de student schreef met wat ze zouden moeten hebben geschreven, wetende wat de geheime aanwijzingen zijn.
    • Als de student een geweldige zoekvraag stelde die het bewijs zou hebben gevonden, geeft de Coach een duim omhoog.
    • Als de student een vage vraag stelde die niet zou helpen, geeft de Coach een zachte duw om het de volgende keer beter te doen.
    • Cruciaal is dat de Coach niet alleen zegt "Je hebt het goed" of "Je hebt het fout". De Coach zegt: "Je zoekopdracht naar 'X' was geweldig omdat het overeenkomt met het bewijs, maar je zoekopdracht naar 'Y' was een doodlopende weg."

De magie van EviSD is dat het deze "feedback van de Coach" gebruikt om het brein van de robot te verfijnen, maar alleen voor de specifieke delen waar de robot een zet deed (de zoekopdrachten en het definitieve antwoord). Het probeert niet de hele persoonlijkheid van de robot te herschrijven of hem te dwingen het referentieblad uit het hoofd te leren. In plaats daarvan werkt het als een volumeknop. Als de oorspronkelijke training van de robot zei: "Deze zoekopdracht was goed," dan draait de Coach het volume nog hoger als het bewijs dit ondersteunt. Als de oorspronkelijke training onzeker was, helpt de Coach om zaken te verduidelijken. Maar als de robot het uiteindelijke antwoord fout had, zal de Coach niet beweren dat de zoekopdracht perfect was; de "winst-of-verlies" score blijft het belangrijkst.

De onderzoekers hebben deze methode getest op zeven verschillende vraagbeantwoordings-uitdagingen, variërend van eenvoudige trivia tot complexe meerstaps-puzzels. Ze ontdekten dat EviSD consequent beter presteerde dan andere topmethoden. Sterker nog, het verbeterde de nauwkeurigheid van de robot met ongeveer 1,3 tot 2,3 punten vergeleken met de beste bestaande technieken. Misschien nog indrukwekkender is dat de robot leerde om efficiënter te zijn, waardoor hij minder zoekopdrachten nodig had om het antwoord te vinden (een daling van gemiddeld 2,27 zoekopdrachten naar 1,87).

Het artikel suggereert dat deze aanpak een belangrijke stap voorwaarts is omdat het het "credit assignment"-probleem oplost — het uitzoeken welke specifieke acties tot succes leidden — zonder hoe de robot zich gedraagt wanneer hij daadwerkelijk in de echte wereld werkt te veranderen. Wanneer de robot uitgaat om echte problemen op te lossen, heeft hij het referentieblad niet, en dat is prima; hij gebruikt simpelweg de slimmere gewoonten die hij tijdens de training heeft geleerd. De studie laat zien dat door de robot een moment van reflectie te geven met een "geprivilegieerd zicht" op de waarheid, we hem kunnen leren een veel scherpere detective te zijn, die het onderscheid kan maken tussen een gelukkige gok en een goed geplande investigatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →