← Nieuwste papers
🤖 machine learning

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

Het artikel stelt Exploration-Driven Optimization (EDO) voor, een nieuw raamwerk dat diversiteitsbevorderende exploratiedoelstellingen integreert in iteratieve post-trainingmethoden zoals iDPO en GRPO om de spanning tussen samplingdiversiteit tijdens inferentie en RL-geïnduceerde verdelingsscherping op te lossen, waardoor de redeneerprestaties en stabiliteit van LLM's worden verbeterd voor zowel in-distribution als out-of-distribution taken.

Oorspronkelijke auteurs: Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student (een Large Language Model) hebt die leert complexe wiskundepuzzels op te lossen. Je wilt dat ze een meester in probleemoplossing worden.

Meestal gebruiken we bij het trainen van deze studenten een methode die Versterkend Leren (Reinforcement Learning) heet. Denk hierbij aan een strenge coach die de student alleen belooft voor het vinden van het enige beste antwoord. Na verloop van tijd wordt de student erg goed in het vinden van dat ene specifieke pad. Maar hier zit het probleem: ze stoppen met verkennen. Ze raken "vast" in een spoor en kennen slechts één manier om een probleem op te lossen. Als die ene manier faalt, hebben ze geen noodplan.

Dit creëert een conflict. Om echt moeilijke puzzels op te lossen, gebruiken we vaak een techniek tijdens het testen die "Zelf-Consistentie" (Self-Consistency) heet. Dit is alsof je de student vraagt om hetzelfde probleem 10 keer op verschillende manieren op te lossen en vervolgens het antwoord kiest dat het vaakst voorkomt. Dit werkt uitstekend als de student 10 verschillende benaderingen genereert. Maar als de student is getraind om slechts één aanpak te kennen, krijg je door ze 10 keer te vragen om te proberen, gewoon 10 kopieën van hetzelfde (potentieel verkeerde) antwoord.

Het artikel introduceert een nieuwe trainingsmethode genaamd EDO (Exploration-Driven Optimization) om dit op te lossen.

Het Kernidee: De "Nieuwsgierige Ontdekker" versus de "Veilige Specialist"

De auteurs beseften dat om de "Zelf-Consistentie"-truc te laten werken, het model tijdens de training een Nieuwsgierige Ontdekker moet zijn, niet zomaar een Veilige Specialist.

  • De Oude Weg (De Specialist): De coach zegt: "Als je het antwoord goed hebt, geweldig! Als je het fout hebt, probeer dan meer te lijken op de laatste keer dat je het goed had." De student leert om hetzelfde succesvolle patroon keer op keer te herhalen. Het resultaat is een zeer smalle, "scherpe" manier van denken.
  • De Nieuwe Weg (EDO - De Ontdekker): De coach zegt: "Krijg het antwoord goed, maar herhaal ook niet gewoon wat je de vorige keer deed. Probeer een iets ander pad. Als je blijft doen wat je altijd doet, ga ik je zachtjes duwen om iets nieuws te proberen."

De Creatieve Analogie: Het Labyrint en de Zaklamp

Stel je voor dat de student zich in een gigantisch, donker labyrint bevindt (de probleemruimte) en probeert de uitgang te vinden (het juiste antwoord).

  1. Standaard Training: De student vindt een pad naar de uitgang. Ze krijgen een beloning. De volgende keer worden ze getraind om dat exactezelfde pad met laserfocus te volgen. Ze stoppen met kijken naar de muren of andere gangen. Als dat ene pad later geblokkeerd raakt, zitten ze vast.
  2. EDO Training: De student vindt een pad naar de uitgang en krijgt een beloning. Maar de coach voegt een regel toe: "Je moet ook een paar zijgangen verkennen die je nog niet hebt geprobeerd." De student leert om hun "zaklamp" (kansverdeling) breed te houden, waardoor veel verschillende paden worden verlicht, niet alleen degene die ze weten dat werkt.

Hoe Dit in de Praktijk Werkt

Het artikel neemt twee bestaande trainingsmethoden (genaamd iDPO en GRPO) en voegt deze "nieuwsgierigheids"-regel eraan toe. Ze noemen de nieuwe versies ED-iDPO en ED-GRPO.

  • Het Mechanisme: Wiskundig voegen ze een "straf" toe als het model te comfortabel wordt met zijn eerdere antwoorden. Het dwingt het model om iets "oncomfortabel" en divers te blijven, waardoor het zijn opties openhoudt.
  • Het Resultaat: Wanneer ze deze nieuwe modellen testen, krijgen ze niet zomaar één goed antwoord; ze genereren een breed scala aan verschillende oplossingen.

Waarom Dit Belangrijk Is (De "Test-Tijd" Magie)

Omdat het model nu diverse oplossingen genereert, werkt de "Zelf-Consistentie"-truc (om 10 antwoorden vragen en stemmen) plotseling veel beter.

  • Voorheen: Vraag om 10 antwoorden \rightarrow Krijg 10 identieke verkeerde antwoorden \rightarrow Stem \rightarrow Nog steeds fout.
  • Met EDO: Vraag om 10 antwoorden \rightarrow Krijg 10 verschillende benaderingen (sommige goed, sommige fout) \rightarrow Stem \rightarrow Het juiste antwoord wint omdat het in verschillende vormen meerdere keren verscheen.

De Resultaten

De auteurs testten dit op moeilijke wiskundewedstrijden (zoals de AIME- en MATH-datasets).

  • Nauwkeurigheid: De nieuwe methoden (ED-iDPO en ED-GRPO) losten meer problemen correct op dan de eerdere beste methoden.
  • Diversiteit: De modellen produceerden veel gevarieerdere antwoorden (gemeten aan de hand van hoe verschillend de woorden en stappen waren).
  • Stabiliteit: In tegenstelling tot andere methoden die soms ervoor zorgen dat het model "instort" (alles vergeet en repetitief wordt), hield EDO het model stabiel en creatief gedurende het hele trainingsproces.

Samenvatting

In eenvoudige termen leert EDO AI-modellen om minder bezeten te zijn van "perfecte consistentie" en meer bereid te zijn om "creatief divers" te zijn. Door het model te dwingen tijdens de training verschillende paden te verkennen, wordt het veel beter in het oplossen van moeilijke problemen wanneer het wordt gevraagd om meerdere oplossingen te genereren tijdens het testen. Het is het verschil tussen een student die één oplossing uit het hoofd leert en een student die het landschap van het probleem zo goed begrijpt dat het antwoord vanuit vele verschillende hoeken kan worden gevonden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →