← Nieuwste papers
🤖 machine learning

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

Dit artikel toont aan dat het integreren van een eenvoudige, op representatie gebaseerde diversiteitsbonus afgeleid van vooraf getrainde verborgen toestanden in zowel inferentie-tijd bemonstering als post-training reinforcement learning de prestaties en de monster-efficiëntie van taalmodellen aanzienlijk verbetert door de ontdekking van nieuwe gedragingen te bevorderen in plaats van enkel bestaande gedragingen te verfijnen.

Oorspronkelijke auteurs: Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

Gepubliceerd 2026-07-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen instructies opvolgen, maar ook echt leren zelfstandig na te denken, puzzels oplossen en code schrijven door te proberen, te falen en het opnieuw te proberen. Dit is het domein van Reinforcement Learning (RL), een tak van kunstmatige intelligentie waarbij een agent leert door te interageren met zijn omgeving om beloningen te maximaliseren. Denk aan het trainen van een hond: als hij zit, krijgt hij een traktatie; als hij springt, krijgt hij niets. Na verloop van tijd leert de hond de beste gedragingen om de meeste traktaties te krijgen.

In de wereld van grote taalmodellen (de superintelligente AI-chatbots die we vandaag de dag gebruiken), wordt dit proces "post-training" genoemd. Wetenschappers voeren het model een wiskundig probleem of een programmeertaak, laten het een antwoord genereren en controleren of het correct is. Als het klopt, krijgt het model een "beloning" en leert het om dat specifieke ding de volgende keer beter te doen. Er is echter een addertje onder het gras. Huidige methoden werken vaak als een student die simpelweg de antwoorden uit het tekstboek uit het hoofd leert. Ze worden erg goed in de specifieke trucjes die ze al kennen, maar ze ontdekken zelden nieuwe manieren om problemen op te lossen. Ze worden alleen scherper in wat ze al doen. De grote vraag die wetenschappers zich afvragen is: Kunnen we deze AI-modellen leren om nieuwsgierige ontdekkingsreizigers te zijn in plaats van alleen maar memoriseerders? Kunnen we hen aanmoedigen om vreemde, nieuwe en diverse benaderingen te proberen om oplossingen te vinden die hun basis training nooit heeft getoond?

Dit artikel, getiteld "Representation-Based Exploration for Language Models," duikt precies in die vraag. De onderzoekers, Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy en Jordan T. Ash, stellen een slimme nieuwe manier voor om AI-modellen te laten exploreren. In plaats van het model simpelweg willekeurig te laten gokken of het simpelweg te laten herhalen wat het al weet, geven ze het model een "diversiteitsbonus." Stel je voor dat je op zoek bent naar een verborgen schat in een enorm bos. Een willekeurige wandelaar zou maar wat ronddwalen, terwijl een slimme wandelaar misschien elke verschillende soort boom probeert te bezoeken om er zeker van te zijn dat hij geen aanwijzing mist. Dit artikel suggereert het gebruik van de eigen interne "gedachten" (de verborgen toestanden) van de AI om te meten hoe verschillend een nieuw idee is van de ideeën die het al geprobeerd heeft. Als een idee "vers" of "nieuw" aanvoelt vergeleken met de eerdere pogingen, krijgt het een bonusbeloning, wat het model aanmoedigt om dat nieuwe pad te blijven verkennen.

Het team testte dit idee op twee belangrijke manieren. Eerst keken ze naar "inference-time" exploratie, wat een eenmalige test is. Ze genereerden duizenden antwoorden op een enkel wiskundig probleem en gebruikten hun "diversiteitsbonus" om de meest interessante ervan te selecteren om te controleren. Ze vonden dat deze methode ongelooflijk efficiënt was. Zo verbeterde hun methode, bij het gebruik van een model genaamd Qwen-2.5-14b-Instruct op een moeilijke wiskundige dataset genaamd MATH, de efficiëntie van het vinden van een correct antwoord met meer dan 50% vergeleken met het simpelweg willekeurig kiezen van antwoorden. Sterker nog, voor sommige taken hadden ze 3 tot 13 keer minder pogingen nodig om een juiste oplossing te vinden wanneer ze deze exploratiestrategie gebruikten.

Ten tweede integreerden ze deze exploratiestrategie in het eigenlijke trainingsproces (post-training). Ze wilden zien of het de AI kon helpen om nieuwe gedragingen te leren in plaats van alleen oude aan te scherpen. De resultaten waren veelbelovend. Wanneer ze het model trainden met deze exploratiebonus, werd het niet alleen beter in dezelfde oude trucjes; het begon ook antwoorden te genereren die veel nieuwer en creatiever oogden. Op een uitdagende wiskundige competitiedataset genaamd AIME 2024 presteerde hun exploratie-versterkte model even goed als een standaard trainingsmethode die vier keer zoveel samples gebruikte. Dit suggereert dat door bewust diversiteit aan te moedigen, we AI-modellen kunnen helpen bij het ontdekken van nieuwe capaciteiten zonder dat daar enorme hoeveelheden extra data of rekenkracht voor nodig zijn.

De auteurs merken echter voorzichtig op dat dit geen wondermiddel is dat alles oplost. Ze ontdekten dat de methode het beste werkt met sterkere, meer capabele modellen; zwakkere modellen profiteerden soms niet of werden zelfs slechter. Ze toonden ook aan dat hoewel deze aanpak het model helpt om nieuwe oplossingen te vinden, dit niet noodzakelijkerwijs betekent dat het model "slimmer" is in algemene zin, maar eerder dat het beter is in het navigeren door de enorme ruimte van mogelijke antwoorden om de juiste te vinden. Het artikel suggereert dat deze "bewuste exploratie" een praktische weg vooruit is, die een manier biedt om verder te gaan dan simpelweg het aanscherpen van bestaande vaardigheden en toe te bewegen naar het ontdekken van werkelijk nieuwe gedragingen in taalmodellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →