← Nieuwste papers
🤖 machine learning

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

Dit artikel introduceert TraFL, een post-trainingmethode op basis van trajectbalans voor diffusietalenmodellen die de faalmodus "trajectvergrendeling" van beloningsmaximaliserende benaderingen overwint door het beleid af te stemmen op een beloningsgeoriënteerde doeldistributie, waardoor consistente prestatiewinsten worden bereikt op benchmarks voor wiskundig redeneren en codegeneratie.

Oorspronkelijke auteurs: Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

Gepubliceerd 2026-05-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Nieuwe Manier om AI Te Leren

Stel je voor dat je een zeer getalenteerde kunstenaar (het AI-model) hebt die schilderijen kan maken door te beginnen met een ruisend, statisch canvas en dit langzaam schoon te maken totdat een helder beeld verschijnt. Zo werken Diffusie-taalmodellen: ze schrijven woorden niet één voor één zoals een typemachine (zoals oudere AI-modellen deden); in plaats daarvan beginnen ze met een warboel van letters en "ontruisen" deze geleidelijk tot een samenhangende zin.

Het artikel betoogt dat de huidige manier waarop we deze kunstenaars leren om betere resultaten te boeken bij moeilijke problemen (zoals wiskunde of programmeren), defect is. De auteurs stellen een nieuwe methode voor genaamd TraFL (Trajectory Flow baLancing) die een specifiek gebrek oplost genaamd "Trajectory Locking" (Trajectvergrendeling).


Het Probleem: De "Eén-Route"-Valstrik (Trajectory Locking)

Om het probleem te begrijpen, stel je een doolhof voor.

  • Het Doel: Het doolhof heeft vele verschillende juiste uitgangen (verschillende geldige oplossingen voor een wiskundeprobleem).
  • De Oude Methode (Beloningsmaximerende RL): Stel je voor dat je een hond traint om de uitgang te vinden. Elke keer dat de hond een uitgang vindt, krijg je een traktatie.
    • Het Gebrek: De hond maakt zich niet druk om welke route hij heeft genomen om de traktatie te krijgen, alleen dat hij er een kreeg.
    • Het Resultaat: Als de hond per toeval op een specifieke route stuit die vroeg leidt tot een traktatie, krijgt hij een traktatie. Hij onthoudt die route. De volgende keer probeert hij die route opnieuw. Hij krijgt nog een traktatie. Hij wordt zelfverzekerder in die ene route.
    • Trajectory Locking: Uiteindelijk stopt de hond met het verkennen van het doolhof. Hij rent alleen nog maar die ene smalle route af, zelfs als er 50 andere geldige uitgangen zijn die hij had kunnen vinden. Hij heeft zich "vergrendeld" op één enkele oplossing en is vergeten hoe hij de anderen kan vinden.

In het artikel noemen de auteurs dit Trajectory Locking. Omdat de AI alleen een "beloning" (een score) krijgt voor het eindantwoord, negeert het het feit dat er vele verschillende manieren (routes) waren om daar te komen. Het stort al zijn creativiteit in één smalle route, waardoor het slecht wordt in het vinden van alternatieve juiste antwoorden als je het vraagt om het opnieuw te proberen.

De Oplossing: De "Gids"-Benadering (TraFL)

De auteurs stellen TraFL voor, wat de trainingsregels verandert. In plaats van alleen een traktatie te geven voor elke uitgang, geven ze de AI een Gids (een bevroren referentiemodel) en een Kaart.

  1. De Gids (Referentiemodel): Dit is een versie van de AI die nog niet is getraind op de specifieke beloningen. Het vertegenwoordigt een "gezonde", diverse manier van denken. Het weet dat er vele manieren zijn om een probleem op te lossen.
  2. De Kaart (Belonings-georiënteerd Doel): We zeggen tegen de AI: "Je wilt de uitgangen vinden die de beloning krijgen (de juiste antwoorden), MAAR je moet je bewegingspatronen vergelijkbaar houden met die van de Gids."

De Analogie:
Stel je voor dat je een student leert een wiskundeprobleem op te lossen.

  • Oude Manier: Je zegt: "Krijg het juiste antwoord, hoe dan ook!" De student vindt één truc die werkt, onthoudt die en weigert om andere methoden te leren.
  • TraFL Manier: Je zegt: "Vind het juiste antwoord, maar houd je denkproces divers en flexibel, zoals een topstudent die vele verschillende strategieën kent."

TraFL dwingt de AI om twee dingen in evenwicht te brengen:

  1. De Beloning Krijgen: Het juiste antwoord vinden.
  2. Divers Blijven: Niet instorten in één enkele, repetitieve route. Het houdt de "waarschijnlijkheidsmassa" (de kans om een route te kiezen) verspreid over vele verschillende geldige oplossingen, verankerd door de Gids.

Hoe Ze Het Werkbaar Maken

Het artikel merkt op dat Diffusiemodellen lastig zijn omdat ze hun "denkproces" niet stap-voor-stap tonen zoals oudere modellen doen. Om dit op te lossen, hebben de auteurs twee tools uitgevonden:

  1. Een Surrogaatscore: Omdat ze de exacte wiskunde van elke stap niet kunnen zien, hebben ze een "proxy"-score gecreëerd die schat hoe goed een volledig antwoord is, waardoor ze het model kunnen trainen zonder perfecte zichtbaarheid op elke kleine stap nodig te hebben.
  2. Een Geleerde Normalisator: Ze hebben de AI een speciale "rekenmachine" geleerd die de moeilijkheidsgraad van de taak aanpast op basis van de specifieke vraag (de prompt), zodat de training eerlijk en gebalanceerd blijft.

De Resultaten: Helpt Het Eigenlijk?

De auteurs hebben deze nieuwe methode getest op Wiskunde (het oplossen van woordproblemen) en Code (het schrijven van computerprogramma's).

  • De "Eén-Route"-Valstrik was verbroken: In tegenstelling tot andere methoden die soms slechter werden in het vinden van verschillende oplossingen terwijl ze beter werden in het vinden van één oplossing, verbeterde TraFL bij elke enkele test.
  • Meer Steekproeven = Betere Resultaten: Toen ze de AI vroegen om 16 verschillende antwoorden te genereren in plaats van slechts 1, werd TraFL aanzienlijk beter. Dit bewijst dat het daadwerkelijk meer verschillende juiste oplossingen vond, niet slechts één gelukkige gok.
  • Het Werkt op Nieuwe Dingen: De AI heeft niet alleen de trainingsvragen uit het hoofd geleerd. Toen getest op gloednieuwe wiskundeproblemen (Minerva Math) en nieuwe programmeeruitdagingen (LiveCodeBench) die het nog nooit had gezien, was TraFL de sterkste presteerder.
  • Diversiteitscontrole: Ze gebruikten een "Rechter" (een andere AI) om de antwoorden te bekijken. De Rechter bevestigde dat TraFL niet gewoon hetzelfde antwoord gaf in andere woorden; het gebruikte daadwerkelijk verschillende redeneerstrategieën en verschillende algoritmen om dezelfde problemen op te lossen.

Samenvatting

Het artikel identificeert een gebrek waarbij AI-modellen "vast komen te zitten" op één manier om een probleem op te lossen, en andere geldige oplossingen negeren. Ze hebben dit opgelost met TraFL, een methode die de AI leert om naar juiste antwoorden te zoeken terwijl het een diverse "verkenning" van verschillende routes behoudt, geleid door een referentiemodel. Het resultaat is een AI die niet alleen slimmer is, maar ook creatiever en betrouwbaarder wanneer er om meerdere oplossingen wordt gevraagd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →