← Nieuwste papers
🤖 machine learning

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

Het artikel stelt LEAF voor, een retrospectieve boomgebaseerde reinforcement learning-methode die de post-training van spraakbewuste grote taalmodellen verbetert door span-niveau voordelen toe te wijzen aan gedeelde prefixen in rollout-batches, waardoor het bestaande GRPO-stijl benaderingen en zelfs full-parameter baselines met kleinere modellen overtreft.

Oorspronkelijke auteurs: Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student leert hoe hij een verhaal moet schrijven op basis van een gesproken opdracht. In de oude manier (met een methode genaamd GRPO) luistert de leraar naar het hele verhaal dat de student schrijft, geeft er een eindcijfer voor en zegt dan tegen de student: "Goed gedaan met het hele verhaal!" of "Slecht gedaan met het hele verhaal!"

Het probleem met deze aanpak is dat het te onhandig is. Als de student een geweldige opening heeft geschreven maar een verschrikkelijk einde, straft het "slechte cijfer" de geweldige opening net zo hard als het slechte einde. Omgekeerd, als de student een wankele start had maar een briljante afsluiting, beloont het "goede cijfer" de wankele start. De leraar weet niet waar de student het goed of fout heeft gedaan.

Maak kennis met LEAF (Low-rank Exploration with Adaptive Forking).

De onderzoekers aan de University of Illinois stellen een slimmere manier voor om deze spraak-AI-modellen te onderwijzen. In plaats van alleen één cijfer te geven voor het hele verhaal, werkt LEAF als een detective die terugkijkt naar het werk van de student om de exacte momenten te vinden waarop het verhaal een wending nam.

Zo werkt LEAF, met behulp van eenvoudige analogieën:

1. De "Groepsreis"-analogie

Stel je voor dat je 8 studenten op dezelfde wandeling stuurt (de "rollout"). Ze beginnen allemaal samen en lopen dezelfde route voor de eerste mijl. Dan, bij een splitsing in de weg, gaan sommige studenten linksaf en anderen rechtsaf. Uiteindelijk bereiken ze allemaal het einde, en je geeft ze een score op basis van hoe mooi het uitzicht was.

  • De Oude Manier (GRPO): Je zegt tegen alle 8 de studenten: "Goed gedaan!" of "Slecht gedaan!" op basis van het uiteindelijke uitzicht. Je geeft niet om het feit dat 4 van hen bij mijl 1 het verkeerde pad hebben gekozen.
  • De LEAF-manier: LEAF kijkt naar de groep en zegt: "Wacht eens even. Iedereen liep de eerste mijl samen. Daarna splitste de groep zich bij mijl 1. Laten we kijken naar de mensen die het linkerpad hebben genomen. Hebben zij een beter uitzicht gekregen? Ja? Dan was de beslissing voor het "linkerpad" goed. Laten we kijken naar de mensen die het rechterpad hebben genomen. Hebben zij een slechter uitzicht gekregen? Ja? Dan was de beslissing voor het "rechterpad" slecht."

2. Het zoeken naar de "Splitsingen" (De vertakking)

In spraak-AI genereert het model woorden één voor één. Soms raakt het in de war of maakt het een riskante gok. LEAF zoekt naar deze momenten van verwarring (zogenaamde "high-surprisal" punten).

Denk aan een Kies je eigen avontuur-boek.

  • Het model schrijft de eerste paar zinnen.
  • LEAF vraagt: "Waren al de groepen AI-modellen het eens over deze eerste zinnen?"
  • Als dat zo is, behandelt LEAF dat als een solide "basis kamp".
  • Vervolgens zoekt LEAF naar het moment waarop de modellen begonnen te verschillen of andere paden insloegen. Het markeert die plek als een "Fork" (splitsing).

3. Het "Terugspoelen en Belonen"

Zodra LEAF deze splitsingen vindt, spoelt het de tape terug. Het groepeert de reacties op basis van het pad dat ze vóór de splitsing hebben genomen.

  • Als een groep reacties een specifieke prefix (het begin van de zin) deelde en daarna een hoge score behaalde, geeft LEAF extra punten specifiek aan dat beginstuk.
  • Als een groep een prefix deelde maar daarna een lage score kreeg, geeft LEAF negatieve punten specifiek aan dat deel, waarbij het tegen het model zegt: "Begin je zinnen niet op die manier."

Dit is als een coach die zegt: "Je hebt de eerste ronde perfect gerend, maar je struikelde bij de 50 meter. Laten we ons trainen richten op het verbeteren van dat specifieke 50-meterstuk, niet op de hele race."

Waarom is dit een grote zaak?

Het onderzoek beweert dat door deze "retrospectieve boom"-methode te gebruiken, LEAF de AI veel beter onderwijst dan de oude methode, zelfs met minder middelen.

  • Slimmer leren: Het voorkomt dat de AI slechte gewoonten aanleert simpelweg omdat het einde gelukkig uitpakte, of goede gewoonten omdat het einde ongelukkig uitpakte.
  • Efficiëntie: Het hoeft geen nieuwe verhalen te genereren om te leren. Het analyseert simpelweg de verhalen die het al heeft gegenereerd en vindt de verborgen structuur daarin.
  • Betere resultaten: Het onderzoek laat zien dat modellen die met LEAF zijn getraind, beter zijn in het beantwoorden van vragen over audio en het vertalen van spraak dan modellen die met de oude methode zijn getraind. Sterker nog, een kleiner model getraind met LEAF presteerde beter dan een veel groter model getraind met de oude methode.

De Kern

LEAF is een nieuwe trainingsmethode voor spraak-AI die stopt met het behandelen van een heel gesprek als één enkele "goede" of "slechte" gebeurtenis. In plaats daarvan breekt het het gesprek af in kleine segmenten, identificeert exact waar de AI een goede of slechte beslissing nam, en geeft krediet (of schuld) aan alleen die specifieke momenten. Het is alsoك een upgrade van een leraar die een heel essay in één keer beoordeelt, naar een leraar die precies de zinnen markeert die aandacht nodig hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →