← Nieuwste papers
🤖 AI

MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop

Het artikel introduceert MulFeRL, een multi-turn reinforcement learning-framework dat redeneren verbetert door rijke verbale feedback op mislukte monsters om te zetten in trainbare leersignalen, waardoor het bestaande supervised en RLVR-baselines overtreft in zowel in-domain als out-of-domain taken.

Oorspronkelijke auteurs: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xuancheng Li, Haitao Li, Yujia Zhou, YiqunLiu, Qingyao Ai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Stille Mislukking" van AI

Stel je voor dat je een student leert om complexe wiskundeproblemen op te lossen. Je geeft ze een toets, en ze geven een fout antwoord.

Bij standaard AI-training (genaamd RLVR) zegt de leraar alleen maar: "Fout." Dat is het. Geen uitleg, geen hint, alleen een score van nul.

  • Het Probleem: Als de student 100 problemen fout heeft, krijgt hij 100 keer de score "Fout". Hij heeft geen idee waarom hij is gefaald. Heeft hij de getallen verkeerd opgeteld? Heeft hij de vraag verkeerd begrepen? Heeft hij een stap overgeslagen?
  • Het Resultaat: De AI loopt vast. Hij blijft willekeurig gokken omdat het "leersignaal" (de feedback) te schaars en onbehulpzaam is. Het is alsof je probeert te leren autorijden door alleen te horen "Crash" wanneer je tegen een muur rijdt, zonder ooit te horen dat je bent vergeten in je achteruitkijkspiegel te kijken.

De Oplossing: MulFeRL (De "Coach met een Klembord")

Onderzoekers stellen MulFeRL voor (Multi-turn Feedback-guided Reinforcement Learning). In plaats van alleen maar "Fout" te zeggen, werkt dit systeem als een strenge maar behulpzame coach die specifieke, verbale adviezen geeft.

Zo werkt het, stap voor stap:

1. De "Alles-Gefaald" Valstrik

Normaal gesproken, als een AI probeert een moeilijk probleem op te lossen en faalt, stopt het proces. De trainingslus wordt doorbroken omdat er geen "goed" antwoord is om het "slechte" antwoord mee te vergelijken.

  • MulFeRL's Zet: Wanneer de AI volledig faalt, geeft het systeem niet op. Het pauzeert en vraagt een "Feedback Provider" (zoals een slim mens of een sterkere AI) om naar de puinhoop te kijken.

2. De "Verbale Feedback" (De Notities van de Coach)

De Feedback Provider zegt niet alleen "Fout". Het schrijft een notitie:

  • "Je probeerde de stelling van Pythagoras te gebruiken, maar je bent vergeten de getallen eerst te kwadrateren."
  • "Je bent een minteken vergeten in stap 3."
    Dit is de Verbale Feedback. Het verandigt een vage mislukking in een specifieke les.

3. De "Regeneratie" (De Doen-het-opnieuw)

Nu krijgt de AI een tweede kans. De AI neemt het oorspronkelijke probleem plus de notities van de coach en probeert het opnieuw op te lossen.

  • De Magie: Als de AI de notities correct gebruikt, kan het eindelijk het juiste antwoord vinden.
  • De Credit: Het systeem weet nu: "Ah! Toen we de AI de specifieke opmerking over het kwadrateren van getallen gaven, slaagde hij." Dit verandert de "mislukking" in een "succes" waarvan geleerd kan worden.

4. Twee Manieren om te Leren (Het Scorebord)

Het paper introduceert twee specifieke manieren om dit nieuwe proces te beoordelen:

  • Scenario A: De "Gemengde Zak" (GRPO)
    Soms, nadat de AI de notities heeft gekregen, probeert hij het 8 keer. Sommige pogingen zijn nog steeds fout, maar andere zijn goed.

  • Analogie: Het is als een sportteam waarbij sommige spelers fouten maakten maar anderen geweldig speelden. De coach kan zeggen: "Kijk naar de spelers die succes hadden; kopieer hun bewegingen." De AI leert door zijn eigen goede pogingen te vergelijken met zijn eigen slechte pogingen.

  • Scenario B: De "Totale Ommekeer" (FCO)
    Soms zijn de notities zo goed dat alle 8 pogingen correct zijn.

  • Analogie: Het hele team speelt plotseling perfect. In standaard training is dit verwarrend omdat er geen "slechte" voorbeelden zijn om mee te vergelijken.

  • MulFeRL's Truc: Het kijkt naar het voor en na. Het vergelijkt het "Voor" (waar iedereen faalde) met het "Na" (waar iedereen slaagde). Het vertelt de AI: "Herinner je hoe je hiervoor faalde? Herinner je hoe je succesvol was na de notities? Doe meer van de 'Na'-versie." Dit wordt Feedback-Contrastive Optimization (FCO) genoemd.

5. De "Vaste Slot" (Het Plaknotitie)

Om ervoor te zorgen dat de AI de notities ook echt leest, plakt MulFeRL de feedback niet zomaar onderaan de pagina. Het plaatst de feedback in een vast, speciaal vak (zoals een <feedback> tag) midden in het denkproces.

  • Analogie: Het is alsoals een student een plaknotitie op zijn rekenmachine heeft met de tekst "Check je tekens!" in plaats van alleen een rapportcijfer aan het einde van de week te lezen. Het dwingt de AI om het advies te bekijken terwijl hij aan het werk is.

Waarom Dit Belangrijk Is

Het paper laat zien dat door deze "Coach met een Klembord"-aanpak te gebruiken:

  1. Het lost het "Stille Mislukking"-probleem op: Het vindt een manier om te leren, zelfs wanneer de AI in eerste instantie alles fout heeft.
  2. Het leert sneller: De AI verbetert sneller omdat hij specifieze instructies krijgt over hoe hij zijn fouten moet herstellen, niet alleen een score.
  3. Het werkt op nieuwe zaken: Hoewel het getraind was op wiskundeproblemen, werd het ook beter in wetenschap en algemene redeneertaken, wat bewijst dat het een betere manier van denken heeft geleerd, en niet alleen wiskundige antwoorden heeft uit het hoofd geleerd.

Samenvatting

MulFeRL is een methode die voorkomt dat AI vastloopt wanneer het faalt. In plaats van mislukte pogingen te negeren, gebruikt het verbale feedback om de AI aan te sturen om het opnieuw te proberen. Het beloont de AI vervolgens niet alleen voor het goed krijgen van het antwoord, maar ook voor het verbeteren op basis van de feedback. Het verandert "Ik ben mislukt" in "Hier is hoe ik het heb opgelost", waardoor het leerproces veel rijker en effectiever wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →