← Nieuwste papers
🤖 machine learning

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

STRIDE is een nieuw trainingskader dat redenering bij grote taalmodellen verbetert door een generator en een generatieve verificator te co-trainen met uitsluitend op uitkomst gebaseerde beloningen, waarbij scalair scores worden vervangen door leerbare, stapsgewijze taalfeedback die fouten expliciet lokaliseert en redeneringstrajecten herleidt.

Oorspronkelijke auteurs: Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar lichtelijk verwarde student leert hoe een complex doolhof opgelost moet worden. In het verleden was de manier waarop we deze AI-"studenten" (Grote Taalmodellen) trainden, vergelijkbaar met hen een toets geven en hen alleen de eindcijfer te vertellen: "Je hebt het fout."

Dit is het probleem dat het artikel STRIDE probeert op te lossen. Hieronder volgt een eenvoudige uiteenzetting van hoe het werkt, met behulp van alledaagse analogieën.

Het Probleem: Het "Stille" Cijferblad

Momenteel gebruikt de meeste AI-training een methode die Versterkend Leren heet. Denk hierbij aan een videospelletje waarbij de AI een level speelt en pas aan het einde een "Game Over" of "Je Wint"-bericht krijgt.

  • Het Probleem: Als de AI een fout maakt in stap 3 van een wiskundeprobleem met 10 stappen, zegt de leraar (de computer) niet: "Hé, je hebt de getallen in stap 3 verkeerd opgeteld." Het zegt gewoon: "Fout antwoord."
  • Het Gevolg: De AI moet raden waar het fout ging. Het is alsof je probeert een kapotte motor te repareren door alleen te weten dat de auto niet start, zonder dat een monteur je vertelt welk onderdeel loszit. Dit wordt een informatieknelpunt genoemd — de leraar geeft te weinig informatie om de specifieke fout op te lossen.

Sommige eerdere methoden probeerden stap-voor-stap cijfers te geven (zoals "Stap 1: Goed, Stap 2: Slecht"), maar deze cijfers zijn gewoon getallen (0 of 1). Ze leggen nog steeds niet uit waarom de stap slecht was.

De Oplossing: STRIDE (De "Praatgrage" Coach)

De auteurs stellen STRIDE voor, wat staat voor Stepwise Trajectory Redirection with In-context Deep Evaluation.

In plaats van een stil cijferblad introduceert STRIDE een Generatieve Verificator. Denk hierbij aan een coach-assistent die naast de student zit en het probleem in real-time met hen doornemen.

Hieronder wordt uitgelegd hoe STRIDE in drie fasen werkt, als een trainingskamp:

Fase 1: De Warm-up (Basisbeleid)

De AI-student probeert problemen op te lossen op eigen houtje. Het krijgt aan het einde een simpel "Goed/Fout"-cijfer. Dit bouwt een basis op, net als het leren van de spelregels.

Fase 2: De Coach Trainen (De Verificator)

Nu traint het systeem een tweede AI (de Verificator) om als coach op te treden.

  • De Magie: De coach wordt niet geleerd door een mens die een lijst met goed/slecht-antwoorden voor elke stap geeft (wat te duur en traag is). In plaats daarvan leert de coach door de student problemen te zien oplossen en te controleren of het eindantwoord correct was.
  • De Vaardigheid: Na verloop van tijd leert de coach om naar het rommelige werk van de student te kijken en te zeggen: "Wacht, in stap 3 ben je vergeten om de 1 over te dragen," of "Je hebt hier een logische stap overgeslagen." Het leert een simpel "Fout"-cijfer om te zetten in een gedetailleerde, geschreven kritiek.

Fase 3: De "Opnieuw" met Gids (Trajectherleiding)

Dit is de kerninnovatie. Wanneer de student een probleem faalt:

  1. De Eerste Fout Vinden: De Coach (Verificator) scant het werk van de student en vindt het Eerste Faalpunt (FPF). Het pinpoint precies waar de logica bezweek.
  2. De "Herleiding": In plaats van de student het hele probleem opnieuw te laten beginnen vanaf nul (wat verspillend is), zegt het systeem: "Oké, je deed het tot stap 2 geweldig. Laten we daar stoppen. Hier is mijn geschreven notitie die uitlegt waarom stap 3 faalde. Probeer nu de rest van het probleem opnieuw op te lossen, beginnend bij stap 2, gebruikmakend van mijn advies."
  3. Meerpuntsstrategie: Soms werd de fout in stap 3 veroorzaakt door een "slechte keuze" in stap 1 die er op dat moment goed uitzag. STRIDE is slim genoeg om te zeggen: "Laten we proberen opnieuw te beginnen bij stap 1 en stap 2," waardoor de student meerdere kansen krijgt om een beter pad te vinden.

Waarom Dit Een Grote Zaken Is

Het artikel beweert dat deze aanpak twee grote problemen oplost:

  1. Het "Stilte" Doorbreken: Door taalfedback (woorden) te gebruiken in plaats van alleen scalare beloningen (getallen), krijgt de AI een veel rijkere uitleg. Het is het verschil tussen een leraar die zegt "Onvoldoende" en een leraar die zegt "Je bent vergeten het minteken te distribueren."
  2. Het "Onoplosbare" Oplossen: De auteurs ontdekten dat voor zeer moeilijke problemen waarbij de AI normaal gesproken 0% goed haalt, standaardmethoden opgeven omdat ze geen bruikbaar signaal krijgen. STRIDE kan echter nog steeds leren. Zelfs als de AI faalt, kan de Coach de fout aangeven, en kan de AI vanaf dat specifieke punt een ander pad proberen, waardoor het uiteindelijk de code kraakt.

De Analogie Samenvatting

  • Oude Manier: Je doet een toets. Je krijgt een "0/100". Je hebt geen idee wat je moet studeren.
  • Vorige "Stap" Manier: Je krijgt een toets met "Stap 1: 10/10, Stap 2: 0/10". Je weet waar je faalde, maar niet waarom.
  • STRIDE: Je doet een toets. Je krijgt een "0/100", maar je leraar geeft je ook een geschreven notitie die zegt: "Je bleef hangen bij Stap 2 omdat je de verkeerde formule gebruikte. Laten we teruggaan naar Stap 1, deze notitie bekijken en een andere aanpak proberen."

De Resultaten

Het artikel testte dit uit op moeilijke wiskunde- en logische puzzels.

  • STRIDE sloeg alle andere huidige methoden (inclusief de vorige state-of-the-art).
  • Het werkte op wiskundeproblemen, programmeeruitdagingen en logische puzzels.
  • Het belangrijkste is dat het problemen wist op te lossen die eerder als "onmogelijk" voor deze modellen werden beschouwd, waardoor een succespercentage van 0% veranderde in een leermogelijkheid.

Kortom, STRIDE leert AI om van zijn fouten te leren door met zichzelf te praten, in plaats van blind te gokken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →