← Nieuwste papers
🤖 AI

RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

Het artikel introduceert RREDCoT, een nieuwe methode die het redeneermodel zelf gebruikt om de optimale segmentniveau-beloningsherverdeling voor Chain-of-Thought-sporen te benaderen, waarmee de hoge variantie en computationele inefficiëntie van traditionele Monte Carlo-credittoewijzing bij reinforcement learning fine-tuning wordt aangepakt.

Oorspronkelijke auteurs: Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Black Box" van Redeneren

Stel je voor dat je een student leert om een zeer moeilijke wiskundige som op te lossen. De student schrijft een lang, stapsgewijs denkproces op (een "Chain of Thought") voordat hij uiteindelijk het antwoord opschrijft.

Bij huidige AI-trainingsmethoden geeft de leraar pas feedback aan het einde.

  • De Student: Schrijft 50 pagina's aan gedachten, maakt een fout op pagina 10, maar gaat door en raadt uiteindelijk het juiste antwoord op pagina 50.
  • De Leraar: Zegt: "Goed gedaan! Je hebt het juiste antwoord gevonden."
  • Het Resultaat: De student denkt: "Wauw, mijn fout op pagina 10 was eigenlijk heel nuttig!" of "Ik weet niet welk deel van mijn 50 pagina's eigenlijk nuttig was."

Dit wordt een delayed reward problem (probleem van vertraagde beloning) genoemd. Omdat de AI niet weet welke specifieke gedachten tot succes leidden, leert het traag en inefficiënt. Het is alsoer dat je probeert te leren autorijden door pas een "Goed gedaan" of "Slecht gedaan" signaal te krijgen nadat je geparkeerd hebt, zonder te weten of je te vroeg aan het stuur draaide of te laat remde.

De Oplossing: RREDCoT (De "Rewind and Re-distribute" Tool)

De auteurs hebben een nieuwe methode ontwikkeld genaamd RREDCoT (Reward REDistribution for Chain of Thoughts).

Zie RREDCoT als een slimme redacteur die het 50-pagina tellende concept van de student bekijkt. In plaats van alleen het eindantwoord te beoordelen, gaat de redacteur terug en wijst aan elke paragraaf een "score" toe.

  • Paragraaf 1-5: "Goede opzet, maar niet cruciaal." (Lage score)
  • Paragraaf 10: "Dit was een verkeerde afslag, maar je bent hersteld." (Negatieve score)
  • Paragraaf 25: "Dit was het cruciale inzicht dat het puzzelstukje oploste!" (Hoge score)
  • Paragrafa 50: "Correct antwoord." (Bonusscore)

Door krediet (of schuld) toe te kennen aan specifieke delen van het denkproces, leert de AI veel sneller welke gedachten daadwerkelijk nuttig zijn.

Hoe het werkt (Zonder de wiskunde)

Het papier legt uit dat eerdere methoden probeerden dit op twee manieren op te lossen, die beide gebreken hadden:

  1. Het "Gokspelletje" (Monte Carlo Sampling): De AI genereert dezelfde opdracht 100 keer om te zien welke stappen meestal tot succes leiden. Dit is accuraat, maar duurt eeuwen (alsof je 100 keer een marathon loopt om de beste route te bepalen).
  2. Het "Schuldspelletje" (Attribution): Kijken naar de interne "aandacht" (attention) van de AI om te raden wat belangrijk was. Het papier stelt dat dit vaak misleidend is, omdat het kijkt naar waar de AI naar keek, niet naar wat er daadwerkelijk werkte.

De truc van RREDCoT:
In plaats van de AI 100 keer te laten draaien of blind te gokken, gebruikt RREDCoT de eigen kennis van de AI om de waarde van elke stap in te schatten.

  • Het kijkt naar de "Referentieoplossing" (het juiste pad).
  • Het vraagt: "Als ik deze specifieke stap had genomen, hoe dichter bij het juiste antwoord was ik dan gekomen?"
  • Het gebruikt een slimme wiskundige shortcut (geïnspireerd door hoe we het volgende woord in een zin voorspellen) om dit direct te berekenen, zonder dat er 100 extra versies van het verhaal gegenereerd hoeven te worden.

De "Hybrid Segmentation" (De taart snijden)

Om dit werkend te krijgen, moet de AI weten waar één "gedachte" eindigt en een andere begint. Je kunt niet simpelweg naar elke letter (token) kijken, want dat is te veel data.

  • Het idee van het papier: Ze gebruiken een "Hybrid Segmentation" strategie. Stel je voor dat je een lange taart snijdt.
    • Eerst snijden ze op duidelijke plekken (zoals nieuwe paragrafen of trefwoorden zoals "Wacht even" of "Daarom").
    • Daarna kijken ze naar de "verwarring" (entropie) van de tekst. Als de AI erg onzeker was over wat hij daarna moest schrijven, is dat een goede plek om de taart te snijden.
    • Dit creëert logische "blokken" van denken die gemakkelijk te beoordelen zijn.

Wat ze vonden (De resultaten)

De onderzoekers testten dit op wiskundige problemen (zoals de AIME en MATH datasets).

  • Sneller leren: Modellen die RREDCoT gebruikten, leerden problemen beter en sneller op te lossen dan modellen die de standaardmethode (GRPO) gebruikten.
  • Betere efficiëntie: Ze behaalden betere resultaten, zelfs wanneer de AI zeer lange ketens van gedachten genereerde (tot 25.000 tokens).
  • Geen extra modellen nodig: In tegen tegenstelling tot sommige andere methoden die een tweede "beoordelende" AI vereisen om het werk te beoordelen, gebruikt RREDCoT de hoofd-AI zelf om de beoordeling te doen, wat tijd en middelen bespaart.

De Addertjes onder het gras (Beperkingen)

Het papier is eerlijk over waar deze methode moeite mee kan hebben:

  1. Je hebt het antwoord nodig: RREDCoT werkt het beste wanneer je al een correct pad naar de oplossing kent (of tenminste een goede hint ervan). Als je probeert een probleem op te lossen waarbij de oplossing onbekend is of de "juiste weg" vaag is, kan deze methode niet veel helpen.
  2. Het kost iets meer: Het vereist ongeveer 1,5 tot 2 keer meer computerkracht dan de standaardmethode, maar de auteurs zeggen dat dit een eerlijke ruil is voor de snelheid van het leren die het biedt.

Samenvatting

RREDCoT is een nieuwe manier om AI beter te laten denken. In plaats van te wachten tot het einde om te zeggen "Goed gedaan", breekt het het denkproces op in kleine blokken en vertelt het de AI precies welke gedachten nuttig waren en welke afleidingen vormden. Het doet dit snel en efficiënt, waardoor AI complexe redeneervaardigheden veel sneller kan leren dan voorheen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →