← Nieuwste papers
🤖 machine learning

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

Dit artikel stelt voor dat het succes van de combinatie van supervised fine-tuning (SFT) en reinforcement learning (RL) bij het verbeteren van het redeneervermogen van taalmodellen voortkomt uit compositionele generalisatie, waarbij SFT de ruwe atomaire modules binnen traces levert en RL deze deconstrueert en recombineert om nieuwe configuraties op te lossen, een theorie die wordt gevalideerd door experimenten die aantonen dat trainen op samengestelde traces superieure generalisatie oplevert vergeleken met geïsoleerde modules.

Oorspronkelijke auteurs: Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

Gepubliceerd 2026-06-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Hoe AI leert "denken"

Stel je voor dat je een robot leert om een complexe puzzel op te lossen. Je hebt twee manieren om hem te leren:

  1. Laten zien en vertellen (SFT): Je laat de robot een perfecte, stapsgewijze oplossing zien voor een specifieke puzzel.
  2. Vallen en opstaan (RL): Je laat de robot de puzzel op eigen wijze proberen op te lossen. Als hij aan het eind het juiste antwoord heeft, geef je hem een "gouden ster" (beloning). Als het mislukt, krijgt hij niets.

Lange tijd merkten onderzoekers op dat het combineren van deze twee methoden het beste werkt. De robot leert de stappen via "Laten zien en vertellen", maar wordt veel beter in het oplossen van nieuwe puzzels die hij nog nooit heeft gezien na de fase van "Vallen en opstaan".

De Vraag: Waarom werkt deze combinatie zo goed? Wat gebeurt er eigenlijk in de hersenen van de robot?

Het Kernidee: De "Lego"-theorie

De auteurs van dit paper stellen een nieuwe manier voor om dit proces te begrijpen. Zij beargumenteren dat redeneren niet alleen het onthouden van een lang verhaal is; het is als bouwen met Lego-steentjes.

Zij breken een redeneerproces (het denkproces van de robot) af in twee soorten herbruikbare onderdelen:

  1. Vaardigheden (De Steentjes): Dit zijn kleine, lokale acties. Voorbeelden: "Tel deze twee getallen op," "Verwijder dit woord," of "Controleer of dit waar is."
  2. Routing (De Instructies): Dit zijn de regels voor hoe de steentjes verbonden worden. Voorbeelden: "Neem het resultaat van stap 1 en voed dit aan stap 2," of "Als het getal groot is, sla dan stap 4 over."

Het Probleem met "Laten zien en vertellen" (SFT):
Wanneer je de robot een perfecte oplossing laat zien, zijn de "steentjes" en de "instructies" aan elkaar gelijmd in een specifieke volgorde. De robot ziet een lange, massieve blok Lego. Hij leert het hele blok te kopiëren, maar hij beseft niet dat het blok bestaat uit losse, herbruikbare onderdelen. Als je hem een puzzel geeft waarbij de steentjes in een andere volgorde nodig zijn, loopt de robot vast omdat hij alleen weet hoe hij het originele blok moet kopiëren.

De Magie van "Vallen en opstaan" (RL):
Wanneer de robot zelf probeert problemen op te lossen en gouden sterren krijgt voor correcte antwoorden, gebeurt er iets wonderlijks. Hij begint te beseffen: "Wacht even, ik heb diezelfde 'Optel'-steen op drie verschillende plekken gebruikt, en het werkte elke keer!"

Het RL-proces werkt als een deconstructeur. Het neemt die aan elkaar gelijmde blokken uit de "Laten zien en vertellen"-fase en breekt ze weer af naar individuele, herbruikbare steentjes en instructies. Zodra de robot een doos heeft met losse, herbruikbare steentjes, kan hij ze op nieuwe manieren aan elkaar klikken om puzzels op te lossen die hij nog nooit eerder heeft gezien.

De Belangrijkste Bevindingen (Het Recept voor Succes)

De paper voerde experimenten uit om deze theorie te bewijzen. Dit is wat zij ontdekten, simpel uitgelegd:

1. Je hebt eerst de grondstoffen nodig.
Je kunt een robot niet leren om met Lego te bouwen als je hem nooit hebt laten zien hoe een Lego-steentje eruitziet. De "Laten zien en vertellen"-fase is cruciaal omdat deze de grondstoffen levert (de atomaire vaardigheden en routingmechanismen). Zonder dit heeft de robot niets om uit elkaar te halen.

2. Dingen afbreken is beter dan ze alleen maar laten zien.
Als je de robot alleen geïsoleerde steentjes laat zien (bijv. "Dit is hoe je getallen optelt"), leert hij wel optellen, maar leert hij niet hoe hij optellen kan combineren met andere stappen.

  • De Bevinding: Het is veel beter om de robot een volledige, complexe oplossing te laten zien (een samengesteld spoor) en het "Vallen en opstaan"-proces het werk te laten doen om het uit elkaar te halen. De robot leert de stukjes veel sneller en effectiever te combineren dan wanneer je hem alleen een stapel geïsoleerde steentjes zou geven.

3. De "Lijm" moet op de juiste plek worden verbroken.
De auteurs ontdekten een specifiek recept voor de beste resultaten:

  • Fase 1 (Laten zien en vertellen): Laat de robot veel verschillende complexe oplossingen zien die elk mogelijk type steentje en instructie dekken. Zorg ervoor dat hij alle gereedschappen in de gereedschapskist ziet.
  • Fase 2 (Vallen en opstaan): Laat de robot oefenen op puzzels die deze gereedschappen in nieuwe, vreemde combinaties mengen die hij nog niet heeft gezien.
  • Waarom? Als je de robot laat oefenen op de zelfde combinaties die hij in Fase 1 zag, onthoudt hij ze gewoon. Maar als je hem laat oefenen op nieuwe combinaties, wordt hij gedwongen om uit te vogelen hoe hij de losse steentjes ter plekke aan elkaar klikt. Dit is waar de "generalisatie" (het vermogen om nieuwe dingen op te lossen) plaatsvindt.

Een Simpele Analogie: De Chef

Stel je voor dat je een chef-kok traint.

  • SFT (Laten zien en vertellen): Je laat de chef een recept zien voor "Spaghetti Carbonara". Je laat hem precies zien hoe hij eieren moet breken, de pasta moet koken en de saus moet mengen. De chef leert om dit ene gerecht perfect te kopiëren.
  • RL (Vallen en opstaan): Nu zeg je tegen de chef: "Maak mij een heerlijk diner," maar je geeft geen recept. Je laat hem het zelf proberen. Als hij een geweldige maaltijd maakt, zeg je: "Goed gedaan!"

Het Inzicht van de Paper:
Als je de chef alleen het Carbonara-recept laat zien, kan hij denken dat "Eieren breken" en "Pasta koken" één enkele, onbreekbare actie is genaamd "Carbonara maken".
Maar wanneer je hem laat experimenteren (RL), beseft hij: "Oh! Ik kan ook eieren breken voor een omelet, of de pasta koken voor een salade." Hij beseft dat de vaardigheden (breken, koken) losstaan van de routing (wat je met de pasta doet).

Zodra hij dit beseft, kan hij een compleet nieuw gerecht uitvinden (zoals een "Pasta-omelet") dat hij nog nooit heeft gezien, omdat hij heeft geleerd om de ingrediënten te behandelen als afzonderlijke, herbruikbare hulpmiddelen in plaats van één vast script.

Samenvatting

  • Redeneren is modulair: Het bestaat uit kleine vaardigheden en regels om ze met elkaar te verbinden.
  • SFT levert de onderdelen: Het geeft het model de grondstoffen (de vaardigheden).
  • RL verzorgt de assemblage: Het dwingt het model om de materialen uit elkaar te halen en te leren hoe ze op nieuwe manieren aan elkaar te klikken.
  • De Beste Strategie: Laat het model eerst een grote verscheidenheid aan complexe voorbeelden zien (om alle onderdelen te krijgen), en laat het daarna oefenen op nieuwe combinaties van die onderdelen (om te leren hoe je ermee bouwt).

Deze paper legt uit waarom de huidige methode van "Eerst laten zien en vertellen, dan vallen en opstaan" zo krachtig is: het verandert een rigide machine die alleen maar onthoudt in een flexibele bouwer.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →