← Nieuwste papers
🤖 machine learning

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

Dit artikel stelt Hindsight Self-Distillation (HSD) voor, een methode die de token-niveau credit assignment in lange redeneersporen verbetert door een docentmodel te conditioneren op succesvolle peer-rollouts om dichte, pad-specifieke begeleiding te bieden op kritieke divergentiepunten, waardoor het bestaande reinforcement learning- en distillatie-baselines op wiskunde- en code-benchmarks overtreft.

Oorspronkelijke auteurs: Yu Li, Shu Hong, Tian Lan

Gepubliceerd 2026-06-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yu Li, Shu Hong, Tian Lan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student leert een complexe wiskundige opdracht op te lossen. Je geeft de student een vraag, en de student schrijft een lang, stapsgewijs redeneerproces uit op een vel papier. Aan het einde van de rit schrijft de student een definitief antwoord op.

Het Probleem: De "Stille Docent"
In traditionele AI-training (specifiek een methode genaamd Reinforcement Learning) kijkt de docent alleen naar het uiteindelijke antwoord.

  • Als het antwoord fout is, zegt de docent: "Slecht gedaan," en geeft een enkele "duim omlaag" voor het gehele essay.
  • De student weet niet waar hij de fout in is gegaan. Is hij in de eerste stap de mist in gegaan? In het midden? Of was het de allerlaatste berekening?
  • Omdat de docent alleen het eindresultaat ziet, blijft hij "stil" tijdens de lange, verwarrende middelste delen. Hij kan niet wijzen naar de specifieke zin waar de logica stokte.
  • Dit is vooral erg slecht voor taken waarbij het antwoord heel kort is (zoals een enkel getal). Als het antwoord slechts "42" is, heeft de docent geen manier om te weten welke van de 500 woorden die de student schreef tot dat getal hebben geleid, of welk woord de fout veroorzaakte.

De Oude Oplossing: "Antwoord-geconditioneerde" Distillatie
Onderzoekers probeerden een slimmere aanpak genaamd "Self-Distillation". Hierbij speelt de AI twee rollen:

  1. De Student: Probeert de opdracht op te lossen zonder hulp.
  2. De Docent: Probeert de opdracht op te lossen terwijl hij het juiste uiteindelijke antwoord al kent.

Het idee was dat als de Docent weet dat het antwoord "42" is, de Docent de Student beter kan begeleiden. Maar het onderzoek vond een gebrek: als het antwoord slechts een kort getal is, weet de Docent nog steeds niet hoe hij bij dat getal moet komen. De Docent blijft stil tijdens de middelste stappen omdat het uiteindelijke antwoord niet genoeg aanwijzingen geeft over het pad. Het is also�elijk een wandelaar vertellen: "De top ligt bovenop de berg," zonder de route te laten zien. De wandelaar raakt nog steeds verdwaald in het bos.

De Nieuwe Oplossing: "Hindsight Self-Distillation" (HSD)
De auteurs stellen een slimme nieuwe truc voor genaamd Hindsight Self-Distillation. In plaats van alleen naar het uiteindelijke antwoord te kijken, kijkt de Docent naar een succesvolle gelijke (peer).

Zo werkt het in de klas:

  1. De docent vraat 8 studenten (de AI genereert 8 verschillende pogingen) om dezelfde opdracht op te lossen.
  2. 7 studenten falen. 1 student slaagt.
  3. De Docent neemt het volledige essay van de geslaagde student en laat dit zien aan de falende studenten.
  4. De Docent zegt: "Kijk naar Student #4. Zij hebben het juiste antwoord gekregen. Jullie twee (Student #1 en #2) volgden exact hetzelfde pad als Student #4 voor de eerste 50 woorden. Maar bij woord 51 sloegen jullie een verkeerde afslag in. Dat is het moment waarop jullie anders moeten gaan denken."

Waarom dit werkt (Het "Divergentie"-moment)
De magie gebeurt bij het divergentiepunt — het exacte moment waarop het pad van de falende student afwijkt van het pad van de succesvolle student.

  • Vóór de splitsing: De Docent is stil omdat beide studenten hetzelfde deden.
  • Bij de splitsing: De Docent roept: "Stop! Kijk naar het succesvolle pad! Je ging links, maar je had rechts moeten gaan!"
  • Na de splitsing: De begeleiding van de Docent vervaagt omdat de falende student nu op een totaal ander spoor zit.

Dit geeft de AI een precieze "score" voor elk afzonderlijk woord. Het vertelt de AI precies welk woord de fout veroorzaakte, in plaats van alleen te zeggen "het hele essay was slecht."

De Resultaten
Het paper testte deze methode op twee krachtige AI-modellen (Qwen3-8B en Qwen3-32B) met wiskunde- en programmeerproblemen.

  • De Test: Ze gebruikten moeilijke benchmarks zoals AIME (wiskundecompetities) waar antwoorden korte getallen zijn.
  • De Uitkomst: HSD versloeg elke andere methode, inclusief de standaard "duim omhoog/duim omlaag"-methoden en de oude "alleen antwoord"-docentmethoden.
  • De Grote Winst: De verbetering was het grootst op de moeilijkste taken met korte antwoorden. Dit bewijst dat het de AI geven van een "pad van een succesvolle gelijke" om mee te vergelijken veel beter is dan alleen het uiteindelijke antwoord te geven.

Samenvattend
In plaats van alleen het eindexamen te beoordelen, laat deze methode de AI leren door zijn eigen mislukte pogingen te vergelijken met een succesvolle poging gemaakt door een "broertje of zusje" in dezelfde trainingssessie. Het benadert het exacte moment waarop de logica van het spoor raakte, waardoor de AI sneller en nauwkeuriger kan leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →