← Nieuwste papers
🤖 AI

Trajectory-Refined Distillation

Dit artikel introduceert Trajectory-Refined Distillation (TRD), een nieuwe on-policy distillatiemethode die het structurele "prefix failure"-probleem mitigeert door traject-niveau correcties toe te passen op student-rollouts onder begeleiding van een docent, waardoor de redeneernauwkeurigheid en dekking over diverse benchmarks en modelschalen worden verbeterd.

Oorspronkelijke auteurs: Li Jiang, Haoran Xu, Yichuan Ding, Amy Zhang

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Li Jiang, Haoran Xu, Yichuan Ding, Amy Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student (de AI) leert hoe hij een complex wiskundig probleem moet oplossen. Je hebt een briljante leraar (een meer geavanceerde AI) die het juiste antwoord weet.

In de standaardmethode beschreven in het paper, genaamd On-Policy Distillation (OPD), werkt het proces als volgt:

  1. De student probeert het probleem zelf op te lossen.
  2. Terwijl de student zijn stappen opschrijft, kijkt de leraar toe en zegt: "Voor dit specifieke woord dat je net schreef, is dit de waarschijnlijkheid van wat er nu volgt."
  3. De student probeert zijn brein aan te passen om de waarschijnlijkheden van de leraar voor elk woord te evenaren.

Het Probleem: "Prefix Failure" (De Foutieve Afslag)

Het paper identificeert een groot gebrek in deze standaardmethode, genaamd Prefix Failure.

Stel je voor dat de student een pad afloopt om het probleem op te lossen. Bij stap 3 slaat hij een verkeerde afslag. Hij is nu terechtgekomen in een doodlopende straat.

  • Het Dilemma van de Leraar: De leraar ziet dat de student verdwaald is. De leraar weet dat het juiste pad begint met "Wacht, eigenlijk..." en dat het daarna een compleet andere richting op gaat.
  • De Verwarring: Maar de leraar wordt gedwongen om naar de huidige locatie van de student te kijken (de doodlopende weg). De adviezen van de leraar worden daarom een verwarrende mix: "Blijf op deze doodlopende weg omdat je er al bent" EN "Draai onmiddellijk om."
  • Het Resultaat: De student krijgt een verwarrend signaal. Hij probeert te leren van de leraar, maar omdat de student vastzit op het verkeerde pad, raakt het advies van de leraar gefragmenteerd. De student leert "goed te zijn in verdwaald zijn" in plaats van te leren hoe hij weer op het juiste spoor komt. Het paper noemt dit een "bimodale mengeling"—de leraar probeert tegelijkertijd twee tegenovergestelde dingen te onderwijzen, en de student raakt in de war.

Bestaande oplossingen probeerden dit te verhelpen door simpelweg het "cijfer" (de loss function) voor specifieke woorden aan te passen, maar ze losten het feit niet op dat de student nog steeds op het verkeerde pad vastzat.

De Oplossing: Trajectory-Refined Distillation (TRD)

De auteurs stellen een nieuwe methode voor genaamd Trajectory-Refined Distillation (TRD). In plaats van alleen de slordige conceptversie van de student woord voor woord te beoordelen, veranderen ze de workflow:

  1. Het Concept: De student maakt nog steeds een eerste poging tot het probleem (de "raw rollout").
  2. Het Herschrijven: Voordat de beoordeling plaatsvindt, neemt de leraar dat slordige concept en schrijft het herschreven. De leraar corrigeert de verkeerde afslagen, herstelt de logica en produceert een zuivere, perfecte versie van de oplossing gebaseerd op het startpunt van de student.
  3. De Les: De student leert vervolgens van deze zuivere, gecorrigeerde versie, en niet van de slordige originele versie.

De Analogie:

  • De Oude Manier: Je schrijft een verhaal met een plotgat in het midden. Je redacteur leest het en zegt: "Voor het woord 'kat' in paragraaf 3 had je 'hond' moeten schrijven." Maar je zit nog steeds vast in paragraaf 3 terwijl je probeert uit te zoeken waarom je 'kat' schreef in de eerste plaats. Het is verwarrend.
  • De TRD-Manier: Je schrijft een verhaal met een plotgat. Je redacteur neemt jouw concept, herstelt het plotgat en schrijft het hele middendeel herschreven zodat het verhaal perfect doorloopt. Daarna bestudeer jij de herschreven versie van de redacteur om de volgende keer beter te leren verhalen te schrijven.

Waarom Dit Beter Werkt

  1. Lost de Oorzaak Aan: Door de "verkeerde afslag" te corrigeren voordat de student probeert te leren van de fout, is het advies van de leraar niet langer verwarrend. Het is één helder pad.
  2. Ontdekt Nieuwe Paden: Zelfs als de student het antwoord de eerste keer goed heeft, kan de leraar hem een andere, kortere of slimmere manier laten zien om het probleem op te lossen. Dit leert de student om flexibeler te zijn.
  3. Efficiëntie: Het paper ontdekte dat de "herschreven" paden vaak veel korter en duidelijker waren dan de oorspronkelijke, oeverloze pogingen van de student, wat het trainen daadwerkelijk sneller maakte.

De Resultaten

De onderzoekers testten dit op moeilijke wiskundige competities (zoals AIME en HMMT) en programmeeruitdagingen. Ze ontdekten dat:

  • De nieuwe methode (TRD) de oude methoden consequent versloeg.
  • Het vooral effectief was in het helpen van de AI bij de moeilijkste problemen waar het normaal gesproken op vastliep.
  • Het werkte, ongeacht of de leraar een aparte, grotere AI was of dezelfde AI die optrad als zijn eigen "slimme" leraar (met behulp van een techniek genaamd "privileged information").

Kortom, het paper betoogt dat om een AI effectief te onderwijzen, je niet alleen zijn fouten woord voor woord moet beoordelen terwijl hij ze maakt. In plaats daarvan moet je de leraar eerst het hele pad laten corrigeren, en de student vervolgens laten leren van de gecorrigeerde reis.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →