← Nieuwste papers
💬 NLP

X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

Het artikel stelt X-Token voor, een projectiegeleid raamwerk voor kennisdistillatie via kruis-tokenizers dat gebruikmaakt van schaarse projectiematrices om vocabulaire-incompatibiliteit en token-matchingsbeperkingen in logit-gebaseerde distillatie te overwinnen, waardoor studentmodellen in staat worden gesteld effectief "donkere kennis" te leren van leraren met niet-overeenkomende vocabulaires en state-of-the-art prestaties te behalen.

Oorspronkelijke auteurs: Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang, Ali Taghibakhshi, Saurav Muralidharan, Ashwath Aithal, Pavlo Molchanov

Gepubliceerd 2026-05-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang, Ali Taghibakhshi, Saurav Muralidharan, Ashwath Aithal, Pavlo Molchanov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een jonge student (het Student Model) te leren wiskundeproblemen op te lossen en verhalen te schrijven. Je hebt een briljante leraar (het Teacher Model) die alles weet, maar er is een addertje onder het gras: ze spreken verschillende talen.

De student spreekt "Llama", waarbij het getal 201 één enkel woord is. De leraar spreekt "Qwen", waarbij 201 is opgesplitst in drie aparte woorden: 2, 0 en 1.

In het verleden was het proberen om de student met deze leraar te onderwijzen, als het proberen om sokken uit twee verschillende laden te matchen waar de maten niet overeenkomen. Als je probeerde een match te forceren, zou de student in de war raken, of erger, de waardevolle adviezen van de leraar zouden volledig worden genegeerd.

Dit artikel introduceert een nieuwe methode genaamd X-Token om dit misverstand op te lossen. Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. Het Probleem: Het "Sokkenlade"-misverstand

Vorige methoden probeerden dit op te lossen door het vocabulaire op te splitsen in twee groepen:

  • De "Gemeenschappelijke" Groep: Woorden die er in beide talen exact hetzelfde uitzien (bijv. "de", "kat").
  • De "Ongebruikelijke" Groep: Woorden die niet overeenkomen (bijv. "201" versus "2-0-1").

De oude methode (genaamd GOLD) behandelde deze twee groepen verschillend. Het gaf perfect advies voor de "Gemeenschappelijke" woorden, maar gaf rommelig, willekeurig advies voor de "Ongebruikelijke" woorden.

  • Het Falen: Als de student een cruciaal wiskundig getal zoals 201 moest leren, en dat getal viel in de "Ongebruikelijke" groep, zou de oude methode het leren van de student eigenlijk schaden. Het is alsof een leraar tegen een student zegt: "Maak je geen zorgen over het getal 201; raad gewoon willekeurig." Het artikel toont aan dat dit ervoor zorgde dat de wiskundescores van de student crashten van een fatsoenlijke 12,89 naar een vreselijke 2,56.

2. De Oplossing: De "Universele Vertaler" (Projectiematrix)

X-Token introduceert een speciaal hulpmiddel genaamd een Projectiematrix (WW). Denk hierbij aan een Universele Vertaler of een Rosetta Stone die tussen de student en de leraar zit.

In plaats van de student te dwingen alleen woorden te leren die er exact hetzelfde uitzien, zegt deze vertaler:

  • "Oké, wanneer de leraar '2', '0' en '1' zegt, is dat hetzelfde als de '201' van de student."
  • Het creëert een brug zodat de student de volledige logica van de leraar kan begrijpen, zelfs als ze woorden anders opsplitsen.

3. Twee Verschillende Onderwijsstijlen (Verliesfuncties)

Het artikel beseft dat de "Universele Vertaler" soms op twee verschillende manieren moet werken, afhankelijk van de situatie. Ze creëerden twee modi:

Modus A: De "Volledige Samenvoeging" (P-KL)

  • Wanneer te gebruiken: Wanneer de leraar kritieke woorden (zoals wiskundige getallen) opsplitst in kleine stukjes die de student helemaal niet herkent.
  • Hoe het werkt: Het gooit het idee van "Gemeenschappelijke" versus "Ongebruikelijke" woorden volledig weg. Het gebruikt de vertaler om het hele brein van de leraar af te beelden op het brein van de student.
  • Het Resultaat: Het redde de wiskundescores! Door deze modus te gebruiken met de Qwen-leraar, sprong de wiskundescore van de student van 2,56 (met de oude methode) helemaal omhoog naar 15,54. Het versloeg zelfs een leraar die dezelfde taal sprak als de student.

Modus B: De "Ontspannen Match" (H-KL)

  • Wanneer te gebruiken: Wanneer de leraar en de student grotendeels overeenkomen, maar er zijn enkele kleine verschillen (zoals de leraar "Hund" + "reds" zeggen voor de "Honderden" van de student).
  • Hoe het werkt: Het behoudt de splitsing tussen "Gemeenschappelijke" en "Ongebruikelijke" maar verslapt de regels. In plaats van een exacte match te eisen, zegt het: "Als de vertaler zegt dat deze twee de dichtstbijzijnde match zijn, laten we ze tellen als een match."
  • Het Resultaat: Dit gaf een kleine maar stabiele boost (ongeveer +0,5 punten) toen de leraar het Phi-4-mini-model was, wat getallen niet zo agressief opsplitste.

4. Het "Panel van Experts" (Multi-Leraar Distillatie)

Het artikel toont ook aan dat je meerdere leraren tegelijk kunt gebruiken.

  • Stel je voor dat je een Wiskunde-Genie-leraar en een Verhaalverteller-leraar hebt.
  • X-Token staat de student toe om tegelijkertijd naar beiden te luisteren.
  • Het Resultaat: Toen ze een op wiskunde gerichte leraar (Phi-4-mini) combineerden met een leraar voor Algemene Kennis (Llama-3), leerde de student beter dan met slechts één leraar. Het is alsof een student een privéleraar krijgt voor wiskunde en een andere voor geschiedenis, en vervolgens die lessen combineert tot één superstudent.

Samenvatting van Resultaten

  • De Oude Manier: Als de vocabulaires niet perfect overeenkwamen, raakte de student in de war en presteerde slecht.
  • De X-Token Manier: Door een slimme vertaler te gebruiken en de juiste onderwijsstijl te kiezen (Volledige Samenvoeging versus Ontspannen Match), leerde de student effectief van leraren die verschillende "talen" spraken.
  • Het Bewijs: Op een standaard wiskundetoets (GSM8k) verbeterde X-Token de score van de student met 6 keer in vergelijking met de vorige beste methode bij het gebruik van een specifieke leraar.

Kortom, X-Token is een slim systeem dat stopt met proberen twee verschillende talen er hetzelfde uit te laten zien en in plaats daarvan een brug bouwt zodat de student kan leren van de ideeën van de leraar, ongeacht hoe de leraar ervoor kiest om ze te zeggen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →