← Nieuwste papers
💬 NLP

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ\Delta Integration into Upcycled MoE

Dit artikel introduceert een datadoeltreffende methode genaamd \method die dichte modellen upcyclt naar Mixture-of-Experts-architecturen en post-training parameterdeltas integreert om meertalige capaciteiten uit te breiden zonder de noodzaak van kostbare voortgezette voortraining of complexe uitlijning, waardoor effectief een evenwicht wordt gevonden tussen het verwerven van nieuwe talen en het behoud van de oorspronkelijke modelcapaciteiten.

Oorspronkelijke auteurs: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het Dilemma van de "Tweetalige Chef"

Stel je hebt een wereldberoemde Chef (een Large Language Model) die een expert is in het bereiden van Engelse gerechten. Ze is hier fantastisch in. Nu wil je dat deze Chef ook Hongaarse, Servische en Bengaalse gerechten leert koken.

De traditionele manier om dit te doen, is de Chef naar een enorme kookschool sturen voor een lange periode (dit heet Continued Pre-Training). Ze bestudeert duizenden kookboeken in die nieuwe talen. Maar er zit een addertje onder het gras:

  1. De "Vergeetachtige" Chef: Als ze te hard studeert in de nieuwe talen, kan het zijn dat ze haar oorspronkelijke Engelse recepten begint te vergeten.
  2. De "Verwaterde" Chef: Als je probeert voorzichtig te zijn en haar oude Engelse kennis zachtjes mengt met het nieuwe materiaal, wordt ze uiteindelijk middelmatig in beide. Ze vergeet het Engels niet, maar ze wordt ook niet erg goed in de nieuwe talen.

Dit is de "Trade-off" waar het paper over spreekt: Je moet meestal kiezen tussen het goed leren van nieuwe talen of het perfect behouden van je oude vaardigheden. Je krijgt zelden beide.

De Oplossing: DeltaMoE (De "Gespecialiseerde Keuken" Aanpak)

De auteurs stellen een nieuwe methode voor genaamd DeltaMoE. In plaats van te proberen de Chef slimmer te maken door haar hele hersenen opnieuw te trainen, geven ze de Chef een gespecialiseerde keuken-upgrade.

Hier is hoe het werkt in drie simpele stappen:

Stap 1: Bouw een "Mixture of Experts" Keuken (Upcycling)

Stel je voor dat de keuken van de Chef wordt uitgebreid. In plaats van één groot aanrecht waar alles gebeurt, bouwen ze een Mixture of Experts (MoE) keuken.

  • Het Originele Aanrecht (Bevroren Expert): De Chef houdt haar oorspronkelijke Engelse aanrecht precies zoals het was. Ze vergrendelt het. Hier verandert niets. Dit zorgt ervoor dat ze haar Engelse recepten nooit vergeet.
  • De Nieuwe Aanrechten (Trainable Experts): Ze bouwen drie gloednieuwe aanrechten die specifiek zijn voor de nieuwe talen (Hongaars, Servisch, Bengaals).
  • De Hoofdkelner (De Router): Ze huren een slimme Hoofdkelner in. Als een klant een Engels gerecht bestelt, stuurt de Kelner ze naar het Originele Aanrecht. Als een klant Hongaars bestelt, stuurt de Kelner ze naar het Hongaarse Aanrecht.

De Chef leert alleen op de nieuwe aanrechten. Het originele aanrecht blijft bevroren, zodat de Engelse vaardigheden perfect behouden blijven.

Stap 2: De "Delta" Transplantatie (De Magische Overdracht)

Nu zijn de nieuwe aanrechten goed in het koken van het eten, maar ze weten niet hoe ze beleefd met klanten moeten praten of complexe instructies moeten volgen (dit heet Alignment). Normaal gesproken zou je ze maanden moeten trainen om dit te leren.

De slimme truc van het paper is Delta Merging.

  • Stel je voor dat er een andere beroemde Chef is (een voorgetraind "Instruct"-model) die al een meester is in het praten met klanten en het volgen van regels, maar die alleen Engels spreekt.
  • In plaats van de nieuwe aanrechten vanaf nul te leren, nemen de auteurs het "verschil" (de Delta) tussen de beroemde Chef en hun oorspronkelijke basis. Denk hierbij aan een "Recept voor Beleefdheid" dat op een post-it staat.
  • Ze plakken deze post-it op de nieuwe aanrechten. Omdat de nieuwe aanrechten zijn gebouwd van hetzelfde "deeg" als het origineel, werkt dit "Recept voor Beleefdheid" direct.

Het Resultaat: De nieuwe aanrechten kunnen nu Hongaars eten koken en beleefd praten, zonder dat ze het dure, data-intensieve trainingsproces hoeven te doorlopen.

Waarom Dit Beter Is dan de Oude Manier

Het paper testte dit uit tegen andere methoden en ontdekte:

  1. Geen Trade-offs Meer:

    • Oude Methode A (Averaging): Probeerde de oude en nieuwe vaardigheden te mengen. Resultaat: De Chef werd slechter in het Engels en alleen maar okay in de nieuwe talen.
    • Oude Methode B (Direct Delta): Probeerde gewoon de nieuwe vaardigheden er bovenop te plakken. Resultaat: De Chef werd geweldig in de nieuwe talen, maar vergat hoe ze Engels moest spreken.
    • DeltaMoE: De Chef is geweldig in het Engels (omdat het originele aanrecht bevroren was) en geweldig in de nieuwe talen (omdat de nieuwe aanrechten ze leerden en de "beleefdheids"-transplantatie kregen).
  2. Data-efficiëntie:

    • Andere methoden hebben miljoenen voorbeelden nodig om het model te leren hoe het beleefd moet zijn in een nieuwe taal.
    • DeltaMoE krijgt dit vermogen gratis door het te "transplanteren" vanuit een bestaand model. Het bespaart een enorme hoeveelheid tijd en rekenkracht.
  3. Schaalbaarheid:

    • De auteurs lieten zien dat zelfs als je meer talen toevoegt (zoals 8 in plaats van 3), het systeem niet kapot gaat. De Hoofdkelner (Router) leert gewoon om bestellingen naar het juiste aanrecht te sturen, en het systeem blijft stabiel.

De Conclusie

DeltaMoE is als het geven van een gespecialiseerde, modulaire keuken aan een meesterchef.

  • Ze houden hun oorspronkelijke werkruimte onaangetast om hun kernvaardigheden te beschermen.
  • Ze voegen nieuwe werkruimtes toe voor nieuwe talen.
  • Ze transfereren direct "klantenservice-vaardigheden" naar de nieuwe werkruimtes zonder opnieuw te trainen.

Dit stelt AI-modellen in staat om vloeiend en beleefd veel nieuwe talen te spreken, zonder hun oorspronkelijke intelligentie te verliezen of een enorme hoeveelheid nieuwe data te vereisen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →