← Nieuwste papers
💬 NLP

Should We Still Pretrain Encoders with Masked Language Modeling?

Door middel van uitgebreide gecontroleerde experimenten toont dit artikel aan dat, hoewel Masked Language Modeling (MLM) over het algemeen superieure tekstrepresentaties oplevert, een biphasische pretrainingstrategie die eerst Causal Language Modeling (CLM) toepast en vervolgens MLM, onder vaste rekenkrachtbudgetten de optimale prestaties bereikt, met name bij benutting van bestaande vooraf getrainde CLM-modellen.

Oorspronkelijke auteurs: Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren menselijke taal te begrijpen. Jarenlang was de standaardmethode het spelen van een spelletje "vul de leegte in". Je toont de robot een zin met enkele verborgen (gemaskeerde) woorden en vraagt het om te raden wat die zijn, gebaseerd op de woorden voor en na de ontbrekende plek. Dit heet Masked Language Modeling (MLM). Het is als een kruiswoordraadsel waarbij je aanwijzingen uit beide richtingen hebt.

Onlangs is een nieuwe aanpak populair geworden: de robot leren het volgende woord in een zin te voorspellen, woord voor woord, net als een tekstautocompleet-functie. Dit heet Causal Language Modeling (CLM). Het is als het lezen van een verhaal en raden wat er als volgt gebeurt, maar dan zonder vooruit te kunnen kijken.

De grote vraag die dit artikel stelt is: "Moeten we robots nog steeds de oude 'vul de leegte in'-methode leren, of is de nieuwe 'voorspel het volgende woord'-methode eigenlijk beter?"

Hier is wat de onderzoekers hebben gevonden, uitgelegd via eenvoudige analogieën:

1. De "Specialist" versus de "Alleskunner"

De onderzoekers trainden 38 verschillende robothersenen (variërend van klein tot zeer groot) met beide methoden.

  • De MLM-robot (De Specialist): Wanneer deze alleen werd getraind op het "vul de leegte in"-spel, werd deze robot een meester in het begrijpen van de volledige context van een zin. Het was het beste in taken zoals het beantwoorden van complexe vragen of het classificeren van de stemming van een tekst. Het is als een detective die een moordplek vanuit alle hoeken kan bekijken om de zaak op te lossen.
  • De CLM-robot (De Alleskunner): Wanneer deze alleen werd getraind op het "voorspel het volgende woord"-spel, was deze robot verrassend goed in sommige dingen (zoals het vinden van specifieke namen in een tekst) en leerde het zeer snel. Het had echter meer moeite met taken die een diep, tweerichtingsbegrip van een zin vereisten.

Het Oordeel: De "vul de leegte in"-methode (MLM) is nog steeds de koning voor het bouwen van het beste alomvattende tekstbegrip. De "voorspel het volgende woord"-methode (CLM) alleen is niet helemaal voldoende om de beste "encoder" te maken (een tool die tekst omzet in betekenis).

2. Het "Snelle Start"-Voordeel

Hier wordt het interessant. De CLM-robot leerde in het begin veel sneller.

  • Analogie: Stel je twee studenten voor die trainen voor een marathon.
    • Student A (MLM) studeert langzaam en gestaag, en bouwt een diepe basis op. Ze beginnen traag maar worden later zeer sterk.
    • Student B (CLM) begint direct te rennen en wordt zeer snel fit. Ze lopen voor op Student A gedurende de eerste paar mijl.
  • De Bevinding: Als je het trainen vroegtijdig stopt (omdat je weinig tijd of geld hebt), is de CLM-robot eigenlijk behoorlijk concurrerend. Het is "data-efficiënter", wat betekent dat het goede resultaten behaalt met minder trainingstijd.

3. De "Stabiele Basis"

De onderzoekers ontdekten ook dat de CLM-robot makkelijker was om fijnaf te stemmen (aan te passen voor specifieke taken).

  • Analogie: Denk aan de CLM-robot als een huis gebouwd op een zeer stevige, vlakke betonnen plaat. Het is makkelijk om een specifieke kamer (zoals een keuken voor een specifieke taak) erbovenop te bouwen zonder dat het huis gaat schudden.
  • De MLM-robot, hoewel overall sterker, was een beetje meer "wankel" wanneer je probeerde het aan te passen voor specifieke taken. Het vereiste meer zorgvuldige afstelling om het perfecte resultaat te krijgen.

4. De Winnende Strategie: De "Twee-Fase"-Training

De grootste ontdekking van het artikel is een nieuw recept voor het trainen van deze robots dat beter werkt dan het toepassen van slechts één methode.

  • Het Recept: Begin met het trainen van de robot met de "voorspel het volgende woord"-methode (CLM) voor een snelle, stabiele start. Schakel dan over naar de "vul de leegte in"-methode (MLM) om het begrip te verdiepen.
  • Het Resultaat: Deze "Twee-Fase"-aanpak creëerde de sterkste robots van allemaal. Het combineerde de snelheid en stabiliteit van de CLM-start met het diepe begrip van de MLM-afwerking.
  • Bonus: Je kunt zelfs een robot nemen die iemand anders al heeft getraind met de "voorspel het volgende woord"-methode (wat zeer gebruikelijk en goedkoop is om te verkrijgen) en het gewoon een "bijtank"-training geven met de "vul de leegte in"-methode. Dit is veel goedkoper dan het trainen van een robot vanaf nul.

Samenvatting

Het artikel concludeert dat hoewel de oude "vul de leegte in"-methode (MLM) nog steeds essentieel is voor de beste resultaten, we de nieuwe "voorspel het volgende woord"-methode (CLM) niet mogen negeren.

Het beste pad vooruit is een hybride:

  1. Begin met de snelle, stabiele "voorspel het volgende woord"-training (of gebruik een vooraf getraind model dat dit al heeft).
  2. Beëindig met de diepe "vul de leegte in"-training.

Deze strategie bespaart geld en rekenkracht terwijl het de slimste beschikbare tekstbegrip-tools produceert. De auteurs hebben al hun code en modellen vrijgegeven zodat anderen dit "twee-fase"-recept zelf kunnen proberen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →