← Nieuwste papers
💬 NLP

GottBERT: a pure German Language Model

Dit artikel introduceert GottBERT, het eerste Duitse single-language RoBERTa-model dat is voorgetraind op de OSCAR-dataset, dat een concurrerende prestatie levert over diverse NLP-taken vergeleken met bestaande Duitse en meertalige modellen, terwijl ook wordt opgemerkt dat corpusfiltering een minimale impact had op de resultaten.

Oorspronkelijke auteurs: Raphael Scheible, Johann Frei, Fabian Thomczyk, Henry He, Patric Tippmann, Jochen Knaus, Victor Jaravine, Frank Kramer, Martin Boeker

Gepubliceerd 2026-06-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Raphael Scheible, Johann Frei, Fabian Thomczyk, Henry He, Patric Tippmann, Jochen Knaus, Victor Jaravine, Frank Kramer, Martin Boeker

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren de Duitse taal te begrijpen. In het verleden leerden onderzoekers robots vaak via een "meertalige" aanpak, waarbij ze een enorme soep van tekst uit tientallen verschillende talen tegelijk aan de robot voerden. Het is alsof je probeert Frans, Duits en Japans tegelijkertijd te leren terwijl je met ballen jongleert. Hoewel dit werkt, is het vaak minder efficiënt dan je concentreren op slechts één taal.

Dit artikel introduceert GottBERT, een nieuwe "robothersenen" die specifiek is ontworiment om alleen Duits te begrijpen. Denk aan het als een gespecialiseerde chef-kok die alleen de Duitse keuken bereidt, in plaats van een algemene chef-kok die alles probeert te koken.

Hier is het verhaal van hoe ze het gemaakt hebben, eenvoudig uiteengezet:

1. De Ingrediënten: Een Enorme Bibliotheek

Om de robot te leren, had het team een enorme bibliotheek van Duitse tekst nodig. Ze gebruikten een dataset genaamd OSCAR, wat een soort enorme digitale stortplaats van het internet is.

  • De Ruwe Stapel: Ze begonnen met 145 gigabyte aan ruwe Duitse tekst. Stel je een bibliotheek voor met 459 miljoen boeken (of documenten), maar veel daarvan zijn slordig. Sommige hebben typefouten, sommige zijn gewoon lijsten met willekeurige woorden (spam), en sommige hebben vreemde karakterfouten (zoals "ä" in plaats van "ä").
  • Het Schoonmaakproces: Het team probeerde deze bibliotheek op te schonen. Ze schreven een speciaal programma om coderingfouten te herstellen, spam te verwijderen en documenten te filteren die er niet uitzagen als echte Duitse zinnen. Dit verminderde de bibliotheek tot 121 gigabyte.
  • Het Experiment: Ze wilden zien of een "schonere" bibliotheek een slimmere robot maakt dan een "ruwe" bibliotheek. Daarom trainden ze twee sets robots: één op de slordige bibliotheek en één op de schone bibliotheek.

2. De Trainingsgym: Supercomputers

Het trainen van deze robots is als het lopen van een marathon voor een computer. Het vereist een enorme kracht.

  • De meeste eerdere modellen werden getraind op Graphics Processing Units (GPU's), die als standaard racewagens kunnen worden beschouwd.
  • GottBERT werd getraind op TPU's (Tensor Processing Units), die als hogesnelheidstreinen zijn ontworpen die specifiek voor dit soort wiskunde zijn gemaakt. Dit maakte hen de eerste Duitse RoBERTa-modellen die getraind zijn op dit specifieke type supersnelle hardware.

3. De Race: Hoe presteerden ze?

Na de training onderwierp het team de robots aan een reeks tests om te zien hoe goed ze Duits begrepen. Ze vergeleken hun nieuwe robots (GottBERT) met andere bestaande Duitse robots en enkele meertalige robots.

De tests omvatten:

  • Namen Vinden (NER): Kan de robot herkennen dat "Müller" een persoonnaam is en "Berlin" een stad?
  • Begrijpend Lezen (NLI): Als ik zeg "De hond achtervolgde de kat," kan de robot dan begrijpen dat "De kat werd achtervolgd door de hond" hetzelfde betekent?
  • Nieuws Categoriseren (Tekstclassificatie): Kan de robot een nieuwsbericht lezen en vertellen of het over sport, politiek of het weer gaat?

De Resultaten:

  • De Kleine Modellen (Base): De standaardformaat GottBERT-robots waren erg sterk. Ze wonnen of deelden de eerste plaats in 4 van de 6 tests vergeleken met andere standaardformaat Duitse modellen.
  • De Grote Modellen (Large): Wanneer ze de robots groter maakten (complexer), waren de resultaten gemengd. De grootste Duitse robot van een ander team (GELECTRA) presteerde in de meeste categorieën iets beter dan de grootste GottBERT-robots.
  • De Schoonmaak-verrassing: Hier is de wending. Het team verwachtte dat de robot die getraind was op de schonere bibliotheek slimmer zou zijn. Dat was niet het geval. De robot die getraind was op de slordige, ruwe bibliotheek presteerde net zo goed, of zelfs iets beter, dan de robot die getraind was op de schone tekst. Het blijkt dat de robot slim genoeg was om de ruis zelf op te lossen.

4. De Kernboodschap

De auteurs concluderen dat:

  1. Specialisten Winnen: Een model dat specif je op Duits is getraind (GottBERT), is zeer competitief en verslaat vaak modellen die proberen vele talen te spreken.
  2. Schoonmaken is Niet Altijd Noodzakelijk: Het besteden van enorme inspanning aan het perfect schoonmaken van de trainingsdata leverde in dit geval geen duidelijk voordeel op.
  3. Open Source: Ze geven hun "blauwdrukken" (de modellen) gratis weg aan het publiek, zodat andere onderzoekers ze kunnen gebruiken om betere Duitse taaltools te bouwen.

Kortom: Ze bouwden een gespecialiseerd Duits taalbrein, trainden het op een enorme en enigszins slordige internetbibliotheek met behulp van supersnelle computers, en ontdekten dat het ongelooflijk goed werkt, wat bewijst dat je niet altijd je data perfect hoeft schoon te maken om een geweldig resultaat te behalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →