← Nieuwste papers
💬 NLP

NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus

Het artikel introduceert NorBERTo, een moderne encoder-only-modellen voor Braziliaans-Portugees getraind op het grootste openbaar beschikbare monolinguale corpus (Aurora-PT) van 331 miljard tokens, dat state-of-the-art-prestaties bereikt op diverse semantische benchmarks en een efficiënte, inzetbare oplossing biedt voor downstream-NLP-taken.

Oorspronkelijke auteurs: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreic
Gepubliceerd 2026-05-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreich, Vinicius F. Caridá

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren het Portugees te begrijpen. Lange tijd waren de beste robots als studenten die een paar goede boeken hadden gelezen, maar de hele bibliotheek niet hadden gezien. Dit artikel introduceert een nieuwe robot genaamd NorBERTo en een enorme nieuwe bibliotheek genaamd Aurora-PT die hem helpt leren.

Hier is het verhaal van hoe ze dat deden, eenvoudig uitgelegd:

1. Het Probleem: De Robot Had een Grotere Bibliotheek Nodig

Voorheen werden de beste robots voor de Portugees taal (zoals BERTimbau en Albertina) getraind op bibliotheken met ongeveer 2 tot 3 miljard "woorden" (tokens). Hoewel goed, is het alsof je probeert een taal te leren door een paar romans en een woordenboek te lezen.

De auteurs beseften dat ze, om een echt slimme robot te maken, een bibliotheek nodig hadden ter grootte van een enorme stad. Ze wilden een robot bouwen die de nuances van het Braziliaans-Portugees kon begrijpen zonder een gigantische, dure supercomputer te hoeven zijn die eindeloze verhalen genereert (die vatbaar zijn voor het verzinnen van dingen, of "hallucineren").

2. De Nieuwe Bibliotheek: Aurora-PT

Het team bouwde Aurora-PT, een gloednieuwe collectie teksten.

  • De Schaal: Het bevat 331 miljard tokens. Om dat in perspectief te plaatsen: als de oude bibliotheken een enkele boekenkast waren, is Aurora-PT een heel magazijn. Het is momenteel de grootste open bibliotheek van zijn soort voor het Portugees.
  • De Schoonmaak: Ze gooiden niet zomaar alles erin. Ze gedroegen zich als strenge bibliothecarissen, met behulp van geautomatiseerde tools om rommel, dubbele pagina's en giftige inhoud weg te gooien. Ze hielden alleen de hoogwaardige, schone tekst uit diverse bronnen zoals Wikipedia, blogs en webpagina's.

3. De Nieuwe Robot: NorBERTo

Met behulp van deze enorme bibliotheek trainden ze een nieuwe robot genaamd NorBERTo.

  • Het Ontwerp: In plaats van het oude, standaard ontwerp voor robots te gebruiken, gebruikten ze een modern blauwdruk genaamd ModernBERT. Denk hierbij aan de upgrade van een fiets naar een snelle elektrische fiets. Het heeft speciale functies die het mogelijk maken langere zinnen te lezen zonder in de war te raken en informatie veel sneller te verwerken.
  • De Grootte: Ze bouwden twee versies: een "Base"-model (ongeveer 150 miljoen "hersencellen" of parameters) en een "Large"-model (ongeveer 395 miljoen).
  • De Training: Ze leerden de robot vanaf nul uitsluitend met Portugese tekst. Het bedroeg niet door te beginnen met kennis uit het Engels; het leerde Portugees puur uit de Aurora-PT-bibliotheek.

4. De Proefrit: Hoe Presteerde Het?

Het team zette NorBERTo door een reeks proefritten (benchmarks) om te zien hoe goed het Portugees begreep in vergelijking met de oude kampioenen.

  • De "Logica"-test (Textual Entailment): Stel je voor dat je de robot twee zinnen laat zien en vraagt: "Volgt de tweede zin logisch uit de eerste?"
    • Resultaat: NorBERTo (Large) won deze categorie en versloeg de vorige beste modellen. Het bewees dat een modern ontwerp + een enorme bibliotheek = betere logica.
  • De "Betekenis"-test (Semantic Similarity): Stel je voor dat je vraagt: "Zeggen deze twee zinnen hetzelfde?"
    • Resultaat: De oude kampioen, BERTimbau, hield hier nog steeds de leiding. De auteurs verklaren dit waarschijnlijk doordat BERTimbau een voorsprong had door training in het Engels, terwijl NorBERTo alles vanaf nul moest leren.
  • De "Parafrase"-test (MRPC): Kan de robot vertellen of twee zinnen gewoon verschillende manieren zijn om hetzelfde te zeggen?
    • Resultaat: NorBERTo (Large) verpletterde de concurrentie en behaalde de hoogste score ooit geregistreerd voor deze specifieke taak in het Portugees.

5. De Grote Conclusie

Het artikel concludeert dat je geen gigantische, dure "super-robot" nodig hebt (zoals de enorme AI-modellen die verhalen schrijven) om specifieke taken goed uit te voeren.

Door een enorme, schone bibliotheek (Aurora-PT) te combineren met een modern, efficiënt ontwerp (ModernBERT), creëerden ze een "Goudlokje"-robot:

  • Het is niet te klein (het is slimmer dan oudere modellen).
  • Het is niet te groot (het is goedkoper en sneller om te draaien dan massale AI).
  • Het is precies goed voor real-world taken zoals e-mails sorteren, klantvragen begrijpen of zoekmachines helpen bij het vinden van de juiste antwoorden.

Kortom: Ze bouwden een grotere, schonere bibliotheek en een slimmere, efficiëntere robot, en bewezen dat je voor het begrijpen van het Portugees niet de grootste AI in de kamer hoeft te zijn; je hebt gewoon de juiste tools en de juiste data nodig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →