← Neueste Arbeiten
💬 NLP

NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus

Die Arbeit stellt NorBERTo vor, ein modernes Encoder-only-Modell für das brasilianische Portugiesisch, das auf dem größten öffentlich verfügbaren monolingualen Korpus (Aurora-PT) mit 331 Milliarden Tokens trainiert wurde, auf mehreren semantischen Benchmarks State-of-the-Art-Leistung erzielt und eine effiziente, einsetzbare Lösung für nachgelagerte NLP-Aufgaben bietet.

Ursprüngliche Autoren: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreic
Veröffentlicht 2026-05-04
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreich, Vinicius F. Caridá

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, die portugiesische Sprache zu verstehen. Lange Zeit waren die besten Roboter wie Schüler, die ein paar gute Bücher gelesen hatten, aber nicht die gesamte Bibliothek gesehen. Diese Arbeit stellt einen neuen Roboter namens NorBERTo und eine riesige neue Bibliothek namens Aurora-PT vor, die ihm beim Lernen hilft.

Hier ist die Geschichte, wie sie es geschafft haben, einfach erklärt:

1. Das Problem: Der Roboter brauchte eine größere Bibliothek

Zuvor wurden die besten Roboter für die portugiesische Sprache (wie BERTimbau und Albertina) mit Bibliotheken trainiert, die etwa 2 bis 3 Milliarden „Wörter" (Tokens) enthielten. Zwar gut, aber es ist wie der Versuch, eine Sprache zu lernen, indem man ein paar Romane und ein Wörterbuch liest.

Die Autoren erkannten, dass sie für einen wirklich intelligenten Roboter eine Bibliothek im Maßstab einer riesigen Stadt benötigten. Sie wollten einen Roboter bauen, der die Nuancen des brasilianischen Portugiesisch verstehen konnte, ohne ein riesiger, teurer Supercomputer zu sein, der endlose Geschichten generiert (die dazu neigen, Dinge zu erfinden oder zu „halluzinieren").

2. Die neue Bibliothek: Aurora-PT

Das Team baute Aurora-PT, eine brandneue Textsammlung.

  • Der Umfang: Sie enthält 331 Milliarden Tokens. Um das einzuordnen: Wenn die alten Bibliotheken ein einzelnes Bücherregal waren, ist Aurora-PT ein ganzes Lagerhaus. Sie ist derzeit die größte offene Bibliothek ihrer Art für Portugiesisch.
  • Die Bereinigung: Sie warfen nicht einfach alles hinein. Sie handelten wie strenge Bibliothekare und nutzten automatisierte Werkzeuge, um Müll, doppelte Seiten und toxische Inhalte zu entfernen. Sie behielten nur hochwertigen, sauberen Text aus verschiedenen Quellen wie Wikipedia, Blogs und Webseiten.

3. Der neue Roboter: NorBERTo

Mit dieser riesigen Bibliothek trainierten sie einen neuen Roboter namens NorBERTo.

  • Das Design: Statt das alte, Standard-Design für Roboter zu verwenden, nutzten sie einen modernen Bauplan namens ModernBERT. Denken Sie daran wie an den Upgrade von einem Fahrrad auf ein Hochgeschwindigkeits-E-Bike. Es verfügt über spezielle Funktionen, die es ihm ermöglichen, längere Sätze zu lesen, ohne verwirrt zu werden, und Informationen viel schneller zu verarbeiten.
  • Die Größe: Sie bauten zwei Versionen: ein „Base"-Modell (etwa 150 Millionen „Gehirnzellen" oder Parameter) und ein „Large"-Modell (etwa 395 Millionen).
  • Das Training: Sie brachten dem Roboter von Grund auf nur portugiesischen Text bei. Er schummelte nicht, indem er mit Wissen aus dem Englischen begann; er lernte Portugiesisch rein aus der Aurora-PT-Bibliothek.

4. Die Probefahrt: Wie hat es funktioniert?

Das Team unterzog NorBERTo einer Reihe von Fahrtests (Benchmarks), um zu sehen, wie gut es Portugiesisch im Vergleich zu den alten Champions verstand.

  • Der „Logik"-Test (Textual Entailment): Stellen Sie sich vor, Sie zeigen dem Roboter zwei Sätze und fragen: „Folgt der zweite Satz logisch aus dem ersten?"
    • Ergebnis: NorBERTo (Large) gewann diese Kategorie und schlug die bisherigen besten Modelle. Es bewies, dass ein modernes Design + eine riesige Bibliothek = bessere Logik bedeutet.
  • Der „Bedeutung"-Test (Semantic Similarity): Stellen Sie sich vor, Sie fragen: „Sagen diese beiden Sätze dasselbe?"
    • Ergebnis: Der alte Champion, BERTimbau, hielt hier weiterhin die Führung. Die Autoren erklären, dass dies wahrscheinlich daran liegt, dass BERTimbau einen Vorsprung durch das Training auf Englisch hatte, während NorBERTo alles von Null lernen musste.
  • Der „Paraphrase"-Test (MRPC): Kann der Roboter feststellen, ob zwei Sätze nur verschiedene Wege sind, dasselbe zu sagen?
    • Ergebnis: NorBERTo (Large) überrannte die Konkurrenz und erreichte die höchste je für diese spezifische Aufgabe im Portugiesischen verzeichnete Punktzahl.

5. Die große Erkenntnis

Die Arbeit kommt zu dem Schluss, dass man keinen riesigen, teuren „Super-Roboter" (wie die massiven KI-Modelle, die Geschichten schreiben) benötigt, um bestimmte Aufgaben gut zu erledigen.

Durch die Kombination einer riesigen, sauberen Bibliothek (Aurora-PT) mit einem modernen, effizienten Design (ModernBERT) schufen sie einen „Goldlöckchen"-Roboter:

  • Er ist nicht zu klein (er ist intelligenter als ältere Modelle).
  • Er ist nicht zu groß (er ist günstiger und schneller im Betrieb als massive KI).
  • Er ist genau richtig für reale Aufgaben wie das Sortieren von E-Mails, das Verstehen von Kundenfragen oder das Helfen von Suchmaschinen, die richtigen Antworten zu finden.

Kurz gesagt: Sie bauten eine größere, sauberere Bibliothek und einen intelligenteren, effizienteren Roboter und bewiesen, dass man für das Verständnis von Portugiesisch nicht die größte KI im Raum sein muss – man braucht nur die richtigen Werkzeuge und die richtigen Daten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →