← Neueste Arbeiten
💬 NLP

In-Place Tokenizer Expansion for Pre-trained LLMs

Dieses Paper stellt eine In-Place-Tokenizer-Erweiterungsmethode vor, die vortrainierte LLMs durch die Fortsetzung von BPE-Merges auf einem multilingualen Korpus und die Initialisierung neuer Embeddings mittels Sub-Token-Averaging aufwertet, wodurch die Token-Anzahl signifikant reduziert und die Dekodierungsgeschwindigkeit für Sprachen wie Hindi und Vietnamesisch verbessert wird, ohne die Modellqualität zu beeinträchtigen.

Ursprüngliche Autoren: Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner

Veröffentlicht 2026-07-17
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Sprache der Maschinen: Ein kurzer Einstieg

Stellen Sie sich vor, Sie bringen einem Roboter das Sprechen bei. Um dies zu tun, können Sie ihm nicht einfach ein Wörterbuch mit jedem Wort des Universums geben; das wäre zu schwer zum Tragen. Stattdessen geben Sie ihm einen Satz Bausteine. In der Welt der Künstlichen Intelligenz werden diese Bausteine Tokens genannt. Betrachten Sie Tokens als die kleinsten Textstücke, die ein Computer versteht – manchmal ein ganzes Wort wie „Katze“, aber oft nur eine Silbe wie „Kat“ oder sogar ein einzelner Buchstabe wie „K“.

Wenn ein Roboter eine Sprache lernt, entscheidet er, wie er Sätze in diese Blöcke zerlegt. Wenn er zuerst Englisch lernt, hat er vielleicht einen speziellen Block für das Wort „the“. Aber wenn Sie ihn später bitten, Hindi oder Vietnamesisch zu sprechen, und er darauf nicht vorbereitet war, muss er diese Wörter vielleicht in winzige, ineffiziente Stücke zerlegen, wie „H-i-n-d-i“ statt „Hindi“. Das ist so, als würde man versuchen, ein Haus mit einem Hammer zu bauen, obwohl man eigentlich einen Schraubendreher bräuchte; es funktioniert zwar, ist aber langsam, klobig und verbraucht viel Energie. Dieses Paper befasst sich mit der Frage, wie man die „Werkzeugkiste“ (das Vokabular) eines Roboters aufwertet, nachdem er bereits trainiert wurde, ohne den ganzen Roboter von Grund auf neu bauen zu müssen.


Das Rätsel der kaputten Werkzeugkiste

Lernen Sie Jimmy und sein Team bei Liquid AI kennen. Sie arbeiteten an einem sehr intelligenten Roboter namens LFM2, der auf Geräten wie Telefonen und Laptops lebt. Dieser Roboter war großartig in Englisch und Programmierung, aber wenn er versuchte, Sprachen wie Hindi, Vietnamesisch oder Thai zu sprechen, stolperte er. Warum? Weil sein Vokabular wie eine Werkzeugkiste war, die für eine Reise nach London gepackt worden war, nicht nach Bangkok. Wenn der Roboter versuchte, „Hindi“ zu schreiben, hatte er keinen einzelnen Block für das ganze Wort. Stattdessen musste er vier oder fünf winzige Blöcke verwenden, um es zusammenzusetzen. Dies machte den Roboter langsam, müde und hungrig nach Akkuleistung.

Das Team stand vor einer schweren Entscheidung. Sie könnten ihre harte Arbeit wegwerfen, einen brandneuen Roboter mit einer besseren Werkzeugkiste bauen und von vorne anfangen. Oder sie könnten versuchen, dem alten Roboter heimlich einen neuen Satz Werkzeuge einzuschmuggeln, ohne ihn kaputt zu machen. Die zweite Option ist wie der Versuch, eine neue Schublade in einen bereits montierten, laufenden Automotor einzubauen, während dieser gerade auf der Autobahn fährt. Die meisten Menschen dachten, dass dies unmöglich oder zu riskant sei.

Das „In-Place“-Upgrade

Das Team entdeckte einen cleveren Weg, genau das zu tun. Sie nannten es Tokenizer Expansion. Anstatt die alte Werkzeugkiste wegzuwerfen, behielten sie die ursprünglichen Werkzeuge bei und fügten am Ende der Box einfach neue hinzu.

So haben sie es Schritt für Schritt gemacht:

  1. Das clevere Kopieren und Einfügen: Sie nahmen die bestehende Liste der Bausteine des Roboters und ließen ihn an einer Mischung aus vielen verschiedenen Sprachen weiterlernen. Während der Roboter neue Wörter lernte, warf er die alten Blöcke nicht weg. Stattdessen erstellte er neue, größere Blöcke für Wörter wie „Hindi“ oder „Thai“. Entscheidend war, dass jeder neue Block durch das Zusammenstecken der alten, kleineren Blöcke, die er bereits kannte, gebaut wurde. Es war wie die Erkenntnis, dass man, wenn man einen „H“-Block und einen „i“-Block hat, diese zusammenstecken kann, um einen „Hi“-Block zu machen, und diesen dann mit „nd“ und „i“ zusammensteckt, um „Hindi“ zu bilden.
  2. Der magische Kleber (Embedding Initialization): Nun hatte der Roboter neue Blöcke, aber er wusste nicht, was sie bedeuteten. Das Team musste dem Roboter beibringen, was diese neuen Blöcke repräsentierten. Sie nutzten einen einfachen, aber brillanten Trick: Sie schauten sich die alten Blöcke an, aus denen der neue Block bestand, und gaben dem neuen Block die „durchschnittliche“ Bedeutung seiner Teile. Wenn ein neuer Block aus drei alten Blöcken bestand, gab der Roboter-Verstand ihm die durchschnittliche Persönlichkeit dieser drei Teile. Das bedeutete, dass der Roboter nicht raten musste; er startete mit einer sehr guten Vermutung.
  3. Das Zwei-Stufen-Workout: Der Roboter war noch nicht bereit, einen Marathon zu laufen. Wenn sie ihn sofort losgelassen hätten, wäre er gestürzt. Also machten sie ein Zwei-Stufen-Workout:
    • Stufe 1: Sie frierten das Gehirn des Roboters ein (alles außer den neuen Blöcken) und ließen nur die neuen Blöcke lernen. Dies war so, als würde man die neuen Schubladen in der Werkzeugkiste daran gewöhnen, Dinge zu halten, ohne den Rest des Autos zu bewegen.
    • Stufe 2: Sobald die neuen Blöcke sich wohlfühlten, tauften sie den gesamten Roboter auf und ließen ihn wieder in vielen Sprachen lesen und schreiben üben. Dies half dem Roboter zu verstehen, wie die neuen Blöcke in das große Ganze passen.

Die Ergebnisse: Schneller, intelligenter und leichter

Die Ergebnisse waren beeindruckend. Durch die Verwendung dieser neuen, erweiterten Werkzeugkiste konnte der Roboter Hindi, Vietnamesisch und Thai viel effizienter sprechen.

  • Hindi-Texte wurden in 2,4-mal weniger Blöcken zerlegt.
  • Vietnamesisch war 2,6-mal weniger.
  • Thai verzeichnete den größten Sprung und benötigte 4,0-mal weniger Blöcke.

Da der Roboter weniger Blöcke verarbeiten musste, um das Gleiche zu sagen, wurde er viel schneller. Das Team schätzte, dass das Sprechen dieser Sprachen auf einem Telefon 2,2 bis 3,7-mal schneller pro Zeichen sein konnte. Es war wie der Wechsel vom Gehen zum Fahrradfahren; der Roboter legte die gleiche Strecke in einem Bruchteil der Zeit zurück.

Was sie lernten (und was sie vermieden)

Das Team lernte auch, was man nicht tun sollte, was genauso wichtig ist.

  • Fassen Sie die alten Werkzeuge nicht an: In einem Experiment versuchten sie, den Roboter die Bedeutung seiner alten Blöcke neu lernen zu lassen, während sie die neuen hinzufügten. Dies verwirrte den Roboter, und er begann sich wie eine kaputte Schallplatte zu wiederholen. Sie fanden heraus, dass das Beibehalten der alten Blöcke exakt so, wie sie waren, das Geheimnis des Erfolgs war.
  • Lesen Sie nicht nur Englisch: Als sie versuchten, den Roboter die neuen Blöcke hauptsächlich mit englischen Texten lehren zu lassen, wurde der Roboter gut darin, Multiple-Choice-Fragen zu beantworten, aber schlecht darin, tatsächlich Sätze zu schreiben. Er konnte die richtige Antwort auswählen, aber keine Geschichte erzählen. Sie lernten, dass sie ihm eine ausgewogene Ernährung aus vielen Sprachen geben mussten, um ihn gesund zu halten.

Das Fazit

Dieses Paper zeigt, dass man nicht immer einen neuen Roboter bauen muss, um ihn eine neue Sprache sprechen zu lassen. Wenn man derjenige ist, der den Roboter gebaut hat, kann man sein Vokabular mitten in seinem Leben aufwerten. Indem man die neuen Werkzeuge sorgfältig hinzufügt und ihnen die richtige „durchschnittliche“ Bedeutung gibt, kann man den Roboter schneller und effizienter für alle machen, ohne die Fähigkeiten zu verlieren, die er bereits besaß. Es ist ein praktisches Rezept, um KI inklusiver und schneller zu machen, direkt auf dem Gerät in Ihrer Tasche.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →