← Neueste Arbeiten
💬 NLP

Leviathan: Decoupling Input and Output Representations in Language Models

Der Artikel stellt Leviathan vor, eine Transformer-Architektur, die Eingabe- und Ausgabedarstellungen entkoppelt, indem sie die standardmäßige gekoppelte Embedding-Matrix durch eine gelernte Embedding-Vektorisierung (LEV) ersetzt und damit signifikante Verbesserungen bei der Sprachmodellierung sowie in nachgelagerten Benchmarks bei minimalem Parameteraufwand erzielt.

Ursprüngliche Autoren: Reza T. Batley, Sourav Saha

Veröffentlicht 2026-05-08
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Reza T. Batley, Sourav Saha

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Das „Ein-Größe-Passt-Alle"-Wörterbuch

Stellen Sie sich vor, Sie unterrichten einen Roboter im Sprechen. Dafür benötigt der Roboter ein Wörterbuch, das zwei sehr unterschiedliche Aufgaben erfüllt:

  1. Lesen: Es schlägt ein Wort nach, um zu verstehen, was es bedeutet (Eingabe).
  2. Schreiben: Es schlägt ein Wort nach, um vorherzusagen, was als Nächstes kommt (Ausgabe).

In den meisten modernen KI-Modellen verwendet der Roboter ein einziges, riesiges physisches Wörterbuch für beide Aufgaben. Dies wird als „Gewichtsverknüpfung" (weight tying) bezeichnet. Das Papier argumentiert, dass dies so ist, als würde man ein Schweizer Taschenmesser zwingen, sowohl ein präzises chirurgisches Skalpell als auch ein schweres Vorschlaghammer zu sein. Es versucht beides zu tun, ist aber in keinem von beiden gut, weil die Anforderungen unterschiedlich sind.

  • Lesen benötigt Geschmeidigkeit: Wörter mit ähnlicher Bedeutung (wie „Katze" und „Kätzchen") sollten im Geist des Roboters nah beieinander liegen.
  • Schreiben benötigt Schärfe: Der Roboter muss zwischen jedem einzelnen Wort im Wörterbuch klar unterscheiden können, selbst den seltsamen.

Wenn man ein einziges Werkzeug zwingt, beides zu tun, muss der Roboter Kompromisse eingehen. Am Ende ist er in beidem „okay", aber in keinem von beiden „großartig".

Die gescheiterte Lösung: Zwei Wörterbücher kaufen

Die offensichtliche Lösung scheint zu sein: „Geben Sie dem Roboter einfach zwei separate Wörterbücher – eines zum Lesen und eines zum Schreiben."
Die Forscher haben dies versucht. Sie gaben dem Roboter ein massives, vollständig separates Wörterbuch zum Lesen. Aber es funktionierte nicht. Der Roboter wurde verwirrt, lernte langsamer und performte tatsächlich schlechter als die Version mit dem einzelnen Wörterbuch, obwohl er mit 50 % mehr Speicher (Parametern) arbeitete. Es war, als würde man einem Schüler zwei Lehrbücher geben, aber keinen Lernleitfaden; die zusätzlichen Informationen wurden einfach zu Rauschen.

Die Lösung: Leviathan (Der „Intelligente Generator")

Das Papier stellt Leviathan vor, eine neue Art, das Gehirn des Roboters zu bauen. Anstelle eines riesigen physischen Wörterbuchs zum Lesen verwendet Leviathan einen intelligenten, kompakten Generator.

Die Analogie: Das Kochbuch vs. der Lebensmittelmarkt

  • Der alte Weg (Verknüpfte Embeddings): Stellen Sie sich einen riesigen Lebensmittelmarkt vor, bei dem jeder einzelne Artikel (jedes Wort) sein eigenes, spezifisches Regal hat. Wenn Sie einen „Apfel" wollen, gehen Sie zu Regal A. Wenn Sie eine „Aprikose" wollen, gehen Sie zu Regal B. Wenn Sie eine seltene Frucht wie eine „Durian" wollen, müssen Sie ihr spezifisches, winziges Regal finden. Wenn der Markt riesig ist, ist es schwierig, dieses seltene Regal zu finden, und der Roboter vergisst oft, wo es ist.
  • Der Leviathan-Weg (LEV): Anstelle eines Regals für jedes einzelne Wort hat Leviathan ein Kochbuch.
    • Um einen „Apfel" herzustellen, sucht der Roboter nicht in einem Regal nach; er folgt einem Rezept: Nehmen Sie 1 Teil „Frucht", fügen Sie 2 Teile „rot" hinzu, mischen Sie mit „süß".
    • Um eine „Durian" (ein seltenes Wort) herzustellen, folgt er einem ähnlichen Rezept: Nehmen Sie 1 Teil „Frucht", fügen Sie 2 Teile „stachelig" hinzu, mischen Sie mit „starker Geruch".

Weil der Roboter ein Rezept (eine mathematische Funktion) verwendet und nicht ein Regal, kann er auf der Stelle einen perfekten „Apfel" oder eine „Durian" erschaffen.

  • Die Magie: Wenn der Roboter lernt, wie ein „Apfel" schmeckt, wird er automatisch besser im Verständnis einer „Birne", weil die Rezepte gemeinsame Zutaten teilen. Dies wird als Geschmeidigkeit bezeichnet.
  • Die Effizienz: Das Kochbuch ist winzig im Vergleich zum riesigen Lebensmittelmarkt. Das bedeutet, der Roboter kann sein „Schreibwörterbuch" (den Ausgabekopf) riesig und separat halten, ohne zusätzlichen Speicher zu benötigen. Er bekommt das Beste aus beiden Welten: ein winziges, intelligentes Lesesystem und ein massives, leistungsfähiges Schreibsystem.

Was passierte in den Experimenten?

Die Forscher testeten diesen neuen „Leviathan"-Roboter gegen den alten „Einzel-Wörterbuch"-Roboter in drei verschiedenen Größen (Klein, Mittel und Groß).

  1. Es lernte schneller: Der Leviathan-Roboter erreichte das gleiche Fähigkeitsniveau mit 2,1-mal weniger Trainingswörtern als der alte Roboter.
  2. Es wurde schlauer: Bei der größten Größe war der Leviathan-Roboter 9 % besser darin, das nächste Wort vorherzusagen (eine Metrik, die als Perplexität bezeichnet wird).
  3. Die „Seltene-Wörter"-Superkraft: Die größte Überraschung war, wo die Verbesserung stattfand.
    • Bei gängigen Wörtern (wie „der" oder „und") waren beide Roboter etwa gleich gut.
    • Bei seltenen Wörtern (Wörter, die der Roboter nur einmal in einer Million sieht), war der Leviathan-Roboter 81 % besser.
    • Warum? Im alten System hat der Roboter, wenn ein Wort selten ist, kaum eine Chance, seine „Regalposition" zu lernen, also vergisst er es. Bei Leviathan kann der Roboter es trotzdem herausfinden, auch wenn er es nur einmal gesehen hat, weil das Wort aus einem Rezept gemeinsamer Teile aufgebaut ist.

Das Fazit

Das Papier beweist, dass die Art und Weise, wie wir die „Lesen"- und „Schreiben"-Teile der KI verbinden, wichtig ist. Man muss nicht einfach mehr Speicher auf das Problem werfen. Stattdessen kann man durch den Wechsel von einer riesigen Nachschlagetabelle zu einem kompakten, geschmeidigen Rezeptgenerator KI-Modelle schlauer, schneller und viel besser im Verständnis seltener und schwieriger Wörter machen, und das alles bei fast gleichem Rechenaufwand.

Kurz gesagt: Leviathan verhindert, dass die KI einen riesigen Telefonbuch auswendig lernt, und lässt sie stattdessen die Grammatik lernen, wie Wörter aufgebaut sind, was sie zu einem viel effizienteren und fähigeren Lerner macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →