Scaling Embeddings Outperforms Scaling Experts in Language Models
Diese Arbeit zeigt, dass die Skalierung von Embeddings eine effizientere Alternative zur Skalierung von Experten (MoE) darstellt, um die Leistungsfähigkeit von Sprachmodellen zu steigern, und führt mit *LongCat-Flash-Lite* ein entsprechendes Modell ein, das trotz hoher Sparsität exzellente Ergebnisse in den Bereichen Coding und Agentic Tasks erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das Problem: Das „Super-Gehirn“-Dilemma
Stell dir vor, du möchtest das schlauste Gehirn der Welt bauen. Bisher haben alle Forscher (wie bei den bekannten ChatGPT-Modellen) versucht, dieses Gehirn zu vergrößern, indem sie immer mehr „Spezialisten“ einstellen.
Das Prinzip heißt MoE (Mixture-of-Experts). Wenn du eine Frage zu Mathe stellst, wird der „Mathe-Experte“ gerufen; bei Geschichte der „Geschichts-Experte“. Das ist super, aber es gibt ein Problem: Wenn du immer mehr Experten einstellst, wird das Büro (der Computer-Speicher) immer voller, die Kommunikation zwischen den Experten dauert ewig und irgendwann wird das ganze System so schwerfällig, dass es kaum noch schneller lernt, obwohl es mehr Wissen hat. Man nennt das „abnehmende Erträge“.
Die neue Idee: Das „Super-Wörterbuch“
Das Team von Meituan LongCat hat eine andere Idee. Anstatt immer mehr Experten für Spezialwissen einzustellen, haben sie beschlossen, das „Wortschatz-Gedächtnis“ (die sogenannten Embeddings) massiv zu vergrößern.
Die Analogie:
Stell dir vor, du hast zwei Wege, um ein Genie zu erschaffen:
- Der Experten-Weg (Bisheriger Standard): Du stellst 1.000 Professoren ein. Wenn du eine Frage stellst, muss ein Assistent erst prüfen: „Wer ist zuständig?“ und dann den Professor rufen. Das kostet Zeit und Organisation.
- Der Wortschatz-Weg (Die neue Methode): Du behältst nur ein paar Professoren, aber du gibst ihnen ein magisches, unendlich großes Wörterbuch. Dieses Wörterbuch enthält nicht nur einzelne Wörter, sondern auch ganze Wort-Kombinationen (N-Gramme), die sofort die Bedeutung und den Kontext verraten.
Anstatt dass der Professor mühsam überlegen muss, was „Bank“ bedeutet (Sitzmöbel oder Geldinstitut?), sagt ihm das Wörterbuch sofort: „Achtung, es steht das Wort 'Park' daneben, es ist also ein Sitzmöbel!“
Wie funktioniert das „Magische Wörterbuch“? (N-gram Embedding)
Das Papier nutzt eine Technik namens N-gram Embedding.
Normalerweise „liest“ eine KI ein Wort nach dem anderen. Die neue Methode schaut aber wie ein Profi-Leser: Sie sieht nicht nur das Wort „Apfel“, sondern sie speichert im Gedächtnis sofort die Kombination „roter Apfel“, „saftiger Apfel“ oder „Apfel essen“.
Diese Kombinationen werden in riesigen Tabellen gespeichert. Das Besondere: Diese Tabellen sind extrem effizient. Sie verbrauchen zwar enorm viel Platz (wie ein riesiges Lexikon), aber sie zu benutzen ist so einfach wie das schnelle Nachschlagen in einem Index – es kostet fast keine Rechenkraft.
Das Ergebnis: LongCat-Flash-Lite
Die Forscher haben daraus ein Modell namens LongCat-Flash-Lite gebaut.
- Es ist riesig (68,5 Milliarden Parameter).
- Aber: Über die Hälfte dieser Größe (30 Milliarden!) besteht nur aus diesem „magischen Wörterbuch“.
- Die eigentliche „Rechenarbeit“ (die Experten) bleibt klein und flink.
Das Ergebnis ist beeindruckend:
Obwohl das Modell im Vergleich zu anderen Modellen eigentlich „weniger Gehirnzellen“ (aktivierte Parameter) nutzt, ist es in Bereichen wie Programmieren (Coding) und komplexen Aufgaben (Agentic Tasks) sogar besser als seine größeren Konkurrenten. Es ist wie ein kleiner, extrem gut informierter Bibliothekar, der schneller antwortet als ein riesiges Team aus zerstreuten Professoren.
Zusammenfassung für den Stammtisch:
- Früher: „Lass uns mehr Experten einstellen, damit das Modell schlauer wird!“ (Problem: Zu langsam und zu teuer).
- Heute (LongCat): „Lass uns den Experten ein viel besseres, tieferes Verständnis für Wörter und deren Zusammenhänge geben!“ (Ergebnis: Schlauer, schneller und effizienter).
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.