← Neueste Arbeiten
💬 NLP

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

Dieser Beitrag stellt Efficient-DLM vor, ein Framework, das vortrainierte autoregressive Modelle durch die Verwendung eines blockweisen Aufmerksamkeitsmusters und einer positionsabhängigen Token-Maskierung in hocheffiziente Diffusions-Sprachmodelle umwandelt und dadurch im Vergleich zu State-of-the-Art-Modellen eine überlegene Genauigkeit und Durchsatzleistung erzielt.

Ursprüngliche Autoren: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

Veröffentlicht 2026-05-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Der Stau vs. die Autobahn

Stellen Sie sich zwei Möglichkeiten vor, eine Geschichte zu schreiben:

  1. Der alte Weg (Autoregressiv/AR): Dies ist wie eine einspurige Straße. Sie schreiben ein Wort, dann das nächste, dann das nächste. Sie können das zweite Wort nicht schreiben, bevor das erste fertig ist. Es ist sehr genau, aber langsam, weil Sie für jedes einzelne Wort in der Schlange warten müssen.
  2. Der neue Weg (Diffusion/DLM): Dies ist wie eine mehrgleisige Autobahn. Sie können viele Wörter gleichzeitig (parallel) schreiben. Es sollte viel schneller sein. In der Vergangenheit waren diese „Autobahnen" jedoch holprig, verwirrend und produzierten oft Geschichten von geringerer Qualität als die einspurige Straße. Außerdem waren sie sehr teuer zu bauen (zu trainieren).

Das Problem: Wissenschaftler wollten die Geschwindigkeit der Autobahn mit der Qualität der einspurigen Straße, konnten aber nicht herausfinden, wie man sie bauen kann, ohne bei Null anzufangen (was ein Vermögen kostet).

Die Lösung: Die Autoren dieses Papiers haben herausgefunden, wie man ein bestehendes, hochwertiges „einspuriges" Modell in ein „Autobahn"-Modell verwandeln kann, das sowohl schnell als auch genau ist. Sie nennen diese neue Modellfamilie Efficient-DLM.


Wie sie es geschafft haben: Drei Schlüsseltipps

Das Papier identifiziert drei Haupt„Regeln", die sie befolgen mussten, um diese Transformation zum Funktionieren zu bringen.

1. Die Regel „Sauberer Kontext" (Die Block-Methode)

  • Der alte Fehler: Frühere Versuche versuchten, das Modell den gesamten Satz auf einmal betrachten zu lassen, sogar die Teile, die noch chaotisch oder fehlten. Stellen Sie sich vor, Sie versuchen ein Puzzle zu lösen, bei dem die Hälfte der Teile fehlt, und Sie dürfen die leeren Stellen so betrachten, als wären sie gefüllt. Dies verwirrte das Modell und ließ es vergessen, was es zuvor gelernt hatte.
  • Die Lösung: Die Autoren beschlossen, den Satz in kleine Blöcke zu zerlegen (wie Kapitel in einem Buch).
    • Das Modell betrachtet die vorherigen Kapitel, die bereits fertig und sauber sind.
    • Es versucht nur, das aktuelle Kapitel zu korrigieren, das chaotisch ist.
    • Analogie: Denken Sie an eine Baufirma. Sie versuchen nicht, das ganze Gebäude auf einmal zu reparieren. Sie beenden das Fundament und den ersten Stock (sauberer Kontext), bevor sie nach oben gehen, um den zweiten Stock (den chaotischen Block) zu reparieren. Dies hält die Struktur stabil und ermöglicht ihnen die Nutzung eines „Abkürzungswegs" (genannt KV-Caching), um sich zu erinnern, was sie bereits gebaut haben, was den Prozess viel schneller macht.

2. Die Regel „Kein Token-Shift" (Hör auf, den nächsten Schritt zu erraten)

  • Der alte Fehler: Beim Umwandeln des alten Modells ließen Forscher das Modell das nächste Wort erraten, genau wie das alte einspurige Modell.
  • Die Lösung: Die Autoren stellten fest, dass das Modell nicht das „nächste" Wort erraten muss. Es muss nur die fehlenden Wörter direkt vor sich korrigieren.
  • Analogie: Stellen Sie sich vor, Sie bearbeiten ein Dokument.
    • Alter Weg: Sie lesen einen Satz und versuchen dann, den aller nächsten Satz vorherzusagen, bevor Sie sogar den aktuellen Satz fertig bearbeitet haben.
    • Neuer Weg: Sie konzentrieren sich einfach darauf, die Leerstellen im aktuellen Absatz auszufüllen. Es stellt sich heraus, dass das Ausfüllen der Lücken einfacher und genauer ist als der Versuch, die Zukunft vorherzusagen.

3. Die Regel „Positionsabhängige Maskierung" (Die Links-nach-Rechts-Bias)

  • Das Problem: Während des Trainings des Modells wurden Wörter früher zufällig versteckt (wie beim Ziehen von Lottozahlen). Aber wenn das Modell tatsächlich genutzt wird (Inferenz), neigt es natürlich dazu, Wörter von links nach rechts zu beenden, genau wie Menschen lesen. Dies erzeugte eine Diskrepanz: Das Training sah nicht aus wie der echte Test.
  • Die Lösung: Die Autoren änderten das Training so, dass das Modell Wörter eher am Ende eines Blocks versteckt als am Anfang.
  • Analogie: Stellen Sie sich einen Lehrer vor, der einen Test korrigiert.
    • Altes Training: Der Lehrer deckt zufällige Fragen auf der Seite zu.
    • Neues Training: Der Lehrer erkennt, dass Schüler normalerweise bei den letzten paar Fragen eines Abschnitts hängen bleiben. Also übt der Lehrer speziell das Abdecken des Endes des Abschnitts. Dies bereitet das Modell auf die reale Welt vor, in der es den Satz von links nach rechts beenden muss.

Die Ergebnisse: Geschwindigkeit und Intelligenz

Durch das Befolgen dieser Regeln schufen die Autoren die Efficient-DLM-Familie (Größen 1,5B, 4B und 8B).

  • Geschwindigkeit: Sie sind deutlich schneller als die besten bestehenden Modelle. Zum Beispiel ist ihr 8B-Modell 4,5-mal schneller als ein Konkurrent namens „Dream" und 2,7-mal schneller als „Qwen3 4B".
  • Genauigkeit: Trotz ihrer Geschwindigkeit sind sie bei mathematischen, Programmier- und Denkaufgaben sogar genauer als die Modelle, die sie schlagen.
  • Flexibilität: Da sie mehrere Wörter gleichzeitig generieren können, können Sie sie anpassen. Wenn Sie Geschwindigkeit benötigen, generieren Sie viele Wörter auf einmal. Wenn Sie extreme Präzision benötigen, generieren Sie weniger Wörter auf einmal. Es ist wie ein Auto, das sofort zwischen „Rennmodus" und „Kreuzmodus" wechseln kann.

Zusammenfassung

Das Papier sagt: „Wir haben ein langsames, genaues Modell genommen und es gelehrt, auf einer Autobahn zu laufen. Wir haben dies getan, indem wir die Arbeit in saubere Blöcke organisierten, es daran hinderten, die Zukunft zu erraten, und es trainierten, sich auf das Ende von Sätzen zu konzentrieren. Das Ergebnis ist eine Modellfamilie, die sowohl schneller als auch intelligenter ist als der aktuelle Stand der Technik."

Sie stellten auch fest, dass diese Modelle, da sie Text in beide Richtungen betrachten können (bidirektional), überraschend gut darin sind, die „Bedeutung" von Text für Such- und Einbettungsaufgaben zu verstehen und dabei die älteren einrichtungsweisen Modelle übertreffen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →