← Neueste Arbeiten
💬 NLP

DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding

DFlare beschleunigt die LLM-Inferenz, indem es die Ausdrucksbeschränkungen früherer Block-Diffusionsmethoden durch einen leichtgewichtigen schichtweisen Fusionsmechanismus überwindet, der tiefere, leistungsfähigere Draft-Modelle ermöglicht und signifikante Beschleunigungen über verschiedene Benchmarks hinweg erzielt.

Ursprüngliche Autoren: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

Veröffentlicht 2026-06-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiebin Zhang, Zhenghan Yu, Song Liu, Eugene J. Yu, Zheng Li, Dawei Zhu, Jiangshan Duo, Weimin Xiong, Yifan Song, Guanghua Yu, Jianchen Zhu, Sujian Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine lange Geschichte zu schreiben, aber Sie sind ein sehr langsamer, perfektionistischer Autor (das Target Model). Jedes Mal, wenn Sie das nächste Wort schreiben wollen, müssen Sie sehr intensiv nachdenken, Ihre Grammatik prüfen und sicherstellen, dass es perfekt passt. Das kostet viel Zeit.

Um dies zu beschleunigen, stellen Sie einen schnellen, energischen Assistenten ein (das Draft Model). Der Assistent versucht, die nächsten Wörter für Sie zu erraten. Wenn der Assistent richtig liegt, sagen Sie einfach „Ja, mach weiter!“ und arbeiten schnell fort. Wenn er falsch liegt, müssen Sie stoppen, ihn korrigieren und von vorne beginnen. Dies nennt man Speculative Decoding.

Das Problem: Der „Einheitsmodell“-Assistent

Vor Kurzem hat eine neue Methode namens DFlash versucht, den Assistenten noch besser zu machen. Anstatt nur ein Wort nach dem anderen zu erraten, versucht der DFlash-Assistent, einen ganzen Block von Wörtern auf einmal zu erraten (wie zum Beispiel den nächsten Satz in einem Rutsch).

DFlash hatte jedoch einen entscheidenden Fehler. Es gab dem Assistenten einen einzigen, generischen „Spickzettel“, der aus dem Gehirn des Hauptautors abgeleitet wurde.

  • Der Fehler: Stellen Sie sich vor, der Assistent hat 7 Ebenen des Denkens (wie 7 Stockwerke in einem Gebäude). DFlash gab dem 1. Stockwerk, dem 4. Stockwerk und dem 7. Stockwerk denselben generischen Spickzettel.
  • Das Ergebnis: Der Assistent wurde verwirrt. Die unteren Stockwerke benötigten einfache Grammatikregeln, während die oberen Stockwerke komplexe Ideen für die Geschichte brauchten. Da alle dieselben generischen Informationen erhielten, konnte der Assistent nicht klüger werden, indem er mehr Stockwerke hinzufügte. Er stieß an eine „Decke“, bei der das Hinzufügen weiterer Schichten nicht mehr half.

Die Lösung: DFLARE

Die Autoren dieser Arbeit haben DFLARE entwickelt. Betrachten Sie DFLARE als ein Upgrade für das Trainingssystem des Assistenten, damit jedes Stockwerk des Gebäudes einen maßgeschneiderten Spickzettel erhält.

So funktioniert DFLARE, unter Verwendung einfacher Analogien:

1. Die maßgeschneiderten Spickzettel (Layer-wise Fusion)

In DFLARE erstellt das System, anstatt jedem Stockwerk denselben generischen Spickzettel zu geben, eine einzigartige Mischung aus Informationen für jedes Stockwerk.

  • Die Analogie: Stellen Sie sich vor, der Hauptautor (Target Model) besitzt eine Bibliothek mit Büchern.
    • DFlash nahm eine Seite aus der Bibliothek, fotokopierte sie 7 Mal und gab jedem Stockwerk eine Kopie.
    • DFLARE schaut in die Bibliothek und sagt: „Stockwerk 1 braucht eine Seite über Grammatik, Stockwerk 4 braucht eine Seite über Plot-Twists und Stockwerk 7 braucht eine Seite über die Emotionen der Charaktere.“ Es mischt verschiedene Seiten aus der Bibliothek, um für jedes spezifische Stockwerk einen einzigartigen, perfekten Leitfaden zu erstellen.
  • Der Vorteil: Da jedes Stockwerk einen spezialisierten Leitfaden hat, kann der Assistent tatsächlich klüger werden, indem er mehr Stockwerke hinzufügt. Die „Decke“ wird durchbrochen.

2. Separate Notizbücher (Heterogeneous KV Projections)

Der Assistent muss zwei Arten von Notizen speichern: seine eigenen Vermutungen und die Informationen des Hauptautors.

  • Die Analogie: Im alten System versuchte der Assistent, seine eigenen Vermutungen und die Notizen des Hauptautors im selben Notizbuch zu schreiben. Die Tinte vermischte sich und es war schwer zu lesen.
  • DFLAREs Lösung: Es gibt dem Assistenten zwei separate Notizbücher. Eines ist für seine eigenen wilden Vermutungen, und das andere ist streng für die Notizen des Hauptautors reserviert. Dies hält die Informationen sauber und leicht nutzbar.

3. Lernen in Phasen (Progressive Loss)

Wenn der Assistent lernt, sollte er nicht versuchen, die schwierigsten Teile der Geschichte sofort zu meistern.

  • Die Analogie: Stellen Sie sich vor, ein Lehrer bewertet einen Schüler.
    • Der alte Weg: Der Lehrer bewertete den ersten einfachen Satz und den letzten schwierigen Satz vom ersten Tag an mit der gleichen Wichtigkeit. Der Schüler war überfordert.
    • DFLAREs Weg: Der Lehrer beginnt sich nur auf die ersten paar einfachen Sätze zu konzentrieren, um Vertrauen aufzubauen. Während der Schüler besser wird, beginnt der Lehrer langsam, auch die schwierigeren Sätze am Ende des Blocks zu bewerten. Dieser „Aufwärmansatz“ hilft dem Assistenten, schneller und effektiver zu lernen.

Die Ergebnisse: Wie viel schneller?

Die Autoren testeten dieses neue System an drei verschiedenen „Hauptautoren“ (KI-Modellen) und fanden heraus, dass DFLARE signifikant schneller ist als die bisher beste Methode (DFlash).

  • Bei einem mittelgroßen Autor (Qwen3-4B): Ist es 5,52-mal schneller.
  • Bei einem großen Autor (Qwen3-8B): Ist es 5,46-mal schneller.
  • Bei einem sehr großen Autor (GPT-OSS-20B): Ist es 3,91-mal schneller.

Einfach ausgedrückt: Wenn die alte Methode 10 Sekunden brauchte, um einen Absatz zu schreiben, kann DFLARE dies in etwa 2 Sekunden erledigen, während es immer noch exakt dieselbe hochwertige Geschichte schreibt.

Zusammenfassung

DFLARE ist wie ein Upgrade für einen schnellen Assistenten, indem man jedem Teil seines Gehirns einen spezialisierten, maßgeschneiderten Leitfaden gibt, anstatt eines generischen. Dies ermöglicht es dem Assistenten, größer und klüger zu werden, was zu massiven Geschwindigkeitssteigerungen führt, wie schnell KI Text, Code oder mathematische Probleme lösen kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →