← Neueste Arbeiten
🤖 machine learning

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree ist eine trainingsfreie Methode für das spekulative Decoding, die die autoregressive Korrektur von linearen Ketten auf festbreitige Kandidatenbäume erweitert und durch die Entkopplung der AR-Kopf-Inferenz von sequentiellen Operationen zur Maximierung der Token-Akzeptanz verlustfreie Geschwindigkeitssteigerungen auf dem Stand der Technik erzielt.

Ursprüngliche Autoren: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

Veröffentlicht 2026-08-14
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine Geschichte mit einem sehr klugen, aber unglaublich langsamen Roboter-Freund zu schreiben. Dieser Roboter ist brillant darin, die Welt zu verstehen und kann wunderbare Sätze schreiben, aber er hat eine strikte Regel: Er kann immer nur ein Wort auf einmal schreiben. Bevor er das nächste Wort schreibt, muss er anhalten, über alles nachdenken, was er bisher geschrieben hat, und dann das eine beste Wort sorgfältig auswählen. Es ist wie ein Koch, der nur eine Zutat zur Zeit probieren kann, bevor er entscheidet, was er in die Suppe gibt. Während dies sicherstellt, dass die Suppe perfekt schmeckt, dauert es ewig, eine große Mahlzeit zu kochen. In der Welt der künstlichen Intelligenz wird dieser „ein Wort nach dem anderen“-Prozess als autoregressive Generierung bezeichnet, und das ist der Hauptgrund, warum leistungsstarke KI-Chatbots manchmal träge wirken können.

Um die Sache zu beschleunigen, ohne die Qualität zu ruinieren, haben Wissenschaftler einen Trick namens Speculative Decoding erfunden. Stellen Sie sich das wie das Einstellen eines schnellen, energischen Praktikanten vor, der die nächsten Wörter errät. Der Praktikant ruft einen ganzen Satz heraus, und der langsame Roboter prüft schnell, ob der Praktikant recht hatte. Wenn der Praktikant richtig geraten hat, akzeptiert der Roboter den ganzen Satz sofort und macht weiter. Wenn der Praktikant einen Fehler gemacht hat, korrigiert der Roboter einfach dieses eine Wort und fängt von vorne an. Die Magie geschieht, wenn der Praktikant gut genug ist, um viele Wörter hintereinander korrekt zu erraten, sodass der langsame Roboter den schweren Denkpart überspringen und einfach „Ja, das ist richtig!“ zu einem ganzen Textblock sagen kann.

Kürzlich versuchten Forscher, den Praktikanten noch schneller zu machen, indem sie eine andere Art von Gehirn namens Diffusion Model verwendeten. Anstatt Wörter einzeln zu erraten, versucht dieser Praktikant, den nächsten ganzen Satz auf einmal zu imaginieren, wie ein Maler, der eine ganze Leinwand mit einem einzigen Strich füllt. Das ist super schnell, aber es hat einen Makel: Da der Praktant den ganzen Satz auf einmal errät, weiß er nicht wirklich, wie das erste Wort das zweite beeinflusst oder wie das zweite das dritte. Es ist, als würde man das Ende eines Films erraten, ohne die Szenen in der Mitte gesehen zu haben. Um dies zu beheben, fügten andere Forscher einen „Korrekturschritt“ hinzu, aber sie taten dies auf eine Weise, die immer noch langsam und klobig war, da sie den Roboter zwangen, die Arbeit des Praktikanten Wort für Wort zu prüfen, was den Zweck des Schnellerwerdens zunichtemachte.

Hier kommt ein neues Paper der VILA Lab am MBZUAI ins Spiel, das eine clevere Lösung namens DARTree bietet. Die Forscher erkannten, dass die alte Art, die Arbeit des Praktikanten zu prüfen, so war, als würde man versuchen, eine Bibliothek zu organisieren, indem man ein Buch nach dem anderen aufhebt, dessen Regal prüft, es zurückstellt, das nächste Buch aufhebt und so weiter. Es war zu viel Hin- und Herlaufen. Stattdessen schlägt DARTree einen neuen Weg vor, einen „Baum“ von Möglichkeiten aufzubauen. Stellen Sie sich vor, der Praktikant zeichnet nicht nur einen einzelnen Pfad von Wörtern, sondern einen ganzen buschigen Baum mit verschiedenen Geschichte-Möglichkeiten. Der langsame Roboter betrachtet dann den gesamten Baum auf einmal, aber mit einer speziellen Wendung: Er prüft die „Zweige“ des Baumes in großen Gruppen (Batches) statt einzeln.

Die entscheidende Innovation ist, dass DARTree das „Raten“ vom „Prüfen“ trennt. Zuerst baut es einen breiten, temporären Baum aus vielen möglichen Pfaden der Geschichte gleichzeitig auf. Dann nutzt es ein intelligentes Pruning-Werkzeug (Beschneidungswerkzeug), um die Zweige abzuschneiden, die nicht vielversprechend aussehen, sodass nur der beste Baum dem langsamen Roboter gezeigt wird. Durch das Verrichten der schweren Arbeit, die Pfade der Geschichte in großen Batches zu prüfen, vermeiden sie das langsame, schrittweise Vorankommen, das sie früher aufhielt. Das Paper zeigt, dass diese Methode ein riesiger Erfolg ist. In einer Vielzahl von Tests, die Mathematikaufgaben, Programmieraufgaben und Chat-Gespräche umfassten, konnte DARTree bis zu 12,97 Token (Wörter oder Wortteile) pro Prüfungsrunde akzeptieren. Dies ist ein gewaltiger Sprung im Vergleich zu früheren Methoden; es war 98,6 % besser als ein Top-Konkurrent namens DFlash und 27,9 % besser als ein anderes namens Domino.

Das Ergebnis ist ein System, das unglaublich schnell und dennoch perfekt genau ist. Die Forscher stellten fest, dass diese neue Methode die KI 9,73 Mal schneller machen kann als die Standardmethode des Schreibens, ohne die Qualität zu mindern oder Fakten zu erfinden. Sie testeten dies auf verschiedenen Arten von KI-Modellen und fanden heraus, dass es hervorragend funktionierte, egal ob die KI sehr streng und logisch war (wie in der Mathematik) oder kreativ und zufällig (wie in einem Chat). Das Paper argumentiert, dass dieser „Baum“-Ansatz, der viele Pfade parallel prüft, bevor er einen endgültigen Schnitt macht, der beste Weg ist, um diese klugen Roboter zu beschleunigen. Es beweist, dass man sich nicht zwischen Geschwindigkeit und Intelligenz entscheiden muss; mit der richtigen Struktur kann man beides haben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →