← Neueste Arbeiten
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

Dieser Beitrag stellt AHASD vor, eine asynchrone heterogene Mobilarchitektur auf Task-Ebene, die durch NPU-PIM-Kollaboration mit neuartigen Steuerungsmechanismen im Vergleich zu bestehenden Baselines eine bis zu 4,2-fache Steigerung des Durchsatzes und eine bis zu 5,6-fache Verbesserung der Energieeffizienz für spekulatives Decodieren in großen Sprachmodellen erreicht.

Ursprüngliche Autoren: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Veröffentlicht 2026-04-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine lange Geschichte zu schreiben, aber Sie unterliegen einer strengen Regel: Sie müssen jeden einzelnen Wort, das Sie schreiben, von einem sehr weisen, langsamen und teuren Lektor (dem Zielmodell) überprüfen lassen, bevor Sie das nächste Wort schreiben dürfen. Dies macht das Schreiben unglaublich langsam.

Um die Dinge zu beschleunigen, stellen Sie einen schnellen, energiegeladenen Assistenten (das Entwurfmodell) ein, der für Sie die nächsten paar Wörter errät. Sie schreiben diese Vermutungen auf, und dann überprüft der weise Lektor sie alle auf einmal. Wenn die Vermutungen gut sind, behalten Sie sie und fahren fort. Wenn sie schlecht sind, werfen Sie sie weg und beginnen von vorne. Dies nennt man Spekulatives Decodieren.

Auf einem Mobiltelefon hat dieser Prozess jedoch zwei große Probleme:

  1. Das „Wartespiel": Manchmal rät der Assistent 2 Wörter, manchmal 20. Wenn der Assistent langsam ist, sitzt der Lektor untätig und wartet. Wenn der Assistent schnell ist, sitzt der Lektor untätig und wartet auf den nächsten Batch. Sie halten sich ständig die Hände und warten darauf, dass der andere fertig wird, was Zeit verschwendet.
  2. Das „Schlechte-Rat"-Problem: Manchmal wird der Assistent zu selbstbewusst und rät einen ganzen Absatz Unsinn, weil der Kontext schwierig ist. Der Lektor muss das Ganze ablehnen und verschwendet so die gesamte Energie, die der Assistent für das Raten investiert hat.

Die Arbeit stellt AHASD vor, ein neues System, das entwickelt wurde, um diese Probleme auf Mobiltelefonen mit Hilfe eines speziellen Computerchips namens PIM (Processing-in-Memory) und eines Standard-KI-Chips namens NPU zu beheben.

So funktioniert AHASD, unter Verwendung einfacher Analogien:

1. Der „nicht synchronisierte Tanz" (Asynchrone Ausführung auf Task-Ebene)

In alten Systemen mussten Assistent und Lektor im perfekten Takt tanzen. Wenn der Assistent stoppte, stoppte auch der Lektor.
AHASD durchbricht die Kette. Es erlaubt dem Assistenten (der auf dem Speicherchip, PIM, läuft) und dem Lektor (der auf dem Prozessor, NPU, läuft), unabhängig voneinander zu arbeiten.

  • Die Analogie: Stellen Sie sich ein Fließband in einer Fabrik vor. Anstatt dass der Arbeiter wartet, bis die Maschine fertig ist, bevor er den nächsten Schritt beginnt, nimmt der Arbeiter weiterhin neue Teile aus einer Kiste (der Warteschlange) und arbeitet daran, während die Maschine noch den vorherigen Batch verarbeitet. Sie warten nicht aufeinander; sie halten einfach das Band in Bewegung. Dies eliminiert die „Leerlaufzeit", in der ein Gerät herumsteht und nichts tut.

2. Das „Vertrauens-Radar" (Entropie- und Historienbewusstes Entwerfen)

Der Assistent wird manchmal zu selbstbewusst und beginnt wild zu raten, wenn er vorsichtig sein sollte.
AHASD gibt dem Assistenten ein „Vertrauens-Radar". Es betrachtet die Historie seiner letzten Vermutungen.

  • Die Analogie: Denken Sie an einen Wettervorhersager. Wenn er in den letzten drei Tagen falsch mit Regen gelegen hat, hört er auf, Regen für den nächsten Tag vorherzusagen, selbst wenn die Wolken ähnlich aussehen. Ebenso, wenn die Vermutungen des Assistenten ein geringes „Vertrauen" (hohe Entropie) aufweisen, sagt ihm das System: „Hör auf, vorauszuahnen! Warte, bis der Lektor das aktuelle Wort bestätigt hat, bevor du das nächste rätst." Dies verhindert, dass der Assistent Energie für Vermutungen verschwendet, die definitiv verworfen werden.

3. Der „Intelligente Timer" (Zeitbewusste Vorverifikation)

Manchmal beendet der Assistent seine Arbeit, aber der Lektor ist noch beschäftigt. Der Assistent könnte wieder mit dem Raten beginnen, aber wenn er zu viel rät, könnte dem Lektor die Arbeit zum Überprüfen ausgehen, und er sitzt untätig da.
AHASD verwendet einen „Intelligenten Timer", um genau zu entscheiden, wann der Assistent pausieren und einen schnellen „Mini-Check" (Vorverifikation) selbst durchführen sollte.

  • Die Analogie: Stellen Sie sich einen Koch (den Assistenten) vor, der Gemüse schneidet, während ein Sous-Chef (der Lektor) eine Sauce zubereitet. Der Koch weiß genau, wie lange die Sauce dauert. Wenn der Koch sieht, dass die Sauce in 5 Sekunden fertig sein wird, hört der Koch auf zu schneiden und führt einen schnellen Geschmackstest (Vorverifikation) am Gemüse durch, um sicherzustellen, dass es bereit ist. Dies stellt sicher, dass der Sous-Chef frisches Gemüse genau in dem Moment bereit hat, wenn die Sauce fertig ist, sodass der Sous-Chef nie herumstehen und warten muss.

Die Ergebnisse

Die Autoren haben eine Simulation dieses Systems auf einem Mobiltelefon-Chip erstellt. Sie stellten fest, dass:

  • Geschwindigkeit: Es ist bis zu 4,2-mal schneller als die Verwendung einer Standard-Grafikkarte (GPU) und 1,5-mal schneller als frühere Versuche, Mobilchips mit Speicherverarbeitung zu kombinieren.
  • Akkulaufzeit: Es ist bis zu 5,6-mal energieeffizienter als eine Standard-GPU und 1,24-mal besser als das bisher beste Mobilsystem.
  • Kosten: All diese neuen, ausgefallenen Funktionen nehmen nur etwa 3% des zusätzlichen Platzes auf dem Speicherchip ein, was ein sehr kleiner Preis für einen so großen Geschwindigkeitsschub ist.

Kurz gesagt, ist AHASD so, als würden Sie der KI Ihres Telefons ein Team von Arbeitern geben, die aufhören, aufeinander zu warten, ihre eigene Zuversicht überprüfen, bevor sie raten, und ihre Pausen perfekt timen, um den Arbeitsfluss reibungslos zu halten, ohne Akkuleistung zu verschwenden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →