← Neueste Arbeiten
💬 NLP

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

AsymSpec ist ein asymmetrisches Framework für spekulatives Dekodieren, das es einem leichtgewichtigen Drafter ermöglicht, auf den vollen Input-Kontext zuzugreifen, während ein großer Verifier auf einer komprimierten Ansicht operiert, wodurch effektiv die Balance zwischen Inferenzgeschwindigkeit und Genauigkeit für agentische LLMs erreicht wird, indem eine nahezu vollständige Kontextleistung bei signifikant reduzierten Rechenkosten erzielt wird.

Ursprüngliche Autoren: Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

Veröffentlicht 2026-08-27
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne Systeme der künstlichen Intelligenz agieren zunehmend als autonome Agenten, die in der Lage sind, Dokumente abzurufen, Softwarewerkzeuge zu nutzen und Multi-Turn-Konversationen zu führen, um komplexe Probleme zu lösen. Während diese Agenten arbeiten, sammeln sie eine wachsende Informationshistorie an: Suchergebnisse, Tool-Ausgaben und vergangene Nachrichten. Um diese Systeme für den realen Einsatz schnell genug zu machen, komprimieren Ingenieure diese Historie oft, indem sie lange Dokumente in kurze Sätze zusammenfassen oder detaillierte Bilder entfernen, um Zeit zu sparen. Diese Kompression geht jedoch mit einem hohen Preis einher: Die KI verliert die feingliedrigen Details, die für präzises Denken notwendig sind, was eine schwierige Entscheidung zwischen Geschwindigkeit und Intelligenz erzwingt. Eine Standardtechnik namens „Speculative Decoding“, bei der ein kleines, schnelles Modell versucht zu erraten, was ein großes, langsames Modell sagen wird, war bisher die gängige Lösung zur Beschleunigung von KI. Doch diese traditionelle Methode stößt in agentischen Umgebungen an eine Grenze, da sowohl der kleine „Guesser“ als auch der große „Verifier“ exakt dieselbe Information sehen müssen. Wenn die Information zur Zeitersparnis komprimiert wird, verliert der Guesser dieselben kritischen Details wie der Verifier, was bedeutet, dass die Geschwindigkeitssteigerung nicht die verlorene Genauigkeit wiederherstellen kann.

Forscher von Huawei Technologies und der University of Science and Technology of China haben einen neuen Ansatz namens ASYMSPEC vorgeschlagen, der dieses Dilemma auflöst, indem er den beiden Modellen erlaubt, unterschiedliche Versionen derselben Geschichte zu sehen. In ihrem System arbeitet das große, leistungsstarke Modell, das die endgültige Entscheidung trifft, nur mit der komprimierten, schnellen Version des Inputs, um die Latenz niedrig zu halten. Gleichzeitig liest ein viel kleineres, leichtgewichtiges Modell im Hintergrund die vollständige, unkomprimierte Historie. Dieses kleine Modell fungiert als Wegweiser, der genau identifiziert, welche Informationen während der Kompression verloren gegangen sind, und das große Modell durch subtile Impulse dazu bringt, diese fehlenden Details in seine Vorhersagen einzubeziehen. Die Forscher fanden heraus, dass dieser asymmetrische Aufbau es dem System ermöglicht, nahezu die gesamte Genauigkeit einer Analyse mit vollem Kontext beizubehalten, während es gleichzeitig mit der Geschwindigkeit einer komprimierten Version operiert. In Tests über vier verschiedene agentische Fähigkeiten hinweg, einschließlich komplexer mehrstufiger Fragen und der Nutzung von Werkzeugen, stellte die Methode etwa 90 Prozent der Genauigkeit des Vollkontext-Baselines wieder her, während sie nur 20 bis 30 Prozent der Rechenleistung beanspruchte.

Die zentrale Innovation liegt darin, wie die beiden Modelle miteinander kommunizieren. Anstatt einfach nur darauf zu setzen, dass das kleine Modell rät und hofft, dass das große Modell zustimmt, vergleicht das System die Reaktion des kleinen Modells auf den Volltext mit seiner Reaktion auf den komprimierten Text. Der Unterschied zwischen diesen beiden Reaktionen offenbart genau, was die Kompression entfernt hat. Das System nutzt dann dieses spezifische Signal, um den Output des großen Modells anzupassen, wodurch die Lücken effektiv gefüllt werden, ohne dass das große Modell selbst die schwere, langwierige Datenmenge verarbeiten muss. Ein intelligenter „Gatekeeper“-Mechanismus stellt sicher, dass diese Anleitung nur dann angewendet wird, wenn sie notwendig ist, um zu verhindern, dass das System verwirrt wird, wenn die Kompression geringfügig ist. Dieser Ansatz funktioniert selbst dann, wenn der Input verschiedene Medientypen umfasst; zum Beispiel kann ein kleines Modell ein Rohbild betrachten, während das große Modell nur eine Textbeschreibung sieht, wobei das kleine Modell das große Modell so steuert, dass es die visuellen Details versteht, die es selbst nicht sehen kann.

Die Forscher testeten diese Methode bei realen Agenten-Aufgaben, wie etwa der Beantwortung von Fragen, die das Durchsuchen mehrerer Dokumente, das Befolgen von Multi-Turn-Instruktionen und die Nutzung von Softwarewerkzeugen erfordern. Sie verglichen ihr System mit Standardmethoden, die entweder alles langsam verarbeiten oder alles schnell komprimieren. Die Ergebnisse zeigten, dass traditionelles Speculative Decoding die durch Kompression verlorene Genauigkeit nicht wiederherstellen konnte; es beschleunigte lediglich den verlustreichen Prozess. Im Gegensatz dazu gelang es der neuen asymmetrischen Methode, die Lücke erfolgreich zu schließen, indem sie eine Leistung lieferte, die nahe am langsamen, Vollkontext-Ideal liegt, aber nur einem Bruchteil der Zeit beansprucht. In spezifischen Benchmarks mit langen Dokumenten erzielte das System gegenüber der unkomprimierten Baseline Beschleunigungen des 1,3- bis 1,7-fachen, während es die benötigte Rechenleistung auf etwa ein Fünftel reduzierte. Die Studie legt nahe, dass diese Technik besonders wertvoll ist, wenn die Kompression massiv ist, da die Fähigkeit des Systems, verlorene Informationen wiederherzustellen, direkt mit der Menge der ursprünglich entfernten Details skaliert.

Diese Arbeit zeigt, dass der Trade-off zwischen Geschwindigkeit und Genauigkeit bei KI-Agenten nicht starr sein muss. Indem man entkoppelt, was das schnelle Modell sieht und was das langsame Modell sieht, und indem man einen leichtgewichtigen Wegweiser nutzt, um kritische Erkenntnisse zu übertragen, ist es möglich, sowohl Effizienz als auch hochwertige Argumentation zu erreichen. Die Ergebnisse deuten darauf hin, dass für Aufgaben, bei denen der Kontext schwergewichtig ist und Details leicht verloren gehen können, ein kleines Modell, das das Gesamtbild betrachtet, ein großes Modell, das mit einer Zusammenfassung arbeitet, effektiv steuern kann. Dieser Ansatz bietet einen praktischen Weg für den Einsatz anspruchsvoller KI-Agenten in Produktionsumgebungen, in denen Latenz und Kosten kritische Randbedingungen sind, ohne die für komplexe Entscheidungsfindungen notwendige Zuverlässigkeit zu opfern.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →