← Neueste Arbeiten
🤖 AI

Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory

Nexus beschleunigt agentische LLMs auf vereinheitlichtem Speicher, indem es das Tool-Routing durch einen semantischen Lookaside-Buffer und komprimierte Signaturen vom kostspieligen Schema-Prefilling entkoppelt, während es einen tiefenadaptiven KV-Cache-Splicing-Mechanismus mit Fallback-Rekodierung einsetzt, um die Ausgabetreue trotz Drift der Rotationspositionseinbettung aufrechtzuerhalten.

Ursprüngliche Autoren: Mustafa Arslan

Veröffentlicht 2026-08-24
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mustafa Arslan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der sich schnell entwickelnden Welt der künstlichen Intelligenz lernt ein spezieller Typ von Software-Agenten, in unserem Namen zu handeln. Diese digitalen Assistenten beantworten nicht nur Fragen; sie greifen aktiv auf Werkzeuge zu, wie etwa das Überprüfen eines Kalenders, das Durchsuchen einer Datenbank oder das Versenden einer E-Mail. Um dies zu tun, muss die Software zuerst eine detaillierte Bedienungsanleitung für jedes einzelne Werkzeug verstehen, das sie verwenden könnte. Da die Anzahl der verfügbaren Werkzeuge auf hunderte anwächst, werden diese Anleitungen enorm und füllen das Kurzzeitgedächtnis des Computers mit repetitiven Texten aus, noch bevor der Agent überhaupt mit dem Denken beginnen kann. Dies erzeugt einen Flaschenhals: Je mehr Werkzeuge der Agent besitzt, desto länger dauert es, bis er mit der Arbeit beginnt, weil der Computer jedes Mal, wenn er einen neuen Schritt macht, diese massiven Instruktionssätze erneut lesen und verarbeiten muss.

Forscher haben nach einem Weg gesucht, diesen Flaschenhals zu umgehen. Eine Idee war es, die Arbeit des Computers an diesen Anweisungen in einer komprimierten Form zu speichern, ähnlich wie ein Lesezeichen, und sie immer dann wieder in den Speicher einzufügen, wenn sie benötigt wird. Das klingt effizient, stößt jedoch auf ein grundlegendes Problem damit, wie moderne KI-Modelle Zeit und Reihenfolge erfassen. Diese Modelle nutzen ein System, um sich zu merken, wo sie sich in einer Sequenz von Wörtern befinden, und wenn man einen gespeicherten Arbeitsblock an eine andere Stelle im Speicher verschiebt, gerät das Modell über die Reihenfolge der Ereignisse in Verwirrung. Es ist, als würde man eine Seite aus der Mitte eines Buches nehmen und sie in ein anderes Kapitel einfügen; die Geschichte mag zwar noch Sinn ergeben, aber die subtilen Verbindungen zwischen den Sätzen können unterbrochen werden, was zu Fehlern führt.

Ein Team unabhängiger Forscher hat nun ein System namens Nexus entwickelt, um diese schwierige Landschaft zu navigieren. Sie entdeckten, dass man diese gespeicherten Instruktionsblöcke nicht einfach ohne Risiko verschieben kann, man es aber tun kann, wenn man vorsichtig ist, wo man sie platziert und wie man die Fehler behebt, die unweigerlich entstehen. Ihre Arbeit, die an einem spezifischen Typ eines leistungsstarken Computerchips getestet wurde, der in modernen Laptops zu finden ist, zeigt eine präzise Grenze auf, wie weit man diese Blöcke verschieben kann, bevor die Ausgabe der KI unzuverlässig wird. Sie fanden heraus, dass, wenn der Block zu weit verschoben wird, das Verständnis des Modells für die Sequenz driftet, aber dieser Drift ist vorhersagbar. Die Forscher entwickelten eine Methode, um zu erkennen, wann dieser Drift zu groß wird, und um automatisch nur den notwendigen Teil der Instruktionen neu zu lesen, um das Gedächtnis perfekt wieder zusammenzufügen.

Die bedeutendste Erkenntnis dieser Arbeit ist, dass das System nicht auf diese riskanten Gedächtnis-Abkürzungen für seine kritischste Aufgabe angewiesen ist: die Entscheidung, welches Werkzeug zu verwenden ist. Anstatt die KI zu zwingen, die massiven Bedienungsanleitungen zu lesen, um eine Wahl zu treffen, nutzt Nexus ein separates, ultraschnelles Nachschlage-System. Dieses System scannt eine kompakte Liste von Werkzeugnamen und -beschreibungen, um die richtige Übereinstimmung in Mikrosekunden zu finden. Sobald das Werkzeug ausgewählt wurde, generiert die KI die notwendigen Argumente mithilfe einer winzigen, komprimierten Zusammenfassung der Instruktionen – oft nur ein paar Dutzend Wörter – anstatt des voluminösen Volltextes. Dieser Ansatz hält den Hauptspeicher sauber und ermöglicht es dem Agenten, seine Arbeit viel schneller aufzunehmen, indem er das erste Wort seiner Antwort in weniger als der Hälfte der Zeit findet, die er zum erneuten Lesen der vollständigen Anleitungen benötigen würde.

Die Forscher testeten auch rigoros die Grenzen ihrer Speicher-Splicing-Technik. Sie bestätigten, dass die Methode zwar über kurze Distanzen gut funktioniert, es aber eine harte Grenze gibt. Wenn der gespeicherte Block mehr als 256 Positionen von dem Ort entfernt platziert wird, an dem er ursprünglich erstellt wurde, werden die Fehler zu signifikant, um ignoriert zu werden. An diesem Punkt hört das System auf, zu versuchen, das Gedächtnis zu flicken, und greift stattdessen auf die langsamere, aber sicherere Methode des vollständigen Neu-Lesens des Textes zurück. Dies stellt sicher, dass das Endergebnis immer exakt so präzise ist, als hätte der Computer nie versucht, den Prozess abzukürzen. Sie bewiesen auch, dass eine einfachere, günstigere Methode, zu raten, wann man den Shortcut stoppen sollte – basierend auf einer schnellen Überprüfung des internen Zustands des Speichers – nicht funktioniert, da sie Fehler nicht zuverlässig vorhersagen kann.

In ihren Tests bewältigte das Nexus-System ein Register von 250 verschiedenen Werkzeugen, ohne langsamer zu werden, und behielt dabei eine hohe Erfolgsquote bei der Auswahl des richtigen Werkzeugs bei. Wenn der Kontext moderat war, war das System bis zu 1,7-mal schneller als die traditionelle Methode des vollständigen Neu-Lesens. Mit zunehmender Länge und Tiefe des Gesprächs nahm der Geschwindigkeitsvorteil jedoch natürlich ab und glich schließlich die Leistung der Standardmethode an. Dies ist kein Fehler, sondern ein Merkmal ihres Designs: Das System priorisiert die Richtigkeit der Antwort gegenüber der Geschwindigkeit. Es garantiert, dass die Ausgabe niemals schlechter als die der Standardmethode ist, selbst wenn sie manchmal genauso viel Zeit in Anspruch nimmt.

Die Arbeit wurde auf einem einzigen Typ von Computerchip mit einer vereinheitlichten Speicherarchitektur durchgeführt, die es dem Prozessor ermöglicht, direkt auf Daten zuzugreifen, ohne sie zwischen verschiedenen Teilen der Maschine hin und her zu bewegen. Dieser spezifische Hardware-Aufbau war essenziell, damit die Speicher-Splicing-Technik funktionieren konnte, da sie den direkten physischen Zugriff auf die Speicherzellen erfordert. Die Forscher sind sich einig, dass, während die Geschwindigkeitszahlen spezifisch für diesen einen Aufbau sind, die zugrunde liegenden Prinzipien – die Grenzen des Verschiebens von Speicherblöcken und die Notwendigkeit eines separaten Routing-Systems – universelle Wahrheiten darüber scheinen, wie diese Modelle funktionieren. Sie haben eine klare Karte davon erstellt, wo die Abkürzungen funktionieren, wo sie scheitern und wie man ein System baut, das diese Grenzen respektiert, um sowohl Geschwindigkeit als auch Zuverlässigkeit zu liefern.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →