← Neueste Arbeiten
🤖 machine learning

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

Diese Arbeit zeigt auf, dass Modelle während des Prefills primär feldkonditionierte Schlussfolgerungen in den nachgelagerten KV-Cache-Notizen speichern, anstatt sich auf die eigenen Vektoren des Feldes zu verlassen, was einen neuartigen Ansatz ermöglicht, bei dem Caches effizient mittels Chain-of-Thought editiert und über Kontexte hinweg komponiert werden können, um eine nahezu perfekte Genauigkeit bei signifikant reduzierter Latenz im Vergleich zur vollständigen Neuberechnung zu erreichen.

Ursprüngliche Autoren: Bojie Li

Veröffentlicht 2026-06-17
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Bojie Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Kernidee: Das „Notizbuch“ des Modells

Stellen Sie sich vor, ein großes Sprachmodell (wie ein sehr intelligenter Roboter-Assistent) liest ein langes Dokument, um eine Frage zu beantworten. Normalerweise, wenn der Roboter einen Satz liest, „denkt“ er darüber nach und macht dann weiter. Wenn sich der Satz später ändert, muss der Roboter das gesamte Dokument von vorne lesen, um den neuen Kontext zu verstehen. Das ist langsam und teuer.

Diese Arbeit entdeckt etwas Überraschendes: Der Roboter liest das Dokument nicht nur; er macht sich beim Lesen Notizen in einem separaten „Notizbuch“ (dem KV-Cache).

Entscheidend ist, dass der Roboter seine Schlussfolgerungen in dieses Notizbuch schreibt, nicht nur die Rohdaten. Sobald er feststellt: „Oh, der Bestellstatus ist ‚versandt‘, also muss ich die Rückerstattung ablehnen“, schreibt er diese Schlussfolgerung in sein Notizbuch. Wenn er später eine Entscheidung treffen muss, schaut er nicht zurück auf den ursprünglichen Satz; er lixt einfach seine eigenen Notizen.

Das Problem: Die „veraltete Notiz“-Falle

Die Forscher versuchten eine einfache Lösung, wenn sich eine Information änderte (z. B. der Bestellstatus änderte sich von „versandt“ zu „ausstehend“). Sie dachten: „Wenn ich einfach das spezifische Wort im Text ändere, wird der Roboter die Änderung sehen und seine Antwort aktualisieren.“

Sie lagen falsch.

Da der Roboter seine Schlussfolgerung („Rückerstattung ablehnen“) basierend auf der alten Information bereits in das Notizbuch geschrieben hatte, bewirkte das bloße Ändern des ursprünglichen Wortes nichts. Der Roboter ignorierte die Änderung und las einfach seine alte Notiz weiter. Es war, als würde man versuchen, eine Matheaufgabe von 2+2=42+2=4 zu 2+2=52+2=5 auf einem Blatt Papier zu ändern, aber der Schüler hatte bereits „Die Antwort ist 4“ in sein Notizbuch geschrieben und kopierte dies nur ab. Der Schüler würde die Änderung an der Aufgabe nicht bemerken, es sei denn, man würde ihn zwingen, die ganze Seite neu zu lesen.

Lösung 1: Das „Errata“ (Der Klebezettel)

Da der Roboter sich auf seine Notizen verlässt, fanden die Forscher einen Weg, den Fehler zu beheben, ohne das ganze Buch neu lesen zu müssen.

Anstatt zu versuchen, die alte Notiz chirurgisch zu löschen und neu zu schreiben (was fehlschlägt), fügen sie einfach eine neue, laute Notiz am Ende des Dokuments an.

  • Die Analogie: Stellen Sie sich vor, der Roboter liest einen Vertrag. Man kann eine Klausel in der Mitte des Vertrags nicht einfach löschen, ohne die Seitenzahlen zu durcheinanderzubringen. Stattdessen kleben Sie eine leuchtend gelbe „ERRATUM“-Notiz ganz ans Ende, die besagt: „Ignorieren Sie die vorherige Notiz. Der Status ist jetzt ‚Ausstehend‘. Die Antwort ist ‚Genehmigen‘.“
  • Das Ergebnis: Der Robrüoter sieht diese neue, laute Notiz, aktualisiert seine Entscheidung und ignoriert die alte Notiz. Dies ist unglaublich schnell und funktioniert fast perfekt.

Lösung 2: „Komponierbare“ Fähigkeiten (Der Lego-Stein)

Die zweite Entdeckung handelt von der Wiederverwendung von Arbeit.

Stellen Sie sich vor, Sie haben eine lange, komplexe Bedienungsanleitung für eine bestimmte Aufgabe (wie „Wie man einen Flug bucht“). Normalerweise muss der Robot jedes Mal, wenn Sie ihn bitten, einen Flug zu buchen, diese ganze Anleitung von Grund auf neu lesen.

Die Forscher fanden heraus, dass, weil der Roboter seine Schlussfolgerungen in das Notizbuch schreibt, man die Notizen für diese Anleitung einmal vorab schreiben, speichern und dann in ein neues Gespräch „einfügen“ kann.

  • Die Analogie: Anstatt jedes Mal, wenn Sie einen Stuhl bauen müssen, eine 50-seitige Bedienungsanleitung zu lesen, haben Sie ein vorgefertigtes „Stuhl-Kit“ (die Notizen). Sie greifen einfach das Kit und legen es in Ihren Arbeitsbereich.
  • Die Magie: Sie können dieses Kit an eine andere Stelle im Gespräch verschieben (repositionieren) und es funktioniert immer noch perfekt. Der Roboter muss die Anleitung nicht neu lesen; er nimmt einfach die vorab geschriebenen Notizen und macht weiter. Dies macht den Prozess 14 Mal schneller für lange Dokumente.

Warum das wichtig ist

  1. Es ist editierbar: Wenn ein Benutzer ein Detail ändert (wie seinen Namen oder einen Bestellstatus), müssen Sie nicht das ganze Gespräch neu starten. Sie fügen einfach eine „Korrekturnotiz“ am Ende hinzu, und der Roboter aktualisiert sofort sein Verhalten.
  2. Es ist komponierbar: Sie können eine Bibliothek von „Fähigkeiten“ erstellen (wie ein Rezept für die Flugbuchung oder eine Anleitung für die Bearbeitung von Rücksendungen). Sie können diese Fähigkeiten vorab berechnen und sie in jedes Gespräch einfügen, was massiv Zeit und Rechenleistung spart.
  3. Es funktioniert überall: Die Forscher haben dies bei vielen verschiedenen KI-Modellen getestet (von kleinen bis zu riesigen und sogar Modellen, die Bilder betrachten), und es funktionierte bei allen.

Zusammenfassung in einem Satz

Die Arbeit zeigt auf, dass KI-Modelle beim Lesen Schlussfolgerungen in ein verstecktes Notizbuch schreiben; durch die Erkenntnis dessen können wir Fehler beheben, indem wir eine „Korrekturnotiz“ am Ende hinzufügen, und Aufgaben beschleunigen, indem wir vorab geschriebene „Fähigkeitsnotizen“ einfügen, anstatt die KI zu zwingen, alles von Grund auf neu zu lesen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →