← Neueste Arbeiten
🤖 AI

δ\delta-mem: Efficient Online Memory for Large Language Models

Das Papier stellt δ\delta-mem vor, einen leichten Mechanismus, der eingefrorene große Sprachmodelle mit einem kompakten, auf Delta-Regeln basierenden Online-Speicherzustand erweitert, um historische Informationen effizient zu komprimieren und wiederzuverwenden, was die Leistung bei speicherintensiven Aufgaben erheblich verbessert, ohne eine vollständige Feinabstimmung oder eine Erweiterung des Kontextfensters zu erfordern.

Ursprüngliche Autoren: Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

Veröffentlicht 2026-05-13
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sprechen mit einem sehr klugen Freund (der KI), der ein fantastisches Gedächtnis für Fakten hat, aber überfordert ist, wenn Sie versuchen, ihm Ihre gesamte Lebensgeschichte in einem Atemzug zu erzählen.

Das Problem: Der Flaschenhals „zu viele Informationen"
Aktuell besteht der übliche Trick, damit eine KI ein langes Gespräch im Gedächtnis behält, darin, einfach den gesamten Chatverlauf erneut in den Prompt einzufügen.

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, ein 1.000-seitiges Buch zu lesen, um einen bestimmten Satz zu finden. Das dauert ewig (es ist rechnerisch sehr teuer), und bis Sie am Ende angekommen sind, haben Sie möglicherweise den Anfang vergessen (dies wird als „Kontext-Rot" bezeichnet).
  • Die Sichtweise des Papers: Einfach das „Buch" größer zu machen, löst das Problem nicht. Die KI hat immer noch Schwierigkeiten, die richtige Nadel im Heuhaufen zu finden.

Die Lösung: δ\delta-mem (Delta-Mem)
Die Autoren schlagen eine neue Methode zur Handhabung von Gedächtnis vor, die δ\delta-mem genannt wird. Anstatt dem Mund der KI Seiten voller vergangenen Textes zu stopfen, geben sie ihr ein winziges, super-effizientes „Haftnotiz"-System, das sich in Echtzeit aktualisiert.

Hier ist die Funktionsweise, aufgeschlüsselt mit einfachen Metaphern:

1. Das gefrorene Gehirn und die Haftnotiz

Stellen Sie sich das Hauptgehirn der KI (das „Fundament") als gefrorene Statue vor. Es ist unglaublich klug, aber Sie können seine interne Verkabelung nicht ändern oder es neu trainieren.

  • Die Innovation: δ\delta-mem fügt dieser Statue ein winziges 8x8-Raster hinzu (stellen Sie sich ein sehr kleines, hochtechnisches Haftnotizblock-Set vor).
  • Wie es aktualisiert wird: Jedes Mal, wenn Sie etwas Neues sagen, schreibt das System keinen ganzen neuen Absatz. Stattdessen berechnet es die Differenz (das „Delta") zwischen dem, was es erwartet hatte, dass Sie sagen, und dem, was Sie tatsächlich sagten, und aktualisiert die Haftnotiz nur mit dieser winzigen Korrektur.
  • Die Analogie: Es ist wie ein GPS, das nicht die ganze Welt neu kartiert, wenn Sie eine Ecke umdrehen. Es aktualisiert lediglich Ihre aktuelle Position relativ zu der Stelle, an der Sie eine Sekunde zuvor waren.

2. Das „Lenkrad" (Niedrigrang-Korrekturen)

Wenn die KI im Begriff ist, Ihnen zu antworten, schaut sie nicht einfach auf die Haftnotiz, um eine Geschichte zu „lesen". Stattdessen fungiert die Haftnotiz wie ein Lenkrad.

  • Der Mechanismus: Die KI betrachtet die Haftnotiz und sagt: „Oh, basierend auf unserer Geschichte sollte ich meine Aufmerksamkeit leicht nach links justieren." Sie nimmt eine winzige, niedrigrangige Anpassung daran vor, wie sie Ihre aktuelle Frage verarbeitet.
  • Das Ergebnis: Die KI muss den gesamten Verlauf nicht erneut lesen. Das „Lenken" geschieht sofort und führt das gefrorene Gehirn dazu, den richtigen Kontext zu behalten, ohne verwirrt zu werden.

3. Drei Arten, die Notiz zu schreiben

Das Paper testete drei verschiedene Methoden, um diese Haftnotiz zu aktualisieren:

  • Token-State (TSW): Aktualisierung der Notiz nach jedem einzelnen Wort, das Sie tippen. (Sehr detailliert, kann aber verrauscht werden).
  • Sequence-State (SSW): Aktualisierung der Notiz nach jedem Satz oder jeder Nachricht. (Glatter, wie das Zusammenfassen eines Absatzes, bevor man ihn aufschreibt).
  • Multi-State (MSW): Verwendung von drei separaten Haftnotizen gleichzeitig. Eine für Fakten, eine für Ihre Präferenzen und eine für die aktuelle Aufgabe. Dies verhindert, dass die Notizen durcheinandergeraten.

Was haben sie herausgefunden?

Die Forscher testeten dies an verschiedenen KI-Modellen und stellten einige beeindruckende Ergebnisse fest:

  • Klein aber mächtig: Selbst mit einem winzigen 8x8-Raster (was in computerischen Begriffen unglaublich klein ist) schnitt die KI bei gedächtnisintensiven Aufgaben deutlich besser ab.
  • Die „magische" Wiederherstellung: In einem Test entfernten sie den gesamten Chatverlauf und gaben der KI nur die winzige Haftnotiz. Die KI konnte sich dennoch genug merken, um Fragen korrekt zu beantworten, was bewies, dass die Notiz das Wesentliche des Gesprächs einfing und nicht nur die Wörter.
  • Die Konkurrenz schlagen: Sie schnitt besser ab als andere Methoden, die versuchten, mehr Text in den Prompt zu stopfen oder externe Datenbanken zu nutzen. Sie war schneller, günstiger und genauer.

Das Fazit

δ\delta-mem ist wie das Geben eines dynamischen, sich selbst aktualisierenden Spickzettels an einen superklugen, aber vergesslichen Roboter. Anstatt den Roboter zu zwingen, eine Bibliothek voller Bücher zu lesen, um sich an ein Gespräch zu erinnern, wirft er nur einen Blick auf eine winzige, sich ständig aktualisierende Notiz, die ihm genau sagt, wie er seine Aufmerksamkeit lenken soll. Dies ermöglicht es der KI, langfristige Interaktionen effizient zu behalten, ohne neu trainiert werden zu müssen oder eine massive Menge an Rechenleistung zu benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →