← Neueste Arbeiten
💻 computer science

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

Gated DeltaNet-2 führt einen neuartigen linearen Aufmerksamkeitsmechanismus ein, der kanalweise Lösch- und Schreiboperationen über separate Gatter entkoppelt, um die Einschränkungen skalarer Kopplung bei früheren Modellen zu überwinden, und erzielt damit State-of-the-Art-Leistung in der Sprachmodellierung sowie bei Aufgaben zur Retrieval in langen Kontexten.

Ursprüngliche Autoren: Ali Hatamizadeh, Yejin Choi, Jan Kautz

Veröffentlicht 2026-05-22
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ali Hatamizadeh, Yejin Choi, Jan Kautz

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Das Problem mit „zu viel Speicher"

Stellen Sie sich einen superschlauen Bibliothekar (das KI-Modell) vor, der ein sehr langes Buch lesen muss, um eine Frage zu beantworten.

  • Der alte Weg (Standard-Transformer): Der Bibliothekar führt für jedes einzelne Wort, das er je gelesen hat, einen riesigen, wachsenden Stapel von Karteikarten. Wenn das Buch 100.000 Wörter lang ist, ist der Stapel enorm. Das nimmt viel Schreibtischfläche (Speicher) in Anspruch und macht die Suche nach Informationen langsam.
  • Der neuere Weg (Lineare Aufmerksamkeit): Um Platz zu sparen, verwendet der Bibliothekar ein einziges, festes Notizbuch. Anstatt alles aufzuschreiben, fasst er die Geschichte zusammen, während er liest. Wenn das Notizbuch voll wird, muss er etwas löschen, um etwas Neues zu schreiben.

Das Problem bei diesem „festen Notizbuch" ist Interferenz. Wenn der Bibliothekar eine Seite löscht, um eine neue Geschichte zu schreiben, könnte er versehentlich ein wichtiges Detail aus der Vergangenheit auslöschen, das er später noch braucht. Es ist, als würde man versuchen, eine neue Einkaufsliste auf einen Zettel zu schreiben, auf dem bereits Ihre Telefonnummer steht; wenn Sie über die Nummer krakeln, verlieren Sie sie.

Die vorherige Lösung: Der „Einheitslöscher"

Forscher versuchten, dies mit Modellen wie KDA und Gated DeltaNet zu beheben. Sie gaben dem Bibliothekar einen speziellen „Löscher" und einen „Stift".

Allerdings hatten diese Modelle einen Fehler: Der Löscher und der Stift waren miteinander verknüpft.
Stellen Sie sich einen einzigen Schalter vor, der zwei Dinge gleichzeitig steuert:

  1. Wie viel vom alten Text wegradiert werden soll.
  2. Wie viel vom neuen Text festgehalten werden soll.

Wenn der Bibliothekar ein bestimmtes Wort aus der Vergangenheit wegradieren wollte, aber den Rest der Seite behalten, konnte er das nicht. Der Schalter zwang ihn entweder, die ganze Seite zu löschen oder die ganze neue Geschichte zu schreiben. Er konnte nicht präzise sein. Sie waren „aneinander gekettet".

Die neue Lösung: Gated DeltaNet-2

Gated DeltaNet-2 ist eine neue Version dieses Notizbuchsystems des Bibliothekars. Seine Hauptinnovation ist die Entkopplung (das Entwirren) des Löschers vom Stift.

Anstatt eines Schalters verfügt das Modell nun über zwei unabhängige Steuerungen:

  1. Das „Lösch-Gate" (Der Löscher): Diese Steuerung betrachtet die alten Informationen. Sie entscheidet genau, welche spezifischen Teile der alten Geschichte wegradiert werden sollen. Es ist, als hätte man einen Präzisionslöscher, der nur das Wort „Apfel" entfernen kann, ohne das Wort „Orange" daneben zu berühren.
  2. Das „Schreib-Gate" (Der Stift): Diese Steuerung betrachtet die neuen Informationen. Sie entscheidet genau, welche Teile der neuen Geschichte aufgeschrieben werden sollen. Es ist, als hätte man einen Stift, der nur die neuen Zutaten schreibt, die Sie gekauft haben, ohne die ganze Liste neu zu schreiben.

Die Analogie:
Stellen Sie sich die Notizbuchseite als digitale Whiteboard vor.

  • Altes Modell: Sie haben eine Fernbedienung. Wenn Sie auf „Aktualisieren" drücken, wischt sie 50 % der Tafel aus und schreibt 50 % neue Dinge. Sie können nicht wählen, was gelöscht oder was geschrieben wird.
  • Gated DeltaNet-2: Sie haben einen Laserpointer und einen Marker. Sie können den Laser verwenden, um nur die spezifischen alten Fakten auszumerzen, die falsch sind (das „Lösch-Gate"), und dann den Marker verwenden, um nur die spezifischen neuen Fakten zu schreiben, die wichtig sind (das „Schreib-Gate").

Warum das wichtig ist (Die Ergebnisse)

Das Papier testete dieses neue „Zwei-Gate-System" gegen andere intelligente Modelle (wie Mamba-2, Mamba-3 und das ursprüngliche KDA) an einem Modell mit 1,3 Milliarden Parametern, das auf einer riesigen Menge an Bildungstexten trainiert wurde.

Hier ist, was sie herausfanden:

  1. Besser im Finden der „Nadel im Heuhaufen":
    Stellen Sie sich einen Test vor, bei dem der Bibliothekar einen bestimmten Satz finden muss, der in einem 100-seitigen Dokument versteckt ist.

    • Die alten Modelle gerieten manchmal in Verwirrung, weil der „verknüpfte" Löscher versehentlich die Nadel auslöschte, während er versuchte, neue Informationen zu schreiben.
    • Gated DeltaNet-2 war hier am besten. Da es selektiv nur die ablenkenden Informationen löschen und gleichzeitig die wichtige „Nadel" schützen konnte, erinnerte es sich viel besser an die richtige Antwort, selbst in sehr langen Dokumenten.
  2. Schlussfolgern mit mehr Intelligenz:
    Bei Tests mit gesundem Menschenverstand (wie „Wenn ich eine Tasse auf einen Tisch stelle, wo ist die Tasse?") erzielte das neue Modell höhere Punktzahlen als seine Konkurrenten. Es scheint, dass die Fähigkeit, den Speicher präzise zu bearbeiten, dem Modell hilft, Zusammenhänge besser zu verstehen.

  3. Geschwindigkeit und Effizienz:
    Trotz der komplexeren Steuerungen (zwei Gates statt eines) wurde das Modell nicht signifikant langsamer. Es verarbeitet Text immer noch mit einer Geschwindigkeit, die den anderen effizienten Modellen ähnelt, was es für den praktischen Einsatz geeignet macht.

Zusammenfassung

Gated DeltaNet-2 ist eine intelligentere Methode für KI, ihr Kurzzeitgedächtnis zu verwalten. Indem es den Akt des Vergessens (Löschen alter Daten) vom Akt des Lernens (Schreiben neuer Daten) trennt, vermeidet das Modell den „Kollateralschaden" des versehentlichen Löschens wichtiger Informationen. Dies ermöglicht es ihm, längere Geschichten und komplexe Aufgaben genauer zu bewältigen als frühere Methoden, und zwar bei gleichzeitig geringem Speicherverbrauch und hoher Geschwindigkeit.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →