← Neueste Arbeiten
🤖 machine learning

Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping

Dieser Artikel schlägt ein stichproben-effizientes Framework für die kontinuierliche Wissenserweiterung in großen Sprachmodellen vor, indem es Gedächtnis als eine Markov-Übergangsmatrix darstellt und eine Token-zu-Wörterbuch-Zuordnungsstrategie mit minimalen Embedding-Aktualisierungen nutzt, um ein katastrophales Vergessen zu vermeiden.

Ursprüngliche Autoren: Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li

Veröffentlicht 2026-05-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Kaustubh Pethkar, Ziyang Xiong, Zuofeng Shang, Yingcong Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Large Language Model (LLM) als eine riesige, hochorganisierte Bibliothek von Geschichten vor. Jedes Mal, wenn das Modell einen Satz liest, ist es so, als würde ein Bibliothekar das letzte Wort betrachten und erraten, welches Wort als Nächstes kommt.

Normalerweise müssen Sie, wenn Sie diesem Bibliothekar ein brandneues Wort beibringen wollen (wie einen neuen wissenschaftlichen Begriff oder einen Slang-Ausdruck), die gesamte Bibliothek neu trainieren. Doch hier liegt das Problem: Wenn Sie die gesamte Bibliothek neu trainieren, um das neue Wort zu lernen, vergisst der Bibliothekar oft, wie man die alten Geschichten korrekt erzählt. Dies wird als „katastrophales Vergessen" bezeichnet.

Dieser Artikel schlägt einen cleveren, wenig aufwendigen Weg vor, neue Wörter hinzuzufügen, ohne die alten zu beschädigen. Hier ist die Aufschlüsselung mit einfachen Analogien:

1. Die Bibliothek als „Verkehrskarte" (Die Markov-Idee)

Die Autoren betrachten das Sprachmodell nicht als komplexes Gehirn, sondern als eine Verkehrskarte.

  • Die Knoten: Jedes Wort im Wörterbuch ist eine Stadt auf der Karte.
  • Die Straßen: Die Verbindungen zwischen den Wörtern sind Straßen. Wenn Sie in der Stadt „The" sind, führen bestimmte Straßen zu „cat", „dog" oder „sun".
  • Das Gedächtnis: Das „Gedächtnis" des Modells ist lediglich die Karte dieser Straßen. Es weiß, dass „The" mit einer bestimmten Wahrscheinlichkeit normalerweise zu „cat" führt.

2. Das Problem: Eine neue Stadt hinzufügen

Wenn Sie dem Modell ein neues Wort beibringen wollen (nennen wir es „Zorp"), fügen Sie im Wesentlichen eine neue Stadt zur Karte hinzu.

  • Der alte Weg (Vollständiges Fine-Tuning): Sie versuchen, die gesamte Karte neu zu zeichnen, um „Zorp" einzubeziehen. Dabei löschen oder verändern Sie versehentlich die Straßen zwischen den alten Städten. Der Bibliothekar vergisst, dass „The" zu „cat" führt, und beginnt stattdessen zu sagen, dass „The" zu „Zorp" führt.
  • Der Weg des Artikels: Anstatt die gesamte Karte neu zu zeichnen, fügen Sie einfach ein Schild für „Zorp" hinzu. Sie sagen: „Hey, wenn du 'Zorp' siehst, behandle es genau so, wie du 'The' oder 'Cat' behandelst."

3. Die Lösung: Die „Token-zu-Wörterbuch"-Karte

Der Artikel schlägt eine Strategie namens Token-to-Dictionary Mapping (Token-zu-Wörterbuch-Zuordnung) vor.

  • Stellen Sie sich vor, Sie haben ein neues, seltsames Wort „Zorp". Anstatt dem Modell die Bedeutung von „Zorp" von Grund auf beizubringen, sagen Sie dem Modell: „Wenn du 'Zorp' siehst, tue einfach so, als wäre es das Wort 'Star'."
  • Das Modell muss keine neuen Straßen für „Zorp" lernen. Es muss nur wissen, dass „Zorp" auf dasselbe Ziel zeigt wie „Star".
  • Da das Modell die bestehenden Straßen (die Übergangswahrscheinlichkeiten zwischen alten Wörtern) nicht ändern muss, vergisst es niemals die alten Geschichten.

4. Die „Stichprobeneffizienz" (Warum es schnell ist)

Die Autoren beweisen mathematisch, dass dies unglaublich effizient ist.

  • Die Analogie: Wenn Sie ein neues Wort lernen wollen, müssen Sie nicht die gesamte Bibliothek erneut lesen. Sie müssen nur einige Beispiele lesen, wie dieses neue Wort in Sätzen verwendet wird.
  • Die Mathematik: Die Anzahl der Beispiele, die Sie benötigen, hängt davon ab, wie viele bestehende Wörter Sie dem neuen Wort zuordnen. Wenn Sie „Zorp" nur 5 gängigen Wörtern zuordnen, benötigen Sie nur eine winzige Menge an Daten, um es zu lernen. Sie müssen sich nicht um die Größe der gesamten Bibliothek kümmern (die möglicherweise 100.000 Wörter hat).

5. Das Experiment: Mathematik und erfundene Wörter lehren

Die Forscher testeten dies mit zwei Szenarien:

  1. Der magische Operator: Sie brachten einem Modell ein spezielles Symbol bei (wie ⟨spec⟩), das „multiplizieren" bedeutete.
    • Ergebnis: Das Modell lernte sehr schnell, mit dem neuen Symbol zu multiplizieren.
    • Der Gewinn: Entscheidend ist, dass das Modell immer noch wusste, wie man Zahlen addiert. Bei anderen Methoden führte das Erlernen des neuen Symbols dazu, dass das Modell das Addieren vergaß. Diese Methode hielt die Additionsfähigkeiten perfekt.
  2. Erfundene Wörter: Sie erfanden 100 Unsinnswörter (wie „glor" und „zorp") und fügten sie in Sätze ein.
    • Ergebnis: Das Modell lernte, diese erfundenen Wörter korrekt zu verwenden, ohne zu vergessen, wie man Englisch spricht.
    • Vergleich: Andere Methoden (wie Standard-Fine-Tuning oder LoRA) führten dazu, dass das Modell das Englische vergaß, während es die erfundenen Wörter lernte. Die neue Methode verursachte kein einziges Vergessen.

Zusammenfassung

Betrachten Sie diese Methode als das Hinzufügen eines neuen Raums zu einem Haus, ohne die Wände der bestehenden Räume niederzureißen.

  • Alter Weg: Um einen neuen Raum hinzuzufügen, bauen Sie das gesamte Fundament neu auf. Die alten Räume reißen und fallen auseinander.
  • Neuer Weg: Sie bauen den neuen Raum und befestigen eine Tür, die direkt in einen bestehenden Flur führt. Der alte Flur bleibt genau so, wie er war, und der neue Raum passt perfekt hinein.

Der Artikel behauptet, dies sei ein mathematisch bewiesener Weg, den Wortschatz eines Sprachmodells mit sehr wenigen Daten zu erweitern und dabei absolut keine Verluste an vorherigem Wissen zu erleiden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →