← Neueste Arbeiten
🤖 machine learning

Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates

Dieser Artikel schlägt einen skalierbaren, geschlossenen Rahmen für das Wissens-Editing bei Mixture-of-Experts-LLMs vor, der Tensorstrukturen und die Woodbury-Matrix-Identität nutzt, um Updates pro Experte mit bis zu einer sechsfachen Beschleunigung zu erreichen, während gleichzeitig eine Editing-Qualität auf dem Niveau von Baselines mit dichten Schichten beibehalten wird.

Ursprüngliche Autoren: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

Veröffentlicht 2026-05-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Aktualisierung einer riesigen Bibliothek

Stellen Sie sich ein Large Language Model (LLM) als massiven, superschlauen Bibliothekar vor, der fast alles weiß. Sobald dieser Bibliothekar jedoch trainiert ist, ist sein Wissen „eingefroren". Wenn sich die Welt verändert (z. B. ein neuer Präsident gewählt wird oder ein wissenschaftlicher Fakt korrigiert wird), liefert der Bibliothekar weiterhin alte, falsche Antworten.

Normalerweise müssen Sie den Bibliothekar für eine lange, teure Nachschulung zurück in die Schule schicken, um dies zu beheben. Dies ist langsam, kostet ein Vermögen an Rechenleistung und birgt das Risiko, dass der Bibliothekar andere Dinge vergisst, die er bereits wusste.

Knowledge Editing ist ein Shortcut. Anstatt den gesamten Bibliothekar neu zu trainieren, gehen Sie einfach hinein und tauschen eine bestimmte Datei in seinem Gedächtnis aus. Bisherige Methoden funktionierten hervorragend für „dichte" Modelle (bei denen jeder Teil des Gehirns aktiv ist), hatten jedoch Schwierigkeiten mit modernen Modellen.

Die neue Herausforderung: Das „Experten"-Team

Moderne KI-Modelle (wie die von OpenAI oder DeepSeek verwendeten) nutzen kein einzelnes riesiges Gehirn. Sie verwenden eine Mixture-of-Experts (MoE)-Architektur.

  • Die Analogie: Stellen Sie sich vor, anstelle eines einzigen riesigen Bibliothekars haben Sie ein Team von 100 spezialisierten Experten (ein Historiker, ein Programmierer, ein Koch, ein Arzt usw.).
  • Funktionsweise: Wenn Sie eine Frage stellen, betrachtet ein „Router" (ein Manager) die Frage und weckt nur die 4 oder 8 relevanten Experten. Die anderen bleiben schlafen.
  • Das Problem: Wenn Sie einen Fakt aktualisieren möchten (z. B. „Die Hauptstadt von Frankreich ist Paris"), wussten die alten Editier-Tools nicht, wie sie mit diesem spezifischen Team sprechen sollten. Sie versuchten, das gesamte Team als einen großen Klumpen zu behandeln, was ineffizient und unübersichtlich ist. Die bestehende Methode zur Behebung dieses Problems (genannt MoE-Edit) war wie der Versuch, die Experten nacheinander in einer langen Schlange zu aktualisieren, was ewig dauerte.

Die Lösung: MoTE (Der intelligente Teammanager)

Die Autoren schlagen eine neue Methode namens MoTE (Mixture-of-Experts Tucker Editor) vor. Sie lösten das Problem mit zwei Haupttricks:

1. Die „Shortcut"-Mathematik (Woodbury-Identität)

Der alte Weg, die Experten zu aktualisieren, erforderte das Lösen eines massiven, komplexen mathematischen Rätsels, das das Invertieren einer riesigen Matrix (ein Gitter von Zahlen) beinhaltete. Es war wie der Versuch, ein Sudoku-Rätsel mit einer Million Feldern zu lösen.

Die Autoren verwendeten einen mathematischen Trick namens Woodbury-Identität.

  • Die Analogie: Anstatt das Rätsel mit einer Million Feldern zu lösen, stellten sie fest, dass sie nur ein winziges 50-Felder-Rätsel lösen mussten, das die Änderungen darstellt, die Sie vornehmen möchten.
  • Das Ergebnis: Dies verwandelt eine Aufgabe, die Stunden dauert, in eine, die Minuten dauert. Sie können das Wissen aktualisieren, ohne jemals das volle Gewicht jedes einzelnen Experten gleichzeitig „aufzuwecken" oder zu berechnen.

2. Respektierung der Teamstruktur (Tensor-Zerlegung)

Der zweite Trick bestand darin zu erkennen, dass die Experten nicht zufällig sind; sie sind miteinander verbunden. Sie wurden gemeinsam trainiert, sodass ihr Wissen in einer spezifischen 3D-Form verbunden ist (wie ein Block Käse und nicht wie ein flaches Blatt Papier).

  • Die Analogie: Stellen Sie sich die Experten als einen Chor vor. Wenn Sie die Tonhöhe des Songs ändern möchten, schreien Sie nicht nur eine Person an; Sie passen die Harmonie der gesamten Gruppe an.
  • Die Methode: Die Autoren verwendeten die Tucker-Zerlegung. Dies ist eine Möglichkeit, den „Käseblock" (die Experten-Gewichte) in eine kleinere, Kernform zu komprimieren, die das Wesentliche der Gruppe einfängt.
  • Der Vorteil: Durch das Editieren dieser kleineren „Kern"-Form aktualisieren sie automatisch alle Experten auf eine Weise, die ihre Beziehungen respektiert. Dies verhindert, dass das Modell verwirrt wird oder andere Dinge „vergisst".

Die Ergebnisse: Schnell und präzise

Das Papier testete MoTE an mehreren modernen KI-Modellen (wie Qwen und GPT-OSS) und verglich es mit der bisherigen besten Methode (MoE-Edit) und dem Standard-Neu-Training.

  • Geschwindigkeit: MoTE ist bis zu 6-mal schneller als die bisher beste Methode. Es kann 1.000 Fakten in einem Bruchteil der Zeit bearbeiten.
  • Qualität: Es ist genauso gut darin, Fakten zu korrigieren (Wirksamkeit) und andere Teile des Modells nicht zu beschädigen (Spezifität), wie die langsameren Methoden.
  • Effizienz: Dies wird erreicht, indem die schwere mathematische Berechnung nur einmal ganz am Ende des Prozesses durchgeführt und das Ergebnis dann auf die anderen Schichten verteilt wird, anstatt für jede einzelne Schicht neu zu berechnen.

Zusammenfassung

Das Papier stellt MoTE vor, ein Werkzeug, das es uns ermöglicht, moderne, „expertenbasierte" KI-Modelle schnell und präzise zu aktualisieren. Dies geschieht durch:

  1. Die Verwendung eines mathematischen Shortcuts, um unnötige schwere Berechnungen zu vermeiden.
  2. Die Respektierung der Teamstruktur der Experten, damit die Aktualisierungen Sinn ergeben.

Dies bedeutet, dass wir KI-Modelle mit der realen Welt auf dem neuesten Stand halten können, ohne sie von Grund auf neu trainieren zu müssen, was enorme Mengen an Zeit und Energie spart.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →