← Neueste Arbeiten
🤖 machine learning

Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning

Das Papier stellt FORA vor, eine Methode zum Schutz des Funktionsraums, die die Modellfähigkeiten während des Fine-Tunings bewahrt, indem sie Updates auf aktivierungsbasierte statt auf gewichtsbasierte Subräume projiziert und dadurch die spezifischen Richtungen, die für bestehende Fähigkeiten verantwortlich sind, getreuer isoliert und schützt.

Ursprüngliche Autoren: Rui Zhou, Tianci Xie

Veröffentlicht 2026-07-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Rui Zhou, Tianci Xie

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Neue Fähigkeiten lernen, ohne alte zu vergessen

Stellen Sie sich vor, Sie haben einen brillanten Schüler (das KI-Modell), der bereits ein Experte im Übersetzen von Sprachen ist. Sie wollen ihm nun eine neue Fähigkeit beibringen: Mathematische Probleme lösen.

Das Problem beim Standardtraining ist, dass die Schüler oft vergessen, wie man übersetzt, wenn man sie zwingt, Mathe zu lernen. Es ist, als würde man versuchen, ein neues Lied auf einem Klavier zu schreiben, aber die Finger rutschen ständig von den Tasten ab, die man für sein liebstes altes Lied benutzt.

Wissenschaftler haben versucht, dies zu beheben, indem sie „Wächter“ in das Gehirn des Schülers einsetzten. Die meisten bisherigen Methoden versuchten, die physische Struktur des Gehirns (die Gewichtmatrix) zu schützen. Sie sagten: „Berühre nicht die größten, stärksten Verbindungen im Gehirn.“

Die Erkenntnis der Arbeit:
Die Autoren argumentieren, dass das Bewachen der „größten Verbindungen“ die falsche Strategie ist.

  • Die Analogie: Stellen Sie sich vor, das Gehirn des Schülers ist eine riesige Bibliothek. Die „größsten Verbindungen“ sind die populärsten Bücher in den Regalen. Aber der Schüler nutzt vielleicht eine ganz bestimmte, ruhige Ecke der Bibliothek (ein spezifisches Aktivierungsmuster), um zu übersetzen. Wenn Sie nur die populären Bücher bewachen, könnten Sie versehentlich die ruhige Ecke blockieren, in der die Übersetzung stattfindet, oder schlimmer noch, Sie lassen die ruhige Ecke völlig offen, damit die Mathestunden sie durcheinanderbringen können.

Die Arbeit behauptet: Bewache nicht die Möbel (die Gewichte); bewache die Aktivität (die Funktion).

Die Lösung: „Fora“ (Function-space Orthogonal Residual Adaptation)

Die Autoren entwickelten eine neue Methode namens Fora. So funktioniert sie, unterteilt in drei einfache Schritte:

1. Die „Übersetzungszone“ kartieren (Die Kalibrierung)

Bevor sie Mathe lehren, lassen die Forscher den Schüler einige Übersetzungsaufgaben durchführen, ohne ihn zu bewerten (keine Labels nötig). Sie beobachten genau, welche Teile des Gehirns während des Übersetzens aufleuchten.

  • Die Analogie: Sie stellen eine Kamera auf den Schüler und zeichnen eine leuchtende Karte auf den Boden, die zeigt, wohin der Schüler tritt, wenn er Französisch spricht. Dies ist der „Funktions-Subraum“ (Function Subspace).

2. Die „No-Go-Zone“ bauen (Der Projektor)

Anstatt die schweren Möbel (die Gewichte) zu schützen, bauen sie ein Kraftfeld um diese leuchtende Karte auf dem Boden.

  • Die Analogie: Sie sagen dem Mathelehrer: „Du kannst überall im Raum Mathe unterrichten, ABER du darfst nicht auf die leuchtende französische Zone treten. Wenn du versuchst, Mathe auf genau diese Bodenfliese zu schreiben, wird dein Stift abprallen.“
  • Dies ist der richtige Projektor (PQP_Q). Er verhindert, dass die neuen Mathestunden die spezifischen Muster überschreiben, die der Schüler für das Übersetzen nutzt.

3. Der „Spezialkanal“ (Der Spektralkanal)

Den Forschern wurde klar, dass der Schüler gar nicht erst verbessert werden kann, wenn man die Übersetzungszone komplett einfriert. Also fügten sie einen winzigen, schmalen Tunnel durch das Kraftfeld hinzu.

  • Die Analogie: Stellen Sie sich ein kleines, verstärktes Glasrohr vor, das durch die „No-Go-Zone“ verläuft. Der Schüler kann durch dieses Rohr winzige, vorsichtige Anpassungen an seinen Übersetzigkeitsfähigkeiten vornehmen, aber er kann nicht die ganze Wand einreißen, um Platz für Mathe zu schaffen.
  • Dies ist der Spektralkanal (Spectral Channel). Er ermöglicht ein wenig „Plastizität“ (Flexibilität), damit der Schüler kein Roboter wird, hält aber die Hauptstruktur sicher.

Warum dies besser ist als alte Methoden

Die Arbeit testete dies gegen andere Methoden (wie die „Weight-Space Projection“, die die schweren Möbel bewacht).

  • Alte Methode (Weight-Space): „Berühre nicht die großen Bücher.“
    • Ergebnis: Der Schüler vergaß trotzdem, wie man übersetzt, weil das Übersetzen nicht im Bereich der „großen Bücher“ stattfand; es fand in der ruhigen Ecke statt.
  • Neue Methode (Fora): „Tritt nicht auf die leuchtende französische Karte.“
    • Ergebnis: Der Schüler lernte perfekt Mathe und behielt seine Übersetzungsfähigkeiten fast exakt bei.

Die Ergebnisse in einfacher Sprache

Die Forscher testeten dies an einem Modell namens Qwen3-1.7B in drei verschiedenen Szenarien:

  1. Logik lernen (COGS) bei gleichzeitigem Erhalt des Übersetzens: Die neue Methode hielt die Übersetzungsfähigkeiten nahezu perfekt, während andere Methoden das Übersetzen verschlechterten.
  2. Mathe lernen (GSM8K) bei gleichzeitigem Erhalt des Übersetzens: Auch hier rettete die neue Methode die Übersetzungsfähigkeiten, während andere sie abdriften ließen.
  3. Übersetzen lernen bei gleichzeitigem Erhalt von Mathe: Sie drehten das Szenario um. Sie lehrten das Übersetzen und versuchten gleichzeitig, die Mathe-Kenntnisse zu bewahren. Die neue Methode bewahrte die Mathe-Fähigkeiten viel besser als die alten Methoden.

Das Fazit

Die Arbeit kommt zu dem Schluss, dass man, um eine Fähigkeit in einer KI zu schützen, nicht darauf schauen sollte, wo die Gewichte schwer sind (die statische Struktur). Stattdessen sollte man darauf schauen, wo die KI tatsächlich aktiviert, wenn sie diese Fähigkeit ausübt (die dynamische Funktion).

Indem man ein Schutzschild um die Aktivität statt um die Hardware baut, kann man der KI neue Dinge beibringen, ohne das zu löschen, was sie bereits weiß.

Kurz gesagt: Bewache nicht die Regale der Bibliothek; bewache den spezifischen Pfad, den der Leser geht, um sein Lieblingsbuch zu finden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →