← Neueste Arbeiten
💬 NLP

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

Dieser Artikel stellt OGPSA vor, eine leichte Methode für kontinuierliches Lernen, die die Alignment-Steuer beim Safety-Post-Training mindert, indem sie Sicherheitsgradienten auf einen orthogonalen Unterraum projiziert, um allgemeine Modellfähigkeiten zu bewahren, ohne eine groß angelegte Datenwiedergabe zu erfordern.

Ursprüngliche Autoren: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

Veröffentlicht 2026-05-13
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Die „Sicherheitssteuer"

Stellen Sie sich einen brillanten, vielseitigen Koch vor (das KI-Modell). Dieser Koch kann fantastische französische Küche zubereiten, Gedichte schreiben und komplexe Matheaufgaben lösen. Allerdings serviert er manchmal versehentlich Gerichte, die giftig oder anstößig sind.

Um dies zu beheben, stellen Sie einen strengen Sicherheitslehrer ein, der den Koch darin schult, keine schlechten Speisen zu servieren. Der Lehrer ist sehr effektiv; der Koch hört auf, giftige Gerichte zu servieren. Doch es gibt einen Haken: Im Prozess des Lernens, „sicher" zu sein, vergisst der Koch, wie man seine ausgefallenen französischen Gerichte zubereitet oder Gedichte schreibt. Er wird sicher, aber auch langweilig und weniger nützlich.

In der Welt der KI nennt man dies die Alignment-Steuer (Ausrichtungssteuer). Die KI sicherer zu machen, macht sie oft bei ihren anderen Aufgaben „dümmer".

Die Ursache: Ein Stau im Gehirn

Das Papier schlägt vor, dass dies aufgrund eines „Staus" im Gehirn der KI (seinen mathematischen Parametern) geschieht.

  • Die alten Fähigkeiten: Die KI lernte zuerst, ein allgemeines Genie zu sein. Diese Fähigkeiten sind in bestimmten „Richtungen" oder Pfaden in ihrem Gehirn gespeichert.
  • Die neuen Sicherheitsregeln: Wenn wir die KI dazu anleiten, sicher zu sein, drängen wir sie in neue Richtungen.
  • Der Zusammenstoß: Leider überschneidet sich die Richtung, die benötigt wird, um „Sicherheit" zu erlernen, oft mit der Richtung, die benötigt wird, um die „allgemeinen Fähigkeiten" zu bewahren. Wenn die KI versucht, vorwärts zu gehen, um Sicherheit zu erlernen, stößt sie versehentlich gegen die Pfade für ihre allgemeinen Fähigkeiten und löscht diese. Es ist, als würde man versuchen, vorwärts zu gehen, um zur Sicherheitstür zu gelangen, aber Ihr Weg ist durch eine Wand blockiert, die Ihre Mathekenntnisse enthält; um hindurchzukommen, müssen Sie die Wand einreißen.

Die Lösung: OGPSA (Der „Seitwärtsschritt")

Die Autoren schlagen eine neue Methode namens OGPSA (Orthogonal Gradient Projection for Safety Alignment) vor.

Stellen Sie sich das Gehirn der KI als riesigen Tanzboden vor.

  • Die allgemeinen Fähigkeiten sind eine bestimmte Zone auf dem Boden, in der die KI weiß, wie man gut tanzt.
  • Das Sicherheitsziel ist eine neue Tanzbewegung, die die KI lernen muss.

Der alte Weg (Naives Tuning): Die KI versucht, die neue Sicherheitsbewegung zu erlernen, indem sie sich direkt darauf zubewegt. Da die Sicherheitsbewegung jedoch genau in die Zone der „allgemeinen Fähigkeiten" zeigt, tritt die KI versehentlich auf ihre eigenen Füße und vergisst, wie man tanzt.

Der OGPSA-Weg:

  1. Erfassung der Zone: Zuerst macht die Methode einen schnellen „Schnappschuss" der Zone der allgemeinen Fähigkeiten. Sie identifiziert genau, welche Richtungen auf dem Tanzboden entscheidend sind, um diese Fähigkeiten am Leben zu erhalten.
  2. Der Seitwärtsschritt: Wenn die KI eine Sicherheitsregel lernen muss, berechnet OGPSA die Bewegung. Wenn diese Bewegung versucht, in die Zone der allgemeinen Fähigkeiten zu gehen, schneidet OGPSA diesen Teil ab.
  3. Das Ergebnis: Die KI wird gezwungen, einen Seitwärtsschritt zu machen. Sie bewegt sich auf das Sicherheitsziel zu, tut dies jedoch in einer Richtung, die perfekt senkrecht (in einem 90-Grad-Winkel) zur Zone der allgemeinen Fähigkeiten steht.

Die Analogie: Stellen Sie sich vor, Sie gehen auf ein Ziel zu, aber Ihnen wird gesagt: „Treten Sie nicht auf das Gras." Anstatt zu stoppen oder über das Gras zu gehen, laufen Sie auf dem Bürgersteig, der parallel zum Gras verläuft. Sie erreichen Ihr Ziel (Sicherheit) immer noch, aber Sie zertreten nie den Rasen (allgemeine Fähigkeiten).

Warum es gut funktioniert

  • Leichtgewichtig: Im Gegensatz zu anderen Methoden, die erfordern, dass die KI ständig alte Lehrbücher neu liest (alte Daten wiederholt), um sich Dinge zu merken, benötigt OGPSA nur eine winzige, regelmäßige „Kontrolle", um sich daran zu erinnern, welche Richtungen tabu sind.
  • Plug-and-Play: Es funktioniert mit verschiedenen Trainingsmethoden (wie SFT und DPO), ohne dass das gesamte System geändert werden muss.
  • Die Ergebnisse: In ihren Tests ermöglichte die Verwendung von OGPSA der KI, sehr sicher zu werden, ohne so viel von ihrem allgemeinen Verstand zu verlieren. Sie erhielt eine bessere „Sicherheitsbewertung", behielt aber im Vergleich zum Standardtraining eine höhere „Nützlichkeitsbewertung".

Das Fazit

Das Papier behauptet nicht, jedes Sicherheitsproblem zu lösen oder die KI perfekt zu machen. Es bietet lediglich einen cleveren geometrischen Trick: Wenn Sie eine KI dazu anleiten, sicher zu sein, stellen Sie sicher, dass Sie dies nicht auf eine Weise tun, die sie zwingt, das zu vergessen, was sie bereits weiß. Indem wir die KI zwingen, Sicherheit „seitwärts" und nicht „gerade durch" zu lernen, können wir die KI sowohl sicher als auch intelligent halten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →