← Neueste Arbeiten
💻 computer science

MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks

MASCing ist ein leichtgewichtiges, ohne Nachtraining auskommendes Framework, das Mixture-of-Experts-Modelle (MoE) für diverse Sicherheitsszenarien konfiguriert, indem es einen auf LSTM basierenden Surrogat verwendet, um Steuermasken auf Routing-Gates zu optimieren, wodurch eine gezielte Verstärkung oder Unterdrückung spezifischer Verhaltensweisen ermöglicht wird, ohne die allgemeine Nutzbarkeit zu beeinträchtigen.

Ursprüngliche Autoren: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

Veröffentlicht 2026-05-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Large Language Model (wie die, die Chatbots antreiben) als ein riesiges, hochtechnisches Orchester vor.

In älteren Modellen spielte jeder Musiker (Parameter) sein Instrument für jede einzelne Note, die das Modell sang. Dies war laut, teuer und langsam.

Mixture-of-Experts (MoE)-Modelle sind anders. Sie sind wie ein riesiges Orchester, bei dem für jede Note nur eine winzige, spezifische Gruppe von Musikern gerufen wird, um zu spielen. Der Rest bleibt stumm. Ein „Dirigent" (der Router) entscheidet, welche Gruppe von 2 oder 4 Musikern für jedes Wort spielen darf. Dies macht das Modell viel schneller und kostengünstiger im Betrieb.

Dieses System hat jedoch ein neues Problem: Der Dirigent ist das schwache Glied.

Das Problem: Der „schlechte Dirigent"

Da nur wenige Musiker gleichzeitig spielen, kann ein cleverer Trickbetrüger (ein Angreifer) versuchen, den Dirigenten zu täuschen, damit er die falsche Gruppe von Musikern ruft.

  • Szenario A (Jailbreak): Der Trickbetrüger bittet das Modell, etwas Schlechtes zu tun (wie ein Handbuch für Bomben zu schreiben). Das Modell sagt normalerweise: „Nein, das ist gefährlich." Doch ein Trickbetrüger könnte über viele Wechsel hinweg auf Umwegen fragen und den Dirigenten verwirren, sodass er die „schädlichen" Musiker statt der „Sicherheits"-Musiker ruft.
  • Szenario B (Übermäßige Verweigerung): Manchmal ist das Modell zu vorsichtig. Es verweigert die Abfassung einer Geschichte über einen fiktiven Bösewicht, weil es denkt, „Bösewicht" bedeute „schlecht". Der Entwickler möchte möglicherweise, dass das Modell in einem bestimmten Kontext diese Geschichte schreiben darf, doch der Dirigent ruft weiterhin die „Verweigerungs"-Musiker.

Normalerweise muss man, um dies zu beheben, das gesamte Orchester feuern und neue einstellen (Neu-Training), was Monate dauert und ein Vermögen kostet.

Die Lösung: MASCing (Die „kluge Partitur")

Die Studie stellt MASCing (MoE Activation Steering Configuration) vor. Betrachten Sie dies nicht als das Entlassen des Orchesters, sondern als die Übergabe einer speziellen, vorab geschriebenen Partitur (einer Lenkmaske) an den Dirigenten, die ihn subtil dazu anregt, die richtigen Musiker für den Job auszuwählen, ohne die Musiker selbst zu verändern.

So funktioniert MASCing in drei einfachen Schritten:

1. Der „Surrogat"-Detektiv (Lernen des Musters)

Zuerst trainieren die Forscher eine winzige, schnelle KI (ein LSTM), die als Detektiv fungiert. Dieser Detektiv beobachtet die „Noten" des Dirigenten (die Routing-Logits), während das Modell spricht.

  • Es lernt: „Wenn der Dirigent diese spezifischen Noten sieht, verweigert das Modell normalerweise die Antwort."
  • Es lernt auch: „Wenn der Dirigent diese Noten sieht, stimmt das Modell normalerweise zu, eine Geschichte zu schreiben."
  • Entscheidend ist, dass der Detektiv nicht nur betrachtet, wer tatsächlich gespielt hat; er betrachtet die potenziellen Noten, die der Dirigent in Erwägung zog, und bewahrt somit alle versteckten Informationen.

2. Finden des „Sicherheitskreises" (Die Maske)

Der Detektiv ermittelt dann genau, welche Noten in der Partitur des Dirigenten angepasst werden müssen, um das gewünschte Ergebnis zu erzielen.

  • Wenn wir eine schlechte Antwort stoppen wollen, findet der Detektiv die Noten, die zu „Sicherheit" führen, und verstärkt sie, während er die Noten dämpft, die zu „Schaden" führen.
  • Wenn wir eine bestimmte Antwort zulassen wollen (wie Erwachseneninhalte in einem sicheren Kontext), findet er die Noten, die zu „Verweigerung" führen, und dämpft sie, während er die „Erfüllungs"-Noten verstärkt.

Dies erzeugt eine Lenkmaske. Stellen Sie sich dies wie einen Textmarker vor, der bestimmte Stellen auf der Notenpartitur des Dirigenten markiert. Er verändert die Musik selbst nicht; er sagt dem Dirigenten lediglich: „Hey, achte besonders auf diese spezifischen Noten."

3. Die Aufführung (Inferenz)

Wenn das Modell tatsächlich läuft, wendet das System diese Maske in Echtzeit an.

  • Der Dirigent betrachtet die Noten.
  • Die Maske fügt den Noten eine winzige „Stoßrichtung" hinzu.
  • Der Dirigent, beeinflusst von diesem Stoß, wählt die „Sicherheits"-Musiker statt der „schädlichen" (oder umgekehrt).

Was haben sie erreicht?

Die Forscher testeten dies an sieben verschiedenen MoE-Modellen mit zwei sehr unterschiedlichen Zielen:

  1. Jailbreaks stoppen (Der Schild): Sie nutzten MASCing, um Modelle besser darin zu machen, Trickbetrügern zu widerstehen, die versuchen, sie über ein langes Gespräch hinweg zu täuschen, damit sie Schlechtes sagen.

    • Ergebnis: Die Modelle gingen von einer Blockade schlechter Anfragen in 52 % der Fälle auf eine Blockade in 84 % der Fälle über.
    • Analogie: Der Dirigent wurde viel schwerer zu täuschen, wenn es darum ging, die „schlechten" Musiker zu rufen.
  2. Spezifische Inhalte zulassen (Der Schlüssel): Sie nutzten MASCing, um Modelle weniger wahrscheinlich zu machen, Anfragen nach Erwachseneninhalten abzulehnen, wenn diese Inhalte tatsächlich durch die Richtlinien erlaubt sind.

    • Ergebnis: Die Modelle gingen von einer Zustimmung zum Schreiben solcher Geschichten in 52 % der Fälle auf 82 % der Fälle über.
    • Analogie: Der Dirigent hörte auf, in Panik zu verfallen und für jede Geschichte über einen Bösewicht die „Verweigerungs"-Musiker zu rufen, und erlaubte den „kreativen" Musikern zu spielen.

Warum ist das besonders?

  • Kein Neu-Training: Sie müssen das gesamte Orchester nicht neu unterrichten. Sie ändern nur die Partitur (die Maske).
  • Schnell: Das Training des „Detektivs" dauert etwa 5 Minuten auf einem leistungsstarken Computer. Das Anwenden der Maske dauert fast keine Zeit.
  • Flexibel: Sie können die Maske sofort austauschen. Wenn sich die Regeln morgen ändern, generieren Sie einfach eine neue Maske.
  • Sicher: Es beeinträchtigt nicht die Fähigkeit des Modells, Mathematik zu betreiben oder normale E-Mails zu schreiben. Es justiert nur den „Sicherheits"-Teil des Entscheidungsprozesses.

Kurz gesagt ist MASCing eine leichte, sofortige Möglichkeit, einer intelligenten KI zu sagen: „Für diese spezifische Situation hören Sie bitte auf eine andere Gruppe von Experten", ohne die KI von Grund auf neu aufbauen zu müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →