← Nieuwste papers
💻 computer science

MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks

MASCing is een lichtgewicht, zonder hertraining werkend raamwerk dat Mixture-of-Experts (MoE)-modellen configureert voor diverse veiligheidsscenario's door gebruik te maken van een op LSTM gebaseerd surrogaat om stuurmaskers op routeringsgaten te optimaliseren, waardoor gerichte verbetering of onderdrukking van specifieke gedragingen mogelijk wordt zonder de algemene bruikbaarheid te compromitteren.

Oorspronkelijke auteurs: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (zoals die chatbots aandrijven) voor als een enorm, high-tech orkest.

In oudere modellen speelde elke muzikant (parameter) zijn instrument voor elke enkele noot die het model zong. Dit was luid, duur en traag.

Mixture-of-Experts (MoE)-modellen zijn anders. Ze zijn als een enorm orkest waarbij, voor elke noot, slechts een kleine, specifieke groep muzikanten wordt geroepen om te spelen. De rest blijft stil. Een "dirigent" (de router) beslist welke groep van 2 of 4 muzikanten voor elk woord mag spelen. Dit maakt het model veel sneller en goedkoper om te draaien.

Echter, dit systeem heeft een nieuw probleem: De dirigent is het zwakke punt.

Het Probleem: De "Slechte Dirigent"

Omdat slechts een paar muzikanten tegelijk spelen, kan een slimme bedrieger (een aanvaller) proberen de dirigent te misleiden om de foute groep muzikanten te roepen.

  • Scenario A (Jailbreak): De bedrieger vraagt het model om iets slechts te doen (zoals een handleiding voor een bom schrijven). Het model zegt meestal: "Nee, dat is gevaarlijk." Maar een bedrieger kan op een omweg over vele beurten vragen, waardoor de dirigent in de war raakt en de "schadelijke" muzikanten roept in plaats van de "veiligheids"-muzikanten.
  • Scenario B (Over-Refusal): Soms is het model te voorzichtig. Het weigert een verhaal te schrijven over een fictieve schurk omdat het denkt dat "schurk" "slecht" betekent. De ontwikkelaar wil misschien dat het model dat verhaal in een specifieke context wel mag schrijven, maar de dirigent blijft de "weigering"-muzikanten roepen.

Meestal moet je, om dit op te lossen, het hele orkest ontslaan en nieuwe huren (hertraining), wat maanden kost en een fortuin kost.

De Oplossing: MASCing (De "Slimme Partituur")

Het artikel introduceert MASCing (MoE Activation Steering Configuration). Denk hierbij niet aan het ontslaan van het orkest, maar aan het geven van een speciale, vooraf geschreven partituur (een stuurmasker) aan de dirigent die hem subtiel aanzet om de juiste muzikanten voor de klus te kiezen, zonder de muzikanten zelf te veranderen.

Zo werkt MASCing in drie eenvoudige stappen:

1. De "Surrogaat"-Detective (Het Patroon Leren)

Eerst trainen de onderzoekers een klein, snel AI-model (een LSTM) om als detective op te treden. Deze detective observeert de noten van de "dirigent" (de routing logits) terwijl het model praat.

  • Het leert: "Wanneer de dirigent deze specifieke noten ziet, weigert het model meestal om te antwoorden."
  • Het leert ook: "Wanneer de dirigent deze noten ziet, stemt het model meestal toe om een verhaal te schrijven."
  • Cruciaal: de detective kijkt niet alleen naar wie er echt speelde; het kijkt naar de potentiële noten die de dirigent overwoog, waardoor alle verborgen informatie behouden blijft.

2. De "Veiligheidskring" Vinden (Het Masker)

De detective komt er vervolgens precies achter welke noten op de partituur van de dirigent moeten worden bijgestuurd om het gewenste resultaat te krijgen.

  • Als we een slecht antwoord willen stoppen, vindt de detective de noten die leiden naar "veiligheid" en versterkt deze, terwijl hij de noten die leiden naar "schade" dempt.
  • Als we een specifiek antwoord willen toestaan (zoals volwassen inhoud in een veilige context), vindt het de noten die leiden naar "weigering" en dempt deze, terwijl het de "naleving"-noten versterkt.

Dit creëert een Stuurmasker. Denk hierbij aan een markeerstift die specifieke plekken op de partituur van de dirigent markeert. Het verandert de muziek zelf niet; het zegt de dirigent alleen: "Hé, besteed extra aandacht aan deze specifieke noten."

3. De Voorstelling (Inferentie)

Wanneer het model daadwerkelijk draait, past het systeem dit masker in real-time toe.

  • De dirigent kijkt naar de noten.
  • Het masker voegt een kleine "duwtje" toe aan de noten.
  • De dirigent, beïnvloed door het duwtje, kiest de "veiligheids"-muzikanten in plaats van de "schadelijke" (of andersom).

Wat Hebben Ze Bereikt?

De onderzoekers testten dit op zeven verschillende MoE-modellen met twee zeer verschillende doelen:

  1. Jailbreaks Stoppen (Het Schild): Ze gebruikten MASCing om modellen beter te maken in het weerstaan van bedriegers die proberen hen over een lang gesprek te misleiden om slechte dingen te zeggen.

    • Resultaat: De modellen gingen van het blokkeren van slechte verzoeken in ongeveer 52% van de gevallen naar het blokkeren in 84% van de gevallen.
    • Analogie: De dirigent werd veel moeilijker te misleiden om de "slechte" muzikanten te roepen.
  2. Specifieke Inhoud Toestaan (De Sleutel): Ze gebruikten MASCing om modellen minder waarschijnlijk te maken om verzoeken om volwassen inhoud te weigeren wanneer die inhoud eigenlijk door het beleid wordt toegestaan.

    • Resultaat: De modellen gingen van het toestaan om zulke verhalen te schrijven in 52% van de gevallen naar 82% van de gevallen.
    • Analogie: De dirigent stopte met paniek en het roepen van de "weigering"-muzikanten voor elk verhaal over een schurk, waardoor de "creatieve" muzikanten konden spelen.

Waarom is dit speciaal?

  • Geen Hertraining: Je hoeft het hele orkest niet opnieuw te leren. Je verandert alleen de partituur (het masker).
  • Snel: Het trainen van de "detective" duurt ongeveer 5 minuten op een krachtige computer. Het toepassen van het masker kost bijna geen tijd.
  • Flexibel: Je kunt het masker direct verwisselen. Als de regels morgen veranderen, genereer je gewoon een nieuw masker.
  • Veilig: Het breekt de mogelijkheid van het model niet om wiskunde te doen of normale e-mails te schrijven. Het stelt alleen het "veiligheids"-gedeelte van het besluitvormingsproces bij.

Kortom, MASCing is een lichtgewicht, directe manier om een slimme AI te vertellen: "Voor deze specifieke situatie, luister alstublieft naar een andere groep experts," zonder dat je de AI van de grond af hoeft te herbouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →