← Nieuwste papers
💬 NLP

RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models

Het artikel introduceert RARE, een router-agnostisch framework dat de sturing van representaties ontkoppelt van de expert-routing in Mixture-of-Experts-modellen door gedragsperturbaties te projecteren op de nulruimte van de router, waardoor de effectiviteit van sturing voor schadelijkheid, waarachtigheid en feitelijke bewerking aanzienlijk wordt verbeteren terwijl de bruikbaarheid van het model behouden blijft.

Oorspronkelijke auteurs: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

Gepubliceerd 2026-08-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter de moderne kunstmatige intelligentie, in staat om verhalen te schrijven, problemen op te lossen en vragen te beantwoorden. Om deze enorme systemen efficiënt te maken, worden er nu veel gebouwd met een ontwerp dat een "mixture of experts" (een mengeling van experts) wordt genoemd. Stel je een groot kantoor voor waar een manager elke inkomende aanvraag ontvangt en beslist welke specifieke specialist de aanvraag moet afhandelen. In deze modellen is de "manager" een routeringsmechanisme dat naar elk woord van een zin kijkt en het naar een kleine, gespecialiseerde groep interne processoren, of "experts", stuurt, in plaats van het hele brein van de computer voor elke taak te gebruiken. Dit stelt het model in staat om ongelooflijk groot en slim te zijn, terwijl het snel en economisch blijft om te draaien.

Onderzoekers zoeken al lang naar manieren om deze modellen te "sturen" naar specifiek gedrag, zoals ze meer waarheidsgetrouw maken of minder waarschijnlijk schadelijke inhoud genereren. Een populaire techniek houdt in dat men de interne wiskundige toestanden van het model tijdens het denkproces een klein duwtje geeft, een methode die goed werkt voor oudere, eenvoudigere modellen waarbij elk deel van het brein altijd actief is. Echter, wanneer wetenschappers probeerden deze zelfde duwtechniek toe te passen op de nieuwere "mixture-of-experts"-modellen, faalde dit vaak. Het probleem was dat de duw die bedoeld was om het gedrag te veranderen, ook per ongeluk de manager in de war bracht, waardoor de aanvraag naar de verkeerde specialisten werd gestuurd. Deze mismatch verstoorde de natuurlijke flow van het model, wat leidde tot slechte resultaten.

Een team van onderzoekers heeft dit puzzelstukje nu opgelost door een nieuw framework te ontwikkelen genaamd RARE. Hun werk onthult een cruciaal inzicht: de manager in deze modellen is primair bezig met het onderwerp van de aanvraag, niet met het specifieke gedrag dat het model moet vertonen. Of een gebruiker nu een vraag stelt over programmeren of het model vraagt om een schadelijk verzoek te weigeren, de manager heeft de neiging om de aanvraag naar dezelfde set specialisten te sturen als het onderwerp hetzelfde blijft. De onderzoekers ontdekten dat de oude methoden faalden omdat ze probeerden het gedrag te veranderen door het pad dat de data aflegde te wijzigen, wat de manager in de war bracht. In plaats daarvan verandert hun nieuwe aanpak het gedrag zonder het pad te veranderen.

Het RARE-framework werkt door de "duw" zorgvuldig te filteren voordat deze wordt toegepast. Het verwijdert elk deel van de instructie dat de manager van gedachten zou doen veranderen over welke specialisten gebruikt moeten worden. Door dit te doen, blijft het model de aanvraag naar de juiste experts sturen, maar die experts verwerken de informatie vervolgens op een manier die het gewenste gedrag voortbrengt. De onderzoekers testten deze methode op zes verschillende grote modellen en over drie afzonderlijke taken: het modellen minder schadelijk maken, ze meer waarheidsgetrouw maken en specifieke feiten die ze kennen bijwerken.

De resultaten waren opmerkelijk. Wanneer geprobeerd werd de modellen te stoppen met het opvolgen van schadelijke instructies, slaagde de nieuwe methode in 53,3% van de gevallen, een significante verbetering ten opzichte van eerdere pogingen, terwijl de modellen nog steeds 67,8% accuraat bleven op algemene kennis testen. In tests van waarheidsgetrouwheid verbeterde de methode het vermogen van de modellen om correcte antwoorden te geven van 41,0% naar 58,6%. Misschien wel het meest spectaculair was dat wanneer gevraagd werd om een specifiek feit bij te werken, het succespercentage sprong van 16,8% naar 96,3%. Deze cijfers suggereren dat door het interne routeringssysteem van het model te respecteren, onderzoekers het gedrag effectief kunnen sturen zonder de onderliggende intelligentie te breken.

De studie vergeleek ook vijf verschillende manieren om de noodzakelijke duw te berekenen om te vinden welke het beste werkte. Ze ontdekten dat een methode gebaseerd op het analyseren van de vorm en spreiding van de data, in plaats van alleen de gemiddelde richting, de meest consistente en krachtige resultaten opleverde over alle verschillende modellen heen. Deze bevinding suggereert dat de geometrie van de interne data net zo belangrijk is als de richting van de verandering.

Uiteindelijk demonstreert dit onderzoek dat het controleren van het gedrag van moderne, complexe AI-modellen een delicaat evenwicht vereist. Je kunt niet simpelweg een verandering afdwingen; je moet binnen de bestaande architectuur van het model werken. Door het natuurlijke pad te behouden dat het model kiest voor een gegeven onderwerp, is het mogelijk om de output te sturen naar veiligheid, waarheid of nauwkeurigheid. Deze aanpak biedt een betrouwbare manier om deze krachtige instrumenten aan te passen aan specifieke behoeften zonder de algemene capaciteiten in gevaar te brengen, wat een duidelijk pad biedt naar het beter afstemmen van kunstmatige intelligentie op menselijke waarden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →