← Nieuwste papers
🤖 AI

Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

Dit artikel introduceert Contribution-Contrast (CoCo), een nieuwe methode voor interpretatie op responsniveau voor Mixture-of-Experts beloningsmodellen die de beperkingen van routeringsgewicht-gebaseerde analyse overwint door de rollen van experts te identificeren via gekozen-gewezen respons-paren met de grootste bijdrage-contrasten, waardoor meer getrouwe en gespecialiseerde interpretaties worden geleverd terwijl een concurrerende nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Soyoung Oh, Isabel Valera, Vera Demberg

Gepubliceerd 2026-08-10
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Soyoung Oh, Isabel Valera, Vera Demberg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om behulpzaam, vriendelijk en slim te zijn. Je kunt de robot niet simpelweg programmeren met een rigide regelboek, want menselijke voorkeuren zijn rommelig en ingewikkeld. In plaats daarvan toon je de robot duizenden voorbeelden van "goede" antwoorden versus "slechte" antwoorden, waardoor de robot leert wat mensen leuk vinden. Dit is de wereld van Reinforcement Learning from Human Feedback (RLHF), een techniek die helpt om enorme AI-chatbots af te stemmen op onze waarden. Om dit te doen, gebruikt de AI een "Reward Model" (beloningsmodel), dat fungeert als een strenge leraar die het huiswerk van de robot nakijkt. Maar hier is het lastige deel: soms is deze leraar een "black box". We weten dat het een hoge score geeft aan een goed antwoord, maar we weten niet waarom het besloot dat. Was het omdat het antwoord grappig was? Omdat het beleefd was? Of omdat het een specifiek formaat volgde?

Om dit op te lossen, hebben onderzoekers onlangs geprobeerd een "Mixture-of-Experts" (MoE) beloningsmodel te bouwen. Denk hierbij niet aan één grote leraar, maar aan een klaslokaal met 20 verschillende specialisten. Wanneer er een vraag binnenkomt, kijkt een "router" (zoals een directeur) naar de vraag en beslist welke specialist de vraag moet beoordelen. Misschien is één expert geweldig in wiskunde, een andere in creatief schrijven, en een derde in het geven van juridisch advies. Het doel was om deze experts begrijpelijk te maken door te kijken naar welke vragen zij ontvingen. Maar, zoals het papier dat we nu gaan verkennen suggereert, vertelt het weten wie de vraag kreeg je nog niet hoe ze het antwoord beoordeelden.

Dit paper, getiteld "Beyond Routing Weights", introduceert een nieuwe manier om in de geest van deze AI-specialisten te kijken. De auteurs, een team van de Universiteit van Saarland en andere instellingen, stellen dat het simpelweg kijken naar welke vragen een specialist ontvangt, is alsof je een chef beoordeelt op basis van de ingrediënten die hij gekregen heeft, zonder het gerecht te proeven. In plaats daarvan stellen ze een methode voor genaamd Contribution-Contrast (CoCo). CoCo kijkt naar de specifieize momenten waarop de mening van een specialist het grootste verschil maakte tussen een "goed" antwoord en een "slecht" antwoord. Door deze paren te vergelijken, onthult CoCo precies waar de expert om geeft—of dat nu "beknoptheid" is of "het gebruik van stapsgewijze logica"—in plaats van alleen welk onderwerp ze gewoonlijk behandelen. De onderzoekers hebben dit getest op twee grote datasets en ontdekten dat CoCo een veel duidelijker, eerlijker en gedetailleerder beeld geeft van wat deze AI-experts daadwerkelijk doen, zonder de AI minder accuraat te maken in zijn taak.

Het Probleem: De "Directeur" versus de "Chef"

In de wereld van AI-beloningsmodellen is de "Mixture-of-Experts"-opstelling als een school met een directeur en veel leraren. De directeur (de router) leest de vraag van een leerling en beslist welke leraar het meest geschikt is om deze te beoordelen. Als de vraag over koken gaat, stuurt de directeur de vraag naar de "Culinaire Expert". Als het over programmeren gaat, gaat het naar de "Programmeer-Expert".

Een tijdje dachten onderzoekers dat ze deze experts konden begrijpen door simpelweg naar de aantekeningen van de directeur te kijken. Ze zouden zeggen: "Ah, de Culinaire Expert krijgt meestal vragen over bakken, dus moet dat wel de 'bak-expert' zijn." Dit wordt het bekijken van routing weights genoemd.

Maar de auteurs van dit paper realiseerden zich dat dit een beetje was als een chef beoordelen op de ingrediënten die hij kreeg, in plaats van op de maaltijd die hij kookte. Alleen omdat de Culinaire Expert een vraag over bakken ontving, vertelt je nog niet hoe hij het antwoord beoordeelde. Prefereerde hij gedetailleerde recepten? Hield hij niet van lange uitleg? Lette hij op veiligheidswaarschuwingen? De routing weights vertellen je alleen wie het werk kreeg, niet hoe hij het deed. Het is een onvolledig verhaal dat het belangrijkste deel mist: het eigenlijke besluitvormingsproces.

De Oplossing: CoCo (Contribution-Contrast)

Om dit op te lossen, hebben het team CoCo uitgevonden, wat staat voor Contribution-Contrast. In plaats van alleen te vragen: "Welke expert kreeg deze vraag?", vraagt CoCo: "Welke expert maakte het grootste verschil in de beslissing dat dit antwoord beter was dan dat andere?"

Stel je voor dat je een rechter bent in een kookwedstrijd. Je hebt twee gerechten: één is een perfecte lasagne, en de andere is een licht aangebrande lasagne.

  • De Oude Manier (Routing Weights): Je kijkt op het scoreformulier en ziet dat de "Italiaanse Expert" is toegewezen om deze ronde te beoordelen. Je concludeert: "De Italiaanse Expert houdt van pasta." Maar je weet niet of hij van de lasagne hield omdat hij kaasachtig was, omdat hij warm was, of omdat er basilicum op zat.
  • De CoCo-Manier: Je kijkt op het scoreformulier en ziet dat de "Italiaanse Expert" de lasagne een enorme puntenboost gaf in vergelijking met het aangebrande gerecht, terwijl de andere experts grotendeels neutraal bleven. CoCo zegt dan: "Aha! De Italiaanse Expert houdt specifiek van kaasrijke, warme lasagne met basilicum."

CoCo werkt door de paren antwoorden te vinden waarbij de mening van een expert de doorslag gaf. Het vermenigvuldigt twee zaken met elkaar:

  1. Hoe waarschijnlijk het was dat de expert de vraag kreeg (de routing weight).
  2. Hoeveel de score van de expert het eindresultaat veranderde (het verschil tussen het "goede" antwoord en het "slechte" antwoord).

Door te focussen op deze impactvolle momenten, kan CoCo een beschrijving van de expert genereren die trouw is aan hun werkelijke gedrag. Het zegt niet alleen "Deze expert behandelt kookvragen"; het zegt "Deze expert geeft de voorkeur aan gedetailleerde, stapsgewijze kookinstructies boven vage suggesties."

Wat Ze Vonden: Een Duidelijker Beeld

De onderzoekers hebben CoCo getest tegen andere methoden, inclusief de oude "routing weight"-methode en enkele andere geavanceerde technieken die gebruikmaken van iets dat "Sparse Autoencoders" wordt genoemd (wat lijkt op het proberen te vinden van verborgen patronen in een enorme berg data). Ze testten deze op twee enorme datasets: één met 700.000 voorbeelden en een andere van Reddit.

De resultaten waren zeer duidelijk. CoCo produceerde interpretaties die:

  • Trouwer waren (More Faithful): De beschrijvingen kwamen overeen met wat de experts daadwerkelijk deden in het besluitvormingsproces van de AI. Wanneer de onderzoekers de expert uit de AI verwijderden, veranderde het gedrag van de AI precies zoals CoCo had voorspeld.
  • Specialisatiesterker waren (More Specialized): De experts die door CoCo werden beschreven, hadden zeer duidelijke persoonlijkheden. De een zou de "strenge grammaticapolitie" kunnen zijn, terwijl een ander de "creatieve verhalenverteller" is. De andere methoden produceerden vaak vage of repetitieve beschrijvingen.
  • Net zo Accuraat waren (Just as Accurate): Cruciaal is dat het gebruik van CoCo om de experts te begrijpen de AI niet slechter maakte in zijn taak. Het beloningsmodel bleef net zo goed in het kiezen van de beste antwoorden.

In menselijke tests, waarbij mensen de beschrijvingen van de experts lazen, beoordeelden zij de beschrijvingen van CoCo als de meest coherente en nuttig. Ze konden daadwerkelijk begrijpen waar elke "leraar" in het klaslokaal goed in was.

Waarom Dit Belangrijk Is

Dit paper suggereert dat als we echt willen begrijpen hoe AI beslissingen neemt, we verder moeten kijken dan de oppervlakte. Alleen weten over welk onderwerp een AI-expert gaat is niet genoeg; we moeten weten hoe ze de kwaliteit van een reactie evalueren. CoCo biedt een manier om dit te doen zonder de AI opnieuw te trainen of complexe nieuwe lagen toe te voegen. Het is een instrument voor het "auditeren" van de AI, dat ons helpt te zien of onze digitale leraren ook echt onderwijzen wat wij denken dat ze doen.

De auteurs merken er voorzichtig bij op dat dit geen toverstaf is die de "ware" verborgen gedachten van de AI onthult. De kwaliteit van de uitleg hangt af van hoe goed de AI in de eerste plaats is getraind. Als de trainingsdata rommelig is, kunnen de experts ook rommelig zijn. Echter, binnen de grenzen van de huidige technologie, biedt CoCo het meest eerlijke en gedetailleerde venster dat we hebben naar de geest van deze gespecialiseerde AI-beloningsmodellen. Het brengt ons van het gissen naar wat de experts doen op basis van met wie ze praten, naar het begrijpen van hoe ze het werk dat ze doen exact beoordelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →