← Nieuwste papers
🤖 machine learning

How Modular Is a Frontier Mixture-of-Experts? A Pre-registered Causal Test in Which Apparent Expert Modularity Mostly Dissolves

Deze vooraf geregistreerde causale studie onthult dat schijnbare functionele modulariteit in frontier Mixture-of-Experts-modellen zeldzaam is en sterk afhankelijk is van meetkeuzes, aangezien slechts één van de zes geteste taalfamilies robuuste, selectieve modulariteit vertoonde, terwijl anderen er niet in slaagden consistente effecten te handhaven over verschillende metrieken en corpora.

Oorspronkelijke auteurs: Tony Salomone, Deep Gandhi, Ali Asaria

Gepubliceerd 2026-06-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tony Salomone, Deep Gandhi, Ali Asaria

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een enorme, krachtige keuken voor (het AI-model) met 128 verschillende chefs (genaamd "experts"). Maar voor elke zin die de AI schrijft, vraagt hij slechts 8 van die chefs om te helpen. De grote vraag die onderzoekers wilden beantwoorden was: Specialiseren deze chefs zich?

De populaire theorie was dat de keuken is georganiseerd als een strikte warenhuis: één team van chefs kookt alleen wiskunde, een ander team schrijft alleen code, en anderen spreken specifieke talen zoals Spaans of Arabisch. Als dit waar zou zijn, zou de AI "modulair" zijn — zoals een gereedschapskist waarbij je de "wiskundige gereedschappen" kunt verwijderen zonder de "taalgereedschappen" te breken.

De onderzoekers besloten deze theorie te testen op een enorme, geavanceerde AI genaamd Command A+. Dit is hoe ze het deden en wat ze vonden, eenvoudig uitgelegd:

Het Experiment: De "Chef Verwijdering"-test

In plaats van alleen te kijken naar welke chefs de AI kiest (wat misleidend kan zijn), besloten de onderzoekers specifieke groepen chefs te ontslaan en te kijken wat er gebeurt.

  1. De Opzet: Ze identificeerden zes groepen chefs op basis van wat ze gewoonlijk doen: Wiskunde, Code, Algemeen redeneren, Arabisch, Chinees en Spaans.
  2. De Test: Ze "ableerden" (verzwegen) elke groep één voor één terwijl de AI probeerde problemen op te lossen.
  3. De Regels: Om te bewijzen dat een groep echt een gespecialiseerde module was, moesten twee dingen gebeuren:
    • De Breuk: Het uitschakelen van de "Wiskunde"-groep moet het vermogen van de AI om wiskunde te doen breken.
    • De Selectiviteit: Het uitschakelen van de "Wiskunde"-groep mag het vermogen van de AI om Spaans te spreken of code te schrijven NIET breken. Als het uitschakelen van wiskunde ook het Spaans breekt, dan zijn de "Wiskunde"-chefs geen zuivere, aparte module; ze zijn dan vermengd met de Spaanse chefs.

Ze voerden deze test uit onder strikte omstandigheden: gebruikmakend van verschillende soorten testvragen, verschillende talen en zeer zorgvuldige wiskunde om ervoor te zorgen dat de resultaten niet simpelweg op geluk berustten.

De Resultaten: Een Verrassende Ontdekking

De resultaten waren een schok. Het idee dat de AI netjes is georganiseerd in aparte "Wiskunde", "Code" en "Taal" afdelingen bleek grotendeels onjuist.

  • De Enige Echte Specialist: Slechts één groep slaagde voor de test met vlag en wimpel: de Arabische chefs. Toen de onderzoekers hen uitschakelden, vergat de AI volledig hoe hij Arabisch moest spreken, maar kon hij nog steeds Engels spreken, wiskunde doen en code schrijven zonder problemen. Dit was een "zuivere module".
  • De "Bijna" Specialisten: De andere groepen (Spaans, Wiskunde, Code) zagen er in eerste instantie uit alsof ze specialisten zouden kunnen zijn.
    • Spaans: Het leek een specialist op een bepaalde set testzinnen, maar toen het werd getest op een andere set zinnen, begon het ook het Arabisch te verstoren. Het was geen zuivere module; het overlapte met het Arabische team.
    • Wiskunde & Code: Deze waren diep verstrengeld. Het uitschakelen van de "Wiskunde"-chefs tastte de algemene redeneervaardigheden van de AI aan, niet alleen de wiskunde. Het uitschakelen van de "Code"-chefs tastte het tekstbegrip van de AI aan, niet alleen het vermogen om code te schrijven. Het waren geen aparte kamers; het was een gedeelde, rommelige werkruimte.

De "Meting"-valstrik

Het artikel benadrukt een cruciale les: Hoe je het resultaat meet, verandert het antwoord.

Denk aan het testen van een auto. Als je de auto alleen op een onverharde weg test, ziet de ophanging er geweldig uit. Als je hem op een racecircuit test, ziet de ophanging er verschrikkelijk uit.

  • In deze AI: als je "Wiskunde" meet door te kijken hoe goed het een specifieke puzzel oplost, lijkt het een specialist.
  • Als je het meet door te kijken hoe goed het de logica achter de puzzel begrijpt, lijkt het vermengd met algemeen redeneren.

De onderzoekers ontdekten dat voor bijna elke groep, hun "specialisatie" verdween of veranderde afhankelijk van welke test je gebruikte, welke taal je testte of hoe strikt je wiskundige regels waren.

Het Eindoordeel

Het paper concludeert dat voor dit specifieke, enorme AI-model:

  1. Modulariteit is zeldzaam. Je kunt er niet vanuit gaan dat de AI over nette, aparte compartimenten voor verschillende vaardigheden beschikt.
  2. De meeste vaardigheden zijn gemengd. Wiskunde, code en algemeen redeneren zijn in dezelfde "chefs" verstrengeld.
  3. Taal is ingewikkeld. Zelfs talen zoals Spaans zijn niet altijd apart; ze kunnen in andere talen (zoals Arabisch) doorsijpelen, afhankelijk van de context.
  4. Arabisch is de uitzondering. Het is het enige echt geïsoleerde, gespecialiseerde team in deze keuken.

De Kernboodschap: Als je deze AI-modellen wilt begrijpen of aanpassen, kun je niet simpelweg aannemen dat ze zijn gebouwd als een Lego-set met losse blokjes. Ze zijn eerder als een complexe, geweven wandtapijt waarbij het trekken aan één draad (het uitschakelen van één groep experts) delen van het beeld die je niet verwachtte kan doen ontrafelen, tenzij je zeer voorzichtig bent met hoe je ze test.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →