← Nieuwste papers
💻 computer science

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

Dit artikel diagnoseert systematisch vijf verschillende trainingsfoutmodi van Token-Choice sparse Mixture-of-Experts in video Diffusion Transformers, stelt een "Functionele Redundantie Hypothese" voor om de waargenomen selectieve deadlock te verklaren, en biedt een complete engineeringoplossing samen met een evolutionaire routekaart voor het schalen van deze architecturen.

Oorspronkelijke auteurs: Haiying Sha

Gepubliceerd 2026-05-20
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haiying Sha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Geheel: Een Video-generator Upgrade

Stel je voor dat je een zeer getalenteerde, eenpersoons video-editor hebt (een "Dicht Model") die alles kan doen: clips bewerken, tekst toevoegen, kleuren veranderen en instructies volgen. Ze is geweldig, maar ze is traag en duur om te draaien.

De onderzoekers wilden deze editor upgraden naar een Mixture-of-Experts (MoE) team. Denk hierbij aan het inhuren van een team specialisten:

  • De Manager (Router): Beslist welke taak naar wie gaat.
  • De Specialist (Routed Experts): Twee klonen van de oorspronkelijke editor, klaar om specifieke taken te doen.
  • De Stage-assistent (Shared Expert): Een nieuwe aanwinst die algemene kennis leert om iedereen te helpen.

Het doel was om de video-generator slimmer en sneller te maken door de Manager verschillende delen van een video naar verschillende Specialist te sturen. Echter, de onderzoekers ontdekten dat deze upgrade niet soepel verliep. In plaats van een gelukkig team, vonden ze een systeem dat vaak "bevroor" of instortte.

De Drie Regels van de Upgrade (De "Drie Wetten")

Voordat de experimenten begonnen, realiseerden de onderzoekers zich dat ze drie strenge regels moesten volgen om überhaupt te kunnen beginnen, anders zou het hele project crashen:

  1. Verander de Uniformen niet (Structurele Consistentie): De Specialist moeten exact gebouwd zijn zoals de oorspronkelijke editor. Als de oorspronkelijke een specifiek type wiskunde gebruikte (GELU), moeten de Specialist hetzelfde gebruiken. Als je probeert een andere stijl in te wisselen (zoals SwiGLU), passen de gewichten niet en breekt het model direct.
  2. Verklein het Signaal niet (1:1 Klonen): Bij het kopiëren van het brein van de oorspronkelijke editor naar de Specialist, moet je het exact kopiëren. Probeer niet de getallen "te schalen" om ze beter te laten passen. Als je het signaal verkleint, vervaagt de video-uitvoer naar zwart omdat het signaal laag voor laag verloren gaat.
  3. De "Micro-ruis" Stage-assistent (Initialisatie van de Gedeelde Expert): Dit is het lastigste deel. De "Stage-assistent" (Shared Expert) begint met bijna nul kennis.
    • De Valstrik: Als je de Stage-assistent start met perfect nul-gewichten, is de wiskunde van de computer (specifiek de bfloat16 precisie) zo ruw dat het de kleine updates afrondt tot nul. De Stage-assistent wordt nooit wakker.
    • De Oplossing: Je moet de Stage-assistent een tiny, bijna onzichtbare "vonk" van ruis geven (zoals een kleine statische schok) om te starten. Dit is genoeg om ze wakker te maken zonder de video-uitvoer te veranderen, maar het stelt hen in staat om te beginnen met leren.

Wat Ging Fout: De Diagnose van het Falen

De onderzoekers draaiden het systeem 5.000 stappen en keken hoe de "Manager" (Router) taken toewees. Ze vonden een hiërarchie van fouten:

1. De Lineaire Router: Het "Vlakke Lijn" Probleem

  • De Opzet: Ze gebruikten een simpele, rechte Manager.
  • Het Resultaat: De Manager raakte in de war. Hij kon het verschil tussen taken niet zien. Hij eindigde met het sturen van alles naar beide Specialist gelijk, maar op een manier die ze identiek maakte.
  • De Analogie: Stel je een manager voor die alleen een rechte lijn op een kaart kan tekenen. Als het terrein complex is (zoals een video met veel taken), kan een rechte lijn de gebieden niet scheiden. De twee Specialist werden klonen van elkaar (99% gelijk), en het systeem voegde alleen extra kosten toe zonder nieuwe vaardigheden.

2. De MLP Router: De "Selectieve Doodloop"

  • De Opzet: Ze upgradeerden de Manager om slimmer te zijn (niet-lineair/MLP).
  • Het Resultaat: De globale verwarring stopte, maar een nieuw, sluimerend probleem verscheen genaamd Selectieve Doodloop.
  • Het Fenomeen: Ongeveer één derde van de videolagen stopte met het gebruik van beide Specialist. In plaats daarvan kozen ze één Specialist en negeerden de ander volledig.
  • De Analogie: Stel je een team van twee werknemers voor. De Manager beseft: "Hé, Werknemer A doet 90% van het werk, en Werknemer B voegt niet veel toe." Dus stopt de Manager met het sturen van werk naar Werknemer B. Werknemer B zit inactief. Zelfs als je de Manager toeschreeuwt (de straf voor gebrek aan balans verhogen), zal hij niet veranderen omdat het systeem zichzelf heeft overtuigd dat één werknemer genoeg is.
  • Het Patroon: Dit gebeurde niet willekeurig. Het gebeurde in een U-vorm:
    • Bovenkant van de U (Vroege Lagen): De "ogen" van het model (ruwe pixels verwerken) raakten vast.
    • Bodem van de U (Diepe Lagen): Het "brein" van het model ( complexe betekenis verwerken) raakte vast.
    • Midden: De middelste lagen werkten prima.

3. De Cross-Attention Router: De "Zelfhelende" Poging

  • De Opzet: Ze gaven de Manager een superkracht: het vermogen om de tekst-instructies te lezen terwijl hij naar de video keek (met behulp van Cross-Attention).
  • Het Resultaat: Dit was de beste opzet. Sommige lagen die "dood" waren, werden daadwerkelijk wakker en begonnen weer te werken!
  • De Beperking: Zelfs met deze superkracht bleven ongeveer 9 lagen koppig vastzitten. De Manager kon nog steeds niet uitzoeken hoe hij beide Specialist in die specifieke lagen moest gebruiken.

De "Functionele Redundantie" Theorie: Waarom gebeurde dit?

De onderzoekers stelden een theorie op om uit te leggen waarom de Specialist vastliepen. Ze noemen het de Functionele Redundantie Hypothese.

  • De Metafoor: Stel je een team voor van "Twee Meesters + Één Leerling".
    • De Meesters (Routed Experts) zijn identieke klonen van de oorspronkelijke expert.
    • De Leerling (Shared Expert) begint met bijna geen vaardigheden (micro-ruis).
  • Het Proces:
    1. Start: De Leerling doet niets. De twee Meesters zijn identiek. De Manager (Gate) ziet geen reden om beide Meesters te gebruiken, dus kiest hij er één en negeert de ander. De genegeerde Meester wordt een "strategische reserve" (vastgelopen).
    2. Growth: De Leerling leert langzaam algemene vaardigheden.
    3. Het Ontwaken: Zodra de Leerling goed genoeg is om de saaie, basis taken te doen, beseft de Manager: "Ik kan de basiszaken aan de Leerling geven!" Dit maakt de "dode" Meester vrij om iets nieuws en anders te leren.
  • De Conclusie: De "dode" lagen zijn niet kapot; ze wachten. Ze wachten tot de Leerling (Shared Expert) groot genoeg is om hen te ondersteunen. Totdat de Leerling sterk is, blijft het systeem in een "doodloop" om energie te besparen.

De "Bfloat16" Valstrik

Het paper vond ook een verborgen technische valstrik. Bij training met een specifiek type computerwiskunde (bfloat16), als een getal heel klein is (zoals de kleine ruis die aan de Stage-assistent wordt gegeven), rondt de computer de updates af tot nul. Het is alsof je de groei van een zaadje probeert te meten met een liniaal die alleen in meters meet. Het zaadje groeit, maar de liniaal zegt "0."

  • De Oplossing: Houd de "hoofdkopie" van de gewichten in hoge precisie (float32) en gebruik alleen de ruwere wiskunde voor de daadwerkelijke stappen van de video-generatie.

Het Stappenplan: Waar gaat dit naartoe?

Op basis van deze bevindingen stellen de auteurs een drie-stappenplan voor voor de toekomst:

  1. Korte Termijn: De tekstgeneratie repareren. Momenteel kan het model woorden niet goed spellen. Ze plannen om een specifieke "Tekst Expert" aan het team toe te voegen die alleen letters en vormen behandelt.
  2. Middellange Termijn: Geluid toevoegen. Ze willen een "Audio Expert" toevoegen zodat het model video en geluid samen kan genereren, in plaats van ze apart te maken.
  3. Lange Termijn: Een "Wereldmodel" bouwen. Ze willen experts toevoegen die fysica begrijpen (zwaartekracht, botsingen) zodat de AI niet alleen mooie plaatjes maakt, maar begrijpt hoe de wereld echt werkt.

De Conclusie

Het paper concludeert dat onder het huidige "Token-Choice" systeem (waar tokens experts kiezen), doodloop een structureel probleem is, geen bug. Je kunt het niet oplossen door alleen maar aan nummers te sleutelen. Om alle experts volledig wakker te maken, moet je óf beginnen met een slimmere "Stage-assistent" (Shared Expert) óf de hele manier waarop het team is georganiseerd veranderen. Dit is een van de eerste gedetailleerde studies die precies laat zien waarom deze video-AI-upgrades vaak niet werken zoals verwacht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →