Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
Dieses Paper schlägt eine trainingsfreie Methode vor, um die Rechenkosten von feingranularen Mixture-of-Experts-Modellen bei der Inferenz zu halbieren, indem es die Expertenauswahl von der Wahrscheinlichkeitsrenormierung entkoppelt und dadurch die Leistung bewahrt, indem es gegenüber einem größeren Referenzsatz an Experten statt gegenüber dem reduzierten aktiven Satz normalisiert.