← Derniers articles
🤖 machine learning

Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models

Cet article propose une méthode sans entraînement pour réduire de moitié le coût computationnel des modèles de mélange d'experts à grain fin lors de l'inférence, en découplant la sélection des experts de la renormalisation des probabilités, préservant ainsi les performances par une normalisation par rapport à un ensemble de référence d'experts plus large plutôt que par rapport à l'ensemble actif réduit.

Auteurs originaux : Xing Chen, Hengshuai Yao

Publié 2026-09-07✓ Author reviewed
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xing Chen, Hengshuai Yao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les systèmes d'intelligence artificielle modernes qui génèrent du texte reposent souvent sur une conception qui sépare la quantité totale de connaissances qu'ils détiennent de la quantité de réflexion qu'ils déploient pour chaque mot. Imaginez une immense bibliothèque contenant des milliers de livres spécialisés, mais que pour chaque phrase écrite, le système n'ouvre qu'une poignée d'entre eux pour trouver l'information appropriée. Cette approche, connue sous le nom de modèle « Mixture-of-Experts » (mélange d'experts), permet aux ordinateurs de stocker d'énormes quantités de données sans ralentir à chaque fois qu'ils parlent. Le système utilise un petit guide interne pour décider quels livres spécifiques ouvrir pour chaque mot, garantissant ainsi qu'une infime fraction de la bibliothèque totale est consultée à tout moment. Cela crée une situation unique : l'ordinateur doit garder tous les livres sur ses étagères pour être prêt pour n'importe quel sujet, mais il ne lit que quelques pages à la fois.

Parce que l'ordinateur doit conserver toutes ces sections spécialisées dans sa mémoire, les chercheurs cherchent depuis longtemps des moyens de rendre le système plus rapide en le forçant à lire encore moins de pages. La méthode standard pour faire cela est simple : dire au système d'ouvrir moins de livres par phrase. Cependant, cette approche directe a historiquement provoqué la confusion du système et l'a poussé à commettre plus d'erreurs. La confusion provient non pas du fait que le système manque des livres appropriés, mais parce que la manière dont il pondère l'information provenant de ces livres change de manière inattendue lorsque le nombre de livres est réduit. Une nouvelle étude de Xing Chen et Hengshuai Yao révèle que cette confusion est causée par un ajustement mathématique caché que le système effectue automatiquement, et ils ont trouvé un moyen de désactiver cet ajustement sans avoir besoin de réentraîner le système ou d'ajouter de nouveaux composants.

Les chercheurs se sont concentrés sur deux modèles de langage très vastes, l'un doté de 35 milliards de paramètres et l'autre de près de 400 milliards. Ces modèles sont conçés avec des centaines de petites sections spécialisées, ou experts, pour chaque couche de traitement. Dans leur fonctionnement standard, le système sélectionne huit de ces experts pour chaque mot traité. Lorsque les chercheurs ont tenté d'accélérer le système en réduisant ce nombre de moitié, le forçant à n'utiliser que quatre experts, les performances ont chuté de manière significative. Sur un test standard de connaissances générales, la précision a chuté de près de cinq points. Cette perte était si sévère que beaucoup avaient supposé que réduire le nombre d'experts actifs était simplement trop coûteux pour être utile. Les chercheurs soupçonnaient que le problème n'était pas la perte des experts eux-mêmes, mais plutôt la façon dont le système recalibrait l'importance des experts restants.

Dans la configuration standard, lorsque le système choisit ses meilleurs experts, il ajuste leur influence de sorte que leur importance combinée atteigne toujours un total fixe. C'est un mécanisme de sécurité pour maintenir la stabilité du système. Cependant, dans ces modèles à grain fin, les huit meilleurs experts ne détiennent généralement qu'une petite fraction de l'importance totale possible. Lorsque le système est contraint de n'en choisir que quatre, l'ajustement standard multiplie leur influence par un facteur important pour combler la différence. Ce boost soudain pousse le système dans un état qu'il n'a jamais été entraîné à gérer, le faisant surréagir et commettre des erreurs. Les chercheurs ont réalisé que le système ne manquait pas réellement d'informations ; il lui était simplement demandé de crier plus fort qu'il ne le devrait.

Pour corriger cela, l'équipe a introduit un changement simple qui ne nécessite ni entraînement ni puissance de calcul supplémentaire. Ils ont séparé la décision de quels experts utiliser de la décision de comment les pondérer. Ils ont permis au système de ne choisir que quatre experts pour effectuer le travail, mais ils lui ont dit de calculer les poids d'importance en se basant sur les seize meilleurs experts au lieu de seulement les quatre premiers. En faisant cela, le système a conservé le même volume d'informations qu'il avait l'habitude d'entendre, même s'il n'utilisait que la moitié du nombre de sections actives. Ce petit ajustement, qui implique de changer un seul paramètre entier, a complètement changé la donne. Sur le modèle de 35 milliards de paramètres, la réduction des experts actifs de huit à quatre avec ce nouveau réglage a fait chuter la précision de seulement 0,35 point, une différence si faible qu'elle est statistiquement indiscernable du système original, plus lent.

L'étude a également testé cette méthode sur le modèle beaucoup plus grand de 400 milliards de paramètres, où les résultats furent similairement spectaculaires. Réduire de moitié les experts actifs avec la méthode standard entraînait une perte de performance significative, mais l'utilisation de la nouvelle méthode de pondération a réduit la perte à seulement 0,55 point. Les chercheurs ont découvert que le meilleur réglage pour cette nouvelle pondération dépendait de la tâche spécifique. Par exemple, un réglage qui faisait paraître le système le plus performant lors de la lecture de textes ne le faisait pas toujours performer de la même manière sur des énigmes logiques ou des tests de connaissances. Cette découverte suggère que mesurer simplement la capacité d'un modèle compressé à lire du texte ne suffit pas à garantir qu'il fonctionnera bien sur d'autres tâches. Les chercheurs ont conclu que pour réduire en toute sécurité la puissance de calcul nécessaire de ces modèles, il faut ajuster soigneusement ce paramètre de pondération en utilisant des tests de performance réels plutôt que de se fier uniquement à la fluidité du texte.

L'article a également exploré pourquoi le simple fait de supprimer définitivement les experts supplémentaires, plutôt que de les utiliser seulement temporairement, est difficile. Ils ont découvert que ces modèles sont hautement spécialisés, avec différents experts gérant différents types de contenus comme le code ou l'écriture générale. Parce que les experts sont si spécialisés et que le système est si bien équilibré, il y a très peu de marge pour supprimer définitivement ces experts sans perdre la capacité de traiter des sujets divers. La voie la plus efficace, par conséquent, n'est pas de jeter des parties du modèle, mais de simplement lui dire d'utiliser moins de parties à la fois tout en maintenant constant le volume global d'informations qu'il traite. Cette approche offre un moyen de rendre ces systèmes puissants plus rapides et plus efficaces sans sacrifier leur intelligence, simplement en corrigeant une erreur de calibration cachée qui survient lorsque les règles d'engagement changent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →