← Derniers articles
🤖 machine learning

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

Ce papier révèle que les modèles pré-entraînés existants de type Mixture-of-Experts (MoE) possèdent intrinsèquement une forte parcimonie d'activation intra-expert, ce qui peut être exploité en modifiant le pipeline d'exécution vLLM pour sauter les calculs de neurones inactifs, permettant d'obtenir une accélération allant jusqu'à 2,5 fois pour l'exécution de la couche MoE et une accélération de bout en bout de 1,2 fois sans aucun réentraînement du modèle ni modification des paramètres.

Auteurs originaux : Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

Publié 2026-05-12
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Idée : Trouver les « Géants Dormants » dans l'IA

Imaginez une immense cuisine de restaurant haut de gamme (le modèle d'IA) qui compte des centaines de chefs spécialisés (appelés Experts). Dans une configuration standard de « Mélange d'Experts » (MoE), lorsqu'un client commande un plat, le chef de cuisine (le Routeur) ne choisit que quelques experts spécifiques pour travailler sur cette commande. Par exemple, si la commande est un « curry épicé », le routeur pourrait réveiller l'« Expert Épices » et l'« Expert Curry », tandis que l'« Expert Dessert » et l'« Expert Pain » restent endormis.

Ceci est déjà efficace car la cuisine ne fait pas fonctionner les 100 chefs pour chaque commande. Cependant, les chercheurs de ce papier ont posé une nouvelle question : « Même lorsqu'un chef est éveillé et travaille, utilise-t-il toute son énergie ? »

Ils ont découvert que même les chefs « éveillés » passent la plupart de leur temps à ne rien faire. Ils ont constaté que, au sein d'un seul expert, jusqu'à 90 % des neurones (les cellules cérébrales individuelles de l'IA) sont effectivement « endormis » ou produisent une sortie nulle pour une entrée donnée.

Le Problème : Pourquoi Nous Ne Pouvons Pas Simplement Ajouter Plus de Chefs

Auparavant, pour rendre l'IA plus rapide, les chercheurs tentaient de rendre la cuisine plus efficace en ajoutant plus de chefs et en réveillant moins d'entre eux (augmentant la « parcimonie inter-experts »). Mais cela devient très difficile.

  • La Lutte de l'Entraînement : Si vous avez trop de chefs et que vous n'en réveillez que quelques-uns, la cuisine devient chaotique. Certains chefs reçoivent tout le travail (déséquilibre de charge), tandis que d'autres ne sont jamais entraînés et deviennent inutiles (effondrement de l'expert).
  • La Limite : Nous atteignons un mur où nous ne pouvons plus facilement rendre la sélection « qui travaille » plus efficace sans casser le modèle.

La Solution : La Stratégie du « Chef Paresseux »

Au lieu d'essayer de choisir moins de chefs, les auteurs ont décidé de rendre les chefs individuels plus efficaces. Ils ont réalisé que même lorsqu'un chef travaille, il n'a pas besoin d'utiliser chaque outil de sa boîte à outils.

L'Analogie :
Imaginez un maître menuisier (un Expert) construisant une chaise.

  • Ancienne Méthode : Le menuisier attrape chaque marteau, scie et tournevis dans le hangar, même s'il n'a besoin que d'un marteau et d'un tournevis. Il transporte tout le hangar sur le chantier.
  • Nouvelle Méthode (Ce Papier) : Le menuisier examine le travail, réalise qu'il n'a besoin que du marteau et du tournevis, et laisse la scie et les 90 % restants des outils dans le hangar. Il ne transporte que ce dont il a besoin.

Les chercheurs ont constaté que, dans les modèles d'IA préentraînés existants (comme Qwen, Llama et DeepSeek), ce comportement « paresseux » se produit déjà naturellement. Les mathématiques à l'intérieur du modèle annulent naturellement la majeure partie du travail. Ils avaient simplement besoin d'enseigner à l'ordinateur de sauter ce travail gaspillé.

Comment Ils L'Ont Fait : Le Système de « Liste de Sauts »

L'équipe a pris un moteur d'IA populaire et haute vitesse appelé vLLM (pensez-y comme au service de livraison qui apporte la nourriture de la cuisine au client) et l'a amélioré.

  1. La Vérification : Avant que le « chef » ne commence à cuisiner, le système vérifie rapidement quels outils (neurones) sont réellement nécessaires.
  2. Le Saut : Si un outil n'est pas nécessaire (sa valeur est trop faible), le système ne le charge même pas dans la mémoire ni n'essaie de l'utiliser. Il saute littéralement le calcul.
  3. Le Résultat : Ils ont construit une « voie rapide » spéciale dans le logiciel. Si le lot de commandes est petit (comme une pause déjeuner calme), le système utilise cette voie rapide et évite les efforts lourds. Si la cuisine est très occupée (une énorme ruée du dîner), il revient au mode standard et robuste pour maintenir la stabilité.

Ce Qu'ils Ont Découvert (Les Résultats)

Ils ont testé cela sur huit grands modèles d'IA différents, allant des petits (1 milliard de paramètres) aux massifs (400 milliards de paramètres).

  • Précision : Ils pouvaient sauter jusqu'à 90 % du travail à l'intérieur d'un expert et l'IA donnait encore les bonnes réponses 95 % du temps. C'était comme sauter 90 % des ingrédients d'une recette et que le plat ait toujours un goût 95 % aussi bon.
  • Vitesse :
    • Pour la partie spécifique de « cuisson » de l'IA (la couche MoE), ils ont observé des accélérations allant jusqu'à 2,5 fois.
    • Pour l'ensemble du système (de bout en bout), ils ont observé une accélération de 1,2 fois.
  • Matériel : L'accélération était la plus spectaculaire sur les cartes graphiques plus petites et moins puissantes (comme une carte de jeu grand public), prouvant que c'est un excellent moyen d'exécuter de grands modèles d'IA sur du matériel moins cher.

Le Bémol (Limitations)

Le papier est honnête sur les limites :

  • Le Gardien : Le système doit toujours vérifier quels outils sont nécessaires avant de pouvoir les sauter. Cette « vérification » prend du temps et ne peut pas encore être sautée. C'est comme un manager qui doit toujours faire le tour de la cuisine pour dire aux chefs quels outils attraper, même si les chefs n'utilisent pas tous ces outils.
  • Taille du Lot : L'accélération est optimale lorsque l'IA traite quelques demandes à la fois. Si vous traitez des milliers de demandes simultanément, la surcharge de « vérification » devient un goulot d'étranglement et l'accélération diminue.

Résumé

Ce papier n'a pas inventé un nouveau type d'IA ni entraîné un nouveau modèle à partir de zéro. Au lieu de cela, ils ont examiné des modèles d'IA existants et puissants et ont réalisé : « Hé, ces modèles font déjà beaucoup de travail inutile, même lorsqu'ils sont 'actifs'. »

En construisant un système qui reconnaît cet effort gaspillé et le saute simplement, ils ont rendu ces modèles d'IA massifs beaucoup plus rapides et plus efficaces, en particulier sur du matériel qui n'est pas extrêmement cher. C'est une technique de « saut intelligent » qui rend la génération actuelle de modèles d'IA plus pratique à exécuter.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →