← Derniers articles
💬 NLP

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

Cet article introduit l'Expert Tying, une méthode qui partage les paramètres d'experts entre des couches transformer consécutives dans les modèles Mixture-of-Experts afin de réduire de près de moitié les besoins en mémoire avec un impact négligeable sur la performance, améliorant ainsi considérablement le compromis calcul-mémoire pour l'entraînement et la mise à l'échelle des grands modèles de langage.

Auteurs originaux : Martin Jaggi

Publié 2026-06-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Martin Jaggi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le gros problème : La « bibliothèque géante » vs le « petit lecteur »

Imaginez que vous construisez un robot bibliothécaire géant et super intelligent (un grand modèle de langage ou LLM) pour aider les gens à écrire des histoires ou à résoudre des problèmes.

Pour rendre ce bibliothécaire incroyablement intelligent, vous lui donnez accès à une bibliothèque massive contenant des milliards de livres (ce sont les « paramètres » ou les « experts »). Cependant, pour que le bibliothécaire reste rapide et efficace, vous décidez que pour chaque phrase qu'il lit, il n'ouvrira qu'un ou deux livres spécifiques pour trouver la réponse. C'est ce qu'on appelle un modèle de « Mélange d'Experts » (Mixture-of-Experts ou MoE).

Le piège : Même si le bibliothécaire ne lit qu'une infime fraction des livres à un instant donné, vous devez quand même garder toute la bibliothèque physiquement présente dans la pièce (dans la mémoire de l'ordinateur). Si la bibliothèque contient 1 000 livres mais que le bibliothécaire n'en ouvre que 10 à la fois, vous avez toujours besoin d'une pièce assez grande pour contenir les 1 000 livres. Cela rend le système très coûteux et lent car la « pièce » (la mémoire) est immense, même si la « lecture » (le calcul) est petite.

La solution : « Tying the Loop » (Nouer la boucle)

Les auteurs proposent une astuce ingénieuse appelée Expert Tying (Liaison d'experts).

Imaginez que le bibliothécaire travaille dans un long couloir avec 32 pièces (couches/layers). Dans une configuration standard, chaque pièce possède son propre ensemble unique de 1 000 livres.

  • Ancienne méthode : La pièce 1 a les livres A à Z. La pièce 2 a les livres A à Z (mais une copie différente). La pièce 3 a les livres A à Z (une autre copie). Vous avez besoin de 32 ensembles de livres.
  • Nouvelle méthode (Expert Tying) : Vous réalisez que les livres de la pièce 1, de la pièce 2 et de la pièce 3 font en réalité un travail très similaire. Vous allez donc les lier ensemble. Vous placez un seul ensemble de livres sur un chariot roulant qui passe de la pièce 1 à la pièce 2, puis à la pièce 3. Le bibliothécaire utilise les mêmes livres physiques dans les trois pièces.

Le résultat : Vous n'avez plus besoin de 32 ensembles de livres ; vous n'avez besoin que d'un seul ensemble pour toutes les 3 pièces. Cela réduit la taille de la « bibliothèque » (la mémoire) de près de moitié, mais le bibliothécaire lit toujours aussi vite car il n'ouvre toujours qu'un seul livre à la fois.

La recette secrète : Ce qu'il faut lier et ce qu'il faut garder séparé

Les chercheurs n'ont pas simplement tout lié aveuglément. Ils ont mené des expériences pour déterminer exactement ce qui pouvait être partagé sans rendre le bibliothécaire stupide.

Considérez une pièce de la bibliothèque comme ayant quatre parties :

  1. Les Livres (Experts) : Le savoir réel.
  2. Les Lunettes du Bibliothécaire (Attention) : Sa façon de regarder les mots.
  3. La Fiche Index (Routeur) : Quel livre choisir.
  4. Le Bureau (Normalisation) : Sa façon d'organiser ses notes.

La découverte :

  • Partager les livres, c'est possible : Vous pouvez partager les mêmes livres à travers plusieurs pièces. Le bibliothécaire peut toujours faire un excellent travail parce que les Lunettes (Attention) sont différentes dans chaque pièce. Les lunettes changent la façon dont le bibliothécaire regarde les mots, ce qui rend chaque pièce unique même si les livres sont les mêmes.
  • Ne pas partager les lunettes : Si vous partagez aussi les lunettes, le bibliothécaire s'embrouille et la qualité chute.
  • La règle du « Prélude et du Coda » : La toute première pièce (où le bibliothécaire prend le livre) et la toute dernière pièce (où il écrit la réponse) ont besoin de leurs propres livres uniques. Si vous forcez le bibliothécaire à utiliser le chariot partagé pour le début et la fin, la qualité en pâtit. Ainsi, gardez les deux premières et les deux dernières pièces uniques, et liez les pièces du milieu.

Les résultats : Plus rapide, plus petit et tout aussi intelligent

L'article a testé cette méthode sur trois modèles d'IA célèbres (OLMoE, Qwen3 et DeepSeek). Voici ce qui s'est passé :

  1. Économies de mémoire : En liant les experts par groupes de 4, ils ont réduit la mémoire totale nécessaire de 40 % à 50 %. C'est comme réduire la taille de la bibliothèque de moitié.
  2. Pas de perte d'intelligence : La « l'intelligence » (perplexité et précision) a très peu chuté. C'était presque aussi bon que le modèle original, qui est beaucoup plus gros.
  3. Gain de vitesse : Comme l'ordinateur n'avait pas besoin de charger autant de livres en mémoire, le processus d'entraînement a été 23 % plus rapide.
  4. L'astuce du « Réinvestissement » : Puisqu'ils ont économisé tellement d'espace en partageant les livres, ils ont utilisé cet espace économisé pour ajouter plus de livres sur le chariot partagé. Cela a créé un modèle qui est en fait meilleur que l'original, même s'il utilise la même quantité totale de mémoire.

Analogie de synthèse

Imaginez une équipe de construction construisant un gratte-ciel.

  • Ancienne méthode : Chaque étage possède sa propre boîte à outils complète et unique. Le camion transportant toutes les boîtes à outils est énorme et coûteux.
  • Nouvelle méthode (Tying the Loop) : Les étages 3 à 28 partagent tous la même boîte à outils qui est montée par l'ascenseur. Les étages 1, 2, 29 et 30 gardent leurs propres boîtes à outils spéciales.
  • Résultat : Le camion est maintenant deux fois plus petit (gain d'argent et d'espace), l'équipe se déplace plus vite car elle ne transporte pas de poids supplémentaire, et le bâtiment est tout aussi solide. En fait, parce qu'ils ont économisé de l'argent sur le camion, ils ont acheté de meilleurs outils pour la boîte à outils partagée, rendant le bâtiment encore plus solide.

L'essentiel : Vous pouvez rendre les modèles d'IA beaucoup plus petits et rapides en réutilisant le même « savoir » à travers plusieurs couches du modèle, tant que vous gardez les « lunettes » (attention) uniques pour chaque couche et que vous laissez les toutes premières et toutes dernières couches intactes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →