Predatory MoE: Serving Mixture-of-Experts with a Sequence-Local Expert Roster
Cet article propose une stratégie de liste d'experts locale à la séquence qui fixe un petit ensemble d'experts par séquence afin de réduire considérablement l'empreinte mémoire et les transferts d'experts lors du service de modèles MoE, atteignant un débit proche de la résidence complète avec nettement moins de poids résidents en appliant cette contrainte de manière cohérente pendant l'entraînement et l'inférence.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les systèmes d'intelligence artificielle modernes qui génèrent du texte reposent souvent sur une conception appelée « mélange d'experts » (mixture of experts). Imaginez une vaste bibliothèque de travailleurs spécialisés possédant des connaissances pointues, où chaque travailleur est un expert dans un sujet précis et étroit. Lorsqu'un système doit répondre à une question, il n'active pas tous les travailleurs à la fois. Au lieu de cela, il sélectionne seulement une petite poignée des experts les plus pertinents pour ce moment précis. Cette approche permet au système d'être incroyablement vaste et capable tout en utilisant relativement peu de puissance de calcul pour chaque mot produit. Cependant, il existe un goulot d'étranglement important dans la manière dont ces systèmes sont exécutés sur des ordinateurs standards. Même si seuls quelques experts sont utilisés à un instant donné, la mémoire de l'ordinateur doit contenir l'intégralité de la bibliothèque d'experts, prête à l'emploi, car le système ne sait pas à l'avance lesquels seront nécessaires ensuite. Cette exigence force la taille totale de la mémoire à correspondre à la taille de la bibliothèque entière, plutôt qu'au petit groupe utilisé, ce qui rend difficile l'exécution de ces modèles puissants sur des appareils dotés d'une mémoire limitée.
Des chercheurs ont tenté de résoudre ce problème en stockant les experts inutilisés sur un disque dur et en les chargeant en mémoire uniquement lorsqu'ils sont nécessaires. Mais cela crée un nouveau problème : comme le système choisit les experts de manière éparpillée et imprévisible, il se retrouve à devoir récupérer constamment de nouveaux experts, ce qui ralentit le processus. Une équipe dirigée par le chercheur indépendant ChaeWoo Son a posé une question différente : au lieu d'essayer de rendre l'ordinateur plus rapide pour récupérer des experts dispersés, pourraient-ils modifier le système pour qu'il s'en tienne naturellement à un petit groupe constant d'experts pour la durée d'une seule conversation ? Ils voulaient voir s'ils pouvaient entraîner le système pour qu'il devienne « local à la séquence », signifiant qu'une fois qu'une conversation commence, la même petite équipe d'experts gère l'intégralité du fil de discussion, permettant à l'ordinateur de ne garder que cette équipe en mémoire.
Les chercheurs ont d'abord tenté d'enseigner ce comportement directement au système. Ils ont essayé d'entraîner le modèle à favoriser les experts qu'il avait déjà utilisés dans la conversation actuelle, espérant que cette habitude deviendrait une partie permanente de son intelligence. Ils ont constaté que si cette astuce fonctionnait pendant l'entraînement, le comportement ne persistait pas. Dès que la pression de l'entraînement était levée, le système revenait à ses anciennes habitudes éparpillées. Même lorsqu'ils ont tenté de renforcer ce comportement en faisant en sorte que le système apprenne de ses propres choix biaisés, le processus est devenu instable et la qualité du texte en a souffert. L'étude a conclu que le système n'apprenait pas une nouvelle compétence, mais réagissait simplement à une règle temporaire. Les chercheurs ont réalisé que tenter de forcer le système à intérioriser ce comportement était la mauvaise approche.
Au lieu de chercher à changer le cerveau du système, les chercheurs ont décidé de changer les règles du jeu. Ils ont imposé une règle stricte et permanente qui s'appliquait aussi bien pendant l'entraînement que lors de l'utilisation réelle du système. Sous cette nouvelle règle, chaque conversation se voit assigner une petite équipe fixe d'experts basée sur les premiers mots du texte. Une fois cette équipe sélectionnée, le système n'est pas autorisé à passer à quelqu'un d'autre pour le reste de la conversation. Cette règle agit comme un budget : l'ordinateur n'a besoin de garder que cette petite équipe spécifique dans sa mémoire rapide, tandis que le reste de la bibliothèque peut rester sur le support de stockage plus lent. Comme l'équipe est fixe pour toute la conversation, l'ordinateur n'a pas besoin de permuter constamment les experts.
Les résultats de cette approche ont été frappants. Lorsque les chercheurs ont appliqué cette règle à un modèle de test et lui ont accordé une courte période de réentraînement pour s'adapter aux nouvelles contraintes, le système a performé presque aussi bien qu'en l'absence de la règle, mais avec une réduction massive de l'utilisation de la mémoire. Dans leurs tests, ils ont pu ne conserver qu'un quart du total des experts en mémoire et atteindre presque la même vitesse que s'ils avaient conservé tous les experts. Le système a réduit le nombre de fois où il devait récupérer des données sur le support de stockage lent d'un facteur trente-deux par rapport à l'ancienne méthode. Bien que la qualité du texte ait légèrement chuté — d'environ cinq pour cent dans le scénario de réduction de mémoire le plus extrême — ce compromis a permis au modèle de fonctionner sur du matériel beaucoup plus petit et plus accessible.
L'étude a également révélé une intuition inattendue sur la manière dont ces systèmes apprennent. Les chercheurs ont découvert que plus un modèle est entraîné sans ces contraintes de mémoire, plus il devient difficile de le forcer à adopter ce schéma efficace par la suite. La tendance naturelle du système à disperser son attention semble se renforcer avec le temps, rendant l'adaptation aux limites de mémoire plus coûteuse après coup. Cela suggère que si nous voulons que ces modèles soient efficaces sur les appareils du quotidien, nous devrons peut-être leur apprendre à être efficaces dès le début, plutôt que d'essayer de corriger le problème après qu'ils aient déjà appris à être éparpillés.
Ce travail ne prétend pas avoir résolu le problème pour toutes les situations possibles, et les chercheurs ont pris soin de noter que leurs tests ont été effectués sur des données synthétiques et des modèles plus petits. Ils ont observé que si une conversation change brusquement de sujet au milieu, l'équipe d'experts fixe pourrait éprouver des difficultés, bien que leurs tests aient montré que même avec un changement de sujet, le système pouvait s'adapter avec une légère pénalité de qualité. L'étude sert de preuve de concept montrant qu'en traitant la contrainte de mémoire comme une règle plutôt que comme un objectif d'apprentissage, nous pouvons rendre ces modèles massifs beaucoup plus pratiques à utiliser. Cela déplace l'attention de la construction de matériel plus rapide vers la conception de règles plus intelligentes pour l'utilisation des ressources du système, ouvrant la voie à une intelligence artificielle puissante capable de fonctionner sur des appareils qui sont actuellement trop petits pour la contenir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.