← Derniers articles
💬 NLP

Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings

Le document présente Giga-Embeddings, une famille de modèles d'encodage de texte dotée d'un encodeur de type Mixture-of-Experts creux de 10 milliards de paramètres qui atteint une qualité de recherche de pointe et un débit élevé sur plusieurs langues, aux côtés de variantes denses et distillées plus petites optimisées pour les environnements à ressources limitées.

Auteurs originaux : Egor Kolodin, Egor Krasnoperov, Evgeniy Kosarev, Fyodor Minkin

Publié 2026-08-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Egor Kolodin, Egor Krasnoperov, Evgeniy Kosarev, Fyodor Minkin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde numérique, les ordinateurs ne comprennent pas les mots de la même manière que les humains. Pour une machine, une phrase n'est qu'une longue chaîne de symboles. Pour donner du sens au texte, les chercheurs ont développé une méthode consistant à transformer les mots en listes de nombres, appelées plongements lexicaux (embeddings). Considérez ces listes comme une adresse unique pour chaque morceau de texte, le plaçant dans un vaste espace multidimensionnel où les idées similaires sont proches et les idées différentes sont éloignées. Ce système alimente les outils que nous utilisons quotidiennement, des moteurs de recherche qui trouvent le bon document à l'intelligence artificielle qui répond aux questions en se basant sur une bibliothèque de textes. Cependant, il existe une tension constante dans ce domaine : plus le système est complexe, mieux il comprend généralement le langage, mais plus il nécessite de puissance de calcul et de mémoire pour fonctionner. Rendre ces systèmes plus rapides et moins coûteux sans perdre leur intelligence a été un défi majeur pour les scientifiques.

Une équipe de chercheurs a introduit une nouvelle famille de modèles de plongement de texte appelée Giga-Embeddings, conçue pour résoudre ce problème en équilibrant haute qualité et haute vitesse. Leur création la plus ambitieuse est un modèle massif contenant dix milliards de paramètres, qui est une mesure de sa complexité interne. Au lieu d'utiliser l'ensemble des dix milliards de paramètres pour traiter chaque mot, ce modèle utilise une technique appelée mélange d'experts (mixture of experts). Imaginez une grande bibliothèque où, pour chaque livre demandé par un client, seule une petite équipe spécifique de bibliothécaires est appelée pour aider, tandis que le reste du personnel reste en attente. Dans ce modèle informatique, environ 1,8 milliard de paramètres sont activés pour chaque mot, tandis que les dix milliards complets restent disponibles en mémoire. Cela permet au système de porter la connaissance d'un cerveau immense tout en n'effectuant le travail que d'un cerveau plus petit à un instant donné.

Les chercheurs ont testé ce grand modèle par rapport à plusieurs autres, y compris un modèle dense standard de trois milliards de paramètres et une version distillée plus petite de 480 millions de paramètres. Ils ont évalué les systèmes sur un large éventail de tâches impliquant l'anglais, le russe, le texte multilingue et le code informatique. Les résultats ont montré que le grand modèle parcimonieux (sparse) a obtenu la meilleure performance globale dans toutes ces catégories. Il comprenait non seulement mieux le texte que les modèles plus petits, mais il traitait également l'information plus rapidement. En mesurant le nombre de mots que le système pouvait traiter par seconde, le modèle de dix milliards de paramètres était 25 % plus rapide que le modèle de trois milliards de paramètres et nettement plus rapide que les autres systèmes avancés testés dans le même environnement. Cela prouve qu'il est possible de construire un système qui soit à la fois incroyablement vaste dans sa capacité et hautement efficace dans son fonctionnement.

Pour rendre ces outils puissants accessibles aux appareils disposant de moins de puissance de calcul, l'équipe a également créé une version beaucoup plus petite du modèle. Ils ont utilisé une méthode appelée distillation de distribution de similitude pour enseigner à ce modèle compact. Au lieu d'essayer de copier les nombres internes exacts du grand modèle enseignant, le petit modèle a appris à imiter les jugements finaux du grand modèle concernant la similitude entre différents morceaux de texte. Cela a permis au petit modèle, qui ne possède que 480 millions de paramètres, d'être presque aussi performant que le modèle beaucoup plus grand de trois milliards de paramètres. Lors de tests sur le texte russe, le petit modèle a obtenu un score légèrement supérieur à celui d'un concurrent bien connu qui est presque deux fois plus grand que lui, démontant qu'un système plus petit peut être très efficace s'il est enseigné de la bonne manière.

L'équipe a rendu publiques les trois versions de ses modèles, permettant ainsi à d'autres de les utiliser pour diverses applications. Ils ont constaté que le grand modèle parcimonieux était particulièrement efficace pour gérer les textes longs, maintenant sa vitesse même lorsque l'entrée devenait plus longue. Bien que les modèles plus petits nécessitent moins de mémoire pour le stockage, le grand modèle offrait la meilleure combinaison de vitesse et de précision pour les tâches lourdes. Les chercheurs ont noté que leurs mesures ont été prises dans un environnement de test spécifique, la performance en conditions réelles pouvant varier légèrement selon le matériel utilisé. Néanmoins, ce travail démontre une voie claire pour l'avenir : en utilisant des choix architecturaux intelligents et des méthodes d'enseignement méticuleuses, il est possible de créer des systèmes de compréhension de texte qui soient à la fois assez puissants pour gérer des tâches complexes et assez efficaces pour fonctionner rapidement sur les ordinateurs modernes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →