Mellum2 Technical Report
Mellum 2 est un modèle de langage à poids ouverts, doté de 12 milliards de paramètres et d'une architecture Mixture-of-Experts avec 2,5 milliards de paramètres actifs par jeton, spécialisé dans le génie logiciel et les tâches agentiques, qui atteint des performances compétitives face à des modèles plus grands grâce à des innovations architecturales telles que la prédiction multi-jetons et un curriculum d'entraînement en trois phases s'étendant sur 10,6 billions de jetons.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de construire un assistant de codage super intelligent qui vit à l'intérieur de votre ordinateur. Le défi est que vous voulez qu'il soit incroyablement intelligent (comme un ingénieur senior) mais aussi incroyablement rapide et peu coûteux à exploiter (comme un ordinateur de bureau standard). Habituellement, vous devez choisir entre l'un ou l'autre : la version « intelligente » est énorme et lente, ou la version « rapide » est trop simple pour gérer des problèmes difficiles.
L'équipe de JetBrains a conçu Mellum 2 pour résoudre exactement ce problème. Voici comment ils ont fait, expliqué simplement :
1. Le cerveau « Couteau Suisse » (L'architecture)
La plupart des modèles d'IA sont comme une seule et immense cellule cérébrale qui fait tout. Mellum 2 est différent. Il est construit comme un Mélange d'Experts (Mixture-of-Experts - MoE).
- L'analogie : Imaginez une immense bibliothèque avec 64 bibliothécaires spécialisés différents. Lorsque vous posez une question, le modèle ne réveille pas les 64 bibliothécaires. À la place, il possède un gestionnaire intelligent qui choisit seulement les 8 bibliothécaires les plus pertinents pour votre question spécifique.
- Le résultat : Le modèle possède la connaissance totale d'un cerveau « géant » de 12 milliards de paramètres, mais pour chaque mot qu'il écrit, il ne « réfléchit » qu'avec la puissance d'un cerveau de 2,5 milliards de paramètres. Cela le rend assez rapide pour fonctionner sur du matériel standard tout en restant très intelligent.
2. Les astuces de la « Fenêtre Glissante » et du « Brouillon »
Pour le rendre encore plus rapide, ils ont ajouté deux raccourcis ingénieux :
- Fenêtre Glissante : Au lieu d'essayer de se souvenir de chaque mot que vous avez tapé dans une conversation (ce qui devient lent), le modèle se concentre sur les 1 024 derniers mots comme une fenêtre glissante sur un train. Il garde le contexte récent net tout en laissant les détails plus anciens s'estomper, ce qui économise énormément d'énergie.
- L'assistant de « Brouillon » : Le modèle possède un petit assistant de « brouillon » intégré. Avant de s'engager dans l'écriture d'une réponse finale, ce petit assistant devine les quelques mots suivants. Si la supposition est correcte, le modèle principal saute le travail et l'accepte simplement. C'est comme un écrivain ayant un ami qui murmure la phrase suivante pour qu'il puisse taper plus vite.
3. Le cursus scolaire en « Trois Phases »
Ils n'ont pas simplement nourri le modèle de données aléatoires. Ils l'ont enseigné en trois étapes spécifiques, comme un programme scolaire :
- Phase 1 (Le Généraliste) : Ils ont commencé avec un mélange massif de données générales issues d'Internet (70 %) et de code (23 %). Cela a donné au modèle une compréhension large de la façon dont les humains parlent et écrivent.
- Phase 2 (Le Spécialiste) : Ils ont modifié le mélange pour inclure plus de code de haute qualité (42 %) et des mathématiques. C'est là que le modèle a commencé à apprendre les règles spécifiques de la programmation.
- Phase 3 (Le Maître) : Dans la phase finale, le mélange était presque entièrement composé de code et de mathématiques (59 % de code). C'est le « camp d'entraînement » où le modèle a affiné ses compétences pour devenir un expert en codage.
4. Deux personnalités : « Instruct » et « Thinking »
À partir du même cerveau entraîné, ils ont sorti deux versions du modèle :
- Le modèle « Instruct » : C'est l'ouvrier direct. Vous posez une question, et il donne la réponse immédiatement. Il est idéal pour les tâches rapides.
- Le modèle « Thinking » : C'est le penseur profond. Avant de donner une réponse, il écrit une « trace de raisonnement » — une explication étape par étape de la façon dont il a résolu le problème. C'est comme un élève qui montre son raisonnement lors d'un examen de mathématiques. L'article de recherche a révélé que ce mode de « réflexion » rend le modèle bien meilleur pour résoudre des énigmes logiques difficiles et des défis de codage complexes.
5. La « Preuve » (Tests)
Ils ont testé Mellum 2 contre d'autres modèles populaires.
- Vitesse : Il fonctionne aussi vite qu'un modèle de 7 milliards de paramètres (qui est beaucoup plus petit que sa taille totale de 12 milliards) mais il est plus intelligent que de nombreux modèles de sa taille.
- Codage : Il excelle dans l'écriture de code, le débogage et l'utilisation d'outils (comme la recherche sur le Web ou l'exécution de commandes).
- Le compromis : Parce qu'ils se sont concentrés intensément sur l'expertise en codage, il est légèrement moins cultivé sur les faits généraux du monde (comme l'histoire ou la biologie) par rapport aux modèles entraînés pour être des chatbots généralistes. Cependant, pour sa mission — aider les développeurs — il est un acteur de premier plan.
Résumé
Mellum 2 est un assistant de codage spécialisé qui utilise une architecture de « équipe d'experts » pour être à la fois intelligent et rapide. Il a été entraîné via un curriculum soigneusement conçu pour maîtriser le code et les mathématiques, et il existe en deux versions : une pour les réponses rapides et une pour le raisonnement profond, étape par étape. L'équipe a publié le modèle gratuitement pour que quiconque puisse l'utiliser pour créer de meilleurs logiciels.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.