MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum
Cet article présente MoganBert-TR, un modèle de fondation encodeur turc de 149 millions de paramètres entraîné à partir de zéro en utilisant un nouveau curriculum CLM-vers-MLM et une planification spécialisée pour les contextes longs, qui atteint des performances de pointe sur les benchmarks de TAL en turc et produit un modèle d'embedding hautement efficace atteignant 99,5 % du score de son modèle enseignant de 7,57 milliards de paramètres.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le vaste paysage de l'intelligence artificielle, il existe deux manières principales pour les ordinateurs d'apprendre à comprendre le langage humain. Une approche, souvent citée dans les actualités, implique des modèles qui génèrent du texte, écrivant des histoires ou répondant à des questions de toutes pièces. L'autre approche, plus discrète mais tout aussi vitale, utilise des modèles qui agissent comme de puissants moteurs de recherche et des classificateurs. Ces modèles « encodeurs » lisent une phrase et la transforment en un résumé mathématique compact, permettant aux ordinateurs de comparer des idées, de trouver des documents pertinents ou de trier des informations avec une vitesse incroyable. Pendant des années, la méthode standard pour enseigner ces modèles a été un type spécifique de jeu de devinettes : l'ordinateur voit une phrase où certains mots sont cachés et doit prédire les parties manquantes. Cette méthode, connue sous le nom de modélisation de langage masqué, a bien fonctionné, mais les chercheurs se demandaient depuis longtemps s'il n'existait pas un meilleur moyen d'enseigner à la machine la structure d'une langue, en particulier pour des langues complexes et riches en formes de mots, comme le turc.
Une équipe de chercheurs a maintenant construit un nouveau fondement pour la compréhension de la langue turque, démontrant que la manière dont un modèle est enseigné importe tout autant que l'architecture sur laquelle il est construit. Ils ont créé un modèle appelé MoganBert-TR, entraîné de fond en comble sur une collection massive de textes turcs. Au lieu de s'en tenir au traditionnel jeu de devinettes, ils ont introduit un programme d'apprentissage en deux étapes. D'abord, le modèle a appris à lire du texte de gauche à droite, prédisant le mot suivant dans une séquence, tout comme un humain lisant un livre. Ce n'est qu'après cette phase initiale qu'ils sont passés à la méthode traditionnelle consistant à cacher des mots et à demander au modèle de les remplir. Ce changement de stratégie d'enseignement, combiné à un ensemble de données soigneusement nettoyé et à une nouvelle façon de gérer les phrases longues, a donné un modèle qui comprend mieux le turc que les versions précédentes, particulièrement lorsqu'il s'agit de trouver des informations pertinentes dans de grandes bases de données.
Les chercheurs ont commencé par rassembler une quantité massive de textes provenant d'Internet, incluant des pages web récentes et des archives plus anciennes, mais ils n'ont pas simplement déversé ces données dans le système d'entraînement. Ils ont construit un pipeline sophistiqué pour filtrer le contenu de faible qualité, tel que le spam ou les publicités répétitives, et pour s'assurer que le texte était réellement utile. Comme il n'existait aucun outil existant pour juger automatiquement la qualité du texte turc, ils ont entraîné un modèle plus petit et spécialisé pour agir comme un enseignant, qui a ensuite enseigné à un système plus rapide comment prendre les mêmes jugements de qualité. Cela leur a permis de traiter des millions de documents efficacement, en ne conservant que le matériel de haute qualité. Ils ont également créé un nouveau dictionnaire pour le modèle, un dictionnaire qui décompose les mots turcs en morceaux plus petits plus efficacement que les tentatives précédentes, ce qui est crucial car les mots turcs peuvent changer de forme de manière significative selon leur rôle dans une phrase.
Le cœur de leur découverte réside dans l'ordre des opérations pendant l'entraînement. Ils ont testé si le fait de commencer par la méthode de prédiction de gauche à droite avant de passer à la méthode de masquage de mots faisait une différence. Dans une expérience contrôlée utilisant la même puissance de calcul et les mêmes données, la nouvelle approche en deux étapes a largement surpassé la méthode traditionnelle lorsqu'il s'agissait de récupérer des informations. Bien que les deux méthodes aient performé de manière similaire sur des tâches de classification simples, la nouvelle approche était près de quatre fois meilleure pour trouver des documents pertinents lors d'un test de recherche. Les chercheurs ont découvert que la méthode traditionnelle provoquait un effondrement des représentations internes du modèle vers une forme étroite et peu utile, où tous les sens semblaient trop similaires. Le nouveau programme a empêché cet effondrement, permettant au modèle de conserver une vue plus large et plus distincte du sens du langage.
Pour affiner davantage le modèle, les chercheurs ont expérimenté la manière dont l'ordinateur apprenait lors des phases finales de l'entraînement. Ils ont divisé le processus en deux voies : une où le modèle continuait d'apprendre avec des phrases courtes, et une autre où il apprenait avec des phrases beaucoup plus longues. En comparant les résultats de ces deux voies, ils ont trouvé que terminer l'entraînement avec des phrases courtes améliorait en réalité la performance globale du modèle plus que de terminer avec des phrases longues. Cette découverte était surprenante, car l'on suppose souvent que les contextes longs sont meilleurs. Ils ont également testé une technique appelée « model soup » (soupe de modèles), où ils faisaient la moyenne des poids de différents modèles entraînés ensemble, espérant obtenir le meilleur des deux mondes. Cependant, leur méthode de branchement simple, qui ne coûtait qu'une fraction infime de plus à exécuter, a produit un meilleur résultat que la technique complexe de moyennage.
Le produit final, MoganBert-TR, a obtenu le score le plus élevé parmi les modèles turcs basés sur l'architecture moderne utilisée dans cette étude. Il a performé exceptionnellement bien sur des tâches impliquant la récupération de code, trouvant les bons extraits de code de programmation à partir de descriptions en langage naturel, une tâche où il a nettement surpassé les modèles plus anciens. Ce succès a été attribué à la combinaison de leur nouveau dictionnaire, qui préserve l'espacement et la structure du code, et à l'inclusion délibérée d'une grande quantité de textes de programmation dans les données d'entraînement. L'équipe a également créé un modèle compagnon conçu spécifiquement pour créer des résumés de texte propices à la recherche. En apprenant à ce modèle plus petit à imiter un enseignant beaucoup plus grand et plus puissant, ils ont obtenu un résultat presque aussi bon que le géant enseignant, tout en nécessitant cinquante et un fois moins de puissance de calcul pour fonctionner.
Ce travail souligne que pour des langues comme le turc, mettre à jour la structure d'un modèle ne suffit pas ; la méthode d'entraînement elle-même doit être repensée. Les chercheurs ont démontré qu'un programme en deux étapes, commençant par la prédiction séquentielle et passant au masquage de mots, crée une compréhension plus robuste de la langue. Ils ont également démontré que les phases finales de l'entraînement constituent un espace de conception critique où de petits changements, comme la longueur du texte traité, peuvent avoir un impact mesurable sur la performance. Bien que le modèle présente encore certaines faiblesses dans des domaines spécifiques, comme la compréhension de la structure des phrases dans certains tests grammaticaux, il représente une avancée significative. L'équipe a rendu son modèle, son dictionnaire et le code utilisé pour le construire accessibles au public, permettant ainsi à d'autres de bâtir sur cette fondation pour la technologie du langage turc.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.