Sumi: Open Uniform Diffusion Language Model from Scratch
Le document présente Sumi, un modèle de langage de diffusion uniforme de 7B entièrement ouvert, préentraîné de zéro sur 1,5 billion de jetons, qui sert de premier point de référence à grande échelle pour l'étude de la diffusion uniforme native et démontre des performances compétitives sur les tests de connaissances, de raisonnement et de codage.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : Une nouvelle façon d'écrire avec l'IA
Imaginez que vous essayez d'écrire une histoire.
- L'ancienne méthode (Modèles autorégressifs) : C'est comme écrire avec un stylo sur du papier. Vous écrivez un mot, puis le suivant, puis le suivant. Une fois que vous avez écrit un mot, c'est fait. Si vous faites une erreur, vous devez raturer ou recommencer toute la page. Vous ne pouvez pas revenir en arrière pour changer le premier mot sans réécrire tout ce qui suit.
- La nouvelle méthode (Sumi / Diffusion uniforme) : Imaginez que vous peignez un tableau sur une toile déjà recouverte de bruit statique (comme de la neige sur une vieille télévision). Au lieu d'écrire mot par mot, vous regardez l'ensemble de la toile d'un coup. Vous pouvez choisir n'importe quel mot dans la phrase, l'effacer et le remplacer par un meilleur. Vous pouvez faire cela encore et encore, en affinant toute l'histoire simultanément jusqu'à ce qu'elle soit parfaite.
L'article présente Sumi (qui signifie « encre » en japonais), un modèle d'IA de 7 milliards de paramètres qui utilise cette méthode de « peinture ». C'est la première fois que quelqu'un construit un modèle de cette taille de zéro en utilisant cette technique spécifique, plutôt que de simplement ajuster un ancien modèle de « l'écriture au stylo ».
Comment ils l'ont construit : L'analogie de l'école
Pour entraîner Sumi, les chercheurs n'ont pas simplement déversé des textes aléatoires provenant d'Internet. Ils ont élaboré un « programme scolaire » très spécifique.
- Le manuel scolaire (Pré-entraînement) : Ils ont nourri le modèle de 1,3 billion de mots. Mais ils n'ont pas pris n'importe quoi. Ils ont filtré les données pour donner la priorité à un contenu éducatif de haute qualité. Considérez cela comme si vous donniez à l'IA une bibliothèque remplie de manuels scolaires, d'encyclopédies et de guides de programmation, tout en filtrant beaucoup de bavardages informels d'Internet, de mèmes ou de blogs de faible qualité.
- L'entraînement spécialisé (Milieu d'entraînement) : Après l'école générale, ils lui ont donné un « camp d'entraînement » axé sur trois sujets spécifiques : le Codage, les Mathématiques et le Raisonnement. Ils ont ajouté encore plus de code et de problèmes mathématiques à son régime alimentaire.
- Le résultat : Grâce à ce régime riche en éducation, Sumi est très doué pour les connaissances, la logique et l'écriture de code. Cependant, comme il n'a pas assez consommé de nourriture de « conversation informelle » ou de « bon sens », il a un peu de mal avec les questions de bon sens quotidien (comme « Pourquoi les gens portent-ils des parapluies quand il pleut ? »).
La performance : À quel point le « peintre » est-il bon ?
Les chercheurs ont testé Sumi contre d'autres modèles d'IA célèbres (comme Llama et Falcon) qui utilisent la méthode traditionnelle de « l'écriture au stylo ».
- Les victoires : Sur des tests impliquant des connaissances générales, le raisonnement et le codage, Sumi a performé aussi bien que les meilleurs modèles de « l'écriture au stylo », même si ces derniers ont été entraînés sur beaucoup plus de données.
- Les points faibles : Sur des tests nécessitant du « bon sens » (comme comprendre des situations sociales), Sumi a obtenu des scores plus bas. Les auteurs admettent que c'est probablement parce que leurs données d'entraînement étaient trop concentrées sur les matières scolaires et pas assez sur la vie quotidienne.
L'expérience de la « Toile » : Trouver le point d'équilibre
L'une des parties les plus intéressantes de l'article est la façon dont ils ont testé la « flexibilité » du modèle.
- La taille de la toile : Dans cette IA, vous devez décider de la longueur de la phrase avant de commencer à la générer. C'est ce qu'on appelle la « longueur de la toile » (canvas length).
- La découverte : Sumi fonctionne mieux lorsque la toile mesure exactement 2048 tokens.
- Si la toile est trop courte, le modèle s'embrouille et écrit des charabia.
- Si la toile est trop longue, il s'embrouille aussi.
- C'est comme un musicien qui peut jouer une chanson parfaitement si la scène est d'une taille spécifique, mais si la scène est trop petite ou trop grande, il perd son rythme.
Le mystère de l'« engagement » : Comment décide-t-il ?
Puisque Sumi peut changer n'importe quel mot à tout moment, vous pourriez vous demander : Est-ce qu'il devine au hasard, ou a-t-il un plan ?
- La découverte : Les chercheurs ont découvert que Sumi n'a pas un ordre fixe (comme « commencer par le début »). Au lieu de cela, il utilise un système de « confiance ».
- Il regarde l'ensemble de la phrase et dit : « Je suis assez sûr de ce mot, donc je le verrouille. Je ne suis pas sûr de ce mot-là, donc je continue à travailler dessus. »
- Cela crée un ordre naturel où il verrouille les parties faciles d'abord et garde les parties difficiles pour plus tard.
- Vitesse parallèle : Parce qu'il verrouille les mots dont il est confiant en premier, il peut en fait écrire plusieurs mots en même temps (décodage parallèle) pour les tâches de codage, ce qui est plus rapide que l'ancienne méthode « un mot à la fois ».
Le mythe de l'« auto-correction »
Une grande promesse de cette méthode de « peinture » est que l'IA devrait pouvoir corriger ses propres erreurs facilement. Les chercheurs ont testé cela en donnant à Sumi du temps supplémentaire pour réviser ses réponses.
- Le résultat : Étonnamment, cela n'a pas aidé. Même lorsque Sumi était autorisé à réécrire ses réponses plusieurs fois, il se contentait souvent de changer un mot pour le remettre tel qu'il était au départ. Il n'a pas réellement « appris » à corriger ses erreurs pendant le processus de génération. Il semble que le modèle atteigne un plafond et ne sache pas comment améliorer une réponse une fois qu'elle est engagée.
Résumé
Sumi est une expérience audacieuse montrant que nous pouvons construire une IA puissante de zéro en utilisant une méthode de « peinture » (Diffusion uniforme) plutôt que la méthode traditionnelle de « l'écriture ».
- Il est excellent en : Mathématiques, codage et faits (parce qu'il a beaucoup étudié).
- Il est correct en : Bon sens (parce qu'il a sauté les choses « amusantes »).
- Il est étrange en : Changement d'avis (il ne s'auto-corrige pas encore très bien).
Les auteurs ont publié le modèle, le code et la recette exacte de ce qu'ils lui ont donné, dans l'espoir que d'autres scientifiques l'utiliseront pour découvrir comment rendre cette méthode de « peinture » encore meilleure.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.