← Derniers articles
💬 NLP

Index SLM Technical Report

Bilibili présente Index-1.9B, une série de petits modèles de langage ouverts dotés d'une fondation de 1,9 milliard de paramètres entraînée sur 2,8 billions de jetons avec un programme spécialisé Warmup-Stable-Decay et une couche Norm-Head, qui atteint des performances compétitives sur les benchmarks standards et comprend des variantes pour le pré-entraînement pur, l'alignement de chat et le jeu de rôle basé sur des personnages.

Auteurs originaux : Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

Publié 2026-07-14
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous construisez un minuscule cerveau de robot super intelligent qui tient dans votre poche. La plupart des gens pensent qu'un cerveau plus grand est toujours meilleur, mais une équipe de Bilibili a décidé de voir si elle pouvait créer un robot de 1,9 milliard de paramètres (appelons-le Index-1.9B) capable de rivaliser bien au-dessus de sa catégorie de poids. Ils n'ont pas seulement réduit la taille d'un modèle géant ; ils ont reconstruit le moteur de zéro en utilisant 2,8 billions de mots de lecture, principalement en chinois et en anglais.

Voici l'histoire de la façon dont ils l'ont fait, de ce qu'ils ont découvert, et des étranges surprises qu'ils ont rencontrées en chemin.

La recette secrète : Comment ils ont entraîné le cerveau

1. La liste de lecture (Les données)
Considérez les données d'entraînement comme la bibliothèque du robot. Ils n'ont pas simplement déversé tout l'internet là-dedans. Ils l'ont nettoyé comme un bibliothécaire organisant un grenier en désordre. Ils ont supprimé les doublons (trouvant même un menu de mois qui avait été copié 156 000 fois par erreur !) et filtré les biais.

  • Le mélange : La bibliothèque est composée principalement de livres et de pages web, mais ils se sont assurés d'inclure 6 % de code et 10 % de contenus de haute qualité comme des articles académiques et des encyclopédies.
  • La surprise : Ils ont découvert que lire des « manuels d'instructions » (comme « Écris un poème » ou « Résous ce problème de maths ») lors de la phase finale de l'entraînement rendait le robot beaucoup plus intelligent lors des tests. En fait, ajouter seulement 7 % de ces données d'instruction a boosté les scores de test du robot d'environ 7 points. Ils ont même publié deux versions du robot — une avec cette lecture supplémentaire et une sans — pour que tout le monde puisse voir exactement à quel point cela a aidé.

2. La structure du cerveau (L'architecture)
Habituellement, lorsque vous avez une quantité fixe de « puissance cérébrale » (paramètres), vous pouvez rendre le cerveau large (beaucoup de neurones dans une couche) ou profond (plusieurs couches empilées).

  • La découverte : L'équipe a testé un design « profond et étroit » (36 couches) contre un design « large et peu profond » (9 couches). Le profond a gagné à chaque fois. C'est comme construire un gratte-ciel plutôt qu'un entrepôt large et plat ; pour cette taille, monter fonctionnait mieux que s'étendre.
  • Le stabilisateur : Ils ont également ajouté une couche spéciale appelée « Norm-Head ». Imaginez le cerveau du robot qui a un peu le vertige lorsqu'il essaie de deviner le mot suivant parce que certains mots sont rares. Cette nouvelle couche agit comme un stabilisateur, gardant le cerveau calme même lorsque le robot apprend très rapidement.

3. Le programme d'apprentissage (La méthode « WSD »)
La plupart des robots apprennent à un rythme régulier ou ralentissent progressivement. Index-1.9B utilise un programme « Warmup–Stable–Decay » (Échauffement–Stable–Décroissance).

  • La stratégie : D'abord, il s'échauffe. Ensuite, il apprend à une vitesse constante et élevée (la phase « Stable ») en lisant toute la bibliothèque. Enfin, dans la phase « Decay » (Décroissance), il ralentit mais passe à la lecture de livres uniquement hautement sélectionnés (les articles académiques et les encyclopédies).
  • Le résultat : Cette combinaison de ralentissement tout en lisant des données de haute qualité lui a donné le plus grand coup de pouce de performance.

La drôle de surprise : Le « Surge » (La poussée)

Voici la partie que même les auteurs n'expliquent pas encore totalement.
Pendant la phase « Stable », lorsque le robot lisait à une vitesse constante, quelque chose d'étrange s'est produit. Entre 1,0 et 1,2 billion de tokens de lecture, les scores de test du robot ont soudainement bondi. Il est passé d'un niveau moyen à un niveau surpassant un certain nombre de modèles de 7B, sans changer la vitesse d'apprentissage ni le type de données.

  • La certitude : L'article admet que c'est un mystère. Ils suggèrent que peut-être les données de haute qualité combinées au taux d'apprentissage rapide ont simplement « cliqué » à ce moment-là, mais ils n'ont pas prouvé exactement pourquoi. C'est comme un étudiant qui comprend soudainement tout après avoir lu un chapitre spécifique, même si le professeur n'a pas changé la leçon.

Les différentes versions du robot

L'équipe ne s'est pas arrêtée à un seul modèle. Ils ont sorti toute une famille :

  • Index-1.9B-Base : Le cerveau brut et intelligent, prêt pour tout.
  • Index-1.9B-Pure : Une version de contrôle qui n'a jamais lu de manuels d'instructions. Cela prouve que les scores « intelligents » du modèle principal proviennent bien de cette lecture supplémentaire.
  • Index-1.9B-Chat : Le modèle Base enseigné à parler gentiment aux humains, en utilisant une technique appelée « Direct Preference Optimization » (DPO). C'est comme apprendre au robot non pas seulement à répondre, mais à répondre bien en lui montrant des exemples de bonnes et de mauvaises conversations.
  • Index-1.9B-Character : Une version qui peut jouer des rôles. Elle utilise une astuce de « récupération » (retrieval), où elle recherche les conversations passées avec un personnage spécifique pour rester dans le personnage. Elle est si douée pour cela qu'elle se classe plus haut que de nombreux modèles beaucoup plus grands sur les tests de jeu de rôle.

Ce qu'il peut (et ne peut pas) faire

Les victoires :

  • Intelligence : Sur les tests standards de mathématiques, de raisonnement et de culture générale, Index-1.9B obtient une moyenne de 64,92. C'est compétitif avec, et parfois supérieur à, des modèles plusieurs fois plus grands. Spécifiquement, il surpasse le modèle Llama-2-13B sur le score moyen global, bien qu'il ne batte pas tous les benchmarks face à tous les modèles plus grands.
  • Langue : Il est excellent en chinois et en anglais. De plus, le tokenizer qu'ils ont construit pour le modèle atteint les taux de compression les plus forts pour le japonais et le coréen parmi les tokenizers qu'ils ont comparés, ce qui le rend efficace pour ces langues.
  • Jeu de rôle : Il peut incarner des personnages avec une grande cohérence, se classant 9e au classement général sur un leaderboard majeur, battant de nombreux modèles de 7B à 14B.

Les limites :

  • Mathématiques et Code : Bien qu'il soit correct, les auteurs admettent que ce sont encore des domaines à améliorer. Ce n'est pas encore un génie des mathématiques.
  • Faits : Parce qu'il est petit, il peut encore inventer des faits ou mal comprendre des instructions complexes.
  • Le Mystère : Ce saut soudat de performance pendant l'entraînement ? Ils ne savent toujours pas exactement pourquoi cela s'est produit.

L'essentiel à retenir

L'article montre que vous n'avez pas besoin d'un cerveau massif et coûteux pour être intelligent. Si vous nourrissez un petit robot avec le bon mélange de livres de haute qualité, que vous lui apprenez à lire en profondeur plutôt qu'en largeur, et que vous lui donnez un stabilisateur spécial pour son cerveau, il peut rivaliser avec les géants. Ils ont également prouvé que les « données d'instruction » (apprendre à suivre des ordres) sont un énorme « cheat code » pour les scores de test, et ils ont publié les preuves pour que personne ne puisse cacher le fait que c'est vrai.

C'est un petit modèle avec une grande personnalité, quelques questions ouvertes et un énorme potentiel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →