← Derniers articles
💬 NLP

Compute Optimal Tokenization

Ce papier démontre que dans les configurations de modèles de langage optimales en calcul, le nombre de paramètres évolue proportionnellement à la taille des données mesurée en octets plutôt qu'en tokens, révélant que le taux de compression optimal des tokens diffère du BPE standard et diminue à mesure que le calcul augmente.

Auteurs originaux : Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

Publié 2026-05-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous construisez la bibliothèque ultime de connaissances. Vous disposez d'une somme d'argent fixe (votre budget de calcul) pour édifier cette bibliothèque. Vous avez deux choix principaux :

  1. Acheter un immense bâtiment avec des millions d'étagères vides (Taille du Modèle).
  2. Acheter une énorme pile de livres pour remplir ces étagères (Données d'Entraînement).

Pendant des années, les experts ont dit aux bibliothécaires : « Pour obtenir la meilleure bibliothèque, achetez 20 livres pour chaque étagère que vous construisez. » Mais ce conseil présentait un défaut caché : il supposait que tous les livres avaient la même taille. En réalité, certains livres sont de grosses encyclopédies, tandis que d'autres sont de minces brochures.

Ce papier, intitulé « Tokenisation Optimale en Calcul », soutient que nous avons mesuré nos livres dans la mauvaise unité. Au lieu de compter les « livres » (tokens), nous devrions compter les « pages » (octets).

Voici la répartition de leurs découvertes à l'aide d'analogies simples :

1. Le problème de la « Taille du Livre » (Taux de Compression)

Dans le monde de l'IA, le texte est découpé en morceaux appelés tokens.

  • Faible compression : Imaginez découper une phrase en lettres individuelles. Vous obtenez une énorme pile de tout petits morceaux (beaucoup de tokens).
  • Forte compression : Imaginez regrouper des mots entiers ou même des phrases en un seul morceau. Vous obtenez une pile plus petite de gros morceaux (moins de tokens).

Le papier demande : La taille de nos morceaux a-t-elle de l'importance ?
La réponse est oui. La taille du morceau (appelée taux de compression) modifie l'efficacité avec laquelle nous pouvons construire notre bibliothèque.

2. Trouver le point idéal : La règle « Octets contre Tokens »

Les chercheurs ont entraîné près de 1 000 modèles d'IA différents, en ajustant la taille des morceaux et la taille du modèle. Ils ont découvert une nouvelle règle pour l'équilibre parfait :

  • L'ancienne règle : « Achetez 20 tokens par paramètre. » (Cela ne fonctionne que si vos tokens ont une taille spécifique, comme les tokens BPE standards).
  • La nouvelle règle : « Achetez 60 octets de texte par paramètre. »

L'analogie :
Imaginez votre modèle d'IA comme un chef et les données comme des ingrédients.

  • Si vous donnez au chef des ingrédients préhachés et minuscules (forte compression), il peut cuisiner beaucoup de repas rapidement.
  • Si vous lui donnez des légumes entiers (faible compression), il doit d'abord les hacher, ce qui prend du temps.
  • Le papier a découvert que, peu importe comment vous hachez les légumes, le chef obtient les meilleurs résultats lorsqu'il dispose d'un poids spécifique d'ingrédients (60 octets) pour chaque unité de son savoir-faire (paramètre). Peu importe que ce poids soit composé de 20 gros morceaux ou de 100 miettes minuscules ; c'est le poids total qui compte.

3. Le taux de compression « Juste Milieu »

Vous pourriez penser : « Si je rends les morceaux plus gros, je gagne plus de temps, alors je devrais les rendre aussi gros que possible ! »
Le papier dit : Pas si vite.

Ils ont découvert qu'il existe une zone Goldilocks pour la taille des morceaux.

  • Trop petits : Le modèle est submergé par trop de petits morceaux de données.
  • Trop gros : Le modèle perd trop de détails car les morceaux sont trop grossiers.
  • Juste ce qu'il faut : Il existe un taux de compression spécifique qui produit le modèle le plus intelligent pour un budget donné.

La surprise : À mesure que vous obtenez plus d'argent (plus de puissance de calcul), la taille « Juste ce qu'il faut » devient en réalité plus petite.

  • Analogie : Si vous avez une petite cuisine, vous voudrez peut-être des légumes préhachés pour gagner du temps. Mais si vous avez une cuisine professionnelle massive avec un personnel illimité, vous préférerez peut-être des légumes entiers car vous pouvez les traiter si efficacement que le détail supplémentaire vaut l'effort.

4. Une taille ne convient pas à tous (La langue compte)

Les chercheurs ont testé cela sur différentes langues (anglais, hindi, arabe, russe, etc.). Ils ont découvert que la taille de morceau « Juste ce qu'il faut » dépend de la langue.

  • L'analogie : Imaginez faire des valises pour différents voyages.
    • Pour un voyage dans un pays où les gens parlent une langue avec des mots très compacts (comme l'anglais), vous pourriez emballer des objets légèrement plus grands.
    • Pour un voyage dans un pays où les mots sont plus longs ou utilisent des scripts différents (comme l'hindi ou l'arabe), la manière « optimale » de faire ses valises change.
  • Le papier a découvert que les outils d'IA populaires (comme Llama 3 ou Qwen) utilisent souvent une méthode d'emballage « taille unique ». Cela fonctionne assez bien pour l'anglais, mais est souvent trop compressé pour certaines langues et pas assez compressé pour d'autres. Ils emballent essentiellement des objets de la mauvaise taille pour le voyage spécifique.

Résumé des points clés

  1. Arrêtez de compter les tokens, commencez à compter les octets. Lors de la planification de la quantité de données à fournir à une IA, mesurez la taille brute du texte (octets), et non le nombre de morceaux (tokens). Le ratio devrait être d'environ 60 octets de texte pour chaque million de paramètres dans le modèle.
  2. Il existe une taille de morceau parfaite. Rendre les tokens trop grands ou trop petits nuit aux performances. Il existe un « point idéal » spécifique pour la compression.
  3. Le point idéal change. À mesure que vous obtenez des ordinateurs plus puissants, vous devriez en fait utiliser des morceaux légèrement plus petits (compression plus faible) pour obtenir les meilleurs résultats.
  4. La langue compte. La taille de morceau parfaite est différente pour l'hindi que pour l'anglais. Les modèles d'IA actuels utilisent souvent un paramètre générique qui n'est pas optimal pour chaque langue.

En bref : Pour construire l'IA la plus intelligente possible, ne suivez pas simplement l'ancienne règle de « 20 tokens par paramètre ». Au lieu de cela, faites correspondre le poids du texte à la taille du cerveau, et ajustez la taille des morceaux de texte en fonction de la puissance de calcul dont vous disposez et de la langue que vous lui enseignez.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →