← Derniers articles
💬 NLP

Tokenization with Split Trees

Ce papier présente ToaST, une nouvelle méthode de tokenisation de sous-mots qui utilise des arbres de division et la programmation en nombres entiers pour optimiser la sélection de vocabulaire afin de minimiser le nombre de tokens, réalisant ainsi des améliorations significatives en matière d'efficacité de compression et de performance des modèles de langage par rapport aux bases de référence existantes telles que BPE et WordPiece.

Auteurs originaux : Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'envoyer une bibliothèque massive de livres à travers Internet, mais que votre connexion Internet est lente. Pour accélérer le transfert, vous souhaitez compresser les livres en le plus petit nombre possible de « morceaux » (tokens) sans perdre aucun sens.

Pendant longtemps, la méthode standard pour y parvenir était celle d'un constructeur de Lego qui commence par de tout petits briques individuelles (lettres) et les colle ensemble une par une, uniquement lorsqu'il voit deux briques collées ensemble fréquemment. Cette méthode, appelée BPE, est rapide et gourmande, mais elle n'est pas toujours la plus efficace. Elle pourrait coller deux briques ensemble qui n'appartiennent pas vraiment l'une à l'autre, ou manquer une occasion de coller un mot entier ensemble parce qu'elle s'est bloquée sur un plus petit morceau en premier.

L'article présente une nouvelle méthode appelée ToaST (Tokenization with Split Trees). Voici comment elle fonctionne, en utilisant quelques analogies simples :

1. L'« Arbre des Possibilités » (Split Trees)

Au lieu de coller les choses ensemble, ToaST commence par un mot entier (comme « Kentucky ») et se demande : « Si je devais couper ce mot en deux, où serait le meilleur endroit pour le faire ? »

Il examine une base de données massive sur la fréquence d'apparition de différentes parties de mots dans le monde réel. Il choisit la coupe qui divise le mot en deux pièces qui sont toutes deux très courantes. Ensuite, il prend ces deux pièces et pose la même question à nouveau. Il continue ainsi jusqu'à atteindre des lettres uniques.

  • L'Analogie : Imaginez que vous avez un énorme pain non coupé. Au lieu de le trancher au hasard, vous consultez une carte indiquant où les gens mangent habituellement du pain. Vous trouvez l'endroit parfait pour le trancher afin que les deux moitiés soient de tailles populaires. Ensuite, vous prenez ces moitiés et les tranchez à nouveau aux endroits les plus populaires. Vous vous retrouvez avec un arbre généalogique de chaque façon possible de couper ce mot, du pain entier jusqu'aux miettes individuelles.

2. Le « Menu Intelligent » (Sélection de Vocabulaire)

Maintenant, vous avez un arbre de millions de coupes possibles. Vous ne pouvez pas les utiliser toutes ; vous n'avez de la place que pour un nombre spécifique d'« articles de menu » (une taille de vocabulaire, disons 40 000).

Les anciennes méthodes choisissaient simplement les coupes les plus populaires. ToaST utilise un optimiseur mathématique (un programme à nombres entiers) pour jouer à un jeu de « Et si ? » :

  • Si je choisis ce gros morceau de « Kentucky » comme un seul token, combien de morceaux au total économise-t-on ?
  • Si je choisis « Kent » et « ucky » séparément, cela économise-t-il plus d'espace ailleurs ?

Il calcule la combinaison parfaite de coupes qui aboutit au nombre total de morceaux le plus faible nécessaire pour écrire toute la bibliothèque. C'est comme un chef planifiant un menu non pas uniquement sur la base de ce qui est populaire, mais sur la façon de servir le plus de clients avec le moins de plats au total.

3. Le « Tour de Magie » (L'Inférence)

Une fois le menu défini, la lecture du texte est rapide. Lorsque l'ordinateur voit « Kentucky », il regarde le sommet de l'arbre.

  • « Kentucky » est-il sur le menu ? Oui ? Super, envoyez-le comme un seul token.
  • « Kentucky » est-il sur le menu ? Non ? Alors regardez au niveau suivant. « Kent » est-il sur le menu ? Oui ? Envoyez « Kent », puis regardez de l'autre côté pour « ucky ».

Parce que l'arbre a été construit avant que le menu ne soit choisi, le chemin est toujours clair. Il n'y a pas de règles confuses ni de scénarios du type « que se passe-t-il si je change cela ? ».

Pourquoi est-ce mieux ?

L'article affirme que pour de grandes bibliothèques (tailles de vocabulaire de 40 000+), ToaST est nettement supérieur aux anciennes méthodes :

  • Compression : Il réduit le nombre de morceaux nécessaires de plus de 11 %. Pensez-y comme à la réduction d'un document de 100 pages à 89 pages sans perdre un seul mot.
  • Efficacité : Il utilise moins de tokens « lettre unique » (comme envoyer uniquement la lettre 'y' ou 'u'). Cela rend le flux de données plus fluide et plus efficace.
  • Performance : Lorsqu'ils ont entraîné un modèle de langage (un cerveau qui apprend à parler) en utilisant cette nouvelle méthode, le modèle a mieux performé lors des tests. Il a obtenu des scores plus élevés sur des tâches de raisonnement et de logique par rapport aux modèles entraînés avec les anciennes méthodes.

La Conclusion

ToaST est une nouvelle façon de décomposer le texte. Au lieu de coller aveuglément des morceaux ensemble, il cartographie chaque façon possible de couper un mot, puis utilise un puissant solveur mathématique pour choisir l'ensemble absolu de coupes le meilleur afin de minimiser la quantité totale de données. Le résultat est une façon plus efficace, plus rapide et plus intelligente pour les ordinateurs de lire et d'écrire le langage.

Note : L'article a uniquement testé cela sur du texte anglais. Il ne prétend pas que ces résultats s'appliquent à d'autres langues pour l'instant, ni ne discute des utilisations médicales ou cliniques. Les améliorations concernent strictement l'efficacité du traitement du texte et la performance des modèles de langage sur des benchmarks standard.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →