← Derniers articles
💬 NLP

Emergent retokenization symmetry in large language models: phenomenology and applications

Cet article démontre que les grands modèles de langage développent partiellement une symétrie émergente envers des segmentations de jetons sémantiquement équivalentes au cours de l'entraînement, révélant que la « re-tokenisation » — le remplacement des tokenisations canoniques par des segmentations alternatives valides — sert de sonde pure pour la compréhension compositionnelle et d'une nouvelle stratégie d'échantillonnage à l'inférence capable de récupérer des solutions manquées par les méthodes conventionnelles.

Auteurs originaux : Kanishk Jain, Matthew Day, Tankut Can

Publié 2026-06-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kanishk Jain, Matthew Day, Tankut Can

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous lisez un livre, mais au lieu de lire des mots entiers, le livre est imprimé dans un code étrange où chaque mot est découpé en morceaux de tailles différentes. Parfois, « probable » est un seul bloc. D'autres fois, il est divisé en deux : « prob » et « able ».

Dans le monde des grands modèles de langage (LLM), c'est exactement comme cela qu'ils lisent. Ils ne voient pas des lettres ; ils voient des « tokens » (des fragments de texte). Habituellement, l'ordinateur possède un carnet de règles strict (un tokenizer) qui dit : « Découpe toujours "probable" en "prob" et "able" ». C'est la manière canonique.

Cet article pose une question fascinante : Et si nous brisions les règles ? Et si nous donnions au modèle la même phrase, mais découpée différemment (par exemple : « pro » + « b » + « able ») ? Le modèle serait-il confus, ou comprendrait-il quand même le sens ?

Les auteurs appellent ce processus la Retokenisation. Voici ce qu'ils ont découvert, expliqué simplement :

1. Le « langage secret » du modèle

Les chercheurs ont découvert que même si le modèle est entraîné pour toujours lire les mots de la manière « standard », il comprend secrètement les manières « non standard » aussi.

  • L'analogie : Imaginez un chef qui est formé pour couper les oignons en cubes parfaits et uniformes. Si vous lui donnez une pile d'oignons découpés en formes irrégulières et bizarres, il sera peut-être quand même capable de cuisiner la soupe. Il comprend que « oignon » est « oignon », peu importe la forme.
  • La découverte : Le modèle n'est pas totalement aveugle aux formes bizarres. Il peut toujours faire ses calculs, écrire du code ou répondre à la question. Cependant, il n'est pas parfaitement aveugle non plus. Les formes bizarres font que le « cerveau » interne du modèle (ses états cachés) travaille légèrement différemment. C'est comme si le chef était légèrement plus stressé lorsque les oignons sont découpés de façon étrange, même si la soupe a toujours bon goût.

2. Une nouvelle façon de « lancer les dés »

Quand nous demandons à une IA de résoudre un problème, nous lui demandons généralement d'essayer plusieurs fois et de voir quelle réponse est la meilleure. C'est ce qu'on appelle l'Échantillonnage par Température (Temperature Sampling). C'est comme lancer un dé pour voir ce que l'IA dira ensuite.

Les auteurs ont trouvé une nouvelle façon d'obtenir des réponses différentes : l'Échantillonnage par Retokenisation.

  • L'analogie : Imaginez que vous essayez de résoudre un labyrinthe.
    • Échantillonnage standard : Vous suivez le même chemin, mais à chaque fois que vous arrivez à une intersection, vous lancez une pièce pour décider si vous allez à gauche ou à droite.
    • Échantillonnage par Retokenisation : Vous suivez le même chemin, mais vous modifiez légèrement la carte. Peut-être que vous redessinez les murs ou changez les étiquettes sur les virages. Même si la destination est la même, la nouvelle carte force votre cerveau à prendre un itinéraire différent pour y arriver.
  • Le résultat : Parfois, cette « nouvelle carte » aide l'IA à trouver une solution qu'elle avait manquée avec la carte standard. C'est comme trouver une porte cachée dans le labyrinthe que l'on ne voit que si l'on regarde le plan sous un autre angle.

3. Là où cela fonctionne (et là où cela ne fonctionne pas)

Les chercheurs ont testé cela sur trois types de tâches :

  • Mathématiques (GSM8K) : Le modèle s'en est bien sorti. Le découpage bizarre n'a pas beaucoup aidé, mais il n'a pas non plus cassé le modèle.
  • Choix multiples (MMLU) : Le modèle était très sensible ici. Changer les fragments le rendait légèrement plus susceptible de donner une mauvaise réponse.
  • Codage (HumanEval) : C'est là que cela devient passionnant. Le codage possède de nombreuses façons de résoudre le même problème. Les chercheurs ont découvert qu'en changeant la façon dont le code était découpé, l'IA trouvait parfois des manières totalement différentes et correctes d'écrire le programme qu'elle n'aurait pas trouvées autrement.

4. Le coût de la créativité

Il y a un inconvénient.

  • L'analogie : Imaginez que vous essayez de lire un livre plus vite.
    • Manière standard : Vous lisez les mots normalement.
    • Manière par Retokenisation : Vous devez vous arrêter et re-découper chaque mot avant de le lire.
  • La découverte : Parce que le modèle doit traiter ces mots « bizarrement découpés », cela demande plus de puissance informatique (et de temps) pour obtenir la réponse. C'est moins efficace que la méthode standard. L'article conclut que, bien que cette méthode soit un outil génial pour trouver de nouvelles solutions (particulièrement en codage), elle n'est pas une solution miracle pour remplacer la façon standard d'utiliser l'IA car elle est plus lente et plus coûteuse.

Résumé

L'article montre que les modèles d'IA sont plus intelligents que nous ne le pensions. Ils ne se contentent pas de mémoriser une seule façon de lire les mots ; ils possèdent une compréhension flexible qui leur permet de gérer différents « découpages » du même texte.

En découpant intentionnellement le texte en fragments bizarres, les chercheurs peuvent forcer l'IA à penser de manières légèrement différentes, révélant parfois des réponses correctes (particulièrement en codage) qu'elle aurait autrement manquées. C'est un nouvel outil pour explorer comment l'IA réfléchit, prouvant que la façon dont nous nourrissons l'information à un ordinateur compte tout autant que l'information elle-même.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →