← Derniers articles
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

Cet article introduit l'Estimation de Densité Guidée par les Quantiles (QGDE), une méthode qui exploite la stabilité des distributions de ratios d'ID de tokens dans les tokeniseurs BPE publiés pour estimer avec précision les ratios de composition des corpus de pré-entraînement cachés, tant au niveau des tokens qu'au niveau des catégories.

Auteurs originaux : Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

Publié 2026-08-12
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous venez d'acheter un tout nouveau robot cuisinier super intelligent. Il peut écrire de la poésie, résoudre des problèmes mathématiques et même coder des jeux vidéo. Mais il y a un piège : le livre de recettes qu'il a utilisé pour apprendre à cuisiner est enfermé dans un coffre-fort. Vous pouvez voir les plats finaux du robot, et vous pouvez même voir la liste des ingrédients qu'il aurait pu utiliser, mais vous n'avez aucune idée de quel était le mélange réel des ingrédients. Était-ce 90 % de pâte à pizza et 10 % d'épices ? Ou peut-être 50 % de chocolat et 50 % de brocoli ? Dans le monde de l'intelligence artificielle, ce « livre de recettes » est appelé un corpus de pré-entraînement, et la « liste des ingrédients » est le vocabulaire du tokenizer.

Lorsque les entreprises sortent un nouveau modèle d'IA, elles partagent souvent les poids finaux (le cerveau du robot) et la liste du vocabulaire (le dictionnaire des ingrédients), mais elles gardent la recette exacte secrète. C'est un problème car savoir ce que l'IA a « mangé » nous aide à comprendre pourquoi elle est douée pour certaines choses et mauvaise pour d'autres. Pendant des années, les scientifiques ont essayé de deviner la recette en observant le comportement du robot ou les règles qu'il utilisait pour découper les mots en morceaux. Mais ces suppositions étaient souvent trop vagues, comme dire « il a probablement mangé beaucoup de fruits » sans savoir s'il s'agissait de pommes ou de bananes. La grande question était : peut-on regarder uniquement le dictionnaire des ingrédients et deviner le ratio exact de chaque ingrédient consommé par le robot ?

Cet article affirme : « Oui, nous le pouvons, et voici comment. » Les chercheurs ont découvert que la manière dont les mots sont découpés et numérotés dans ces dictionnaires n'est pas aléatoire ; elle suit un motif caché et stable, un peu comme la façon dont la fréquence des mots dans n'importe quelle langue suit une courbe prévisible. Ils ont réalisé que si vous connaissez le motif d'une recette « connue » (un corpus auquel nous avons accès), vous pouvez transférer ce motif pour deviner la recette d'une autre recette « cachée ». Ils ont construit un outil ingénieux appelé QGDE (Quantile-Guided Density Estimation). Voyez cela comme un détective qui ne se contente pas de regarder un seul indice, mais qui utilise un ensemble entier de scénarios de type « et si » (tendances de quantiles) et les pondère en fonction de la densité de voisinage des indices (pondération de densité locale).

Les résultats sont étonnamment précis. Dans leurs tests, le QGDE a pu deviner le ratio de mots spécifiques avec un taux d'erreur infime de seulement 3,00 %. Lorsqu'ils ont regroupé ces mots en catégories plus larges comme « Web », « Math » ou « Code », l'erreur n'était encore que de 3,08 %. C'est une amélioration majeure par rapport aux méthodes précédentes, qui consistaient à deviner la météo en regardant un seul nuage. L'article a également testé cette méthode sur un modèle d'IA réel et publié, nommé SmolLM, dont la recette réelle était connue. Même là, le QGDE a surpassé les autres méthodes, prouvant que le dictionnaire des ingrédients détient réellement le secret de la recette. Cependant, les auteurs précisent prudemment que, bien que cela fonctionne bien dans leurs simulations et sur SmolLM, nous ne pouvons toujours pas tester cela sur des géants comme ChatGPT ou Qwen car leurs recettes d'entraînement complètes restent verrouillées. Mais pour l'instant, cela suggère que la prochaine fois que vous verrez la liste du vocabulaire d'une IA, vous regarderez peut-être simplement une carte vers son régime alimentaire caché.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →