Résumé technique : Les vocabulaires de LLM publiés peuvent-ils permettre une estimation au niveau du jeton des corpus cachés ?
1. Formulation du problème
La composition des corpus de préentraînement est fondamentale pour comprendre les capacités des grands modèles de langage (LLM), pourtant cette information reste souvent opaque même lorsque les poids du modèle sont publiés. Bien que les vocabulaires de tokeniseurs publiés (généralement entraînés par BPE, ou Byte-Pair Encoding) soient souvent publics, ils ne sont que rarement accompagnés des statistiques exactes des données d'entraînement.
Le problème central abordé est l'estimation du ratio de corpus au niveau du jeton. Étant donné un vocabulaire de tokeniseur cible V∗ publié et entraîné sur un corpus caché C∗, l'objectif est d'estimer le ratio ri∗ pour chaque jeton vi du vocabulaire. Contrairement aux travaux antérieurs qui infèrent des mélanges de catégories grossières (par exemple, des proportions de langues ou de domaines) ou tracent des groupes de jetons spécifiques, cet article vise à estimer le ratio pour des jetons individuels arbitraires.
Les auteurs supposent avoir accès à un ou plusieurs corpus connus D avec des ratios de jetons observables. Le défi consiste à apprendre un estimateur f^ qui associe les identifiants de jetons (token IDs) aux ratios dans le corpus caché en exploitant la relation entre les identifiants de jetons et les ratios observés dans les corpus connus.
2. Observation clé : Transférabilité des distributions ID-Ratio
Avant de proposer une solution, les auteurs étudient si la relation entre les identifiants de jetons et les ratios est transférable d'un corpus à un autre.
- Méthode : Ils ont entraîné des tokeniseurs BPE sur diverses langues (anglais, français, japonais, chinois) et domaines (Web, Wikipédia, Code, Mathématiques) et ont tracé les distributions des identifiants de jetons par rapport à leurs ratios dans un espace log-log.
- Résultat : Malgré des différences significatives de structure linguistique ou de contenu de domaine, les distributions ID-jeton–ratio partagent une forme globale stable.
- Quantification : En utilisant un score de similitude de transfert directionnel basé sur la divergence de Kullback–Leibler (KL), ils ont démontré que ces distributions sont largement transférables. Par exemple, l'anglais et le français présentent une interchangeabilité quasi totale, tandis que même des paires structurellement distinctes comme le Code et Wikipédia conservent une similitude substantielle.
- Implication : Cette stabilité motive le transfert de la structure distributionnelle des corpus connus vers un tokeniseur cible entraîné sur des données cachées.
3. Méthodologie : Estimation de densité guidée par les quantiles (QGDE)
Pour exploiter cette transférabilité, les auteurs proposent l'Estimation de Densité Guidée par les Quantiles (QGDE - Quantile-Guided Density Estimation). La méthode se compose de trois étapes principales :
A. Ajustement des tendances ID-Ratio avec les quantiles
Au lieu d'ajuster une seule courbe médiane (comme dans le travail antérieur PoCTrace), la QGDE modélise la relation partagée ID–ratio en utilisant une famille de tendances de quantiles.
- Transformation Log-Log : Suivant la loi de Zipf, les identifiants de jetons (t) et les ratios (r) sont modélisés dans un espace log-log, où la relation s'approche d'une tendance linéaire.
- Régression par Quantiles : Pour un ensemble de niveaux de quantiles τ, la méthode ajuste des courbes log-linéaires qτ(x)=aτ+bτx. Cela capture non seulement la tendance centrale, mais aussi toute l'étendue verticale des ratios plausibles pour un identifiant de jeton donné.
- Génération de Candidats : Pour un jeton cible avec un ID ti, chaque tendance de quantile fournit une estimation candidate du log-ratio zi,τ.
B. Sélection des ancres de quantiles
Pour éviter la redondance et assurer la couverture de la distribution, la méthode sélectionne un petit ensemble d'ancres de quantiles représentatives TK∗.
- Optimisation : Les ancres sont sélectionnées en maximisant la Couverture des Ancres de Quantiles (QAC - Quantile Anchor Coverage), qui compte combien de points ID–ratio connus tombent dans une bande passante verticale des tendances sélectionnées.
- Résultat : Ce processus favorise les ancres dont les tendances passent conjointement par des régions bien soutenues de la distribution plutôt que de se répartir uniformément ou de se concentrer sur des zones éparses. L'analyse empirique montre que la couverture sature à mesure que le nombre d'ancres (K) augmente (par exemple, des rendements décroissants après K=14).
C. Pondération par densité locale
La dernière étape convertit les multiples estimations candidates en une estimation ponctuelle unique en utilisant une pondération par densité locale.
- Mécanisme : Pour un identifiant de jeton cible, la méthode identifie les points ID–ratio connus à proximité dans une fenêtre locale.
- Pondération : Elle attribue des poids souples à chaque estimation candidate en fonction de la force avec laquelle les points environnants soutiennent cette tendance de quantile spécifique, en utilisant l'estimation de la densité par noyau gaussien.
- Estimation Finale : Le ratio estimé est la moyenne pondérée par la densité des estimations candidates. Cela transforme le signal de type "intervalle" des travaux précédents en une estimation ponctuelle fine au niveau du jeton.
4. Résultats expérimentaux
Les auteurs ont évalué la QGDE dans des contextes contrôlés (utilisant mC4, OSCAR, FineWeb, etc.) et dans un contexte réaliste (en utilisant le tokeniseur de SmolLM).
Contextes contrôlés
- Estimation au niveau du jeton : La QGDE a nettement surpassé deux lignes de base : le transfert direct du ratio par ID (copie des ratios de la source par position) et PoCTrace (tendance médiane unique).
- Performance : La QGDE a atteint des erreurs relatives moyennes (MRE) aussi basses que 3,00 % pour l'estimation au niveau du jeton dans des contextes de sources mixtes.
- Ablation : L'augmentation du nombre d'ancres de quantiles (K) de 3 à 14 a réduit drastiquement les erreurs, particulièrement dans les réglages de domaine, avant que les gains ne plafonnent.
- Mélanges de sources : L'utilisation de corpus connus mixtes a généralement produit de meilleurs résultats que les contextes à source unique, bien que le ratio exact du mélange importe moins que la diversité des composants couverts.
Agrégation au niveau de la catégorie
- Estimation de mélange : Les estimations au niveau du jeton ont été agrégées pour estimer les proportions de langues ou de domaines.
- Comparaison : La QGDE a largement surpassé la ligne de base DMI (Data Mixture Inference).
- Réduction de l'erreur : Dans les réglages linguistiques, la MRE est passée d'environ 9,09 % (DMI) à 3,08 % (QGDE). Dans les réglages de domaine, elle est passée d'environ 15,14 % à ~5,3 %.
- Observation : Bien que l'augmentation de K améliore la précision au niveau du jeton, les gains au niveau de la catégorie sont moins prononcés en raison de l'effet de lissage de l'agrégation.
Contexte réaliste (SmolLM)
- Validation : La méthode a été testée sur le tokeniseur de SmolLM, où les proportions des données d'entraînement sont connues (FineWeb-edu, Cosmopedia, Python-edu).
- Résultats : La QGDE a obtenu l'erreur la plus faible tant pour l'estimation au niveau du jeton (MRE de 5,72–5,78 %) que pour l'estimation au niveau de la catégorie (MRE de 5,93 %), surpassant à la fois le transfert direct et PoCTrace. Cela a confirmé l'efficacité de la méthode même lorsque les corpus sources exacts ne pouvaient pas être utilisés comme sources d'entraînement directes.
5. Contributions et Signification
L'article apporte trois contributions principales :
- Découverte de la transférabilité : Il démontre que les distributions ID-ratio des jetons sont transférables entre les vocabulaires BPE entraînés sur différentes langues et domaines, fournissant un signal utilisable pour estimer les ratios de corpus cachés.
- Innovation méthodologique : Il introduit la QGDE, un estimateur général au niveau du jeton qui utilise de multiples tendances de quantiles et une pondération par densité locale pour approximer la distribution transférable, allant au-delà de l'inférence de mélange grossière ou du traçage de jetons spécifiques.
- Validation empirique : Il montre que la QGDE atteint une haute précision (jusqu'à 3,00 % de MRE) dans des contextes contrôlés et réalistes, surpassant les lignes de base existantes.
Signification :
Les auteurs soutiennent que les vocabulaires de tokeniseurs publiés fournissent un signal utile pour l'estimation fine du corpus. Cette capacité va au-delà de l'inférence de composition grossière possible avec les méthodes actuelles, offrant une voie pour auditer et interpréter les sources de données des LLM publiés, même lorsque les corpus d'entraînement restent cachés. Ce travail suggère que l'« empreinte digitale » de la composition du corpus est encodée dans la structure du vocabulaire du tokeniseur d'une manière qui peut être décodée avec une modélisation statistique suffisante.
Limites :
Les auteurs notent que la rareté des données de vérité terrain pour les LLM publiés (par exemple, ChatGPT, Qwen, DeepSeek) limite l'évaluation directe sur ces modèles. La validation repose actuellement sur des expériences contrôlées et sur le cas rare de SmolLM où les données d'entraînement sont publiques. Une validation plus large attend la publication de nouveaux corpus d'entraînement.