Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
Auteurs originaux : Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
Auteurs originaux : Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : La multiplicité de la tokenisation entraîne une variation arbitraire des prix dans le modèle LLM-as-a-service
1. Énoncé du problème
L'article traite d'un problème critique, bien que négligé, concernant l'économie des grands modèles de langage (LLM) offerts en tant que service (LLM-as-a-service). Actuellement, les fournisseurs utilisent principalement un modèle de tarification au jeton (token), où les utilisateurs sont facturés un prix fixe par jeton généré. L'hypothèse standard est que des prompts d'entrée identiques produisant des chaînes de sortie identiques devraient entraîner des coûts identiques.
Cependant, les auteurs démontrent que cette hypothèse est erronée en raison de la multiplicité de la tokenisation. Même lorsqu'un LLM génère exactement la même chaîne de caractères à partir du même prompt, la séquence de jetons sous-jacente peut différer. Puisque la tarification est basée sur le nombre de jetons plutôt que sur le nombre de caractères, ces différentes tokenisations entraînent des variations de prix arbitraires pour une même sortie. Ce phénomène est particulièrement présent dans les langues autres que l'anglais et affecte à la fois les modèles propriétaires et les modèles à poids ouverts (open-weights).
2. Méthodologie
Investigation empirique
Les auteurs ont mené des études empiriques approfondies sur trois tâches de traitement du langage naturel : la traduction, la correction orthographique et la reformulation.
- Configuration : Ils ont construit 100 prompts d'entrée par tâche en utilisant de courts textes de Wikipédia. Pour la traduction, ils ont testé des paires langue anglaise vers 5 langues cibles ; pour la correction orthographique et la reformulation, ils ont testé 6 langues.
- Exécution : Chaque prompt a été soumis au LLM 100 fois avec des paramètres identiques mais des graines aléatoires (random seeds) différentes pour simuler différents utilisateurs demandant la même tâche.
- Modèles : L'étude inclut des modèles propriétaires (GPT-4o-mini, GPT-4.1, GPT-5-mini, Gemini, Claude) et des modèles à poids ouverts (Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct).
- Mesure : Ils ont identifié des paires de sorties où les chaînes décodées étaient identiques mais où les longueurs de tokenisation différaient. Ils ont mesuré la probabilité de cette occurrence ainsi que l'ampleur de la variation de prix qui en résulte.
Analyse théorique
L'article définit formellement la tokenisation canonique comme la tokenisation unique qu'une chaîne reçoit lors du processus d'entraînement du LLM (déterminée par l'encodeur). Les auteurs prouvent un résultat théorique clé concernant les tokeniseurs non-récupérateurs (non-recovering) :
- Théorème : Pour les tokeniseurs BPE, Unigram et Wordpiece, si une séquence de jetons partielle est non-canonique, toute extension de cette séquence (ajout de jetons supplémentaires) sera également non-canonique.
- Implication : Pour générer une séquence de sortie canonique, le modèle doit générer des séquences partielles canoniques à chaque étape. Cette propriété permet des stratégies de génération contraintes.
Solution proposée : Génération canonique
Pour éliminer la variation de prix, les auteurs introduisent la génération canonique, une méthode de génération contrainte qui restreint le LLM à ne générer que la tokenisation canonique de n'importe quelle chaîne de sortie.
- Algorithme : Ils proposent un algorithme d'échantillonnage efficace basé sur l'astuce Gumbel-Max.
- Au lieu de calculer explicitement une nouvelle distribution de probabilité (ce qui nécessiterait de vérifier la canonicité de tous les jetons du vocabulaire), l'algorithme échantillonne un bruit de Gumbel pour chaque jeton.
- Il classe les jetons par probabilités logarithmiques perturbées.
- Il itère à travers les jetons classés et sélectionne le premier qui, lorsqu'il est ajouté à la séquence actuelle, résulte en une séquence canonique.
- Cette approche redistribue efficacement la masse de probabilité des jetons non-canoniques vers les jetons canoniques restants sans normalisation coûteuse.
3. Résultats clés
Multiplicité de la tokenisation
- Prévalence : La multiplicité de la tokenisation a été observée dans tous les modèles et tâches testés. Pour les modèles à poids ouverts (Llama, Qwen), elle s'est produite régulièrement dans les trois tâches. Les modèles propriétaires ont également présenté le problème, bien qu'avec des fréquences variables.
- Dépendance linguistique : Le phénomène est nettement plus fréquent dans les langues minoritaires (ex. turc, swahili) par rapport à l'anglais. Par exemple, dans les tâches de traduction, jusqu'à 7 % des prompts pour le turc et le swahili ont abouti à des chaînes identiques avec des longueurs de tokenisation différentes.
- Variation de prix : Lorsque la multiplicité se produit, la différence de prix peut être substantielle. Les auteurs ont observé des différences de prix relatives allant jusqu'à 15 % pour une même chaîne de sortie entre la tokenisation la plus courte et la plus longue.
- Sorties longues : Dans les textes longs, les erreurs de tokenisation ont tendance à se propager ; si un mot est généré avec une tokenisation non-canonique, les occurrences suivantes de ce mot suivent souvent le même schéma non-canonique, amplifiant la différence de prix.
Performance de la génération canonique
- Garantie théorique : Les auteurs prouvent que la distribution des séquences de jetons générées via la génération canonique est prouvablement plus proche (en termes de divergence KL) de la distribution réelle des séquences vues lors de l'entraînement que la génération standard.
- Performance empirique : Les expériences sur la traduction, la correction orthographique, la reformulation et le benchmark MGSM (mathématiques multilingues) montrent que la génération canonique est comparable à la génération standard en termes de :
- Qualité : Les métriques telles que les scores de qualité de traduction, la distance d'édition et la similitude cosinus ont montré des différences négligeables (souvent dans la marge d'erreur).
- Temps d'exécution : Le temps par jeton n'a augmenté que marginalement (par exemple, de 0,019s à 0,020s), démontrant l'efficacité de l'algorithme d'échantillonnage basé sur Gumbel-Max.
- Taux de non-canonicité : La génération standard a produit des sorties non-canoniques dans 6 % à 29 % des cas selon le modèle et la tâche, tandis que la génération canonique a réduit ce taux à 0 % par conception.
4. Signification et revendications
L'article affirme fournir la première preuve empirique que la multiplicité de la tokenisation entraîne une variation de prix arbitraire et indésirable dans le modèle LLM-as-a-service, même lorsque les fournisseurs sont « fidèles » (c'est-à-dire qu'ils ne manipulent pas intentionnellement les comptes de jetons).
- Impact économique : Les conclusions remettent en question l'équité du modèle de tarification au jeton, montrant que les utilisateurs peuvent être facturés des montants significativement différents pour une valeur identique (texte) en raison de variations stochastiques de la tokenisation.
- Contribution technique : L'introduction de la génération canonique offre une solution pratique qui élimine cette variation de prix sans sacrifier la performance du modèle ni augmenter significativement la latence.
- Aperçu théorique : La preuve que BPE, Unigram et Wordpiece sont non-récupérateurs fournit une compréhension fondamentale de la raison pour laquelle les séquences non-canoniques apparaissent et comment elles peuvent être évitées via des contraintes étape par étape.
Les auteurs concluent que bien que la génération canonique restreigne légèrement l'espace d'échantillonnage (pouvant potentiellement mener à une performance marginalement inférieure dans certains scénarios contraints), elle résout efficacement le problème de la tarification arbitraire tout en maintenant une génération de sortie de haute qualité.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles NLP chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.