Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
Autores originales: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
Autores originales: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: La multiplicidad de la tokenización conduce a una variación arbitraria de precios en el modelo de LLM como servicio
1. Declaración del Problema
El artículo aborda un problema crítico, aunque pasado por alto, en la economía de los Modelos de Lenguaje de Gran Tamaño (LLM) ofrecidos como servicio (LLM-as-a-service). Actualmente, los proveedores utilizan predominantemente un modelo de precios por token, donde se cobra al usuario un precio fijo por cada token generado. El supuesto estándar es que los prompts de entrada idénticos que producen cadenas de salida idénticas deberían resultar en costos idénticos.
Sin embargo, los autores demuestran que este supuesto es erróneo debido a la multiplicidad de la tokenización. Incluso cuando un LLM genera exactamente la misma cadena de texto (carácter por carácter) a partir del mismo prompt de entrada, la secuencia subyacente de tokens puede diferir. Dado que el precio se basa en el recuento de tokens y no en el recuento de caracteres, estas diferentes tokenizaciones conducen a variaciones de precio arbitrarias para la misma salida. Este fenómeno es particularmente prevalente en idiomas distintos al inglés y afecta tanto a modelos propietarios como a modelos de pesos abiertos.
2. Metodología
Investigación Empírica
Los autores realizaron extensos estudios empíricos en tres tareas de lenguaje natural: traducción, corrección ortográfica y refraseo.
- Configuración: Construyeron 100 prompts de entrada por tarea utilizando textos cortos de Wikipedia. Para la traducción, probaron pares de 1 idioma origen (inglés) a 5 idiomas destino; para corrección ortográfica y refraseo, probaron 6 idiomas.
- Ejecución: Cada prompt fue introducido al LLM 100 veces con parámetros idénticos pero con diferentes semillas aleatorias para simular diferentes usuarios solicitando la misma tarea.
- Modelos: El estudio incluyó modelos propietarios (GPT-4o-mini, GPT-4.1, GPT-5-mini, Gemini, Claude) y modelos de pesos abiertos (Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct).
- Medición: Identificaron pares de salidas donde las cadenas decodificadas eran idénticas pero las longitudes de tokenización diferían. Midieron la probabilidad de esta ocurrencia y la magnitud de la variación de precio resultante.
Análisis Teórico
El artículo define formalmente la tokenización canónica como la tokenización única que una cadena recibe durante el proceso de entrenamiento del LLM (determinada por el codificador). Los autores demuestran un resultado teórico clave respecto a los tokenizadores no recuperables:
- Teorema: Para los tokenizadores BPE, Unigram y Wordpiece, si una secuencia de tokens parcial es no canónica, cualquier extensión de esa secuencia (añadir más tokens) también será no canónica.
- Implicación: Para generar una secuencia de salida canónica, el modelo debe generar secuencias parciales canónicas en cada paso. Esta propiedad permite estrategias de generación restringida.
Solución Propuesta: Generación Canónica
Para eliminar la variación de precio, los autores introducen la generación canónica, un método de generación restringida que limita al LLM a generar únicamente la tokenización canónica de cualquier cadena de texto.
- Algoritmo: Proponen un algoritmo de muestreo eficiente basado en el truco de Gumbel-Max.
- En lugar de computar explícitamente una nueva distribución de probabilidad (lo que requeriría verificar la canonicidad de todos los tokens del vocabulario), el algoritmo muestrea ruido Gumbel para cada token.
- Clasifica los tokens por sus log-probabilidades perturbadas.
- Itera a través de los tokens clasificados y selecciona el primero que, al ser añadido a la secuencia actual, resulte en una secuencia canónica.
- Este enfoque redistribuye efectivamente la masa de probabilidad de los tokens no canónicos a los tokens canónicos restantes sin una normalización costosa.
3. Resultados Clave
Multiplicidad de la Tokenización
- Prevalencia: La multiplicidad de la tokenización se observó en todos los modelos y tareas probados. Para los modelos de pesos abiertos (Llama, Qwen), ocurrió regularmente en las tres tareas. Los modelos propietarios también exhibieron el problema, aunque con frecuencias variables.
- Dependencia del Idioma: El fenómeno es significativamente más prevalente en idiomas minoritarios (por ejemplo, turco, suajili) en comparación con el inglés. Por ejemplo, en tareas de traducción, hasta el 7% de los prompts para turco y suajili resultaron en cadenas idénticas con longitudes de tokenización distintas.
- Variación de Precio: Cuando ocurre la multiplicidad, la diferencia de precio puede ser sustancial. Los autores observaron diferencias de precio relativas de hasta un 15% para la misma cadena de salida entre la tokenización más corta y la más larga.
- Salidas Largas: En textos más largos, los errores de tokenización tienden a propagarse; si una palabra se genera con una tokenización no canónica, las ocurrencias subsiguientes de esa palabra suelen seguir el mismo patrón no canónico, agravando la diferencia de precio.
Rendimiento de la Generación Canónica
- Garantía Teórica: Los autores demuestran que la distribución de secuencias de tokens generadas mediante la generación canónica es demostrablemente más cercana (en términos de divergencia KL) a la distribución real de secuencias vistas durante el entrenamiento que la generación estándar.
- Rendimiento Empírico: Los experimentos en traducción, corrección ortográfica, refraseo y el benchmark MGSM (matemáticas multilingües) muestran que la generación canónica es comparable a la generación estándar en términos de:
- Calidad: Las métricas como las puntuaciones de calidad de traducción, la distancia de edición y la similitud de coseno mostraron diferencias insignificantes (a menudo dentro del margen de error).
- Tiempo de Ejecución: El tiempo por token aumentó solo marginalmente (por ejemplo, de 0.019s a 0.020s), lo que demuestra la eficiencia del algoritmo de muestreo basado en Gumbel-Max.
- Tasa de No Canonicidad: La generación estándar produjo salidas no canónicas en el 6% al 29% de los casos, dependiendo del modelo y la tarea, mientras que la generación canónica redujo esta tasa al 0% por diseño.
4. Significado y Reivindicaciones
El artículo afirma proporcionar la primera evidencia empírica de que la multiplicidad de la tokenización conduce a una variación de precio arbitraria y no deseada en el modelo de LLM como servicio, incluso cuando los proveedores son "fieles" (es decir, no manipulan intencionadamente los recuentos de tokens).
- Impacto Económico: Los hallazgos cuestionan la equidad del modelo de pago por token, mostrando que los usuarios pueden ser cobrados cantidades significativamente diferentes por un mismo valor (texto) debido a variaciones estocásticas en la tokenización.
- Contribución Técnica: La introducción de la generación canónica ofrece una solución práctica que elimina esta variación de precio sin sacrificar el rendimiento del modelo ni aumentar significativamente la latencia.
- Perspectiva Teórica: La demostración de que BPE, Unigram y Wordpiece son no recuperables proporciona una comprensión fundamental de por qué surgen las secuencias no canónicas y cómo pueden prevenirse mediante restricciones paso a paso.
Los autores concluyen que, si bien la generación canónica restringe ligeramente el espacio de muestreo (lo que podría conducir a un rendimiento marginalmente inferior en escenarios específicos de restricción), resuelve eficazmente el problema de la fijación de precios arbitraria manteniendo una generación de alta calidad.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de NLP cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.