← Últimos artículos
💬 NLP

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty

Este artículo cuantifica una "tasa de tokenización" en 25 idiomas europeos, revelando que los idiomas no ingleses, especialmente el ucraniano y aquellos con morfología compleja, sufren ratios significativamente más altos de tokens por palabra debido a la subrepresentación en los datos de preentrenamiento, mientras demuestra que estas clasificaciones de fertilidad se mantienen consistentes entre dominios y que los efectos de pocos ejemplos son intrínsecos al modelo y no dependen del idioma.

Autores originales: Volodymyr Ovcharov

Publicado 2026-05-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Volodymyr Ovcharov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás pagando por un viaje en taxi. En inglés, el taxi te cobra por "parada" (una palabra). Pero en ucraniano, el conductor del taxi insiste en cobrarte por "paso" (un pequeño fragmento de una palabra). Debido a que las palabras ucranianas suelen ser más largas y complejas, el conductor da muchos más pasos para llegar al mismo destino. Terminas pagando el doble por exactamente el mismo viaje, aunque la distancia no haya cambiado.

Este artículo, escrito por Volodymyr Ovcharov, trata sobre ese "impuesto" oculto que sufren los idiomas distintos al inglés al utilizar la IA. Aquí tienes el desglose de lo que descubrieron, usando analogías sencillas:

1. El impuesto por "paso" (Fertilidad del tokenizador)

Los modelos de IA no leen palabras completas como lo hacen los humanos. Dividen el texto en fragmentos diminutos llamados tokens.

  • La analogía: Imagina una palabra como una barra de pan.
    • Inglés: La IA corta la barra en rebanadas grandes y gruesas. Solo necesitas 1,2 rebanadas para representar una palabra.
    • Ucraniano: La IA usa un cuchillo romo y corta la misma barra en trozos diminutos y desmenuzados. Se necesitan 2,7 rebanadas para representar una palabra.
  • El costo: Dado que las empresas de IA te cobran por "rebanada" (token), hablar ucraniano te cuesta aproximadamente 2,2 veces más que hablar inglés por la misma cantidad de texto.
  • La jerarquía: El artículo midió 25 idiomas europeos.
    • El grupo barato: Inglés, español y francés (1,2 a 1,7 rebanadas por palabra).
    • El grupo medio: Alemán y neerlandés (1,7 a 1,9 rebanadas).
    • El grupo caro: Idiomas eslavos como el polaco y el checo (2,2 a 2,5 rebanadas).
    • Los más caros: Ucraniano, griego y maltés (alrededor de 3,1 rebanadas).

2. La "penalización ucraniana"

Los investigadores descubrieron algo sorprendente sobre el ucraniano. Aunque el ucraniano, el polaco y el checo son todos primos eslavos con estructuras de palabras similares, el ucraniano es significativamente más costoso de procesar.

  • La analogía: Imagina dos fábricas idénticas. Una (Polonia) tiene un suministro bien provisto de ladrillos precortados porque ha estado construyendo durante mucho tiempo. La otra (Ucrania) tiene que cortar cada ladrillo desde piedra bruta porque fue ignorada en el pasado.
  • La causa: El artículo muestra que el ucraniano tiene de 2 a 6 veces menos datos de entrenamiento en la "biblioteca" de la IA en comparación con el polaco o el checo. Como la IA no ha visto palabras ucranianas con tanta frecuencia, no sabe cómo agruparlas de manera eficiente. Sigue cortándolas en trozos diminutos e ineficientes.

3. El cuchillo "talla única"

El artículo probó si este "impuesto" cambia dependiendo de lo que estés hablando (por ejemplo, contratos legales vs. noticias vs. Wikipedia).

  • El hallazgo: No importa. La clasificación de qué IA es "barata" y cuál es "cara" se mantiene exactamente igual, ya sea que estés hablando de fútbol, derecho o historia.
  • La conclusión: Si pruebas una IA con un tipo de texto, sabes exactamente cuánto te costará para cualquier otro tipo de texto. No necesitas volver a probarla cada vez.

4. El "truco de magia" (Aprendizaje con pocos ejemplos)

La IA a veces puede aprender una nueva tarea simplemente viendo unos pocos ejemplos (como mostrarle una pregunta y respuesta de muestra). Los investigadores probaron si este "truco de magia" funcionaba de manera diferente para distintos idiomas.

  • El hallazgo: El truco no se trata del idioma; se trata de la personalidad de la IA (su diseño).
    • Algunas IAs (como "Nemotron") se vuelven más inteligentes cuando se les muestran ejemplos, sin importar si el texto es ucraniano, polaco o ruso.
    • Otras IAs (como "Maverick") en realidad se vuelven menos inteligentes cuando se les muestran ejemplos, nuevamente, sin importar el idioma.
  • La lección: No culpes al idioma por la confusión de la IA. Culpa el diseño de la IA. Si una IA falla con ejemplos en inglés, probablemente fallará con ejemplos en ucraniano también.

5. Por qué algunas IAs son mejores cortando

Los investigadores miraron bajo el capó para ver cómo cortan las palabras diferentes IAs.

  • Los buenos cortadores: Algunas IAs (como Gemma 2) cortan las palabras ucranianas en los límites naturales de los "morfemas" (las partes significativas de una palabra, como raíces y terminaciones). Esto es eficiente.
  • Los malos cortadores: Otras IAs (como Qwen3) cortan las palabras en puntos aleatorios, a veces dividiendo una sola parte significativa por la mitad. Es como cortar un sándwich justo por el medio de un pepinillo en lugar de entre las rebanadas de pan.
  • La sorpresa: Tener un diccionario más grande (vocabulario) no garantiza un mejor corte. Algunas IAs con diccionarios enormes aún cortaban las palabras ucranianas en trozos diminutos e ineficientes porque simplemente no tenían suficientes ejemplos ucranianos en sus datos de entrenamiento para aprender los cortes correctos.

Resumen de recomendaciones

El artículo sugiere tres reglas simples para cualquiera que utilice la IA con el ucraniano o idiomas similares:

  1. Espera el impuesto: Presupuesta el hecho de que el ucraniano costará aproximadamente el doble que el inglés.
  2. Prueba una vez: Solo necesitas medir el "impuesto" una vez; se aplica a todos los temas.
  3. Ten cuidado con los ejemplos: No asumas que mostrarle ejemplos a una IA la ayudará. Para algunos modelos, podría incluso perjudicar el rendimiento, y esto ocurre en todos los idiomas.

La conclusión final: El mundo de la IA se construye actualmente con un sesgo hacia el inglés. Hasta que las "bibliotecas" de datos de entrenamiento estén equilibradas, idiomas como el ucraniano pagarán un "impuesto por paso" oculto solo para ser comprendidos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →