← Últimos artículos
💬 NLP

Compute Optimal Tokenization

Este artículo demuestra que en las configuraciones de modelos de lenguaje óptimas para el cómputo, la cantidad de parámetros escala proporcionalmente al tamaño de los datos medido en bytes en lugar de en tokens, revelando que la tasa óptima de compresión de tokens difiere del BPE estándar y disminuye a medida que aumenta el cómputo.

Autores originales: Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

Publicado 2026-05-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás construyendo la biblioteca definitiva del conocimiento. Tienes una cantidad fija de dinero (tu presupuesto de computación) para construir esta biblioteca. Tienes dos opciones principales:

  1. Comprar un edificio masivo con millones de estantes vacíos (Tamaño del Modelo).
  2. Comprar una enorme pila de libros para llenar esos estantes (Datos de Entrenamiento).

Durante años, los expertos dijeron a los bibliotecarios: "Para obtener la mejor biblioteca, compra 20 libros por cada estante que construyas". Pero este consejo tenía un defecto oculto: asumía que todos los libros tenían el mismo tamaño. En realidad, algunos libros son enciclopedias gruesas, mientras que otros son folletos delgados.

Este artículo, titulado "Tokenización Óptima de Computación", argumenta que hemos estado midiendo nuestros libros en la unidad incorrecta. En lugar de contar "libros" (tokens), deberíamos estar contando "páginas" (bytes).

Aquí está el desglose de sus hallazgos utilizando analogías simples:

1. El problema del "Tamaño del Libro" (Tasa de Compresión)

En el mundo de la IA, el texto se divide en trozos llamados tokens.

  • Baja Compresión: Imagina cortar una oración en letras individuales. Obtienes una enorme pila de trozos diminutos (muchos tokens).
  • Alta Compresión: Imagina agrupar palabras enteras o incluso frases en trozos únicos. Obtienes una pila más pequeña de trozos grandes (menos tokens).

El artículo pregunta: ¿Importa qué tan grandes sean nuestros trozos?
La respuesta es . El tamaño del trozo (llamado tasa de compresión) cambia la eficiencia con la que podemos construir nuestra biblioteca.

2. Encontrando el punto dulce: La regla de "Bytes vs. Tokens"

Los investigadores entrenaron casi 1.000 modelos de IA diferentes, ajustando el tamaño de los trozos y el tamaño del modelo. Descubrieron una nueva regla para el equilibrio perfecto:

  • La Vieja Regla: "Compra 20 tokens por parámetro". (Esto solo funciona si tus tokens tienen un tamaño específico, como los tokens BPE estándar).
  • La Nueva Regla: "Compra 60 bytes de texto por parámetro".

La Analogía:
Piensa en tu modelo de IA como un chef y los datos como ingredientes.

  • Si le das al chef ingredientes prepicados y diminutos (alta compresión), puede cocinar muchas comidas rápidamente.
  • Si le das vegetales enteros (baja compresión), tiene que picarlos primero, lo cual toma tiempo.
  • El artículo encontró que no importa cómo piques los vegetales, el chef rinde mejor cuando tiene un peso específico de ingredientes (60 bytes) por cada unidad de su habilidad (parámetro). No importa si ese peso son 20 trozos grandes o 100 migajas diminutas; lo que importa es el peso total.

3. La tasa de compresión "Justa" (Goldilocks)

Podrías pensar: "¡Si hago los trozos más grandes, ahorro más tiempo, así que debería hacerlos tan grandes como sea posible!".
El artículo dice: No tan rápido.

Descubrieron que existe una zona de Goldilocks para el tamaño de los trozos.

  • Demasiado pequeño: El modelo se abruma con demasiados trozos diminutos de datos.
  • Demasiado grande: El modelo pierde demasiados detalles porque los trozos son demasiado gruesos.
  • Justo: Existe una tasa de compresión específica que produce el modelo más inteligente para un presupuesto dado.

El Giro: A medida que obtienes más dinero (más potencia de computación), el tamaño "Justo" en realidad se vuelve más pequeño.

  • Analogía: Si tienes una cocina pequeña, quizás quieras vegetales prepicados para ahorrar tiempo. Pero si tienes una cocina masiva y profesional con personal ilimitado, quizás prefieras vegetales enteros porque puedes procesarlos tan eficientemente que el detalle extra vale la pena el esfuerzo.

4. Una talla no sirve para todos (El idioma importa)

Los investigadores probaron esto en diferentes idiomas (inglés, hindi, árabe, ruso, etc.). Descubrieron que el tamaño "Justo" de los trozos depende del idioma.

  • La Analogía: Imagina hacer maletas para diferentes viajes.
    • Para un viaje a un país donde la gente habla un idioma con palabras muy compactas (como el inglés), quizás empacaras artículos ligeramente más grandes.
    • Para un viaje a un país donde las palabras son más largas o usan scripts diferentes (como el hindi o el árabe), la forma "óptima" de hacer la maleta cambia.
  • El artículo encontró que las herramientas de IA populares (como Llama 3 o Qwen) a menudo usan un método de empaquetado "talla única". Esto funciona aceptablemente para el inglés, pero a menudo está demasiado comprimido para algunos idiomas y no lo suficientemente comprimido para otros. Básicamente, están empacando artículos del tamaño incorrecto para el viaje específico.

Resumen de las conclusiones clave

  1. Deja de contar tokens, empieza a contar bytes. Al planificar cuántos datos alimentar a una IA, mide el tamaño crudo del texto (bytes), no la cantidad de trozos (tokens). La proporción debería ser aproximadamente 60 bytes de texto por cada 1 millón de parámetros en el modelo.
  2. Existe un tamaño de trozo perfecto. Hacer los tokens demasiado grandes o demasiado pequeños perjudica el rendimiento. Existe un "punto dulce" específico para la compresión.
  3. El punto dulce cambia. A medida que obtienes computadoras más potentes, en realidad deberías usar trozos ligeramente más pequeños (menor compresión) para obtener los mejores resultados.
  4. El idioma importa. El tamaño de trozo perfecto es diferente para el hindi que para el inglés. Los modelos de IA actuales a menudo usan una configuración genérica que no es óptima para cada idioma.

En resumen: Para construir la IA más inteligente posible, no sigas simplemente la vieja regla de "20 tokens por parámetro". En su lugar, iguala el peso del texto al tamaño del cerebro, y ajusta el tamaño de los trozos de texto en función de cuánta potencia de computación tienes y qué idioma estás enseñándole.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →