← Últimos artículos
💬 NLP

Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models

Este artículo sostiene que la tokenización debe ser reimaginada como una decisión de modelado central que requiere un codiseño sensible al contexto con el modelo, en lugar de un paso de preprocesamiento estático, para abordar problemas de desalineación lingüística, sesgo e ineficiencia en los modelos de lenguaje de gran tamaño.

Autores originales: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

Publicado 2026-01-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un estudiante brillante (un Modelo de Lenguaje Grande) cómo leer y entender el mundo. Antes de que el estudiante pueda aprender, tienes que decidir cómo dividir los libros que leerá. ¿Los cortas en palabras completas? ¿En letras individuales? ¿O en pequeños fragmentos de letras, como sílabas o grupos de letras comunes?

Este proceso de dividir el texto en piezas se llama tokenización.

Según este artículo, la forma en que lo hacemos actualmente es como un hábito de "configurar y olvidar". Normalmente tomamos unas tijeras estándar (una herramienta prefabricada llamada Codificación de Par de Bytes, o BPE) y simplemente empezamos a cortar, asumiendo que funciona para todos. Los autores argumentan que esto es un error. Dicen que la tokenización no es solo un paso de preparación aburrido; es, de hecho, una de las decisiones de diseño más importantes que realizas al construir una IA.

Aquí está el argumento del artículo, desglosado con analogías sencillas:

1. El Probleo: Las tijeras de "talla única"

Actualmente, la mayoría de los modelos de IA utilizan el mismo método de tokenización estándar. El artículo compara esto con usar un único par de tijeras para cortar todo: un delicado pañuelo de seda, un grueso suéter de lana y una lámina de metal.

  • El problema: Este método estándar a menudo corta en lugares extraños. Por ejemplo, podría trocear una palabra compleja en un idioma que no es el inglés en fragmentos diminutos y sin sentido, o podría dividir un comando de código de una manera que confunda a la IA.
  • El resultado: La IA tiene que trabajar más duro para entender el texto, se vuelve menos eficiente e incluso puede aprender sesgos porque los "cortes" favorecen a ciertas lenguas o tipos de palabras sobre otras.

2. El Cambio: De "trabajo de preparación" a "diseño central"

Los autores quieren que dejemos de tratar la tokenización como lavar los platos antes de cocinar. En su lugar, dicen que debería ser parte de la receta misma.

  • La analogía: Imagina que estás construyendo una casa. No agarrarías simplemente cualquier ladrillo que esté por ahí esperando que encaje. Elegirías ladrillos específicamente para los cimientos, las paredes y el techo basándote en el clima y el diseño.
  • La afirmación: La tokenización debe elegirse cuidadosamente en función de qué se supone que debe hacer la IA (por ejemplo, escribir código, diagnosticar problemas médicos o hablar múltiples idiomas) y a quién se dirige.

3. La Solución: Un kit de herramientas "consciente del contexto"

El artículo propone una nueva forma de pensar llamada marco de trabajo consciente del contexto. Esto significa que no solo eliges una herramienta; diseñas la herramienta para el trabajo específico.

  • Codiseño: En lugar de elegir un tokenizador y luego entrenar la IA, deberías diseñarlos juntos. Si la IA está aprendiendo a leer revistas médicas, el tokenizador debe ser entrenado con textos médicos para que sepa que "inmunohistoquímica" es una unidad importante, no un revoltijo de letras aleatorias.
  • Adaptación: Si estás usando una IA para un idioma específico (como el árabe) o un campo específico (como el derecho), es posible que necesites ajustar las "tijeras" para que corten de manera diferente a como lo harían con noticias generales en inglés.

4. Los Peligros Ocultos: Sesgo y Seguridad

El artículo advierte que una mala tokenización no es solo una cuestión de eficiencia; puede ser injusta o peligrosa.

  • El "fallo silencioso": Algunas palabras o caracteres podrían cortarse tan mal que la IA nunca llegue a entender realmente lo que significan. El artículo llama a esto "tokens subentrenados". Es como darle a un estudiante un libro de texto donde la mitad de las palabras están borrosas; adivinarán, pero no entenderán realmente.
  • Sesgo: Si el tokenizador corta las palabras de ciertas culturas o idiomas en trozos diminutos pero mantiene las palabras en inglés completas, la IA entenderá naturalmente mejor el inglés y tendrá más dificultades con los demás. Esto crea una ventaja injusta para algunos grupos.
  • Seguridad: Los hackers a veces pueden explotar las formas extrañas en que la IA corta el texto para engañarla y hacer que haga cosas que no debería.

5. La Solución: Una Nueva Lista de Verificación

Los autores sugieren un proceso estructurado para cualquiera que construya una IA:

  1. No reutilices sin más: No agarres automáticamente un tokenizador de un modelo famoso (como LLaMA) sin comprobar si se ajusta a tus necesidades.
  2. Audita los cortes: Comprueba si el tokenizador corta de manera justa entre diferentes idiomas y si está creando piezas extrañas e inútiles.
  3. Mide lo que importa: Deja de contar simplemente en cuántos pedazos se corta el texto. En su lugar, mide si la IA realmente entiende mejor el significado con estos cortes.

La Conclusión

El artículo concluye que la tokenización es la base de la comprensión de la IA. Si construyes esa base con una herramienta genérica y mal diseñada, toda la casa (la IA) será inestable, ineficiente e injusta. Al tratar la tokenización como una decisión de diseño crítica —personalizándola para el idioma, la tarea y la audiencia específicos— podemos construir una IA que sea más inteligente, más rápida y más justa para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →