← Últimos artículos
💬 NLP

Tokenisation via Convex Relaxations

Este artículo presenta ConvexTok, un algoritmo de tokenización novedoso que formula la construcción del vocabulario como un programa lineal resoluble mediante optimización convexa, superando así a los métodos codiciosos tradicionales en métricas intrínsecas y eficiencia de los modelos de lenguaje, al tiempo que proporciona un límite certificado sobre su proximidad a la optimalidad.

Autores originales: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

Publicado 2026-05-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: Empacar una Maleta

Imagina que estás intentando empacar una biblioteca masiva de libros en una sola maleta (la memoria de la computadora) para enviársela a un amigo. Para hacerlo de manera eficiente, necesitas un tokenizador.

En el mundo de la IA, un tokenizador es como un set de sellos personalizados. En lugar de enviar cada letra individual de cada libro (lo cual es lento y voluminoso), el tokenizador agrupa las letras en "trozos" o "tokens" (como palabras completas o frases comunes) y envía esos en su lugar. El objetivo es hacer la maleta lo más pequeña posible (alta compresión) mientras aún se puedan reconstruir los libros perfectamente cuando lleguen.

El Problema: El Empacador "Avaricioso"

Actualmente, la mayoría de los modelos de IA utilizan un método llamado BPE (Codificación de Pares de Bytes). Piensa en el BPE como un empacador avaricioso.

  • Cómo funciona: El empacador mira los libros, encuentra las dos letras más comunes que aparecen una al lado de la otra (como "t" y "h"), las pega juntas en un nuevo sello ("th"), y repite este proceso una y otra vez.
  • El defecto: Como el empacador solo mira el siguiente paso inmediato (óptimo localmente), podría pegar dos letras que parecen útiles ahora mismo pero que terminan creando una forma extraña e ineficiente más adelante que no encaja bien en la maleta. Toman una serie de decisiones pequeñas y buenas que conducen a un mal resultado general. Nunca dan un paso atrás para ver la "gran imagen".

La Solución: El Enfoque de "Arquitecto" (ConvexTok)

Los autores de este artículo, Jan Tempus y colegas, decidieron dejar de usar al empacador avaricioso. En su lugar, construyeron un Arquitecto.

Se dieron cuenta de que encontrar la forma perfecta de empacar la maleta es un problema matemático tan difícil que las computadoras usualmente se rinden ante él (es "NP-difícil"). Sin embargo, encontraron un truco inteligente: Relajación Convexa.

  • La Analogía: Imagina intentar encontrar el punto más bajo en una cordillera para construir una casa. El empacador avaricioso simplemente camina cuesta abajo hasta chocar con un pequeño valle y se detiene allí, pensando que es el fondo.
  • El Truco del Arquitecto: Los autores suavizaron las montañas dentadas en un cuenco perfecto y liso (una forma "convexa"). En este cuenco liso, es matemáticamente fácil encontrar el punto absolutamente más bajo.
  • El Resultado: Resolvieron esta versión suave y fácil del problema utilizando una herramienta llamada Programación Lineal (LP). Esto les dio un "plano" para el empaquetado perfecto.

El Obstáculo: Del Plano a la Realidad

El plano que obtuvieron del cuenco liso tenía un problema: sugería usar "sellos a medias". Por ejemplo, podría decir: "Usa 0.7 del sello 'th' y 0.3 del sello 'ing'". No puedes imprimir realmente un sello a medias.

Para arreglar esto, inventaron tres formas de redondear estos números a sellos enteros (como redondear 0.7 hacia arriba a 1):

  1. Determinista (Det): Simplemente elige los KK sellos superiores con las puntuaciones más altas.
  2. Sesgado (Bias): Elige sellos que sean cortos y eficientes, incluso si su puntuación es ligeramente más baja.
  3. Entero (Int): Solo elige sellos de los que el plano tenía un 99% de certeza.

Lo que Encontraron (Los Resultados)

El equipo probó su nuevo método ConvexTok contra el método BPE avaricioso estándar. Esto es lo que sucedió:

  1. Mejor Empaque: Las maletas de ConvexTok fueron consistentemente más pequeñas (mejor compresión) que las maletas de BPE. Esto significa que los modelos de IA podían leer la misma cantidad de texto usando menos "tokens".
  2. La Garantía "Casi Perfecta": Una de las cosas más geniales de su matemática es que proporciona una "cota inferior". Piensa en esto como un certificado que dice: "Sabemos que el tamaño de la maleta perfecta es al menos tan pequeño como esto". Descubrieron que sus maletas ConvexTok estaban dentro del 1% de ese tamaño teórico perfecto. En otras palabras, son casi tan buenas como matemáticamente posible.
  3. Rendimiento de la IA: Cuando entrenaron modelos de IA usando estas nuevas maletas:
    • Los modelos fueron ligeramente mejores entendiendo el texto (medido en "bits por byte").
    • En tareas complejas de razonamiento (como responder acertijos lógicos), los resultados fueron mixtos. A veces ConvexTok fue mejor, a veces BPE fue mejor, pero ConvexTok nunca fue significativamente peor.
  4. Estabilidad: El método avaricioso BPE es muy estable; si le das libros ligeramente diferentes, hace los mismos sellos. El nuevo método ConvexTok es un poco más sensible a los libros específicos que ve, lo que significa que los sellos podrían cambiar ligeramente si cambias los datos de entrenamiento.

Resumen

El artículo argumenta que hemos estado usando un método "avaricioso" para enseñar a la IA a leer durante demasiado tiempo. Al usar matemáticas avanzadas (optimización convexa) para mirar el problema completo de una vez, crearon un nuevo tokenizador llamado ConvexTok.

Es como cambiar de una persona que ciegamente pega las letras más comunes juntas, a un arquitecto que diseña todo el diseño de la maleta de una sola vez. El resultado es una forma más eficiente de comprimir texto, acercándonos al límite teórico de lo pequeños que podemos hacer estas "maletas" de IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →