← Últimos artículos
💬 NLP

Tokenization with Split Trees

Este artículo presenta ToaST, un método novedoso de tokenización de subpalabras que utiliza árboles de división y programación entera para optimizar la selección del vocabulario con el fin de minimizar la cantidad de tokens, logrando mejoras significativas en la eficiencia de compresión y el rendimiento de los modelos de lenguaje en comparación con las líneas base existentes como BPE y WordPiece.

Autores originales: Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner

Publicado 2026-05-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Craig W. Schmidt, Michael Krumdick, Adam Wiemerslage, Seth Ebner, Varshini Reddy, Yuval Pinter, Chris Tanner

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enviar una biblioteca masiva de libros a través de internet, pero tu conexión a internet es lenta. Para hacer la transferencia más rápida, quieres comprimir los libros en la menor cantidad posible de "trozos" (tokens) sin perder ningún significado.

Durante mucho tiempo, la forma estándar de hacerlo fue como un constructor de Lego que comienza con ladrillos individuales diminutos (letras) y los pega juntos uno por uno, solo cuando ve que dos ladrillos se unen con frecuencia. Este método, llamado BPE, es rápido y codicioso, pero no siempre es el más eficiente. Podría pegar dos ladrillos juntos que realmente no pertenecen, o perder la oportunidad de pegar una palabra completa porque se quedó atascado primero en una pieza más pequeña.

El artículo introduce un nuevo método llamado ToaST (Tokenización con Árboles de División). Así es como funciona, usando algunas analogías simples:

1. El "Árbol de Posibilidades" (Split Trees)

En lugar de pegar cosas juntas, ToaST comienza con una palabra completa (como "Kentucky") y pregunta: "Si tuviera que cortar esta palabra por la mitad, ¿dónde sería el mejor lugar para hacerlo?"

Examina una base de datos masiva de la frecuencia con la que aparecen diferentes partes de las palabras en el mundo real. Elige el corte que divide la palabra en dos piezas que son ambas muy comunes. Luego, toma esas dos piezas y hace la misma pregunta de nuevo. Sigue haciendo esto hasta llegar a letras individuales.

  • La Analogía: Imagina que tienes un pan gigante, sin cortar. En lugar de cortarlo al azar, miras un mapa de dónde la gente suele comer pan. Encuentras el lugar perfecto para cortarlo para que ambas mitades sean tamaños populares. Luego tomas esas mitades y las cortas de nuevo en los lugares más populares. Terminas con un árbol genealógico de cada forma posible de cortar esa palabra, desde el pan entero hasta las migajas individuales.

2. El "Menú Inteligente" (Selección de Vocabulario)

Ahora, tienes un árbol de millones de cortes posibles. No puedes usarlos todos; solo tienes espacio para un número específico de "ítems del menú" (un tamaño de vocabulario, digamos 40,000).

Los métodos antiguos simplemente elegían los cortes más populares. ToaST utiliza un optimizador matemático (un Programa Entero) para jugar un juego de "¿Qué pasaría si?":

  • Si elijo este gran trozo de "Kentucky" como un solo token, ¿cuántos trozos totales ahorro?
  • Si elijo "Kent" y "ucky" por separado, ¿eso ahorra más espacio en otro lugar?

Calcula la combinación perfecta de cortes que resulta en la menor cantidad total de trozos necesaria para escribir toda la biblioteca. Es como un chef que planifica un menú no solo basándose en lo que es popular, sino en cómo servir a la mayor cantidad de clientes con la menor cantidad total de platos.

3. El "Truco de Magia" (La Inferencia)

Una vez establecido el menú, leer el texto es rápido. Cuando la computadora ve "Kentucky", mira la parte superior del árbol.

  • ¿Está "Kentucky" en el menú? ¿Sí? Genial, envíalo como un solo token.
  • ¿Está "Kentucky" en el menú? ¿No? Entonces mira al siguiente nivel hacia abajo. ¿Está "Kent" en el menú? ¿Sí? Envía "Kent", luego mira al otro lado para buscar "ucky".

Como el árbol se construyó antes de elegir el menú, el camino siempre está claro. No hay reglas confusas ni escenarios de "¿qué pasa si cambio esto?".

¿Por qué es esto mejor?

El artículo afirma que para bibliotecas grandes (tamaños de vocabulario de 40,000+), ToaST es significativamente mejor que los métodos antiguos:

  • Compresión: Reduce la cantidad de trozos necesarios en más de un 11%. Piensa en esto como reducir un documento de 100 páginas a 89 páginas sin perder una sola palabra.
  • Eficiencia: Utiliza menos tokens de "letra individual" (como enviar solo la letra 'y' o 'u'). Esto hace que el flujo de datos sea más suave y eficiente.
  • Rendimiento: Cuando entrenaron un modelo de lenguaje (un cerebro que aprende a hablar) usando este nuevo método, el modelo tuvo un mejor rendimiento en las pruebas. Obtuvo puntuaciones más altas en tareas de razonamiento y lógica en comparación con los modelos entrenados con los métodos antiguos.

La Conclusión

ToaST es una nueva forma de descomponer el texto. En lugar de pegar piezas ciegamente, traza cada forma posible de cortar una palabra, luego utiliza un potente solucionador matemático para elegir el conjunto absolutamente mejor de cortes para minimizar la cantidad total de datos. El resultado es una forma más eficiente, rápida e inteligente para que las computadoras lean y escriban lenguaje.

Nota: El artículo solo probó esto en texto en inglés. No afirma que estos resultados se apliquen a otros idiomas todavía, ni discute usos médicos o clínicos. Las mejoras se refieren estrictamente a qué tan eficientemente se procesa el texto y qué tan bien los modelos de lenguaje se desempeñan en las pruebas estándar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →