← Últimos artículos
💬 NLP

In-Place Tokenizer Expansion for Pre-trained LLMs

Este artículo presenta un método de expansión de tokenizador in situ que actualiza LLM preentrenados mediante la continuación de las fusiones BPE en un corpus multilingüe e inicializando nuevos embeddings a través del promedio de sub-tokens, reduciendo así significativamente el recuento de tokens y mejorando la velocidad de decodificación para idiomas como el hindi y el vietnamita sin sacrificar la calidad del modelo.

Autores originales: Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner

Publicado 2026-07-17
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El lenguaje de las máquinas: Una breve introducción

Imagina que le estás enseñando a un robot a hablar. Para hacer esto, no puedes simplemente darle un diccionario con cada palabra del universo; eso sería demasiado pesado para cargar. En su lugar, le das un conjunto de piezas de construcción. En el mundo de la Inteligencia Artificial, estas piezas se llaman tokens. Piensa en los tokens como los trozos más pequeños de texto que una computadora entiende—a veces una palabra completa como "gato", pero a menudo solo una sílaba como "ga" o incluso una sola letra como "g".

Cuando un robot aprende un idioma, decide cómo dividir las oraciones en estos bloques. Si aprende inglés primero, podría tener un bloque especial para la palabra "the". Pero si más tarde le pides que hable hindi o vietnamita, y no estaba preparado para esos idiomas, podría tener que dividir esas palabras en piezas diminutas e ineficientes, como "h-i-n-d-i" en lugar de "Hindi". Esto es como intentar construir una casa con un martillo cuando en realidad necesitas un destornillador; funciona, pero es lento, torpe y desperdicia energía. Este artículo aborda el problema de cómo actualizar la "caja de herramientas" de un robot (su vocabulario) después de haber sido entrenado, sin tener que reconstruir todo el robot desde cero.


El rompecabezas de la caja de herramientas rota

Conoce a Jimmy y su equipo en Liquid AI. Estaban trabajando en un robot muy inteligente llamado LFM2, que vive en dispositivos como teléfonos y computadoras portátiles. Este robot era excelente en inglés y programación, pero cuando intentaba hablar idiomas como el hindi, el vietnamita o el tailandés, tropezaba. ¿Por qué? Porque su vocabulario era como una caja de herramientas que había sido empacada para un viaje a Londres, no a Bangkok. Cuando el robot intentaba escribir "Hindi", no tenía un solo bloque para la palabra completa. En su lugar, tenía que usar cuatro o cinco bloques diminutos para armarla. Esto hacía que el robot fuera lento, se cansara y tuviera hambre de batería.

El equipo enfrentó una elección difícil. Podían tirar a la basura su trabajo duro, construir un robot completamente nuevo con una mejor caja de herramientas y empezar de nuevo. O podían intentar meter un nuevo conjunto de herramientas en el robot viejo sin romperlo. La segunda opción es como intentar añadir un nuevo cajón a un motor de coche totalmente ensamblado y en funcionamiento mientras todavía conduce por la autopista. La mayoría de la gente pensaba que esto era imposible o demasiado arriesgado.

La actualización "en el lugar"

El equipo descubrió una forma ingeniosa de hacer exactamente eso. Lo llamaron Expansión del Tokenizador. En lugar de tirar la caja de herramientas vieja, conservaron las herramientas originales y simplemente añadieron nuevas al final de la caja.

Así fue como lo hicieron, paso a paso:

  1. El copiar y pegar inteligente: Tomaron la lista de piezas de construcción existente del robot y le pidieron que siguiera aprendiendo con una mezcla de muchos idiomas diferentes. A medida que el robot aprendía nuevas palabras, no desechaba los bloques viejos. En su lugar, creaba nuevos bloques más grandes para palabras como "Hindi" o "Thai". Crucialmente, cada nuevo bloque se construía uniendo los bloques viejos y más pequeños que ya conocía. Era como darse cuenta de que, si tienes un bloque "H" y un bloque "i", puedes unirlos para hacer un bloque "Hi", y luego unir eso con "nd" e "i" para hacer "Hindi".
  2. El pegamento mágico (Inicialización de Embeddings): Ahora el robot tenía nuevos bloques, pero no sabía qué significaban. El equipo tuvo que enseñarle al robot qué representaban estos nuevos bloques. Usaron un truco simple pero brillante: observaron los bloques viejos que componían el nuevo y le dieron al nuevo bloque el "promedio" del significado de sus partes. Si un nuevo bloque estaba hecho de tres bloques viejos, el cerebro del robot le dio la personalidad promedio de esos tres. Esto significaba que el robot no tenía que adivinar; comenzaba con una muy buena suposición.
  3. El entrenamiento de dos etapas: El robot no estaba listo para correr un maratón todavía. Si lo dejaban correr inmediatamente, tropezaría. Así que realizaron un entrenamiento de dos etapas:
    • Etapa 1: Congelaron el cerebro del robot (todo excepto los nuevos bloques) y solo dejaron que los nuevos bloques aprendieran. Esto fue como dejar que los nuevos cajones en la caja de herramientas se acostumbraran a sostener cosas sin mover el resto del coche.
    • Etapa 2: Una vez que los nuevos bloques se sintieron cómodos, descongelaron a todo el robot y lo dejaron practicar la lectura y escritura en muchos idiomas nuevamente. Esto ayudó al robot a entender cómo los nuevos bloques encajaban en el panorama general.

Los resultados: Más rápido, más inteligente y más ligero

Los resultados fueron impresionentes. Al usar esta nueva caja de herramientas expandida, el robot podía hablar hindi, vietnamita y tailandés de manera mucho más eficiente.

  • El texto en hindi se dividió en 2.4 veces menos bloques.
  • El vietnamita fue 2.6 veces menos.
  • El tailandés tuvo el mayor salto, necesitando 4.0 veces menos bloques.

Debido a que el robot tenía que procesar menos bloques para decir lo mismo, se volvió mucho más rápido. El equipo estimó que, en un teléfono, hablar estos idiomas podía ser de 2.2 a 3.7 veces más rápido por carácter. Era como cambiar de caminar a andar en bicicleta; el robot recorría la misma distancia en una fracción del tiempo.

Lo que aprendieron (y lo que evitaron)

El equipo también aprendió qué no hacer, lo cual es igual de importante.

  • No toques las herramientas viejas: En un experimento, intentaron que el robot volviera a aprender los significados de sus bloques viejos mientras añadía los nuevos. Esto confundió al robot y empezó a repetirse como un disco rayado. Descubrieron que mantener los bloques viejos exactamente como estaban era el secreto del éxito.
  • No solo leas inglés: Cuando intentaron enseñar al robot los nuevos bloques usando principalmente texto en inglés, el robot se volvió bueno respondiendo preguntas de opción múltiple, pero terrible en la práctica de escribir oraciones. Podía elegir la respuesta correcta pero no podía contar una historia. Aprendieron que debían alimentarlo con una dieta equilibrada de muchos idiomas para mantenerlo sano.

La conclusión

Este artículo muestra que no siempre necesitas construir un nuevo robot para que hable un nuevo idioma. Si eres quien construyó el robot, puedes actualizar su vocabulario en medio de su vida. Al añadir cuidadosamente nuevas herramientas y darles el "promedio" significado correcto, puedes hacer que el robot sea más rápido y eficiente para todos, sin perder las habilidades que ya tenía. Es una receta práctica para hacer que la IA sea más inclusiva y rápida, directamente en el dispositivo que llevas en tu bolsillo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →