← Últimos artículos
🤖 machine learning

Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families

Este artículo presenta un algoritmo de mapeo de tokens preciso que permite que la Destilación On-Policy opere a través de diferentes familias de modelos con tokenizadores distintos, superando limitaciones previas y demostrando una eficiencia computacional significativamente mejorada en comparación con los métodos de cross-tokenizer existentes.

Autores originales: Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

Publicado 2026-06-09
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: Dos Expertos Hablando Diferentes Idiomas

Imagina que tienes un Profesor brillante (un modelo de IA grande) que es experto en resolver problemas matemáticos. También tienes un Estudiante (un modelo de IA más pequeño) que quiere aprender del Profesor.

En el pasado, para que el Estudiante aprendiera de manera efectiva del Profesor, tenían que hablar exactamente el mismo "idioma". En términos de IA, esto significaba que tenían que usar el mismo Tokenizador.

  • ¿Qué es un Tokenizador? Piensa en él como un diccionario que divide las oraciones en pequeños fragmentos (tokens).
    • El Diccionario del Profesor: Podría dividir la palabra "corriendo" en dos fragmentos: corr + iendo.
    • El Diccionario del Estudiante: Podría mantener "corriendo" como un único fragmento: corriendo.

Si el Profesor dice: "Lo hiciste genial en la parte de corr", el Estudiante (que solo ve corriendo como una sola pieza) se confunde. No sabe a qué parte de su fragmento único se refiere el elogio del Profesor. Este desajuste significaba que la poderosa "Destilación On-Policy" (una forma de enseñanza de alta tecnología donde el estudiante aprende mientras practica) solo podía ocurrir entre modelos que ya eran de la misma familia y compartían el mismo diccionario.

La Solución: Un Traductor Inteligente

Este artículo presenta un nuevo método llamado Cross-Tokenizer On-Policy Distillation (Destilación On-Policy de Tokenizador Cruzado). Los autores construyeron un "Traductor Inteligente" que permite que el Profesor y el Estudiante aprendan el uno del otro incluso si usan diccionarios completamente diferentes.

Así es como funciona su sistema, paso a paso:

1. La Danza de los "Dos Punteros" (Encontrando la Coincidencia)

Imagina que el Profesor y el Estudiante están leyendo la misma historia, pero el Profesor la lee en frases cortas, mientras que el Estudiante la lee en oraciones largas.

  • Los autores crearon un algoritmo (llamado Dual-Pointer Chunk Alignment) que actúa como dos personas caminando una al lado de la otra.
  • Una persona señala los fragmentos del Profesor, la otra los del Estudiante.
  • Mueven sus dedos hacia adelante hasta encontrar un punto donde el significado del texto coincida perfectamente, incluso si el número de palabras es diferente.
  • El Resultado: Identifican "Fragmentos Sincronizados". Por ejemplo, se dan cuenta de que los tres fragmentos diminutos del Profesor (1, 2, 0) son exactamente iguales a la palabra grande del Estudiante (120).

2. La "Asignación de Crédito" (Compartiendo el Elogio)

Una vez que encuentran un fragmento que coincide, deben decidir cómo repartir la retroalimentación del Profesor.

  • El Problema: El Profesor dio una puntuación para tres palabras pequeñas. El Estudiante solo tiene una palabra grande. ¿Cómo dividimos esa puntuación?
  • La Solución: El artículo utiliza un "Prior Semántico" (una forma elegante de decir "lo que el Estiente ya pensaba").
    • Si el Estudiante ya estaba bastante seguro de la palabra 120, recibe una parte menor del elogio del Profesor.
    • Si el Estudiante estaba confundido o sorprendido por 120, recibe una parte mayor del elogio para ayudarlo a aprender más rápido.
  • Esto asegura que el Estudiante aprenda las lecciones correctas sin perder su propia forma única de pensar.

Por qué esto es un Gran Cambio (Los Resultados)

Los autores probaron esto enseñando a un modelo "Llama" (Estudiante) usando un modelo "Qwen" (Profesor). Estos son dos tipos de familias de IA muy diferentes con diccionarios distintos.

  1. Funciona Mejor: El Estudiante aprendió mucho más rápido y se volvió más inteligente en matemáticas y programación que si solo hubiera intentado memorizar las respuestas del Profesor (el método antiguo).
  2. Ahorra una Energía Masiva: Esta es la parte más sorprendente.
    • Forma Antigua (SFT): Para alcanzar el mismo nivel de inteligencia, el Estudiante necesitaría leer 480,000 ejemplos adicionales.
    • Nueva Forma (OPD): El Estudiante solo necesitó 20,000 ejemplos para alcanzar el mismo nivel.
    • La Analogía: Es como la diferencia entre intentar aprender un idioma leyendo un diccionario 10 veces frente a tener una conversación con un hablante nativo que corrige tus errores en tiempo real. La conversación (OPD) es mucho más eficiente.

La Conclusión

Este artículo rompe un "muro" que mantenía aislados a los modelos de IA. Antes, solo podías enseñar a un estudiante si hablaba el mismo "lenguaje de tokens" que el profesor. Ahora, gracias a este nuevo "Traductor Inteligente", podemos emparejar cualquier IA poderosa con cualquier IA más pequeña, independientemente de cómo dividan las palabras, y transferir el conocimiento de manera eficiente.

Los autores descubrieron que este método no solo es posible, sino que es significativamente más barato y rápido que los métodos anteriores, abriendo la puerta a una variedad mucho más amplia de modelos de IA para aprender entre sí.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →