← Últimos artículos
💬 NLP

Pass the Baton: Trajectory-Relayed On-Policy Distillation

El artículo presenta Relay-OPD, un nuevo método de destilación on-policy que mitiga el fallo de prefijo mediante la activación dinámica de intervenciones del profesor para corregir las desviaciones en la trayectoria del estudiante, logrando así un rendimiento de vanguardia en evaluaciones de razonamiento matemático al tiempo que reduce significativamente la longitud de la trayectoria de entrenamiento.

Autores originales: Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde computadoras gigantes y súper inteligentes (llamadas Modelos de Lenguaje Extensos) están aprendiendo a resolver acertijos complejos, como problemas matemáticos o enigmas de lógica. Para enseñárselos, solemos utilizar una configuración de "maestro-estudiante". El maestro es un modelo masivo y poderoso que conoce las respuestas, y el estudiante es un modelo más pequeño y rápido que intenta aprender de él. Normalmente, el maestro simplemente escribe la solución perfecta y el estudiante la copia. Pero hay una forma más inteligente llamada Destilación On-Policy. En lugar de solo copiar un ensayo terminado, el estudiante intenta escribir la solución por sí mismo. Si se queda atascado o toma el camino equivocado, el maestro interviene para guiar la próxima palabra, justo en ese momento. Esto es genial porque le enseña al estudiante cómo pensar, no solo qué memorizar.

Sin embargo, este método tiene un fallo complicado. Si el estudiante comete un error temprano —como tomar un giro equivocado en un laberinto— el maestro intenta guiar el resto del viaje. Pero debido a que el estudiante ya está perdido, la guía del maestro suele volverse confusa o poco fiable, y el estudiante sigue deambulando fuera de curso. Es como intentar dar direcciones a alguien mientras ya está conduciendo en la dirección equivocada; cuanto más conduce, más confundido se siente. Este artículo aborda ese problema específico: ¿cómo evitamos que el estudiante se pierda irremediablemente antes de que la ayuda del maestro sea inútil?

La Carrera de Relevos del Razonamiento

Los autores de este artículo, trabajando con modelos de la familia Qwen, se dieron cuenta de que cuando un modelo estudiante comienza a salirse de los rieles, el maestro y el estudiante realmente empiezan a discrepar sobre qué hacer a continuación. El estudiante, obstinadamente comprometido con su idea errónea, quiere seguir recto. El maestro, al ver el error, quiere detenerse, reflexionar y cambiar de dirección.

Llaman a este momento de desacuerdo un "disparador de traspaso" (handoff trigger). Piensa en esto como una carrera de relevos. En una carrera estándar, si el corredor (el estudiante) tropieza y comienza a correr en la dirección equivocada, el entrenador (el maestro) podría simplemente gritar instrucciones desde la línea de banda, pero el corredor sigue tropezando. En este nuevo método, llamado Relay-OPD, en el momento en que el entrenador ve que el corredor se dirige hacia un precipicio, el entrenador interviene, toma el testigo y corre unos pasos en la dirección correcta para resetear la trayectoria del corredor. Luego, el entrenador devuelve el testigo, y el estudiante continúa la carrera, ahora por el camino correcto.

Cómo Funciona: Los Tokens de "Pero" y "Espera"

El sistema es ingenioso porque no necesita que un humano le diga cuándo ocurre un error. Observa las probabilidades. Si el maestro tiene una alta probabilidad de decir una palabra de "reflexión" como "Pero", "Espera" o "Sin embargo" (que señalan un cambio de pensamiento), pero el estudiante tiene la probabilidad de decir "Entonces" o "Ahora" (que señalan la continuación del pensamiento actual), el sistema sabe: ¡Estamos fuera de ruta!

En ese instante exacto, el maestro toma el control durante un breve "tramo" del viaje. El maestro escribe un párrafo corto para corregir el razonamiento, luego devuelve el control al estudiante. El estudiante entonces termina el resto del problema, aprendiendo del camino corregido.

Los investigadores descubrieron que esta intervención no necesita ser larga. De hecho, el maestro solo necesita escribir aproximadamente el 0.35% de las palabras totales para marcar una gran diferencia. Es como un entrenador dando un solo empujón agudo para corregir la forma de un corredor, en lugar de correr toda la carrera por él.

Los Resultados: Más Inteligentes y Rápidos

El equipo probó esto en ocho bancos de pruebas matemáticos diferentes, utilizando modelos estudiantes de diferentes tamaños (0.6 mil millones y 1.7 mil millones de parámetros) y un maestro de 4 mil millones de parámetros. Los resultados fueron impresionantes:

  • Mejores Puntuaciones: Los estudiantes de Relay-OPD obtuvieron puntuaciones significativamente más altas que aquellos que utilizaban métodos estándar. Para el modelo de 1.7 mil millones de parámetros, mejoró la puntuación promedio en un 5.73% sobre el método estándar y superó al siguiente mejor competidor por un 1.49%.
  • Menos Tiempo Desperdiciado: Debido a que el sistema evita que el estudiante deambule por callejones sin salida, el proceso de entrenamiento se volvió mucho más eficiente. La longitud promedio de las trayectorias de entrenamiento se redujo en más del 50%. Los estudiantes aprendieron lo mismo en la mitad del tiempo.
  • El "Tramo" Importa: Los investigadores demostraron que la breve corrección del maestro (el "tramo del maestro") era crucial. Simplemente detener al estudiante cuando cometía un error (sin que el maestro lo arreglara primero) no funcionaba tan bien. El maestro tenía que mostrarle al estudiante cómo retomar el camino.

Lo Que No Es

El artículo es cuidadoso en mostrar lo que este método no es. No se trata solo de cortar respuestas largas prematuramente (como intentaron otros métodos), ni se trata de reescribir todo el ensayo del estudiante después de que ha terminado. Es una corrección en tiempo real, "en el momento". Tampoco se trata de que el maestro tome el control de toda la carrera; el estudiante sigue haciendo la mayor parte del trabajo. El maestro solo interviene en esos estallidos cortos y críticos cuando el estudiante está a punto de cometer un error permanente.

En resumen, Relay-OPD es como una red de seguridad que atrapa a un estudiante que cae justo antes de tocar el suelo, lo redirige suavemente y le permite seguir corriendo. Convierte un posible desastre en un momento de aprendizaje, haciendo que los modelos de IA sean más inteligentes, más rápidos y menos propensos a perderse en sus propios pensamientos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →