← Últimos artículos
🤖 machine learning

On-Policy Delta Distillation

Este artículo presenta On-Policy Delta Distillation (OPD2^2), un nuevo método de postentrenamiento para el aprendizaje por refuerzo que aprovecha una "señal delta" —que representa la diferencia entre un modelo profesor y su base previa al ajuste de razonamiento— para transferir capacidades de razonamiento de manera más efectiva y lograr un alto rendimiento en evaluaciones de matemáticas, ciencia y código con un postentrenamiento mínimo.

Autores originales: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

Publicado 2026-07-17
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras son como bibliotecas gigantes y hambrientas que han leído casi todos los libros jamás escritos. Estas bibliotecas, llamadas Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés), son increíblemente inteligentes adivinando la siguiente palabra en una oración. Pero saber cómo terminar una frase no es suficiente para resolver un problema matemático difícil o depurar un programa de computadora roto. Para volverse realmente buenos en esas tareas, necesitamos enseñarles cómo pensar.

Piensa en este proceso como el entrenamiento de un estudiante. Primero, el estudiante lee una biblioteca masiva (pre-entrenamiento) para aprender lo básico del lenguaje. Luego, un profesor viene para darle lecciones específicas sobre cómo resolver acertijos (post-entrenamiento). Usualmente, los profesores usan dos métodos principales: o bien le muestran al estudiante la respuesta perfecta y le dicen: "Copia esto" (Ajuste Fino Supervisado), o dejan que el estudiante lo intente, le dan una calificación y le dicen: "Inténtalo de nuevo, pero hazlo mejor la próxima vez" (Aprendizaje por Refuerzo). Recientemente, un nuevo método llamado "Destilación On-Policy" se volvió popular. Es como un profesor observando al estudiante resolver un problema en tiempo real y susurrándole: "Sí, esa palabra fue buena", o "No, esa palabra estuvo mal", basándose en lo que el profesor habría dicho. Es eficiente y evita el negocio desordenado de diseñar sistemas de calificación complejos.

Pero aquí está el truco: incluso este método inteligente tiene un fallo. Cuando el profesor susurra, puede que accidentalmente susurre cosas que el estudiante ya sabe, como ser educado o contar una historia, en lugar de los momentos de "¡ajá!" específicos de la lógica que hacen al profesor un genio en el razonamiento. El artículo que estás por leer plantea una pregunta simple: ¿Qué pasaría si pudiéramos filtrar el ruido y solo enseñarle al estudiante los nuevos trucos que el profesor aprendió?

Este artículo introduce una técnica ingeniosa llamada Destilación Delta On-Policy (OPD2). Los investigadores se dieron cuenta de que un "Profesor de Razonamiento" es en realidad dos modelos en uno: el modelo "Base" original (antes de aprender a razonar) y el modelo de "Razonamiento" (después de aprender). Si restas los pensamientos del modelo Base de los pensamientos del modelo de Razonamiento, obtienes una "Señal Delta". Esta señal es como un video de los mejores momentos de exactamente lo que cambió cuando el profesor aprendió a pensar. En lugar de solo copiar la respuesta final del profesor, el estudiante aprende de esta "Señal Delta": la diferencia específica que representa el salto en la capacidad de razonamiento.

Los autores probaron esta idea mezclando problemas de matemáticas, ciencia y programación. Descubrieron que usar esta "Señal Delta" como recompensa principal ayudó a los estudiantes a aprender mucho más rápido y mejor que los métodos antiguos. De hecho, su nuevo método, OPD2, superó consistentemente a las técnicas anteriores más avanzadas en diferentes tamaños de modelos, desde modelos diminutos de 1.7 mil millones de parámetros hasta masivos de 8 mil millones. Funcionó tan bien que un modelo más pequeño entrenado con OPD2 podía, a veces, superar a un modelo mucho más grande entrenado con los métodos antiguos. El artículo sugiere que, al enfocarse solo en el cambio en el pensamiento, en lugar de toda la personalidad del profesor, podemos enseñar a la IA a razonar de manera más efectiva sin perder tiempo en lo que ya sabe.

La historia de la señal "Delta"

Sumerjámonos en la mecánica de este descubrimiento usando una analogía simple. Imagina que estás aprendiendo a jugar un videojuego complejo. Tienes una versión "Base" de tu personaje que sabe caminar, saltar y hablar. Luego, consigues una versión "Pro" de ese personaje que ha dominado los niveles más difíciles del juego.

La vieja forma de enseñar (Destilación On-Policy estándar) es como si el personaje Pro estuviera parado junto a ti y dijera: "Haz exactamente lo que yo hago". El problema es que el personaje Pro todavía camina y habla exactamente como lo hacía el personaje Base. Entonces, cuando el Pro dice: "Camina hacia adelante", solo está repitiendo algo que ya sabes hacer. Pasas tu tiempo practicando cómo caminar, no aprendiendo los combos secretos que te convierten en un profesional.

Los autores de este artículo, Byeongho Heo, Jaehui Hwang, Sangdoo Yun y Dongyoon Han, del NAVER AI Lab, propusieron un enfoque diferente. Preguntaron: "¿Qué tal si solo le enseñamos al estudiante la diferencia entre el Pro y el Base?"

Esta diferencia es la Señal Delta.

  • El Modelo Base: Sabe hablar y escribir, pero puede tropezar con la lógica compleja.
  • El Profesor de Razonismo: Sabe hablar, escribir y resolver acertijos lógicos difíciles.
  • El Delta: El "magia" específica que el Profesor aprendió para resolver el acertijo.

En el artículo, visualizan esto con nubes de palabras. Cuando observaron lo que el método antiguo enseñaba, estaba lleno de palabras genéricas como "ver", "intentar" y "verificar". Pero cuando observaron la Señal Delta, las palabras que destacaban eran conectores lógicos como "por lo tanto", "sin embargo", "nota" e "incluso" (en lugar de). Estos son las palabras que pegan un argumento lógico. La Señal Delta efectivamente filtra las cosas "aburridas" que el estudiante ya sabe y resalta la "receta secreta" del razonamiento.

Cómo construyeron OPD2

Para que esto funcionara, los investigadores tuvieron que resolver algunos problemas complicados. Si solo le das a un estudiante la Señal Delta, podría confundirse porque la señal no tiene en cuenta lo que el propio estudiante está haciendo. Es como un entrenador gritando instrucciones sin observar la posición actual del jugador.

Por eso, añadieron dos ingredientes especiales a su receta:

  1. Centrado (Centering): Ajustaron la señal para que esté equilibrada alrededor de cero. Esto ayuda al estudiante a entender si un movimiento es "mejor que el promedio" o "peor que el promedio", en lugar de solo recibir una puntuación bruta que podría ser engañosa.
  2. Condicionamiento Conjunto (Joint Conditioning): Se aseguraron de que la nueva Señal Delta solo se active cuando esté de acuerdo con el método antiguo y estándar. Esto actúa como una red de seguridad. Si la Señal Delta intenta empujar al estudiante en una dirección extraña que contradiga el estilo general del profesor, el sistema dice: "Espera", y detiene la actualización. Esto evita que el estudiante se confunda o se olvide de cómo hablar correctamente mientras intenta aprender a pensar.

Los resultados: Un nuevo campeón

El equipo probó su nuevo método, al que llamaron OPD2, contra el estándar antiguo (OPD) y un método más avanzado llamado ExOPD. Utilizaron una mezcla de 100,000 preguntas de conjuntos de datos de matemáticas, ciencia y programación. Probaron esto en varios modelos, incluyendo la familia Qwen3 (tamaños 1.7B, 4B y 8B) y el modelo Gemma4.

Los resultados fueron impresionantes. En el modo de "no pensamiento" (donde los modelos responden rápidamente sin mostrar su proceso de trabajo), OPD2 superó consistentemente a los demás.

  • Para el modelo Qwen3-1.7B en matemáticas, OPD2 aumentó la puntuación promedio de 34.8 a 54.6. Ese es un salto enorme, superando al siguiente mejor método por más de 3 puntos.
  • Para el Qwen3-4B, OPD2 alcanzó un promedio de 70.3, mientras que el anterior mejor (ExOPD) estaba en 66.4.
  • Incluso más sorprendente, el modelo 4B entrenado con OPD2 funcionó mejor que el modelo 8B entrenado con los métodos antiguos. Esto sugiere que cómo entrenas importa tanto como qué tan grande es tu modelo.

También probaron los modelos en modo de "pensamiento", donde los modelos ya son bastante inteligentes y muestran sus pasos de razonamiento. Esto es más difícil de mejorar porque los modelos ya son buenos. Sin embargo, OPD2 logró extraer rendimiento extra. Por ejemplo, en el benchmark de matemáticas HMMT25, el modelo Qwen3-8B mejoró su puntuación de 44.3 a 52.3 con OPD2, mientras que los otros métodos hicieron que la puntuación empeorara o apenas cambiara.

El método también funcionó en Gemma4, una familia de modelos diferente. Mientras otros métodos tuvieron dificultades o incluso empeoraron el modelo, OPD2 mejoró las puntuaciones de matemáticas de 60.6 a 67.8. Esto demuestra que la idea de usar la "Señal Delta" no es solo un golpe de suerte para un modelo específico; parece ser un principio general que ayuda a la IA a pensar mejor.

Por qué esto es importante

El artículo sugiere que la clave para enseñar a la IA a razonar no es solo alimentarla con más datos o hacer que el profesor sea más grande. Se trata de ser precisos sobre qué estamos enseñando. Al aislar los cambios específicos que ocurren cuando un modelo aprende a razonar (el Delta), podemos transferir esa capacidad de manera mucho más eficiente.

Los autores señalan que este método es computacionalmente eficiente. Requiere aproximadamente un 24-28% más de tiempo para entrenar que el método estándar porque la computadora tiene que ejecutar el modelo "Base" en segundo plano para calcular la diferencia. Sin embargo, dado que estas sesiones de entrenamiento suelen ser cortas (a menudo menos de una pasada completa por los datos), este pequeño costo adicional vale la pena por la enorme ganancia de rendimiento.

En resumen, OPD2 es como un chef maestro que se da cuenta de que para enseñar a un aprendiz el secreto de una sopa perfecta, no debe limitarse a decir "añade sal". Debe decir: "Añade esta cantidad adicional de sal de la que sueles añadir, porque esa es la diferencia entre una sopa buena y una excelente". Al enfocarse en la diferencia, el estudiante aprende el secreto más rápido y mejor. El artículo concluye que este enfoque es un paso significativo hacia la creación de una IA más inteligente, rápida y capaz de resolver los problemas complejos del futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →