← Últimos artículos
🤖 AI

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

El artículo presenta DASH (Divergence-Adaptive Supervision Horizons), un método que mejora la autodestilación on-policy para modelos de razonamiento mediante el ajuste adaptativo de los pesos de supervisión a nivel de token basándose en la evolución temporal de las divergencias entre profesor y estudiante, mejorando así el rendimiento en evaluaciones matemáticas sin requerir pasadas hacia adelante adicionales.

Autores originales: ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

Publicado 2026-08-07
📖 7 min de lectura🧠 Análisis profundo

Autores originales: ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras están aprendiendo a resolver acertijos complejos, como problemas matemáticos avanzados o la escritura de código de programación, practicando una y otra vez. Este campo se llama Aprendizaje por Refuerzo (Reinforcement Learning), donde la computadora (el "estudiante") intenta diferentes respuestas y recibe un simple "sí" o "no" al final para ver si acertó. El problema es que, si el estudiante toma un camino largo y sinuoso para llegar allí, ese único "sí" o "no" no le dice qué pasos específicos fueron buenos y cuáles fueron malos. Es como recibir una "B" en un examen final sin saber qué preguntas fallaste. Para solucionar esto, los investigadores utilizan un truco llamado "Autodestilación On-Policy" (On-Policy Self-Distillation). Piensa en esto como un estudiante que le pide a un "profesor privilegiado" (que conoce la clave de respuestas secreta) que califique cada uno de los pasos de su viaje a medida que avanza. Esto le proporciona al estudiante un flujo denso de retroalimentación en lugar de solo uno al final. Pero aquí está el truco: la forma estándar de utilizar este profesor trata cada paso de la retroalimentación exactamente igual, como si un error cometido al principio fuera tan importante como un error cometido al final, independientemente de cómo estuviera cambiando el desempeño del estudiante.

Este artículo presenta un nuevo método llamado DASH (Horizontes de Supervisión Adaptativos a la Divergencia) para solucionar ese punto ciego. Los investigadores descubrieron que el enfoque estándar es demasiado rígido; no presta atención a la historia de los errores del estudiante. A veces, un pequeño error al principio puede llevar a un desastre total más tarde, mientras que un error similar más tarde puede ser inofensivo. DASH actúa como un editor inteligente que observa la secuencia completa de la retroalimentación. Si el estudiante se está alejando de los consejos del profesor de una manera que sugiere un problema creciente, DASH amplifica el peso de esas señales para corregir el rumbo. Si el estudiante lo está haciendo bien, reduce su intensidad. El artículo muestra que, al realizar estos ajustes, DASH ayuda al estudiante a aprender mucho más rápido y mejor que antes, mejorando sus puntuaciones de razonamiento matemático a través de diferentes tamaños de modelos sin necesidad de potencia de cómputo adicional o un profesor más inteligente.

El Problema: El Calificador de "Talla Única"

En el mundo de entrenar IA para razonar, tenemos un modelo estudiante y un modelo profesor. El estudiante genera una larga cadena de pensamientos (un "rollout") para resolver un problema. El profesor, que tiene acceso a la solución correcta, observa al estudiante y dice: "Oye, en esta palabra específica, deberías haber elegido esta otra palabra". Esto se llama supervisión a nivel de token.

El método estándar, llamado OPSD (Autodestilación On-Policy), recolecta todas estas pequeñas señales de "estás equivocado" del profesor y las promedia. Es como un profesor que le entrega a un estudiante una boleta de calificaciones donde cada error cuenta exactamente lo mismo, sin importar cuándo ocurrió.

Los autores se dieron cuenta de que esto es un poco absurdo. Imagina a un estudiante resolviendo un problema matemático.

  • Escenario A: El estudiante comete un pequeño error de cálculo en el paso 1, pero luego se corrige a sí mismo y lo arregla en el paso 2. La "divergencia" (la brecha entre el estudiante y el profesor) fue alta por un momento, pero luego desapareció.
  • Escenario B: El estudiante comete exactamente el mismo error en el paso 1, pero luego lo hace cada vez peor, cayendo en una espiral hacia una respuesta completamente errónea para el paso 10.

En el OPSD estándar, ambos escenarios reciben exactamente la misma "penalización" por ese primer paso. El sistema no se da cuenta de que en el Escenario B, ese primer error fue el inicio de un desastre, mientras que en el Escenario A, fue solo un tropiezo menor. El método estándar trata el error local de forma aislada, ignorando el historial de cómo se desempeñó el estudiante hasta ese momento y el futuro de hacia dónde podría llevar ese error.

La Solución: DASH, el Entrenador Adaptativo

Los autores proponen DASH para darle al sistema de calificación una memoria y un sentido de contexto. En lugar de solo promediar los errores, DASH pregunta: "¿Cómo encaja este error específico en la historia de toda la respuesta?".

Así es como funciona DASH, usando una analogía simple:

Imagina que el estudiante está caminando por un sendero y el profesor sostiene una cuerda atada a la cintura del estudiante. La "divergencia" es qué tan lejos se está alejando el estudiante del camino ideal del profesor.

  1. Medir la Brecha: DASH observa qué tan lejos está el estudiante del profesor en cada paso.
  2. El Mecanismo de "Comuerta" (Gate): En lugar de simplemente tirar del estudiante hacia atrás con la misma fuerza cada vez, DASH utiliza una "compuerta" especial.
    • Si el estudiante está haciendo peor de lo normal (la brecha se está agrandando), la compuerta se abre de par en par. Esto significa que la retroalimentación del profesor para los pasos futuros recibe una señal más fuerte para atraer al estudiante de vuelta con fuerza. Dice: "¡Oye, esta es una mala tendencia! Necesitamos prestar especial atención para corregir este camino".
    • Si el estudiante lo está haciendo mejor de lo normal (la brecha es pequeña), la compuerta se cierra un poco. La retroalimentación del profesor sigue ahí, pero no grita tan fuerte porque el estudiante ya está en el camino correcto.
  3. Mirar hacia Atrás: DASH utiliza un truco ingenioso llamado "agregación hacia atrás" (backward aggregation). Comienza al final de la respuesta y trabaja de regreso hacia el principio. Pregunta: "Si miro el final de este camino, ¿cuánto contribuyó este paso específico al desastre (o éxito) final?". Luego, ajusta el peso de la retroalimentación para ese paso basándose en lo que sucedió después.

Esto crea un sistema dinámico donde la "importancia" de un error no es fija. Un error que conduce a una larga serie de errores recibe un peso pesado. Un error que se corrige rápidamente recibe un peso más ligero.

Lo Que Encontraron

Los investigadores probaron esta idea en tres tamaños diferentes de modelos de IA (1.7 mil millones, 4 mil millones y 8 mil millones de parámetros) utilizando tres evaluaciones matemáticas difíciles (AIME 2024, AIME 2025 y HMMT Febrero 2025).

  • Los Resultados: DASH superó consistentemente al método estándar (OPSD) en todos los ámbitos. Para el modelo más pequeño (1.7B), la precisión promedio saltó del 41.87% al 45.07%. Para los modelos más grandes, las ganancias también fueron claras, con el modelo de 8B pasando del 64.80% al 66.40%.
  • El "Porqué": A través de una serie de experimentos, demostraron que la mejora no se debió simplemente a que añadieron más "ruido" o cambiaron la matemática de forma aleatoria. Probaron qué pasaría si usaran una compuerta fija (como el método antiguo) frente a una compuerta inteligente y cambiante. La compuerta inteligente (DASH) fue la ganadora. También verificaron si la dirección de la lógica importaba (por ejemplo, ¿deberíamos castigar más o menos las brechas grandes?). Encontraron que su lógica específica —castigar las brechas grandes abriendo la compuerta más ampliamente para permitir más corrección— fue la clave.
  • Eficiencia: Lo mejor es que DASH no necesita un profesor súper inteligente ni potencia de cómputo adicional. Simplemente reutiliza la información que el método estándar ya estaba calculando, pero la procesa de una manera más inteligente. Es como tomar un montón de datos brutos y organizarlos mejor, en lugar de recolectar más datos.

La Conclusión

El artículo sugiere que cuando enseñamos a la IA a razonar, no debemos limitarnos a contar errores; debemos entender la historia de los errores. Al hacer que la supervisión sea "adaptativa" —cambiando cuánto escuchamos al profesor según cómo se desempeña el estudiante a lo largo del tiempo— podemos ayudar a la IA a aprender de manera mucho más efectiva. DASH demuestra que un poco de contexto llega muy lejos, convirtiendo un sistema de calificación rígido en un entrenador flexible e inteligente que sabe cuándo ser estricto y cuándo ser permisivo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →