← Últimos artículos
🤖 machine learning

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

Este artículo revela que, si bien la autodestilación on-policy con demostraciones muestreadas logra una sólida precisión pass@1, reduce inadvertidamente la diversidad de la salida y aplana el rendimiento pass@k al amplificar los sesgos existentes del modelo mediante la retroalimentación compuesta, limitando en última instancia la capacidad del modelo para generar estrategias diversas para tareas fuera de la distribución.

Autores originales: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

Publicado 2026-06-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Efecto "Cámara de Eco"

Imagina que estás intentando aprender a resolver un laberinto. Tienes un profesor que es, en realidad, solo una versión de ti mismo un poco mayor.

En una configuración de aprendizaje estándar (llamada Aprendizaje por Refuerzo o RL), si encuentras cualquier camino correcto a través del laberinto, el profesor dice: "¡Buen trabajo!" y te da una recompensa. No importa si tomaste la ruta escénica larga y sinuosa o la autopista corta y directa. Mientras llegues a la salida, recibes el mismo choque de manos. Esto te anima a probar muchos caminos diferentes.

En el método que estudia este artículo, llamado Autodestilación con Demostraciones Muestreadas (SDSD), el profesor trabaja de forma distinta. Antes de que empieces, el profesor elige un camino correcto específico que tú (o alguien más) encontró antes y dice: "Está bien, quiero que intentes resolver el laberinto exactamente como este camino específico".

El artículo argumenta que, si bien este método te ayuda a obtener la respuesta correcta muy a menudo (alta precisión), secretamente te vuelve perezoso y repetitivo. Dejas de explorar nuevos caminos porque el profesor solo te elogia cuando imitas el camino específico que él está sosteniendo.

El Problema Central: "El Rico se Hace Más Rico"

Los autores descubrieron un costo oculto de este método: la Périda de Diversidad.

Piénsalo como una canción popular en la radio.

  • RL Estándar: Si una canción nueva es buena, el DJ la pone. Si otra canción nueva también es buena, la pone también. Obtienes una mezcla de éxitos.
  • Autodestilación (SDSD): El DJ elige la única canción que ya se está reproduciendo más. Le dice a la banda: "Tóquenla tal como esa canción".
    • Si la banda toca una canción que suena aunque sea ligeramente parecida al éxito, el profesor la ama y la refuerza.
    • Si la banda toca una canción completamente diferente (pero aún así correcta), el profesor se confunde o es menos entusiasta porque no coincide con la "demostración muestreada" que él sostiene.

Con el tiempo, la banda deja de tocar algo nuevo. Solo tocan variaciones de ese único éxito. Se vuelven increíblemente buenos en esa única canción, pero si la estación de radio pide un género diferente, fallan.

Lo que el Artículo Encontró (La Evidencia)

Los investigadores probaron esto en dos temas principales:

1. El Juego del "Laberinto de Grafos"
Crearon un juego donde una IA tenía que encontrar un camino a través de un grafo compuesto por diferentes conceptos (como aves, frutas o formas).

  • La Trampa: Algunos caminos eran cortos y fáciles; otros eran largos y difíciles.
  • El Resultado: Los modelos SDSD encontraron los caminos fáciles muy rápido y obtuvieron puntuaciones altas. Sin embargo, ignoraron por completo los caminos largos y difíciles.
  • El Fracaso: Cuando los investigadores cambiaron las reglas (haciendo que todos los caminos fueran largos), los modelos SDSD colapsaron. Habían aprendido a depender del hábito de la "ruta fácil" y no pudieron adaptarse. Los modelos de RL, habiendo practicado muchas rutas diferentes, manejaron las nuevas reglas fácilmente.

2. Preguntas de Ciencia
Probaron los modelos con preguntas de ciencia (Biología, Química, Física).

  • La Métrica: Observaron el pass@k. Esto pregunta: "Si le pedimos a la IA que genere 16 respuestas diferentes, ¿cuántas de ellas son correctas?".
  • El Hallazgo: Los modelos SDSD fueron excelentes para obtener la primera respuesta correcta (pass@1). Pero cuando se les pidió generar 16 respuestas, casi las 16 eran la misma respuesta, solo que escrita de forma ligeramente distinta.
  • El Contraste: Los modelos de RL generaron 16 respuestas correctas diferentes. Si la primera era incorrecta, la decimosexta podría ser correcta. Los modelos SDSD no ofrecían planes de respaldo.

¿Por qué sucede esto? (La Balanza "Inclinada")

El artículo utiliza matemáticas pesadas para explicar por qué, pero aquí está la versión sencilla:

Imagina una balanza que equilibra diferentes soluciones.

  • El RL Estándar trata todas las soluciones correctas como iguales. Si la Solución A y la Solución B son ambas correctas, la balanza se mantiene equilibrada.
  • La Autodestilación inclina la balanza. Mira la "demostración" (el camino de ejemplo) y pregunta: "¿Qué tanto se parece la Solución A al ejemplo?". Si la Solución A se parece un poco al ejemplo, la balanza se inclina fuertemente a su favor. Si la Solución B es diferente, la balanza se inclina en su contra.

Debido a que la IA está viendo constantemente sus propias respuestas "populares" como los ejemplos, la balanza se inclina cada vez más hacia esas respuestas populares. Las respuestas "impopulares" pero correctas son aplastadas. Esto se llama Colapso de Modo (Mode Collapse): la IA colapsa en una única forma de pensar.

La Trampa de la "Entropía"

El artículo también señala un problema de medición engañoso. Usualmente, los científicos miden la "diversidad" contando cuántas palabras diferentes usa la IA (Entropía de Tokens).

  • El artículo encontró que los modelos SDSD pueden seguir usando una gran variedad de palabras (alta diversidad de palabras) mientras siguen pensando de la misma manera exacta (baja diversidad semántica).
  • Es como dos personas escribiendo ensayos. Uno escribe sobre "gatos" y el otro sobre "perros". Usan palabras diferentes, pero si ambos argumentan exactamente el mismo punto con la misma estructura, no son realmente diversos en su pensamiento. Los modelos SDSD hacen esto: barajan las palabras pero se aferran a la misma estrategia rígida.

La Conclusión

El artículo concluye que la Autodestilación con Demostraciones Muestreadas es un arma de doble filo.

  • Lo Bueno: Hace que los modelos sean muy precisos para obtener la respuesta correcta al primer intento para los problemas que ya han visto antes.
  • Lo Malo: Destruye la capacidad del modelo para pensar de forma creativa o probar diferentes estrategias. Si el problema cambia ligeramente, o si el primer intento es erróneo, el modelo no tiene un plan de respaldo.

Los autores sugieren que, si queremos que la IA sea robusta y adaptable, no podemos limitarnos a observar con qué frecuencia obtiene la respuesta correcta. Tenemos que verificar si realmente está probando diferentes enfoques, o si solo está repitiendo el mismo truco una y otra vez.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →