← Últimos artículos
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

Este artículo desafía la noción de que "SFT memoriza y RL generaliza" al demostrar, mediante análisis por puntos de control y espectrales, que SFT a menudo provoca un olvido fuera de la distribución que posteriormente es restaurado por RL, un proceso de recuperación vinculado a la rotación de los vectores singulares en lugar de cambios en los valores singulares.

Autores originales: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

Publicado 2026-05-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Panorama General: La Danza de "Dos Pasos" del Entrenamiento de la IA

Imagina que estás enseñando a un estudiante brillante pero inexperto (un Modelo de Lenguaje Grande) a resolver rompecabezas complejos. La receta estándar para convertir a este estudiante en un experto en razonamiento implica dos pasos:

  1. Paso 1: Ajuste Fino Supervisado (SFT) – Le das al estudiante un libro de texto con respuestas y dices: "Memoriza estos patrones y copia el estilo".
  2. Paso 2: Aprendizaje por Refuerzo (RL) – Pones al estudiante en un juego donde gana puntos por respuestas correctas y pierde puntos por las incorrectas, diciendo: "Ahora, descubre la lógica tú mismo para ganar".

Durante mucho tiempo, la comunidad de la IA creyó una historia simple: "El SFT hace que el estudiante memorice el libro de texto (bueno para problemas conocidos), y el RL hace que el estudiante generalice y piense creativamente (bueno para problemas nuevos)."

Este artículo dice que esa historia está incompleta. Los autores descubrieron que, aunque el SFT es excelente al principio, en realidad comienza a perjudicar la capacidad del estudiante para resolver nuevos tipos de rompecabezas si le permites estudiar el libro de texto durante demasiado tiempo. Entonces, el RL no necesariamente les enseña nuevos superpoderes; principalmente repara el daño que causó el SFT.


El Descubrimiento: El "Pico y el Colapso"

Los investigadores observaron el progreso del estudiante cada día durante el proceso de entrenamiento. Encontraron un patrón sorprendente:

  • La Victoria Temprana: Al muy inicio del "estudio del libro de texto" (SFT), el estudiante se vuelve muy bueno resolviendo nuevos tipos de rompecabezas (tareas fuera de distribución o OOD). Es como si el estudiante de repente entendiera la lógica subyacente de las matemáticas.
  • El Colapso: A medida que el estudiante sigue estudiando el libro de texto, comienza a obtener peores resultados en los rompecabezas nuevos, aunque obtiene mejores resultados en los problemas específicos del libro de texto. Se vuelven tan obsesionados con el formato exacto de las respuestas del libro de texto que olvidan cómo aplicar la lógica a situaciones ligeramente diferentes.
  • La Solución: Cuando finalmente cambian a la fase de "juego" (RL), el rendimiento del estudiante en los rompecabezas nuevos se recupera y sube.

La Analogía:
Imagina a un chef aprendiendo a cocinar.

  • SFT Temprano: El chef aprende las reglas básicas del sabor. Puede cocinar una gran comida con cualquier ingrediente.
  • SFT Tardío: El chef se ve obligado a memorizar un libro de recetas específico. Se vuelve increíble cocinando ese plato exacto, pero olvida cómo ajustar los sabores si se le dan ingredientes diferentes. Ha "olvidado" su intuición general de cocina.
  • RL: Se pone al chef en una competencia donde gana puntos por comida sabrosa, independientemente de la receta. Esto lo obliga a dejar de seguir ciegamente el libro y comenzar a usar su intuición nuevamente. Recupera sus habilidades generales de cocina, pero no se convierte repentinamente en un chef mejor de lo que era al inicio de su entrenamiento.

El Hallazgo Clave: El RL es un "Restaurador", no un "Creador"

El artículo desafía la idea de que el RL crea nuevas capacidades de razonamiento desde cero. En cambio, los autores encontraron:

  1. El SFT Olvida: Si entrenas demasiado tiempo con datos específicos, el modelo "olvida" su capacidad para manejar situaciones extrañas o nuevas.
  2. El RL Recupera: El RL actúa como un vendaje. Parcha los agujeros que hizo el SFT, restaurando el modelo al nivel de rendimiento que tenía en el pico de la fase de SFT.
  3. El Techo: El RL rara vez hace que el modelo sea mejor que ese pico temprano. Simplemente lo devuelve a donde estaba antes de volverse demasiado especializado.

La Zona "Ricitos de Oro":
Los investigadores descubrieron que el RL solo funciona si lo inicias en el momento correcto.

  • Si inicias el RL demasiado pronto (antes de que el modelo conozca lo básico), falla porque el modelo está demasiado confundido.
  • Si inicias el RL demasiado tarde (después de que el modelo ha olvidado todo), las señales del "juego" son demasiado desordenadas para que el modelo aprenda de ellas.
  • Existe un "punto dulce" específico (un rango de puntos de control) donde el RL puede sanar con éxito el olvido.

El Mecanismo Secreto: La "Brújula Giratoria"

Para entender por qué sucede esto, los autores miraron dentro del cerebro del modelo utilizando una herramienta matemática llamada Descomposición en Valores Singulares (SVD). Imagina que el conocimiento del modelo es una brújula gigante con muchas agujas apuntando en diferentes direcciones.

  • El Tamaño de las Agujas (Valores Singulares): Los investigadores descubrieron que la fuerza de estas agujas (cuánto conocimiento se almacena) apenas cambia durante el entrenamiento. Se mantienen estables.
  • La Dirección de las Agujas (Vectores Singulares): Sin embargo, la dirección a la que apuntan las agujas cambia drásticamente.

La Analogía:
Imagina que el conocimiento del modelo es un mapa.

  • El SFT no borra el mapa (el tamaño de los datos permanece igual), pero rota el mapa. Gira la brújula para que el "Norte" apunte hacia los ejemplos específicos del libro de texto, haciendo difícil encontrar el "Norte" para ubicaciones nuevas y diferentes.
  • El RL rota la brújula de nuevo. No añade nueva tierra al mapa; simplemente re-alinea la brújula para que el "Norte" apunte a la lógica general nuevamente, permitiendo que el modelo navegue por nuevos terrenos.

Resumen para el Lector Cotidiano

  • Antigua Creencia: "El SFT memoriza, el RL generaliza".
  • Nueva Realidad: "El SFT olvida (por sobre-especializarse), y el RL recupera (re-alineando)".
  • La Lección: No sigas entrenando tu IA con los mismos datos específicos para siempre. Perderá su capacidad de pensar con flexibilidad. Si quieres que sea inteligente sobre cosas nuevas, necesitas detener la fase de "memorización" en el momento correcto y usar la fase de "juego" para corregir el enfoque, en lugar de esperar que el juego le enseñe habilidades completamente nuevas desde cero.

El artículo concluye que el mejor rendimiento para resolver problemas nuevos y difíciles a menudo ocurre temprano en el proceso de entrenamiento, y la segunda etapa (RL) está principalmente allí para salvarnos de los errores que cometimos al entrenar demasiado tiempo en la primera etapa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →