← Últimos artículos
🤖 machine learning

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

Este artículo demuestra que el método estándar de SFT seguido de RL supera a los métodos de política mixta, revelando que investigaciones recientes reportaron resultados erróneos debido a dos errores de implementación en optimizadores y agregación de pérdidas que penalizaban injustamente el rendimiento del SFT.

Autores originales: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

Publicado 2026-04-28
📖 3 min de lectura☕ Lectura para el café

Autores originales: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Error de los "Entrenadores de Inteligencia Artificial"

Imagina que estás organizando un concurso de matemáticas para niños. Tienes dos formas de prepararlos:

  1. El Método Tradicional (SFT-then-RL): Primero, les das un libro de texto con todos los problemas resueltos paso a paso para que aprendan la lógica (esto es el SFT o Aprendizaje Supervisado). Una vez que ya saben resolver problemas, los dejas practicar solos y les das una estrella cada vez que aciertan (esto es el RL o Aprendizaje por Refuerzo).
  2. El Método "Moderno" (Mixed-Policy): En lugar de enseñarles primero, intentas que aprendan la teoría y practiquen al mismo tiempo, mezclando el libro de texto con los intentos de resolver problemas en una sola sesión intensa.

Recientemente, muchos científicos dijeron: "¡Oigan! El método moderno es mucho mejor que el tradicional". Pero este nuevo estudio acaba de descubrir que no es que el método moderno sea mejor, es que el método tradicional estaba siendo evaluado con "profesores con sueño" que cometían errores sin darse cuenta.


¿Qué salió mal? (Las dos "trampas" invisibles)

Los investigadores descubrieron que las herramientas que usaban los científicos para entrenar a la IA tenían dos fallos técnicos (bugs) que hacían que el método tradicional pareciera un desastre.

1. El error del "Olvidadizo" (El bug del optimizador)

Imagina que un profesor le dicta 10 frases a un alumno para que las memorice. Pero el profesor tiene un problema: solo anota la primera frase y se olvida de las otras 9. Al final, el alumno cree que solo tiene que aprenderse una frase y el examen sale fatal.

  • En la IA: Debido a un error en el software (DeepSpeed), la IA solo "aprendía" de la primera parte de sus datos y descartaba el resto. Parecía que el método tradicional no servía, pero en realidad, la IA simplemente no estaba recibiendo toda la información.

2. El error del "Promedio Mal Calculado" (El bug de la agregación de pérdida)

Imagina que un profesor califica un examen de 10 preguntas. Un alumno responde 1 pregunta muy larga y otro responde 9 preguntas muy cortas. El profesor, por error, decide que el examen de la pregunta larga vale lo mismo que el de las 9 cortas, sin importar cuántas palabras escribieron. Esto distorsiona la nota real del alumno.

  • En la IA: El software estaba calculando las "notas" de aprendizaje de forma desigual, dándole el mismo peso a grupos de datos que tenían mucha información que a otros que tenían poca. Esto hacía que el aprendizaje fuera inestable y confuso.

La Gran Revelación: El método de siempre gana

Cuando los investigadores arreglaron estos dos errores, ocurrió algo sorprendente: el método tradicional (primero estudiar el libro y luego practicar) volvió a ser el rey.

  • Es más inteligente: Superó a todos los métodos "modernos" en exámenes de matemáticas difíciles.
  • Es más eficiente: Es como si, gracias a que el alumno estudió bien el libro primero, solo necesitara 50 minutos de práctica para ser un genio, mientras que los otros métodos necesitaban horas de práctica mezclada para llegar a la mitad de su nivel.

En resumen...

Este estudio es como descubrir que un corredor de maratones parecía lento solo porque le habían puesto zapatos rotos y le habían dado la mitad de la comida. Una vez que le dieron los zapatos correctos y la nutrición adecuada, resultó ser el más rápido de todos.

La lección para la ciencia: Antes de inventar un método "revolucionario", asegúrate de que tus herramientas básicas no tengan errores escondidos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →