RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
Este artículo presenta un marco novedoso que analiza las trayectorias de razonamiento a nivel de trayectoria y de paso para revelar que el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) comprime las trayectorias incorrectas y concentra el razonamiento en menos pasos, mientras que el Ajuste Fino Supervisado (SFT) expande las trayectorias correctas y distribuye el razonamiento a lo largo de muchos pasos, explicando así el éxito complementario del paradigma actual de entrenamiento en dos etapas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Imagen: Dos Maneras de Enseñar a un Robot a Pensar
Imagina que tienes un robot que es bueno hablando, pero no muy bueno resolviendo problemas complejos de matemáticas o programación. Para hacerlo más inteligente, los investigadores utilizan dos métodos principales de entrenamiento:
- SFT (Ajuste Fino Supervisado): Esto es como la imitación. Le muestras al robot un ejemplo perfecto de cómo un experto humano resuelve un problema, paso a paso, y le dices: "Haz exactamente esto".
- RL (Aprendizaje por Refuerzo): Esto es como el ensayo y error con una tarjeta de puntuación. Dejas que el robot intente resolver el problema por sí mismo. Si obtiene la respuesta correcta, recibe una "estrella de oro" (recompensa). Si se equivoca, no recibe nada. Con el tiempo, aprende a evitar los caminos que conducen al fracaso.
El artículo pregunta: ¿Qué sucede realmente dentro del cerebro del robot cuando usamos estos dos métodos diferentes? ¿Cambian cómo piensa el robot o solo qué responde?
Los autores descubrieron que estos dos métodos hacen cosas opuestas al "proceso de pensamiento" del robot.
Analogía 1: El "Sendero de Razonamiento" (Nivel de Trayectoria)
Imagina el proceso de pensamiento del robot como un excursionista caminando por un bosque masivo y neblinoso para encontrar un tesoro oculto (la respuesta correcta). Hay muchos caminos: algunos llevan al tesoro, y muchos conducen a callejones sin salida o acantilados.
SFT (El Imitador) "Expande" los Buenos Caminos:
Cuando le muestras al robot el mapa de un experto (SFT), aprende a caminar por el camino correcto. Pero aquí está el truco: también empieza a caminar por muchas variaciones diferentes de ese camino correcto. Se vuelve muy creativo y diverso en cómo encuentra el tesoro.- El Truco: No deja de caminar por los malos caminos. Si el robot ya estaba vagando por un pantano (cometiendo errores), SFT le enseña nuevas formas de caminar, pero podría seguir vagando por el pantano ocasionalmente. "Expande" el número de rutas correctas, pero no necesariamente elimina las malas.
RL (El Puntador) "Apretura" los Malos Caminos:
Cuando dejas que el robot juegue el juego con recompensas (RL), se da cuenta rápidamente de que los caminos del pantano conducen a cero puntos. Así que deja de caminar por allí. "Apretura" todos los caminos incorrectos, confusos o sin salida hasta hacerlos desaparecer.- El Truco: También tiende a "apreturar" los buenos caminos. Puede dejar de explorar variaciones creativas de la respuesta correcta y simplemente ceñirse al único camino que sabe que funciona mejor. Se vuelve muy enfocado, pero menos diverso.
La Combinación Ganadora (SFT + RL):
El artículo explica por qué la mejor práctica actual es hacer SFT primero, luego RL.- Primero, usa SFT para enseñar al robot nuevas formas de encontrar el tesoro (expandiendo los caminos correctos).
- Luego, usa RL para castigar al robot por vagar por el pantano (apreturando los caminos incorrectos).
- Resultado: Obtienes un robot que conoce muchas formas de resolver el problema, pero es muy disciplinado para evitar errores.
Analogía 2: La "Ciudad de Pensamientos" (Nivel de Paso)
Ahora, veamos el pensamiento del robot no como un solo camino, sino como un mapa de ciudad. Cada "paso" en el razonamiento (como "calcular el área" o "verificar la fórmula") es un edificio en esta ciudad. Las conexiones entre los pasos son las carreteras.
RL Crea una Ciudad de "Eje y Radios":
Después del entrenamiento con RL, la ciudad cambia. El robot empieza a depender en gran medida de unos pocos edificios específicos, súper importantes (hubs). Visita estos pasos clave una y otra vez.- El Efecto: La ciudad se vuelve muy eficiente, pero muy concurrida alrededor de estos pocos puntos. El robot concentra su "poder de pensamiento" en un pequeño número de pasos críticos. Es como un conmutador que solo usa tres puentes específicos para cruzar el río, ignorando todos los demás.
SFT Crea una Ciudad "Distribuida":
Después del entrenamiento con SFT, la ciudad se ve diferente. El robot dispersa su pensamiento. Visita muchos edificios diferentes, y ningún edificio individual es visitado de manera tan abrumadora como en la ciudad de RL.- El Efecto: El pensamiento se "homogeneiza" o se distribuye uniformemente. Es como una ciudad donde todos usan una amplia variedad de calles, y ninguna calle única es un embotellamiento.
El Hallazgo Clave:
- RL hace que el pensamiento del robot sea intenso y enfocado en unos pocos pasos clave (Apretura).
- SFT hace que el pensamiento del robot sea amplio y distribuido a través de muchos pasos (Expande).
La Forma de la Ciudad (Topología)
Los investigadores también observaron la "forma" de estas ciudades de pensamiento utilizando geometría.
- El Modelo Base (Antes del entrenamiento): La ciudad está dividida en barrios aislados (comunidades). Es difícil pasar de un barrio a otro. El robot se queda atrapado en bucles locales.
- RL: Derrumba los muros entre los barrios. Crea una ciudad dominada por unos pocos "hubs" masivos que conectan todo. Esto hace que el robot sea muy rápido para encontrar la respuesta si golpea el hub correcto, pero depende de esos hubs específicos.
- SFT: También derrumba los muros, pero en lugar de crear hubs, construye una red donde todo está conectado con todo lo demás. Esto hace que la ciudad sea muy robusta y fácil de navegar desde cualquier punto hacia cualquier otro punto.
Resumen de las Afirmaciones del Artículo
- RL es un "Apretador": Aplasta los caminos de pensamiento incorrectos y concentra el razonamiento del robot en unos pocos pasos altamente eficientes y de alto tráfico. Hace que el robot sea muy bueno para obtener la respuesta correcta en el primer intento (Pass@1) eliminando las malas opciones.
- SFT es un "Expansor": Enseña al robot nuevas formas correctas de pensar y distribuye la carga del razonamiento a través de muchos pasos. Sin embargo, no elimina automáticamente los malos caminos que el robot podría haber estado usando antes.
- Por qué Funciona SFT + RL: Los mejores resultados provienen de usar SFT para enseñar al robot cómo pensar correctamente (expandiendo los buenos caminos) y luego usar RL para obligarlo a dejar de cometer errores (apreturando los malos caminos).
- La Estructura Importa: RL crea una estructura de razonamiento "cargada de hubs", mientras que SFT crea una estructura "distribuida". Ambas son diferentes de la estructura "fragmentada" de un modelo no entrenado.
El artículo concluye que comprender estas diferencias mecánicas ayuda a explicar por qué la receta actual de entrenamiento de "dos etapas" (SFT luego RL) es tan exitosa para crear IA de razonamiento inteligente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.