← Últimos artículos
🤖 machine learning

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning

Este artículo propone que el éxito de combinar el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo (RL) para mejorar el razonamiento de los modelos de lenguaje proviene de la generalización compositiva, donde el SFT proporciona módulos atómicos brutos dentro de las trazas y el RL los descompone y recombina para resolver configuraciones novedosas, una teoría validada por experimentos que muestran que el entrenamiento en trazas compuestas produce una generalización superior en comparación con los módulos aislados.

Autores originales: Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

Publicado 2026-06-17
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: Cómo la IA aprende a "pensar"

Imagina que estás enseñando a un robot a resolver un rompecabezas complejo. Tienes dos formas principales de enseñarle:

  1. Mostrar y contar (SFT): Le muestras al robot una solución perfecta, paso a paso, para un rompecabezas específico.
  2. Ensayo y error (RL): Dejas que el robot intente resolver el rompecabezas por su cuenta. Si obtiene la respuesta correcta al final, le das una "estrella de oro" (recompensa). Si falla, no recibe nada.

Durante mucho tiempo, los investigadores notaron que combinar estos dos métodos funciona mejor. El robot aprende los pasos mediante el "Mostrar y contar", pero se vuelve mucho mejor resolviendo nuevos rompecabezas que nunca ha visto después del "Ensayo y error".

La pregunta: ¿Por qué esta combinación funciona tan bien? ¿Qué está pasando realmente dentro del cerebro del robot?

La idea central: La teoría de los "Lego"

Los autores de este artículo proponen una nueva forma de entender este proceso. Argumentan que el razonamiento no es solo memorizar una historia larga; es como construir con ladrillos de Lego.

Ellos descomponen un rastro de razonamiento (el proceso de pensamiento del robot) en dos tipos de partes reutilizables:

  1. Habilidades (Los ladrillos): Estas son acciones pequeñas y locales. Ejemplos: "Suma estos dos números", "Elimina esta palabra" o "Verifica si esto es cierto".
  2. Enrutamiento (Las instrucciones): Estas son las reglas sobre cómo conectar los ladrillos. Ejemplos: "Toma el resultado del paso 1 y pásalo al paso 2" o "Si el número es grande, salta al paso 4".

El problema con "Mostrar y contar" (SFT):
Cuando le muestras al robot una solución perfecta, los "ladrillos" y las "instrucciones" están pegados en un orden específico. El robot ve un bloque largo y sólido de Lego. Aprende a copiar todo el bloque, pero no se da cuenta de que el bloque está hecho de piezas separadas y reutilizables. Si le das un rompecabezas que requiere los ladrillos en un orden diferente, el robot se queda atascado porque solo sabe cómo copiar el bloque original.

La magia del "Ensayo y error" (RL):
Cuando el robot comienza a intentar resolver problemas por su cuenta y recibe estrellas de oro por las respuestas correctas, algo increíble sucede. Comienza a darse cuenta: "¡Espera, usé ese mismo ladrillo de 'Sumar' en tres lugares diferentes, y funcionó cada vez!"

El proceso de RL actúa como un deconstructor. Toma esos bloques que estaban pegados de la fase de "Mostrar y contar" y los vuelve a desarmar en ladrillos y las instrucciones individuales y reutilizables. Una vez que el robot tiene una caja de ladrillos sueltos y reutilizables, puede encajarlos de nuevas maneras para resolver rompecabezas que nunca ha visto antes.

Los hallazgos clave (La receta del éxito)

Los autores realizaron experimentos para probar esta teoría. Esto es lo que encontraron, explicado de forma sencilla:

1. Primero necesitas las materias primas.
No puedes enseñarle a un robot a construir con Lego si nunca le has mostrado cómo luce un ladrillo de Lego. La fase de "Mostrar y contar" es crucial porque proporciona las materzas primas (las habilidades atómicas y los mecanismos de enrutamiento). Sin esto, el robot no tiene nada que desarmar.

2. Descomponer las cosas es mejor que solo mostrarlas.
Si solo le muestras al robot ladrillos aislados (por ejemplo, "Aquí tienes cómo sumar números"), aprenderá a sumar, pero no aprenderá cómo combinar la suma con otros pasos.

  • El hallazgo: Es mucho mejor mostrarle al robot una solución completa y compleja (un rastro compuesto) y dejar que la fase de "Ensayo y error" descubra cómo desarmarla. El robot aprende a recombinar las piezas de manera mucho más rápida y efectiva que si solo le dieras un montón de ladrillos aislados.

3. El "pegamento" debe romperse en el lugar correcto.
Los autores descubrieron una receta específica para obtener los mejores resultados:

  • Fase 1 (Mostrar y contar): Muestra al robot muchas soluciones complejas diferentes que cubran cada tipo posible de ladrillo e instrucción. Asegúrate de que vea todas las herramientas en la caja de herramientas.
  • Fase 2 (Ensayo y error): Deja que el robot practique en rompecabezas que mezclen estas herramientas en combinaciones nuevas y extrañas que no haya visto antes.
  • ¿Por qué? Si dejas que el robot practique con las mismas combinaciones que vio en la Fase 1, simplemente las memoriza. Pero si lo dejas practicar con nuevas combinaciones, lo obligas a descubrir cómo encajar los ladrillos sueltos sobre la marcha. Aquí es donde ocurre la "generalización" (la capacidad de resolver cosas nuevas).

Una analogza sencilla: El Chef

Imagina que estás entrenando a un chef.

  • SFT (Mostrar y contar): Le muestras al chef una receta para "Espagueti Carbonara". Le muestras exactamente cómo romper los huevos, hervir la pasta y mezclar la salsa. El chef aprende a copiar este plato perfectamente.
  • RL (Ensayo y error): Ahora, le dices al chef: "Hazme una cena deliciosa", pero no le das una receta. Dejas que lo intente. Si hace una gran comida, le dices: "¡Buen trabajo!".

La visión del artículo:
Si solo le muestras al chef la receta de la Carbonara, podría pensar que "romper los huevos" y "hervir la pasta" son una sola acción única e inquebrantable llamada "Hacer Carbonara".
Pero cuando dejas que experimente (RL), se da cuenta: "¡Ah! Puedo romper huevos para una tortilla, o puedo hervir la pasta para una ensalada". Se da cuenta de que las habilidades (romper, hervir) son separadas de la ruta (qué hacer con la pasta después).

Una vez que comprende esto, puede inventar un plato completamente nuevo (como una "Tortilla de Pasta") que nunca ha visto antes, porque ha aprendido a tratar los ingredientes como herramientas separadas y reutilizables en lugar de un guion único y fijo.

Resumen

  • El razonamiento es modular: Está hecho de pequeñas habilidades y reglas para conectarlas.
  • SFT proporciona las partes: Le da al modelo las materias primas (las habilidades).
  • RL realiza el ensamblaje: Fuerza al modelo a desarmar los materiales y aprender cómo encajarlos de nuevas maneras.
  • La mejor estrategia: Mostrar primero al modelo una gran variedad de ejemplos complejos (para obtener todas las partes), luego dejar que practique con nuevas combinaciones de esas partes (para aprender a construir).

Este artículo explica por qué el método actual de "Mostrar y contar, luego Ensayo y error" es tan poderoso: transforma una máquina de memorización rígida en un constructor flexible.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →