← Últimos artículos
💬 NLP

Latent Reasoning in TRMs is Secretly a Policy Improvement Operator

Este artículo demuestra que el razonamiento recursivo latente en modelos pequeños funciona como un operador de mejora de política, permitiendo la aplicación de esquemas de aprendizaje por refuerzo y entrenamiento por difusión para eliminar pasos de computación ineficaces y reducir significativamente las pasadas hacia adelante manteniendo el rendimiento.

Autores originales: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: Por qué "pensar" a veces solo hace perder el tiempo

Imagina que estás intentando resolver un rompecabezas difícil. Tienes un pequeño y listo asistente (el modelo de IA) que intenta resolverlo.

En los últimos años, los investigadores intentaron hacer a este asistente más inteligente diciéndole que "pensara en bucles". En lugar de dar una sola respuesta, el asistente miraba su propio intento anterior, pensaba en él un momento y luego hacía un nuevo intento, ligeramente mejor. Hacía esto una y otra vez, con la esperanza de que para el décimo o vigésimo intento, tuviera la solución perfecta.

Esto se llama Razonamiento Latente. La teoría era: "Si dejamos que el modelo vuelva sobre sí mismo en bucles, es como darle un cerebro mucho más profundo sin necesidad de hacer el cerebro más grande".

El Probleem: Los autores de este artículo encontraron un fallo en esta lógica. Aunque el modelo estaba realizando bucles, muchos de esos bucles no hacían nada útil. Era como un estudiante mirando un problema matemático, escribiendo la misma respuesta incorrecta, borrándola y escribiéndola de nuevo, una y otra vez, esperando que mágicamente se volviera correcta. El artículo llama a esto "computación muerta" (dead compute): desperdiciar energía en pasos que en realidad no mejoran la respuesta.

El Descubrimiento: Es secretamente una máquina de "Mejora de Política"

Los autores se hicieron una gran pregunta: ¿Qué está pasando realmente dentro del cerebro del modelo durante estos bucles?

Descubrieron que el modelo no solo está "pensando más profundamente". Está actuando secretamente como un agente de aprendizaje por refuerzo (un tipo de IA que aprende mediante ensayo y error).

Aquí está la analogía:

  • La forma antigua: El modelo lanza un intento, y luego lanza otro, esperando que el segundo intento sea mejor. Es como lanzar dardos con los ojos vendados y esperar que el segundo lanzamiento esté más cerca del centro.
  • La nueva visión: Los autores se dieron cuenta de que el modelo en realidad está realizando una "Mejora de Política" (Policy Improvement). Esta es una forma elegante de decir: "Toma tu intento actual, mira la diferencia entre tu intento y la verdad, y usa esa diferencia para empujar tu siguiente intento más cerca del objetivo".

El artículo demuestra que cada vez que el modelo realiza un bucle, debería estar calculando una "ventaja" específica (una puntuación de cuánto mejor es el nuevo intento comparado con el anterior). Si no lo hace, simplemente está patinando sin avanzar.

La Solución: Supervisión de Mejora Profunda (DIS)

Dado que el modelo se perdía en la "computación muerta", los autores inventaron un nuevo método de entrenamiento llamado Supervisión de Mejora Profunda (DIS, por sus siglas en inglés).

La Analogía: El camino de las "Migas de Pan"
Imagina que intentas caminar desde tu casa hasta un tesoro escondido.

  • Método Antiguo (TRM): Te dicen: "Sigue caminando en círculos hasta que encuentres el tesoro". Podrías caminar 100 círculos, pero solo 5 de ellos te acercaron realmente al tesoro. El resto fueron pasos desperdiciados.
  • Nuevo Método (DIS): El profesor te da un mapa con migas de pan.
    1. Paso 1: Camina hacia la primera miga de pan (un intento ligeramente mejor).
    2. Paso 2: Camina hacia la segunda miga de pan (un intento aún mejor).
      ...y así sucesivamente, hasta que llegues al tesoro.

Los autores crean estas "migas de pan" tomando la respuesta correcta y "corrompiéndola" lentamente (haciéndola ligeramente incorrecta) para crear un camino de metas intermedias. Luego entrenan al modelo para que alcance cada una de esas migas de pan perfectamente.

Por qué esto funciona:
En lugar de esperar que el modelo descubra por sí mismo cómo mejorar, los profesores obligan al modelo a aprender que cada uno de los pasos debe ser una mejora. Esto convierte la "computación muerta" en "mejora activa".

Los Resultados: Más Rápido, Más Pequeño y Mejor

Los autores probaron este nuevo método (DIS) en el Modelo Recursivo Diminuto (TRM), que es un modelo de IA muy pequeño.

  1. Menos trabajo, mismo resultado: Descubrieron que con DIS, el modelo no necesitaba realizar tantos bucles. Redujeron los "pasos de pensamiento" 18 veces (de 336 pasos a solo 18) obteniendo los mismos o mejores resultados.
  2. Venciendo a los gigantes: Lo probaron en el benchmark ARC-AGI (una prueba muy difícil de inteligencia general, como un test de CI moderno para la IA).
    • Su modelo diminuto (con solo 0.8 millones de parámetros) obtuvo un 24%.
    • Esto es enorme porque la mayoría de los otros modelos de código abierto necesitan miles de millones de parámetros para acercarse a esa puntuación.
    • Superaron significativamente al modelo TRM original, demostrando que la "salsa secreta" no era el tamaño del modelo, sino el método de entrenamiento.

Resumen en una frase

El artículo revela que los modelos de IA recursivos intentaban secretamente mejorar sus intentos como un aprendiz de refuerzo, pero fallaban porque no se les enseñó cómo mejorar; al darles un camino de entrenamiento paso a paso con "migas de pan", los autores hicieron que los modelos fueran 18 veces más eficientes y significativamente más inteligentes, todo ello utilizando una fracción mínima de la potencia de cómputo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →