← Últimos artículos
💬 NLP

The Invisible Leash: Why RLVR May or May Not Escape Its Origin

Este artículo demuestra empíricamente que, si bien el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) mejora significativamente la precisión de los LLM, en última instancia no logra expandir los límites del razonamiento porque su optimización restringida por el soporte estrecha el espacio de soluciones del modelo, causando a menudo que este pase por alto respuestas correctas que antes eran accesibles para el modelo base.

Autores originales: Fang Wu, Weihao Xuan, Ximing Lu, Mingjie Liu, Yi Dong, Zaid Harchaoui, Yejin Choi

Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Fang Wu, Weihao Xuan, Ximing Lu, Mingjie Liu, Yi Dong, Zaid Harchaoui, Yejin Choi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: La "correa invisible"

Imagina que tienes a un estudiante muy talentoso (el Modelo Base) que ha leído una biblioteca de libros y conoce muchos datos. Puede resolver problemas matemáticos, pero a veces se queda atascado o da una respuesta algo desordenada.

Para hacerlo mejor, introduces a un entrenador estricto (el sistema RLVR). Este entrenador no le enseña al estudiante nuevas materias desde cero. En su lugar, el entrenador observa al estudiante resolver problemas y, cada vez que el estudiante obtiene la respuesta exacta y correcta, el entrenador le da un "choca esos cinco" (una recompensa). Si la respuesta es incorrecta, el entrenador le dice suavemente: "inténtalo de nuevo".

El artículo plantea una pregunta crucial: ¿Realmente este entrenamiento le enseña al estudiante nuevas formas de pensar, o solo lo entrena para repetir las respuestas específicas que ya conocía, pero con más confianza?

Los autores llaman a esto una "correa invisible". Descubrieron que, aunque el estudiante mejora mucho en obtener la primera respuesta correcta, en realidad está atado al mismo conjunto limitado de ideas con las que empezó. No puede saltar fácilmente la valla para descubrir soluciones totalmente nuevas que no tuviera ya un indicio previo.


Explicación de los hallazgos clave

1. La trampa del "Soporte": Mantener el mapa antiguo

Piensa en el conocimiento del estudiante como un mapa de una ciudad. El "Modelo Base" tiene un mapa que muestra muchas rutas posibles hacia un destino, incluyendo algunas rutas oscuras y sinuosas.

  • Lo que hace el RLVR: Mira el mapa y dice: "¡Oye, esta ruta funciona perfectamente! Pavimentémosla con oro y hagamos que sea la única carretera por la que conduzcamos".
  • El resultado: El estudiante se vuelve increíblemente rápido y preciso en esa única carretera pavimentada. Sin embargo, comienza a olvidar las otras rutas válidas y sinuosas que estaban en el mapa original.
  • El hallazgo del artículo: En casi todas las pruebas (matemáticas, lógica, programación), los modelos entrenados con RLVR mantuvieron las respuestas "buenas" que ya conocían (aproximadamente el 93–99%) pero perdieron el acceso a otras respuestas correctas que el modelo original sí podría haber encontrado. No añadieron nuevas carreteras al mapa; simplemente estrecharon el tráfico a un solo carril.

2. El equilibrio entre "Precisión vs. Diversidad"

Imagina que estás pescando en un lago.

  • El Modelo Base lanza una red amplia. Atrapa algunos peces grandes, pero también atrapa algunos peces más pequeños y de tipos diferentes. Es un poco desordenado, pero encuentra todo lo que hay allí.
  • El Modelo RLVR usa una lanza. Es increíblemente preciso. Si ve un pez, le da cada vez. Pero debido a que está tan concentrado en dar en el blanco, deja de lanzar la red de forma amplia.

El problema: Si solo necesitas un pez (una respuesta correcta), la lanza (RLVR) es mejor. Pero si necesitas atrapar cualquier pez en un cubo grande (intentar muchas veces para encontrar una solución), la red amplia (Modelo Base) es en realidad mejor porque cubre más terreno. El artículo encontró que, aunque el RLVR es excelente para acertar al primer intento, el modelo original suele ganar si se le dan muchas oportunidades para intentarlo.

3. La ilusión del "Ruido Confuso"

A veces, el estudiante entrenado con RLVR parece estar pensando con más intensidad. Puede que haga pausas más largas, diga más palabras o parezca más "incierto" mientras habla (esto se llama Entropía a nivel de Token).

  • La analogía: Imagina a un chef que corta verduras de forma muy ruidosa y caótica. Parece que está experimentando con nuevas técnicas.
  • La realidad: A pesar del ruido, sigue preparando exactamente los mismos tres platos de siempre. No está inventando una nueva receta; solo está preparando las de siempre con un toque más dramático.
  • El hallazgo del artículo: Aunque los modelos suenan más "inciertos" paso a paso, en realidad convergen en un conjunto de respuestas finales mucho más reducido. Son menos diversos al final.

4. ¿Cuándo aprende realmente algo nuevo?

El artículo sí encontró algunas excepciones raras donde el modelo RLVR encontró una solución nueva. Esto solo ocurrió en dos escenarios específicos:

  1. Reensamblar piezas de un rompecabezas: El estudiante ya conocía las piezas individuales del rompecabezas (sub-habilidades), pero no sabía cómo unirlas correctamente. El entrenador les ayudó a encajar las piezas.
  2. Corregir el formato: El estudiante conocía la respuesta, pero no sabía cómo escribirla en el formato específico que el entrenador quería. El entrenador le enseñó las reglas de formato, desbloqueando la respuesta que ya estaba allí.

En estos casos, el modelo no estaba descubriendo un nuevo universo de pensamiento; solo estaba puliendo lo que ya estaba oculto en las sombras de su conocimiento original.

La conclusión: Romper la correa

El artículo concluye que los métodos actuales de RLVR son como una herramienta de precisión, no un motor de creatividad. Son excelentes para refinar y perfeccionar lo que un modelo ya sabe, pero están "atados por una correa" a la distribución inicial del modelo base. No pueden descubrir fácilmente soluciones que el modelo base tenía una probabilidad de cero de encontrar.

Para expandir verdaderamente las capacidades de razonamiento de un modelo —para permitirle descubrir cosas que nunca ha visto antes— necesitamos añadir algo nuevo a la mezcla: exploración explícita. Necesitamos empujar deliberadamente la masa de probabilidad hacia los "rincones oscuros" del espacio de soluciones, en lugar de simplemente agudizar el enfoque en los puntos brillantes que ya conocemos.

En resumen: El RLVR hace que el modelo sea un mejor ejecutor de ideas conocidas, pero no necesariamente lo convierte en un mejor pensador de ideas nuevas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →