← Últimos artículos
🤖 AI

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

El artículo propone VIGOR, un método de asignación de despliegue en línea guiado por la varianza que distribuye dinámicamente un presupuesto de generación fijo a los ejemplos con la mayor varianza de recompensa, reduciendo así significativamente los costos computacionales y mejorando la estabilidad, al tiempo que logra un rendimiento superior en tareas de razonamiento matemático y programación en comparación con el GRPO estándar.

Autores originales: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

Publicado 2026-07-27
📖 4 min de lectura☕ Lectura para el café

Autores originales: Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot muy inteligente, pero un poco distraído, cómo resolver acertijos complejos como problemas matemáticos o escribir código de computadora. No puedes sentarte ahí y explicarle cada paso; en su lugar, dejas que el robot lo intente, y cuando acierta una respuesta, le das un "choca esos cinco" (una recompensa). Cuando se equivoca, le dices suavemente "inténtalo de nuevo". Este proceso se llama Aprendizaje por Refuerzo. El robot sigue probando diferentes formas de resolver el problema y, con el tiempo, aprende qué caminos conducen a los "choca esos cinco" y cuáles a callejones sin salida.

Sin embargo, hay un inconveniente. Para aprender eficazmente, el robot necesita probar muchos caminos diferentes. Si solo prueba uno o dos, podría tener suerte y pensar que un mal camino es en realidad bueno. Pero si prueba miles de caminos, se convierte en un enorme desperdicio de tiempo y electricidad, especialmente porque la mayoría de esos caminos son aburridos o inútiles. Es como pedirle a un estudiante que escriba 100 ensayos para aprender a escribir, cuando 90 de ellos son solo garabatos que no le enseñan nada nuevo. La gran pregunta para los científicos es: ¿Cómo hacemos que el robot pruebe el número correcto de caminos sin desperdiciar energía en los que son aburridos?

Aquí es donde entra en juego un nuevo método llamado VIGOR. Piensa en el proceso de aprendizaje del robot como un juego de "caliente o frío". En la forma antigua de hacer las cosas (llamada GRPO), el robot intentaba ciegamente el mismo número de conjeturas para cada acertijo, independientemente de si el acertijo era fácil o difícil. Era como un profesor que les da a todos los estudiantes la misma cantidad de tarea, incluso si algunos ya saben la respuesta y otros están completamente perdidos.

Los investigadores detrás de VIGOR se dieron cuenta de que la información más útil proviene de los momentos en los que el robot no está seguro. Si un robot intenta un problema matemático y obtiene una mezcla de respuestas correctas e incorrectas, esa "varianza" (o desacuerdo) es una señal de que está aprendiendo algo importante. Pero si obtiene la misma respuesta incorrecta cada vez, o la misma respuesta correcta cada vez, solo está perdiendo el tiempo.

VIGOR cambia el juego actuando como un entrenador inteligente que observa los primeros intentos del robot. En lugar de dar a cada acertijo un número fijo de intentos, VIGOR comienza dejando que el robot haga solo un par de conjeturas en todo. Luego, observa los resultados:

  1. Si el robot obtuvo la misma respuesta cada vez (baja varianza), el entrenador dice: "Está bien, ya lo entendimos, sigamos adelante".
  2. Si las respuestas del robot estaban por todas partes (alta varianza), el entrenador dice: "¡Este es difícil! Vamos a darle más intentos para resolverlo".

El método luego vierte más "energía de conjetura" (rollouts) solo en los acertijos que están causando más confusión, mientras ignora los que son demasiado fáciles o demasiado rotos para aprender de ellos. Es como un videojuego que solo genera enemigos más difíciles para el jugador que tiene dificultades, en lugar de hacer los niveles fáciles más difíciles solo para llenar el tiempo.

El artículo muestra que este enfoque cambia las reglas del juego. Al usar esta estrategia "guiada por la varianza", el robot alcanza el mismo nivel de habilidad utilizando significativamente menos conjeturas. En problemas matemáticos, VIGOR alcanzó su objetivo de precisión con hasta 2.3 veces menos rollouts que el método estándar. En tareas de programación, alcanzó la misma tasa de éxito con 1.49 veces menos rollouts e incluso mejoró la tasa de éxito final en 3.4 puntos.

Los autores sugieren que esto no es solo un pequeño ajuste; es un cambio fundamental en la forma en que enseñamos a la IA a razonar. Midieron estos resultados en diferentes tamaños de modelos de IA y descubrieron que VIGOR aprende de manera más rápida y eficiente de forma constante. Demuestra que no necesitas lanzar más potencia de cómputo a un problema para resolverlo; solo necesitas ser más inteligente sobre dónde gastas esa potencia. Al enfocarse solo en los momentos de incertidumbre, VIGOR ayuda a la IA a aprender a razonar de manera más efectiva, convirtiendo un proceso caótico de prueba y error en un viaje de descubrimiento enfocado y eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →