← Últimos artículos
💬 NLP

On Advantage Estimates for Max@K Policy Gradients

Este artículo presenta MaxPO, un nuevo método de gradiente de política para optimizar objetivos max@K en el aprendizaje por refuerzo con recompensas verificables, el cual utiliza una novedosa línea base de "Leave-Two-Out" para asegurar ventajas centradas, reducir la varianza del gradiente y unificar los estimadores existentes para un post-entrenamiento de LLM más efectivo.

Autores originales: Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Shota Takashiro, Soichiro Nishimori, Paavo Parmas, Yongmin Kim, Kohsei Matsutani, Gouki Minegishi, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un profesor intentando entrenar a un estudiante para resolver un problema matemático muy difícil. El estudiante es una IA, y el problema es una "tarea de razonamiento".

En la forma antigua de entrenar a estas IA (Aprendizaje por Refuerzo), el profesor le pedía al estudiante que intentara resolver el problema una sola vez. Si la respuesta era incorrecta, el estudiante no recibía retroalimentación (recompensa cero). Si era correcta, recibía una estrella dorada. ¿El problema? El estudiante tenía que adivinar el camino correcto en un gigantesco laberinto de posibilidades, y recibir una estrella dorada era tan raro que el estudiante a menudo se quedaba estancado, sin saber qué intentos estaban "casi bien" y cuáles estaban "completamente mal".

Para solucionar esto, los investigadores comenzaron una nueva estrategia: El enfoque de "Intentar muchas veces".

En lugar de pedirle al estudiante que resuelva el problema una vez, el profesor le pide que genere K soluciones diferentes al mismo tiempo. El objetivo no es solo obtener una respuesta correcta; es asegurarse de que al menos uno de esos K intentos sea correcto. Esto se llama optimizar para Max@K (o Pass@K).

El problema con los antiguos métodos de "Intentar muchos"

El artículo argumenta que, si bien este enfoque de "Intentar muchos" es excelente, las matemáticas utilizadas para enseñar a la IA cómo mejorar eran ligeramente defectuosas.

Imagina que tienes un grupo de 8 estudiantes (un "lote" o batch) intentando resolver un rompecabezas. Quieres decirle a cada estudiante qué tan bien lo hizo.

  • El Método Antiguo (EI-only): Observaba la respuesta de un estudiante y la comparaba con la mejor respuesta de los otros 7 estudiantes. Si el estudiante lo hacía mejor que los demás, recibía una señal enorme de "¡Buen trabajo!". Si lo hacía peor, recibía un "0".
  • La Falla: Debido a que la señal de "¡Buen trabajo!" siempre era positiva (o cero) y nunca negativa, el profesor estaba diciendo esencialmente: "¡Siempre lo estás haciendo mejor que el promedio!". Esto es engañoso. Es como un entrenador que solo dice "¡Genial!" y nunca señala que un jugador está en realidad rindiendo por debajo del potencial real del equipo. Esto crea mucho "ruido" (varianza) en el entrenamiento, haciendo que el aprendizaje de la IA sea inestable y lento.

La Solución: La línea base "Leave-Two-Out"

Los autores de este artículo proponen una forma más inteligente de calificar a los estudiantes, la cual llaman MaxPO (Optimización de Política Max@K).

Introducen una nueva regla para calificar, la cual llaman la línea base Leave-Two-Out (L2O) (Dejar fuera a dos). Así es como funciona usando una analogía simple:

Imagina que estás juzgando un concurso de talentos con 8 concursantes.

  1. La Forma Antigua: Para juzgar al Concursante A, lo comparas con el mejor de los otros 7. Si A es el mejor, recibe una puntuación alta. Si no lo es, recibe un cero. Esto es sesgado porque el "mejor de los otros 7" es un objetivo móvil que cambia dependiendo de quién esté en la sala.
  2. La Nueva Forma (L2O): Para juzgar al Concursante A, eliminas temporalmente tanto al Concursante A como al Concursante B de la sala. Luego, observas a las 6 personas restantes para ver qué representa un desempeño "justo" promedio.
    • Calculas qué tan bien le habría ido al Concursante A contra este grupo "justo".
    • Crucialmente, al eliminar a dos personas, te aseguras de que el grupo "justo" no incluya accidentalmente a la persona que estás intentando juzgar (Concursante A) o a un "rival" específico (Concursante B) que pueda sesgar la comparación.

¿Por qué es esto mejor?
Este método asegura que la puntuación "promedio" de todo el grupo sea exactamente cero. Algunos estudiantes obtienen una puntuación positiva (lo hicieron mejor que el promedio justo) y algunos obtienen una puntuación negativa (lo hicieron peor). Estas puntuaciones positivas y negativas se cancelan entre sí perfectamente.

  • El Resultado: La IA recibe una señal mucho más clara y con menos "ruido". Sabe exactamente dónde se encuentra en relación con una línea base justa, en lugar de simplemente recibir un "eres genial" o "no eres nada".

Lo que el artículo encontró

Los investigadores probaron este nuevo método "Leave-Two-Out" de dos maneras:

  1. En Juegos Simples (Bandidos y Laberintos): Demostraron que su nuevo método redujo el "ruido" en la señal de aprendizaje por un margen enorme (hasta un 77% menos de ruido en algunos casos). Esto significa que la IA aprende de manera más constante y no se confunde con las fluctuaciones aleatorias.
  2. En Modelos de IA Reales (LLMs): Lo probaron en modelos de lenguaje de gran tamaño (como Llama y Qwen) resolviendo problemas matemáticos.
    • El Resultado: La IA entrenada con su nuevo método (MaxPO) se volvió significativamente mejor resolviendo problemas cuando se le permite intentarlo muchas veces (por ejemplo, Pass@256).
    • En el modelo Qwen, mejoró la tasa de éxito en un 5.2%.
    • En el modelo Llama, mejoró la tasa de éxito en un 2.4%.

La Visión General

Piensa en el método antiguo como un entrenador que es excesivamente optimista y le da a todos una calcomanía de "Buen Trabajo", incluso cuando están teniendo dificultades. El nuevo método (MaxPO) es un entrenador que utiliza un sistema de puntuación estricto, justo y equilibrado. Al eliminar el "ruido" y asegurar que las puntuaciones estén centradas en cero, la IA puede aprender de manera mucho más rápida y efectiva, especialmente cuando el objetivo es encontrar al menos una respuesta correcta de entre muchos intentos.

El artículo concluye que este enfoque "Leave-Two-Out" es la forma matemáticamente correcta de entrenar a la IA para estas tareas de "intentar muchas veces", proporcionando una base unificada y estable para futuras mejoras.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →