← Últimos artículos
📊 statistics

Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity

Este trabajo identifica que los objetivos estándar de Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) provocan un colapso de la diversidad al ser indiferentes a la distribución de la masa de probabilidad entre las soluciones correctas, y propone la Optimización de Políticas Correctas Uniformes (UCPO) para imponer uniformidad sobre las salidas válidas, mejorando así significativamente la diversidad y cobertura de múltiples muestras mientras se mantiene la precisión en un solo intento.

Autores originales: Anamika Lochab, Bolian Li, Ruqi Zhang

Publicado 2026-05-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anamika Lochab, Bolian Li, Ruqi Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: La Trampa del "Talla Única"

Imagina que estás entrenando a un estudiante brillante para resolver problemas de matemáticas. Le dices: "Tu objetivo es obtener la respuesta correcta".

En el mundo de la IA, esto se llama RLVR (Aprendizaje por Refuerzo con Recompensas Verificables). La IA intenta resolver un problema y, si la respuesta es correcta, recibe una "estrella de oro".

El Problema:
El artículo argumenta que los métodos de entrenamiento estándar (como GRPO) están demasiado enfocados en conseguir la estrella de oro y no les importa cómo el estudiante la obtiene.

Imagina un problema de matemáticas que tiene tres formas válidas diferentes de resolverse (Método A, Método B y Método C).

  • La Vieja Forma (GRPO): La IA intenta los tres. Por pura suerte, resuelve un problema usando el Método A. Recibe una estrella de oro. Como obtuvo una estrella, la IA piensa: "¡El Método A es el mejor! Lo haré así la próxima vez". Deja de intentar los Métodos B y C.
  • El Resultado: La IA se convierte en una maestra del Método A. Obtiene la respuesta correcta casi todas las veces que intenta una sola vez (Pass@1). Pero si le pides que intente 64 veces para ver si puede encontrar alguna solución, falla. ¿Por qué? Porque ha olvidado los Métodos B y C. Ha colapsado en un solo hábito estrecho.

El artículo llama a esto "Colapso de la Diversidad". La IA se convierte en un mono de un solo truco.

El Diagnóstico: ¿Por Qué Sucede Esto?

Los autores encontraron dos razones principales por las que esto sucede:

  1. El Objetivo es Demasiado Vago: La regla de entrenamiento dice: "Maximiza las respuestas correctas". No dice: "Maximiza las respuestas correctas y trata de usar todos los métodos posibles". Por lo tanto, la IA es indiferente. No sabe que se supone que debe ser diversa.
  2. El Ciclo de "Los Ricos se Hacen Más Ricos":
    • Imagina que la IA es un poco más propensa a elegir el Método A simplemente por casualidad.
    • Como elige el Método A con más frecuencia, obtiene más práctica con él.
    • Las actualizaciones del entrenamiento hacen que el Método A sea aún más fuerte.
    • Ahora elige el Método A con aún más frecuencia.
    • Eventualmente, los Métodos B y C nunca son elegidos, por lo que la IA nunca tiene la oportunidad de aprenderlos de nuevo. Desaparecen.

La Solución: La Política "Uniforme-Correcta"

Los autores se preguntaron: "¿Cuál es la forma perfecta en que una IA debería comportarse cuando hay múltiples respuestas correctas?"

Concluyeron que la IA debería ser Uniforme-Correcta.

  • Uniforme: Debe tratar cada solución válida (Método A, B y C) exactamente igual. Debe darles la misma oportunidad (33% cada uno).
  • Correcta: No debe desperdiciar tiempo en respuestas incorrectas.

Piénsalo como un chef que conoce tres formas diferentes de hacer una tortilla perfecta. El chef "Uniforme-Correcto" no se queda solo con la que hizo primero; rota a través de los tres métodos por igual para que nunca olvide cómo hacer los demás.

La Nueva Herramienta: UCPO

Para solucionar la trampa del "Talla Única", los autores crearon un nuevo método de entrenamiento llamado UCPO (Optimización de Política Uniforme-Correcta).

Cómo funciona (La Analogía):
Imagina que la IA es un profesor calificando una clase de estudiantes (las diferentes soluciones).

  • Método Viejo (GRPO): El profesor solo elogia al estudiante que levantó la mano primero. Los otros estudiantes se quedan callados y eventualmente dejan de levantar la mano.
  • Nuevo Método (UCPO): El profesor mira a toda la clase. Si el Estudiante A levantó la mano mucho, el profesor dice: "Buen trabajo, pero demos un bono especial al Estudiante B y al Estudiante C, que no han levantado la mano mucho todavía".

UCPO añade una "penalización" al entrenamiento. Si la IA comienza a favorecer una solución demasiado, el entrenamiento empuja hacia atrás y dice: "No, necesitas distribuir tu atención de manera más uniforme entre todas las respuestas correctas".

Los Resultados: ¿Qué Sucedió?

El equipo probó esto en tres modelos de IA diferentes (desde pequeños hasta grandes) utilizando benchmarks difíciles de matemáticas (como la competencia matemática AIME).

  1. La precisión se mantuvo alta: La IA seguía siendo tan buena obteniendo la respuesta correcta en el primer intento (Pass@1) como los métodos antiguos.
  2. La diversidad se disparó: Cuando pidieron a la IA que generara 64 intentos diferentes, encontró muchas más soluciones únicas y correctas.
    • En la prueba más difícil (AIME24), el nuevo método mejoró la capacidad de encontrar cualquier solución correcta entre 64 intentos en un 10%.
    • La variedad de las ecuaciones matemáticas utilizadas en las respuestas aumentó en un 45%.

Resumen

El artículo muestra que el entrenamiento estándar de IA hace que los modelos sean demasiado rígidos: encuentran una forma de estar en lo correcto y se apegan a ella, olvidando todas las demás formas válidas. El nuevo método, UCPO, obliga a la IA a mantener todas sus opciones abiertas, tratando cada camino correcto como igualmente valioso. Esto hace que la IA sea más robusta y creativa sin sacrificar su precisión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →