← Últimos artículos
🤖 machine learning

ReCo: Reweighting GRPO Against Distributional Concentration

El artículo introduce ReCo, un método de reponderación que mitiga la tendencia de GRPO a concentrarse en respuestas y tokens de alta probabilidad mediante la normalización de las contribuciones de las respuestas y el reemplazo de los ratios de importancia por un escalado basado en la varianza, mejorando así el rendimiento de Pass@k en evaluaciones de razonamiento matemático sin sacrificar la precisión de k pequeño.

Autores originales: Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

Publicado 2026-07-30
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras no solo charlan, sino que realmente piensan a través de acertijos complejos como problemas matemáticos o desafíos de programación. Esta es la frontera de la Inteligencia Artificial, específicamente un campo llamado Aprendizaje por Refuerzo. Piensa en esto como entrenar a un perro: no solo le dices al perro qué hacer; dejas que lo intente, y si se sienta, le das un premio. Si salta al sofá, no se lo das. Con el tiempo, el perro aprende a sentarse porque quiere el premio. En el mundo de la IA, damos una "recompensa" cuando la computadora resuelve un problema correctamente.

Una forma popular de entrenar a estos "perros" de IA se llama Optimización de Política Relativa de Grupo, o GRPO. Imagina que le pides a la IA que resuelva un problema matemático diez veces. Genera diez respuestas diferentes. GRPO observa todas las diez, ve cuáles recibieron el "premio" (fueron correctas) y empuja a la IA para que sea más parecida a las que tuvieron éxito. Es un truco ingenioso que ha hecho que la IA sea mucho mejor razonando. Pero hay un inconveniente: a veces, en su afán por obtener el premio, la IA se vuelve demasiado confiada y deja de intentar cosas nuevas. Comienza a repetir los mismos pocos trucos una y otra vez, ignorando otras formas ingeniosas de resolver el problema que podrían funcionar igual de bien.

Este es el acertijo que un equipo de investigadores de la Universidad Nacional de Seúl decidió resolver. Notaron que, si bien GRPO hace que la IA sea más inteligente para resolver problemas rápidamente, en realidad hace que la IA sea menos creativa y menos propensa a encontrar la respuesta correcta si le das muchas oportunidades para intentarlo. Llamaron a este problema "concentración de distribución"—una forma elegante de decir que la IA se queda estancada en una rutina, explorando solo los caminos que ya sabe que son seguros.

Para solucionar esto, el equipo inventó un nuevo método llamado ReCo (Reweighting GRPO Against Distributional Concentration - Reajuste de GRPO contra la Concentración de Distribución). Así es como funciona, usando una analogía simple:

Imagina que eres un profesor calificando una clase de estudiantes que están tratando de resolver el mismo problema matemático difícil.

  • La forma antigua (GRPO): Le pides a la clase que escriba sus respuestas. Si cinco estudiantes escriben exactamente la misma solución (porque es la más popular), le das mucha atención a esa solución. Le dices a toda la clase: "¡Miren! ¡Cinco personas hicieron esto! ¡Todos deberían hacer esto!". Mientras tanto, el único estudiante que probó un método extraño y creativo que también funcionó es ignorado porque era el único. La clase deja de intentar cosas nuevas y simplemente copia la respuesta popular.
  • La nueva forma (ReCo): El profesor (ReCo) nota este sesgo. Primero, se da cuenta de que si cinco estudiantes escribieron la misma respuesta, es probablemente porque esa respuesta fue fácil de encontrar, no necesariamente porque sea la única buena respuesta. Así que, reduce la importancia de esa respuesta popular. Dice: "Está bien, cinco de ustedes hicieron esto, pero como fue tan común, no cuenta tanto como una solución única". Esto evita que la clase copie ciegamente a la multitud.
  • El segundo truco: El profesor también observa cómo están pensando los estudiantes. Si un estudiante está un 99% seguro de un paso específico en su matemática, el profesor dice: "Genial, tienes confianza, ¡pero no te confíes demasiado! Todavía hay una pequeña posibilidad de que estés equivocado, así que mantengamos tu mente abierta a otras posibilidades". Pero si un estudiante está atrapado en una bifurcación del camino donde no está seguro de qué camino tomar, el profesor le da un gran impulso de aliento para explorar esa incertidumbre. Esto evita que los estudiantes se bloqueen en una única forma de pensar, rígida y cerrada, demasiado pronto.

Al usar estos dos trucos, ReCo cambia la forma en que la IA aprende. Evita que la IA solo memorice las respuestas "seguras" y la obliga a seguir explorando diferentes caminos.

Los investigadores probaron este nuevo método en algunos problemas de competencias matemáticas muy difíciles, como el AIME (Examen de Invitación de Matemáticas de América) y problemas de Olimpiadas. Utilizaron diferentes modelos de IA, incluyendo algunos basados en Qwen y Llama. Los resultados fueron prometedores. Cuando le pedían a la IA que intentara solo unas pocas veces, ReCo funcionaba tan bien como el método antiguo. Pero cuando le daban muchas oportunidades para intentarlo (como pedirle que generara 64 respuestas diferentes y elegir la mejor), ReCo brillaba. Encontró respuestas correctas que el método antiguo pasaba por alto por completo.

De hecho, en algunas de las pruebas más difíciles, el método antiguo (GRPO) en realidad se volvió peor que la IA original, sin entrenar, cuando se le daban muchos intentos, porque se había vuelto tan estrecha de miras. ReCo, sin embargo, mantuvo la "mente" de la IA abierta. Preservó la capacidad de encontrar soluciones diversas, asegurando que incluso si los primeros intentos fallan, la IA tenga toda una caja de herramientas con diferentes estrategias a las que recurrir.

El equipo también analizó por qué sucedió esto. Vieron que bajo el método antiguo, el "proceso de pensamiento" de la IA se volvía muy repetitivo, como un disco rayado tocando la misma canción. Bajo ReCo, la IA seguía generando enfoques únicos y variados, incluso al resolver el mismo problema. Era como observar a un estudiante que, en lugar de solo copiar el libro de texto, comenzaba a dibujar diagramas, usar diferentes fórmulas e incluso construir modelos físicos para entender el concepto.

En resumen, ReCo sugiere que para hacer que la IA sea verdaderamente inteligente, no debemos limitarnos a recompensarla por obtener la respuesta correcta rápidamente. También necesitamos recompensarla por no quedarse estancada en una rutina. Al empujar suavemente a la IA para que valore la variedad y la incertidumbre, los investigadores encontraron una forma de mantener los cerebros digitales curiosos, creativos y capaces de resolver problemas de maneras que no esperábamos. Es un recordatorio de que, a veces, la mejor manera de aprender es mantener las opciones abiertas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →