← Últimos artículos
🤖 machine learning

Understanding Diversity Collapse in RLVR via the Lens of Overtraining

Este artículo identifica el "colapso de la diversidad" en el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) como una forma de sobreentrenamiento que estrecha el límite de razonamiento del modelo, y propone el "Control de Frontera Bayesiano" para redirigir la optimización hacia problemas no resueltos, mejorando así el rendimiento de Pass@kk de alto-kk a través de diversos bancos de pruebas de razonamiento.

Autores originales: Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An

Publicado 2026-06-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El panorama general: El problema del "artista de un solo truco"

Imagina que estás entrenando a un estudiante (una IA) para resolver problemas matemáticos. Le das un examen de práctica donde puede intentarlo tantas veces como quiera para obtener la respuesta correcta.

  • El objetivo: Quieres que el estudiante mejore resolviendo nuevos problemas que nunca ha visto antes, y quieres que sea capaz de encontrar la respuesta incluso si tiene que probar muchos enfoques diferentes.
  • El problema: El artículo descubre que, si bien el estudiante se vuelve muy bueno obteniendo la respuesta correcta al primer intento (Pass@1), en realidad se vuelve peor encontrando la respuesta si se le permite intentarlo muchas veces (Pass@k).

Los autores llaman a esto "Colapso de la Diversidad" (Diversity Collapse). Es como si el estudiante dejara de pensar de forma creativa. En lugar de intentar cinco formas diferentes de resolver un problema, simplemente repite la única forma que sabe que funciona, una y otra vez. Si esa única forma falla, se rinde, aunque podría haber encontrado la respuesta en el segundo o tercer intento si hubiera probado algo distinto.

La causa: "Sobreentrenamiento" en las cosas equivocadas

¿Por por qué sucede esto? Los autores argumentan que es un caso de sobreentrenamiento (overtraining).

Piensa en ello como un entrenador que solo elogia a un jugador cuando marca un gol.

  1. La configuración: El entrenador (el sistema de entrenamiento de la IA) le plantea un problema al jugador. El jugador lo intenta 8 veces (esto se llama "rollouts").
  2. La trampa: Si el jugador acierta la respuesta aunque sea una sola vez de esos 8 intentos, el entrenador piensa: "¡Genial! ¡Este problema está resuelto!".
  3. El error: El entrenador le sigue diciendo al jugador que se concentre en este problema "resuelto", reforzando esa forma específica de resolverlo. El jugador deja de intentar nuevos ángulos y simplemente perfecciona ese movimiento específico.

El artículo muestra que, en el entrenamiento estándar de IA, la mayor parte del tiempo que la IA pasa entrenando se desperdicia en problemas que ya ha "resuelto" al menos una vez. Debido a que la IA sigue practicando estas victorias "fáciles", olvida cómo explorar nuevos caminos. Se convierte en un maestro de un truco específico, pero pierde la capacidad de ser flexible.

La analogía del "Límite de Razonamiento"

Los autores introducen un concepto llamado "Límite de Razonamiento" (Reasoning Boundary). Imagina una pared que representa todo lo que la IA puede resolver.

  • Pass@1 es como preguntar: "¿Puede la IA resolver este problema al primer intento?".
  • Pass@k (High-k) es como preguntar: "Si dejamos que la IA lo intente 256 veces, ¿puede encontrar una solución?".

El artículo afirma que el entrenamiento estándar empuja la pared hacia adentro. La IA mejora en los problemas específicos que ya conoce, pero deja de expandir la pared para incluir nuevos problemas que antes no podía resolver. Es como un jardinero que sigue regando las mismas pocas flores hasta que son enormes, mientras el resto del jardín (los nuevos problemas sin resolver) muere porque no llega agua a ellos.

La evidencia: No es que la IA no pueda aprender

Una creencia común era que este declive en el rendimiento significaba que la IA simplemente no podía aprender nuevas habilidades de razonamiento. Los autores demuestran que esto es falso con dos experimentos:

  1. Observación: Observaron a la IA durante el entrenamiento. Vieron que la IA aprendía a resolver algunos problemas que no podía resolver al principio. Sin embargo, al mismo tiempo, empezaba a fallar en problemas que antes resolvía fácilmente. Las "ganancias" quedaban ocultas por las "pérdidas".
  2. Intervención: Intentaron un arreglo simple: Dejar de entrenar en problemas que la IA ya ha resuelto. Le dijeron a la IA: "Si acertaste aunque fuera una vez, deja de practicar eso. Solo practica aquellos en los que fallaste".
    • Resultado: Cuando hicieron esto, la capacidad de la IA para resolver problemas difíciles (Pass@256) en realidad subió por encima de su nivel inicial. Esto demostró que la IA podía aprender cosas nuevas, pero el método de entrenamiento estándar la estaba bloqueando accidentalmente al hacer que sobreentrenara las cosas fáciles.

La solución: "Control de Límite Bayesiano" (Bayesian Boundary Gating - BBG)

Para solucionar esto, los autores proponen un nuevo método llamado Control de Límite Bayesiano (BBG).

Piensa en BBG como un filtro inteligente para el entrenador. Antes de que el entrenador decida qué problemas practicar, el BBG pregunta:

  • "¿Ya se resolvió este problema? Si es así, sáltalo".
  • "¿Es este un problema completamente sin resolver? ¡Si es así, enfócate en él!".
  • "¿Está este problema en un punto medio? Tal vez dale un poco de atención".

Mediante la estimación matemática de qué problemas aún tienen "espacio para crecer", el BBó redirige la energía de la IA lejos del sobreentrenamiento de las victorias fáciles y hacia los problemas que realmente necesitan ayuda.

Los resultados

Cuando probaron este nuevo método en varios bancos de pruebas matemáticos difíciles:

  • IA Estándar: Mejoró en lograr el acierto al primer intento, pero empeoró en la resolución de problemas cuando se le permitieron muchos intentos.
  • IA con BBG: Mejoró en lograr el acierto al primer intento Y mantuvo (o mejoró) su capacidad para resolver problemas cuando se le permitieron muchos intentos.

Resumen

El artículo sostiene que los modelos de IA se están "atascando" en una rutina porque se les obliga a practicar problemas que ya han dominado. Esto los vuelve rígidos y menos creativos. Al evitar que la IA practique lo que ya sabe y centrarse solo en lo que aún no conoce, podemos ayudarla a convertirse en un solucionador de problemas más versátil y capaz.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →