Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies
Este artículo demuestra que las Estrategias de Evolución (ES) superan al Aprendizaje por Refuerzo (RL) en el post-entrenamiento de Grandes Modelos de Lenguaje para dominios de descubrimiento al mantener una cobertura de soluciones más amplia y puntuaciones pass@k más altas, evitando así el colapso de la distribución de salida que limita la efectividad del RL al generar soluciones candidatas diversas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando encontrar un tesoro oculto en una vasta isla cubierta de niebla. En el mundo de la Inteligencia Artificial, los Modelos de Lenguaje Extensos (LLM) son como exploradores increíblemente inteligentes que pueden leer mapas y adivinar dónde podría estar el tesoro. Durante mucho tiempo, la mejor manera de entrenar a estos exploradores era mostrarles un problema, dejar que adivinaran y luego recompensarlos solo si su mejor suposición era perfecta. Este método, conocido como Aprendizaje por Refuerzo (RL), es como un entrenador estricto que grita "¡Error!" ante cada respuesta incorrecta y "¡Perfecto!" ante la única respuesta correcta. El problema es que este entrenador se obsesiona tanto con encontrar esa única respuesta perfecta que el explorador deja de buscar en cualquier otro lugar. Deja de explorar los bordes brumosos de la isla donde podrían estar escondidos otros tesoros, centrándose únicamente en el lugar que cree que es el correcto.
Pero, ¿qué pasa si el tesoro no es una sola cosa? ¿Qué pasa si hay muchas formas diferentes de resolver un problema matemático o de descubrir un nuevo hecho científico? En estos dominios de "descubrimiento", no basta con tener una suposición perfecta; se necesita una red amplia para capturar cualquier solución correcta. Aquí es donde entra una nueva idea llamada "escalado en tiempo de inferencia" (test-time scaling). En lugar de simplemente pedirle al modelo una respuesta, le pedimos que genere docenas o incluso cientos de intentos diferentes y veamos si alguno de ellos es correcto. El artículo que estás a punto de leer investiga si nuestro estricto entrenador (RL) o un método de entrenamiento diferente es mejor para ayudar al explorador a lanzar una red amplia. Los investigadores descubrieron que, mientras que el estricto entrenador hace que el explorador sea muy seguro de sí mismo en un solo punto, un método diferente llamado Estrategias de Evolución (ES) mantiene al explorador curioso y errante, asegurando que, si una solución existe en cualquier parte de la niebla, el explorador tenga muchas más probabilidades de encontrarla.
El artículo: Más allá de la mejor suposición
Este artículo aborda un problema complicado en el entrenamiento de la IA: ¿cómo nos aseguramos de que un modelo de IA no solo se vuelva muy bueno adivinando la única respuesta correcta, sino que realmente mantenga sus opciones abiertas para encontrar cualquier respuesta correcta? Los autores, investigadores de Cognizant AI Lab y la Universidad de Texas en Austin, compararon dos métodos de entrenamiento: el Aprendizaje por Refuerzo (RL) estándar y un enfoque más nuevo llamado Estrategias de Evolución (ES).
Piensa en el Aprendizaje por Refuerzo como un estudiante que estudia intensamente para un examen memorizando la clave de respuestas exacta. Si el estudiante acierta una pregunta, recibe un premio; si falla, no recibe nada. Con el tiempo, el estudiante se convierte en un maestro de esa pregunta específica pero deja de comprender los conceptos subyacentes. En el mundo de la IA, esto causa algo llamado "colapso de la distribución". El modelo se vuelve tan enfocado en su "mejor suposición" que deja de generar respuestas diversas. Es como un músico que solo toca una nota porque es la única que recibe aplausos, olvidando cómo tocar una canción completa.
Las Estrategias de Evolución (ES), por otro lado, funcionan más como un ecosistema natural. En lugar de entrenar un único modelo, ES crea toda una "población" de versiones ligeramente diferentes del modelo. Modifican sus "cerebros" (pesos) de forma aleatoria, como la mutación de los genes en la naturaleza, y ven qué versiones funcionan mejor. Crucialmente, no solo eligen al único ganador y descartan al resto; aprenden de todo el grupo. Esto mantiene el "cerebro" de la IA flexible y diverso, permitiéndole explorar muchos caminos diferentes hacia una solución.
Los investigadores probaron estos métodos en problemas matemáticos, que van desde aritmética simple hasta desafíos complejos de nivel de Olimpiada, utilizando modelos de diferentes tamaños (desde 1.500 millones hasta 32.000 millones de parámetros). Midieron el éxito utilizando una métrica llamada pass@k. Imagina pedirle a la IA que genere 100 respuestas diferentes a un problema. Pass@1 pregunta: "¿Es la primera respuesta la correcta?". Pass@k pregunta: "¿Es al menos una de las 100 respuestas correcta?".
Esto es lo que encontraron:
1. La trampa de la "mejor suposición"
Cuando los investigadores observaron el pass@1 (la suposición única más acertada), los modelos entrenados con RL eran a menudo muy buenos. Eran agudos y seguros. Sin embargo, a medida que los investigadores aumentaban el número de intentos (k) a 2, 8, 16 o incluso 128, los modelos de RL chocaban contra un muro. Su rendimiento dejaba de mejorar. De hecho, para algunos problemas difíciles, los modelos de RL se volvieron peores que el modelo original, no entrenado, cuando se les daban muchas oportunidades para adivinar. El modelo de RL se había vuelto tan estrecho en su pensamiento que dejó de encontrar respuestas correctas que fueran ligeramente diferentes de su "favorita".
2. El poder de la diversidad
En contraste, los modelos entrenados con ES mostraron un patrón diferente. Aunque también eran buenos acertando la primera suposición, su verdadero superpoder apareció a medida que aumentaba el número de intentos. A medida que los investigadores pedían más y más muestras (hasta 128), los modelos de ES seguían encontrando nuevas soluciones correctas. El artículo muestra que ES alcanzó consistentemente puntuaciones de pass@k más altas que RL en todos los tamaños de modelo y en todas las pruebas matemáticas que probaron.
3. Por qué sucede esto
Los autores investigaron el porqué de esto. Descubrieron que el entrenamiento de RL tiende a "podar" el conocimiento de la IA. Elimina los caminos que conducen a respuestas correctas pero menos comunes, haciendo que algunos problemas sean imposibles de resolver incluso si la IA lo intenta 100 veces. El método ES, sin embargo, preserva la "amplitud" del conocimiento de la IA. No solo aprende la respuesta correcta; aprende a mantener muchas puertas abiertas. Cuando los investigadores observaron la "entropía" de la IA (una medida de qué tan diversas son sus respuestas), vieron que cuando los modelos de RL fallaban, eran erróneamente seguros de sí mismos (baja diversidad). Cuando los modelos de ES fallaban, seguían siendo diversos e inciertos, lo que significa que todavía estaban explorando y tenían una mejor oportunidad de encontrar la respuesta correcta si se les daba más tiempo o capacidad de cómputo.
4. El impacto en el mundo real
El artículo sugiere que para problemas donde necesitamos descubrir cosas nuevas —como resolver una demostración matemática difícil, escribir código o encontrar un nuevo hecho científico—, tener un modelo que pueda generar una amplia variedad de soluciones correctas es más valioso que tener un modelo que sea simplemente muy bueno en una suposición específica. Al usar ES, podemos obtener mejores resultados en estos dominios de descubrimiento porque es menos probable que el modelo se quede atrapado en un "atrapamiento local" y sea más probable que encuentre la solución global.
En resumen, el artículo argumenta que si quieres que una IA sea un gran explorador en lo desconocido, no debes entrenarla solo para ser el mejor adivinador del día. Debes entrenarla para que mantenga sus opciones abiertas, deambule un poco y esté lista para encontrar el tesoro sin importar dónde esté escondido. Las Estrategias de Evolución, resulta ser, son el mejor entrenador para ese tipo de aventura.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.