← Últimos artículos
🤖 machine learning

Parameter Exploration for RLVR via Variational Learning

Este artículo presenta la Optimización de Política de Parámetros Perturbados (3PO), un método que mejora el aprendizaje por refuerzo para los LLM al explorar el espacio de parámetros para generar políticas diversas, mejorando así el rendimiento en tareas posteriores y la estabilidad del entrenamiento en comparación con las técnicas estándar de exploración del espacio de acciones como GRPO.

Autores originales: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

Publicado 2026-08-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente a resolver un rompecabezas difícil, como un problema matemático complejo o escribir una pieza de código. No puedes simplemente sentarte y mostrarle la respuesta; en su lugar, dejas que el robot lo intente, y si lo logra, le das un "choca esos cinco" (una recompensa). Si se equivoca, le dices suavemente "inténtalo de nuevo". Esto se llama Aprendizaje por Refuerzo. La parte difícil es que el robot tiene que descubrir por sí mismo cómo conseguir ese "choca esos cinco". A veces, se queda estancado en una rutina, repitiendo los mismos errores una y otra vez porque tiene demasiado miedo de intentar algo nuevo. Para solucionar esto, los científicos suelen intentar que el robot sea un poco más "caótico" o "aleatorio" cuando piensa, con la esperanza de que tropiece con una solución brillante y nueva.

Durante mucho tiempo, la forma estándar de añadir este caos fue ajustar la "temperatura" del robot. Piensa en esto como subir el volumen de la estática de una radio: hace que las elecciones del robot sean un poco más impredecibles, pero no cambia realmente lo que sabe o cómo piensa; solo baraja ligeramente el orden de sus conjeturas. Es como decirle a un chef que eche más especias a una sopa sin cambiar la receta en sí. El problema es que, a veces, la sopa sigue sabiendo fatal, y el robot sigue haciendo las mismas malas conjeturas, solo que en un orden diferente. Este artículo explora una idea diferente y más radical: ¿qué pasaría si no solo barajamos las especias, sino que realmente retocamos el cerebro del chef? ¿Qué pasaría si le damos al robot una pequeña "niebla mental" temporal o un ligero "cambio de personalidad" para cada intento? Esto permite que el robot explore formas de pensar completamente nuevas, no solo nuevas formas de adivinar.

Los investigadores detrás de este estudio, Vatsal Venkatkrishna, Nico Daheim e Iryna Gurevych, decidieron probar esta idea de "retocar el cerebro" en grandes modelos de lenguaje (el tipo de IA que escribe texto y resuelve problemas). Llaman a su nueva familia de métodos 3PO (Optimización de Política de Parámetros Perturbados). En lugar de simplemente hacer que las conjeturas del robot sean aleatorias (exploración en el espacio de acciones), en realidad añaden un poco de ruido a los pesos internos del robot (exploración en el espacio de parámetros). Imagina que tienes un equipo de 16 chefs intentando resolver un rompecabezas. La forma antigua (llamada GRPO) sería que los 16 chefs usen exactamente el mismo libro de recetas, simplemente adivinando al azar. Si todos fallan, todo el equipo se queda estancado.

El equipo de 3PO probó tres formas diferentes de agitar las cosas. Primero, B3PO es como darle a todo el equipo una versión del libro de recetas ligeramente diferente y nublada para toda la ronda. Segundo, M3PO es como hacer que el equipo pruebe cuatro versiones diferentes del libro, una tras otra, y promediar los resultados. Pero la verdadera estrella del espectáculo es C3PO. En C3PO, el equipo se divide. En lugar de que todos usen el mismo libro, dividen a los 16 chefs en grupos más pequeños, y cada grupo recibe una versión de la niebla del libro de recetas completamente diferente. Esto significa que el equipo está explorando muchos "universos" de soluciones diferentes al mismo tiempo.

Los resultados fueron bastante prometedores. Cuando probaron estos métodos en problemas matemáticos difíciles (como la competencia AIME) y desafíos de programación, el método C3PO superó consistentemente a los métodos estándar. El artículo sugiere que, al usar estas diferentes versiones "nubladas" del modelo, el equipo pudo encontrar respuestas correctas que el método estándar pasó por alto. Específicamente, C3PO logró "rescatar" más grupos de intentos que de otro modo habrían sido callejones sin salida (donde cada uno de los intentos obtenía la misma respuesta incorrecta). También produjo menos respuestas "malformadas", que son esas respuestas extrañas y rotas donde el robot simplemente repite tonterías.

Curiosamente, el artículo argumenta que simplemente hacer al robot más aleatorio (como subir la temperatura) no es suficiente. De hecho, descubrieron que hacer al robot demasiado aleatorio a menudo solo conducía a más respuestas basura. La clave era la estructura de la exploración: tener múltiples versiones diferentes del modelo trabajando juntas en el mismo grupo. Aunque el artículo no afirma que esto sea una solución mágica que lo solucione todo, sugiere fuertemente que retocar los parámetros internos del modelo es una herramienta poderosa. Es como darse cuenta de que, para encontrar un tesoro escondido, no basta con caminar en direcciones aleatorias; necesitas enviar a todo un equipo de exploradores, cada uno con un mapa ligeramente diferente, para cubrir más terreno. Los investigadores descubrieron que este enfoque funciona bien sin necesitar significativamente más potencia de cómputo, lo que lo convierte en una mejora práctica para entrenar IAs más inteligentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →