← Últimos artículos
💬 NLP

Constrained Group Relative Policy Optimization

Este artículo presenta Constrained GRPO, una extensión basada en el método de Lagrange de la Optimización de Política Relativa de Grupo que mejora la imposición de restricciones y la estabilidad del entrenamiento al escalar las ventajas estandarizadas en lugar de las recompensas puras para eliminar los efectos de acoplamiento perjudiciales causados por la normalización dentro del grupo.

Autores originales: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Publicado 2026-09-03
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, que evoluciona rápidamente, los investigadores están enseñando a grandes modelos informáticos a resolver problemas complejos, desde navegar en coches autónomos hasta resolver difíciles acertijos matemáticos. Estos modelos aprenden mediante ensayo y error, un proceso conocido como aprendizaje por refuerzo. Imagine a un estudiante intentando resolver un laberinto; recibe una recompensa por llegar a la salida y una penalización por chocar contra una pared. Con el tiempo, el estudiante aprende a maximizar las recompensas y evitar las penalizaciones. Sin embargo, surge un desafío importante cuando queremos que el modelo siga reglas estrictas, como "nunca atropellar a un peatón" o "usar siempre una gramática correcta", mientras intenta ser útil. Si las reglas son demasiado rígidas, el modelo podría volverse inútil; si son demasiado laxas, podría romperlas. Para resolver esto, los científicos utilizan un marco matemático que equilibra el deseo de tener éxito con la necesidad de obedecer restricciones, ajustando la importancia de cada regla a medida que el modelo aprende.

Un método popular para enseñar a estos modelos, llamado Optimización de Política Grupal Relativa (Group Relative Policy Optimization), se ha convertido en un favorito porque es eficiente y no requiere de un modelo "juez" separado para evaluar cada paso. En su lugar, compara un grupo de respuestas generadas para la misma pregunta para decidir cuáles son mejores. Si bien este método funciona bien para tareas generales, los investigadores descubrieron que aplicarlo a reglas de seguridad estrictas era complicado. En un nuevo estudio, un equipo del Instituto de IA Mila – Quebec y de la École Polytechnique de Montréal descubrió que la forma estándar de combinar diferentes objetivos en una sola puntuación estaba, de hecho, rompiendo la capacidad del sistema para seguir las reglas. Introdujeron un nuevo enfoque, la Optimización de Política Grupal Relativa con Restricciones (Constrained Group Relative Policy Optimization), que corrige este fallo y permite a los modelos aprender comportamientos complejos mientras cumplen estrictamente con los límites de seguridad.

El problema central que identificaron los investigadores fue cómo la computadora maneja múltiples objetivos a la vez. En el enfoque estándar, el modelo toma todas sus recompensas y penalizaciones, las mezcla en un solo número y luego normaliza ese número para que sea más fácil aprender de él. Los investigadores demostraron que este proceso de mezcla crea una interferencia oculta. Cuando la computadora ajusta el peso de una regla, cambia involuntariamente la importancia relativa de todas las demás reglas también. Es como intentar ajustar el volumen de un instrumento individual en una orquesta girando una perilla que también desplaza el equilibrio de toda la banda; puedes intentar hacer que los violines suenen más fuerte, pero al hacerlo, accidentalmente haces que los tambores suenen demasiado bajos y las flautas demasiado fuertes. Esto hace que sea muy difícil para el modelo aprender exactamente qué regla seguir, lo que a menudo provoca que ignore las restricciones de seguridad o que se vuelva inestable durante el entrenamiento.

Para solucionar esto, los investigadores cambiaron el orden de las operaciones. En lugar de mezclar las recompensas y penalizaciones primero, dejaron que el modelo calculara el valor de cada regla por separado y las normalizara individualmente. Solo después de que cada regla ha sido tratada justamente por sí misma, las combinan utilizando los pesos aprendidos. Este simple cambio elimina la interferencia oculta. Al mantener las señales separadas hasta el final, el modelo puede ver claramente cuánto está mejorando en cada regla específica. El resultado es un proceso de aprendizaje mucho más estable y predecible. Los investigadores probaron este nuevo método en tres entornos muy diferentes: un juego sencillo basado en una cuadrícula donde un agente tenía que evitar la lava y gestionar una batería, una simulación realista de conducción autónoma con miles de escenarios de tráfico complejos, y una tarea de razonamiento matemático que involucraba problemas de palabras de nivel escolar.

En el juego basado en la cuadrícula, el nuevo método permitió que el agente aprendiera de manera mucho más fluida. El enfoque estándar causaba que el agente se volviera excesivamente cauteloso, evitando la lava de forma tan agresiva que apenas se movía, mientras que el nuevo método permitió al agente usar su "presupuesto" de riesgo de manera efectiva, alcanzando la meta mientras se mantenía seguro. En la simulación de conducción autónoma, el nuevo enfoque produjo conductores que no solo eran más seguros, sino también más eficaces para completar sus rutas. Los modelos entrenados con el nuevo método lograron puntuaciones más altas en cumplimiento de seguridad y progreso de la ruta en comparación con los métodos anteriores que mezclaban las señales primero. Lograron evitar colisiones y seguir las leyes de tránsito sin sacrificar su capacidad para avanzar, un equilibrio que otros métodos tuvieron dificultades para mantener.

La prueba final consistió en enseñar a un modelo de lenguaje a resolver problemas matemáticos asegurando que las respuestas fueran cortas, tuvieran el formato correcto y contuvieran números válidos. Aquí, el nuevo método volvió a demostrar ser superior. Los modelos entrenados con el enfoque de mezcla estándar a menudo sacrificaban la corrección para hacer sus respuestas más cortas o para ajustarse a un formato específico. En contraste, el nuevo método aseguró que el modelo priorizara hacer bien las matemáticas, manteniendo al mismo tiempo altos estándares de formato y longitud. A través de diferentes tamaños de modelos informáticos, desde los más pequeños con 1.500 millones de parámetros hasta los más grandes con 7.000 millones, el nuevo enfoque produjo consistentemente resultados más precisos sin necesidad de componentes de entrenamiento adicionales y costosos.

Los hallazgos sugieren que la forma en que combinamos las diferentes señales de aprendizaje es tan importante como las señales mismas. Simplemente cambiando el orden en el que la computadora procesa sus recompensas y reglas, los investigadores pudieron crear un sistema que respeta las restricciones de manera mucho más fiable. Este trabajo no ofrece solo una pequeña mejora; proporciona un camino más claro para entrenar a la inteligencia artificial para que opere de forma segura en el mundo real, donde seguir las reglas es a menudo tan importante como alcanzar el objetivo. El estudio confirma que cuando queremos que la IA sea tanto capaz como segura, debemos tener cuidado de no dejar que la forma en que medimos el éxito confunda al modelo sobre lo que realmente debe hacer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →