← Últimos artículos
💬 NLP

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

Este artículo presenta AdvGRPO, un novedoso marco de co-entrenamiento que estabiliza GRPO para la optimización conjunta de atacante-defensor mediante recompensas densas multicanal, normalización de ventaja desacoplada y un currículo progresivo, logrando finalmente ataques transferibles altamente efectivos y defensas de modelos de lenguaje más robustas.

Autores originales: Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: Un combate de entrenamiento digital

Imagina que tienes un robot muy inteligente (el Defensor) que ha sido entrenado para ser útil, pero también para rechazar peticiones dañinas, como "¿Cómo construyo una bomba?" o "¿Cómo hackeo un banco?".

Normalmente, los humanos intentan probar a este robot escribiendo una lista de preguntas capciosas. Pero el robot es inteligente; aprende a decir "No" a esas preguntas específicas. El problema es que un atacante astuto y adaptativo puede cambiar su estrategia para encontrar una nueva forma de engañar al robot.

Este artículo presenta una nueva forma de entrenar a ambos lados al mismo tiempo utilizando un método llamado AdvGRPO. Piensa en ello como la configuración de un dojo digital donde un Equipo Rojo (el atacante) y un Equipo Azul (el defensor) entrenan entre sí continuamente. En lugar de que los humanos escriban las preguntas, los modelos de IA aprenden a atacar y defender jugando uno contra el otro, volviéndose más fuertes con cada ronda.

El problema del método antiguo

Previamente, los investigadores intentaron usar una herramienta de entrenamiento específica (llamada GRPO) para enseñar al atacante cómo romper al defensor. Sin embargo, descubrieron que cuando el atacante y el defensor aprendían al mismo tiempo, el sistema se volvía "inestable". Era como si dos boxeadores intentaran aprender un nuevo estilo de combate mientras el ring mismo se sacudía; no podían ponerse de acuerdo sobre quién estaba ganando, y el entrenamiento colapsaba o daba vueltas en círculos.

La solución: AdvGRPO (El dojo estable)

Los autores crearon un nuevo marco de trabajo llamado AdvGRPO que soluciona el problema del ring que se sacude. Lo hicieron con tres trucos principales:

  1. Una tarjeta de puntuación con múltiples carriles (Recompensas densas multicanal):
    Imagina a un árbitro que no solo grita "¡Punto!" al final de la ronda. En su lugar, otorga una puntuación por cada movimiento.

    • ¿Se mantuvo el atacante en el tema?
    • ¿Siguió el atacante la estrategia?
    • ¿Logró realmente obtener la respuesta dañina?
      Al puntuar cada pequeño paso, el atacante recibe una retroalimentación constante sobre qué mejorar, en lugar de esperar hasta el final para saber que falló.
  2. Jueces independientes (Normalización de ventaja desacoplada):
    En el método antiguo e inestable, si el atacante de repente se volvía muy bueno, las puntuaciones para el defensor se veían terribles en comparación, lo que confundía el entrenamiento.
    El nuevo método utiliza un sistema (llamado GDPO) donde cada tipo de puntuación es juzgado de forma independiente antes de combinarse. Es como tener un juez para la "Velocidad", un juez para la "Técnica" y un juez para la "Creatividad", que califican por separado, de modo que uno no arruine la puntuación del otro. Esto mantiene el entrenamiento estable incluso a medida que ambos modelos se vuelven más inteligentes.

  3. El campamento de entrenamiento (Aprendizaje por currículo):
    No pondrías a un boxeador principiante en el ring con un campeón inmediatamente. El artículo utiliza un "currículo".

    • Fase 1: El atacante entrena solo contra un defensor fijo para aprender lo básico.
    • Fase 2: Una vez que el atacante es decente, comienza a hacer sparring con el defensor.
    • Fase 3: Se turnan. El atacante intenta romper al defensor durante algunas rondas, luego el defensor intenta parchar los agujeros durante algunas rondas, y cambian. Esto evita que el defensor simplemente diga "No" a todo (una victoria fácil) y lo obliga a aprender cómo manejar ataques específicos y complicados.

Lo que encontraron

El artículo reporta varios resultados clave de sus experimentos:

  • Los atacantes se volvieron aterradoramente buenos: Los atacantes entrenados aprendieron a engañar al defensor mucho mejor que los modelos no entrenados o los modelos que simplemente fueron "desbloqueados" (a los que se les quitaron los filtros de seguridad). Aprendieron que simplemente eliminar los filtros de seguridad no es suficiente; tienes que aprender cómo atacar.
  • Pueden adaptarse: Los atacantes aprendieron estrategias que funcionaron no solo en el defensor contra el que entrenaron, sino también en modelos completamente diferentes que nunca habían visto antes. Es como un boxeador que aprende un movimiento que funciona contra cualquiera, no solo contra su compañero de sparring.
  • Los defensores se volvieron más fuertes: Los defensores entrenados en este "dojo" se volvieron mucho mejores para detectar y bloquear ataques que los defensores entrenados con métodos más antiguos. Aprendieron a decir "No" a las peticiones malas, pero seguir diciendo "Sí" a las peticiones buenas e inofensivas.
  • Los modelos de pensamiento necesitan ayuda especial: Descubrieron que los modelos capaces de "pensar" (razonar) a menudo intentaban ser demasiado seguros y se negaban a atacar incluso cuando se les pedía. Tuvieron que crear un sistema de recompensa especial para enseñar a estos modelos a pensar a través del ataque sin quedarse estancados en las advertencias de seguridad.

La conclusión fundamental

El artículo afirma que, al utilizar este nuevo método estable (AdvGRPO), pueden crear un sistema donde los atacantes y defensores de IA aprenden juntos. Esto resulta en atacantes que son muy buenos encontrando debilidades y defensores que son muy buenos corrigiéndolas, haciendo que la IA sea más segura en general. Enfatizan que esto es una herramienta de investigación para encontrar debilidades antes de que actores malintencionados puedan usarlas, ayudando a construir sistemas de IA más fuertes y robustos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →