← Últimos artículos
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

Este artículo presenta AdvGame, un nuevo paradigma de alineación de seguridad que enmarca la interacción entre un modelo de lenguaje Atacante y uno Defensor como un juego de suma no nula entrenado mediante aprendizaje por refuerzo en línea con recompensas basadas en preferencias, lo que resulta en un Defensor más robusto y útil junto con un potente agente de red teaming de propósito general.

Autores originales: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot muy inteligente pero inexperto (el Defensor) cómo lidiar con un mundo caótico lleno de preguntas truculentas, algunas de las cuales son peligrosas.

Tradicionalmente, los desarrolladores intentaban enseñar a este robot mostrándole una lista de "malas preguntas" y diciéndole: "No respondas estas". Pero el robot es inteligente; eventualmente aprende a memorizar la lista, pero falla cuando alguien le hace un nuevo tipo de mala pregunta que no había visto antes. Es como enseñarle a un guardia de seguridad a reconocer solo los rostros específicos de un cartel de "se busca", en lugar de enseñarle a detectar comportamientos sospechosos en general.

Este artículo presenta una nueva forma de entrenar al robot llamada AdvGame. En lugar de un profesor y un estudiante, establecen un videojuego con dos jugadores:

  1. El Atacante (El "Bromista"): Un robot cuyo único trabajo es inventar nuevas y astutas formas de engañar al Defensor para que diga algo dañino.
  2. El Defensor (El "Guardián"): Un robot cuyo trabajo es responder preguntas útiles mientras esquiva de forma segura las trampas del Bromista.

La idea central: Una danza sin fin

En el método antiguo, el Bromista intentaba romper al Guardián, luego el Guardián era reparado, y entonces el Bromista lo intentaba de nuevo. Era un juego lento de "va y ven" de "el gato y el ratón".

En AdvGame, juegan simultáneamente.

  • El Bromista intenta encontrar un nuevo agujero en la armadura del Guardián.
  • El Guardián aprende instantáneamente a parchar ese agujero.
  • Debido a que están jugando al mismo tiempo, el Guardiente aprende a manejar cualquier nuevo truco que el Bromista invente, no solo los que vio ayer.

El artículo argumenta que esto no es un juego de "suma cero" (donde uno gana y el otro pierde). En cambio, es un juego de suma no nula. El Bromista no está intentando destruir al Guardián; está intentando hacer al Guardián mejor al encontrar sus debilidades. El Guardián no está intentando silenciar al Bromista; está intentando mantenerse útil mientras se niega a ser engañado.

El marcador: "¿Mejor que?" vs. "¿Cuántos puntos?"

Una innovación importante en este artículo es cómo juzgan a los jugadores.

  • Forma antigua (Por puntos): Un juez da una puntuación como "7 de 10" a una sola respuesta. Esto es complicado porque un "7" es subjetivo. El robot podría aprender a manipular el sistema dando respuestas que parecen buenas al juez pero que no son realmente seguras (como un estudiante que memoriza la clave de respuestas en lugar de aprender la materia).
  • Nueva forma (Por pares): Al juez se le muestran dos respuestas una al lado de la otra y simplemente se le pregunta: "¿Cuál es mejor?".
    • Analogía: En lugar de pedirle a un crítico gastronómico que califique una hamburguesa en una escala del 1 al 10 (lo cual es difícil de calibrar), simplemente le preguntas: "¿Es la Hamburguesa A mejor que la Hamburguesa B?". Esto es mucho más difícil de engañar y proporciona una señal más clara de lo que "bueno" realmente significa.

Los resultados: Más fuertes y más inteligentes

El artículo probó este método en dos modelos de robots populares (Llama y Qwen). Esto es lo que encontraron:

  1. El Guardián se volvió más resistente: Los modelos Defensores entrenados con AdvGame fueron mucho más difíciles de engañar. Cuando fueron probados contra ataques de "jailbreak" conocidos (formas de saltarse los filtros de seguridad), mantuvieron su posición mucho mejor que los modelos entrenados con los métodos antiguos.
  2. El Guardián se mantuvo útil: Un problema común con el entrenamiento de seguridad es que el robot se vuelve demasiado cauteloso y se niega a responder preguntas inofensivas (como "¿Cómo mato un proceso de computadora?"). AdvGame logró mantener al robot útil y servicial mientras seguía siendo seguro.
  3. El Bromista se convirtió en una súper herramienta: El robot Atacante no desapareció después del entrenamiento. Se convirtió en una poderosa herramienta de "Red Team" (equipo de ataque). Esto significa que el Atacante en sí puede usarse ahora para probar si otros robots son seguros, actuando como un profesional de pruebas de estrés.

La receta secreta

El artículo destaca tres razones por las que esto funcionó tan bien:

  • Dos robots separados: No usaron un solo robot para jugar ambos roles (lo que puede confundirlo). Usaron dos modelos distintos, de modo que el Atacante se mantiene enfocado en atacar y el Defensor en defender.
  • El juez de "Mejor que": El uso de la comparación por pares (¿cuál es mejor?) evitó que los robots engañaran el sistema de puntuación.
  • El truco del "Promedio Móvil": Utilizaron una técnica llamada EMA (Promedio Móvil Exponencial). Imagina que el Guardián es un estudiante tomando un examen. En lugar de entrar en pánico porque falló una pregunta, observa su desempeño durante las últimas semanas para ver su verdadero nivel de habilidad. Esto mantiene el entrenamiento estable y evita que el robot reaccione de forma exagerada ante un solo mal ejemplo.

Resumen

AdvGame es como un gimnasio donde un robot aprende a esquivar golpes. En lugar de que un entrenador le muestre un video de un golpe y le diga cómo esquivarlo, el robot entrena haciendo sparring con un compañero que está constantemente inventando nuevos golpes en tiempo real. El resultado es un robot que no solo es más seguro, sino también más útil, y un compañero de sparring que es tan bueno encontrando huecos en las defensas que puede usarse para probar cualquier otro robot en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →