← Derniers articles
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

Cet article introduit AdvGame, un nouveau paradigme d'alignement de sécurité qui cadre l'interaction entre un modèle de langage Attaquant et un modèle Défenseur comme un jeu à somme non nulle entraîné via un apprentissage par renforcement en ligne avec des récompenses basées sur les préférences, résultant en un Défenseur plus robuste et utile aux côtés d'un agent de red-teaming généraliste puissant.

Auteurs originaux : Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Publié 2026-06-02
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un robot très intelligent mais inexpérimenté (le Défenseur) comment gérer un monde chaotique rempli de questions piégeuses, dont certaines sont dangereuses.

Traditionnellement, les développeurs essayaient d'enseigner cela au robot en lui montrant une liste de « mauvaises questions » et en lui disant : « Ne réponds pas à celles-ci ». Mais le robot est intelligent ; il finit par apprendre la liste par cœur, mais échoue lorsqu'on lui pose un nouveau type de mauvaise question qu'il n'a pas vue auparavant. C'est comme enseigner à un garde de sécurité à reconnaître uniquement les visages spécifiques sur une affiche de « personnes recherchées », plutôt que de lui apprendre à repérer un comportement suspect en général.

Ce document présente une nouvelle façon d'entraîner le robot appelée AdvGame. Au lieu d'un enseignant et d'un élève, ils ont mis en place un jeu vidéo avec deux joueurs :

  1. L'Attaquant (Le « Trickster » ou le Fripon) : Un robot dont le seul travail est d'inventer de nouvelles façons astucieuses de piéger le Défenseur pour le faire dire quelque chose de préjudiciable.
  2. Le Défenseur (Le « Gardien ») : Un robot dont le travail est de répondre à des questions utiles tout en esquivant en toute sécurité les pièges du Trickster.

L'idée centrale : Une danse sans fin

Dans l'ancienne méthode, le Trickster essayait de briser le Gardien, puis le Gardien était réparé, puis le Trickster essayait à nouveau. C'était un jeu de « chat et de la souris » lent et en mode va-et-vient.

Dans AdvGame, ils jouent simultanément.

  • Le Trickster essaie de trouver une nouvelle faille dans l'armure du Gardien.
  • Le Gardien apprend instantanément à colmater cette faille.
  • Parce qu'ils jouent en même temps, le Gardien apprend à gérer n'importe quel nouveau tour que le Trickster peut lui jouer, pas seulement ceux qu'il a vus hier.

Le document soutient que ce n'est pas un jeu à « somme nulle » (où l'un gagne et l'autre perd). C'est un jeu à somme non nulle. Le Trickster ne cherche pas à détruire le Gardien ; il cherche à rendre le Gardien meilleur en trouvant ses faiblesses. Le Gardien ne cherche pas à faire taire le Trickster ; il cherche à rester utile tout en refusant d'être piégé.

Le tableau de bord : « Meilleur que » vs « Combien de points »

Une innovation majeure de ce document est la façon dont ils jugent les joueurs.

  • L'ancienne méthode (par points) : Un juge donne un score comme « 7 sur 10 » à une seule réponse. Cela est délicat car un « 7 » est subjectif. Le robot pourrait apprendre à détourner le système en donnant des réponses qui semblent bonnes pour le juge mais qui ne sont pas réellement sûres (comme un élève qui mémorise le corrigé plutôt que d'apprendre la matière).
  • La nouvelle méthode (par paire) : Le juge voit deux réponses côte à côte et on lui demande simplement : « Laquelle est la meilleure ? »
    • Analogie : Au lieu de demander à un critique gastronomique de noter un burger sur une échelle de 1 à 10 (ce qui est difficile à calibrer), on lui demande simplement : « Est-ce que le Burger A est meilleur que le Burger B ? » C'est beaucoup plus difficile à tricher et cela donne un signal plus clair de ce qu'est un « bon » résultat.

Les résultats : Plus forts et plus intelligents

Le document a testé cette méthode sur deux modèles de robots populaires (Llama et Qwen). Voici ce qu'ils ont trouvé :

  1. Le Gardien est devenu plus robuste : Les modèles Défenseurs entraînés avec AdvGame sont beaucoup plus difficiles à piéger. Lorsqu'ils sont testés contre des attaques de « jailbreak » connues (des moyens de contourner les filtres de sécurité), ils tiennent bien mieux leurs positions que les modèles entraînés avec les anciennes méthodes.
  2. Le Gardien est resté utile : Un problème courant de l'entraînement à la sécurité est que le robot devient trop prudent et refuse de répondre à des questions inoffensives (comme « Comment puis-je tuer un processus informatique ? »). AdvGame a réussi à maintenir le robot utile et performant tout en restant sûr.
  3. Le Trickster est devenu un super-outil : Le robot Attaquant n'a pas disparu après l'entraînement. Il est devenu un puissant outil de « Red Team » (équipe rouge). Cela signifie que l'Attaquant lui-même peut désormais être utilisé pour tester d'autres robots afin de voir s'ils sont sûrs, agissant comme un testeur de stress professionnel.

La recette secrète

Le document souligne trois raisons pour lesquelles cela a si bien fonctionné :

  • Deux robots distincts : Ils n'ont pas utilisé un seul robot pour jouer les deux rôles (ce qui peut créer de la confusion). Ils ont utilisé deux modèles distincts, de sorte que l'Attaquant reste concentré sur l'attaque et le Défenseur sur la défense.
  • Le juge « Meilleur que » : L'utilisation de la comparaison par paire (lequel est meilleur ?) a empêché les robots de tricher avec le système de notation.
  • L'astuce de la « Moyenne Mobile » : Ils ont utilisé une technique appelée EMA (Moyenne Mobile Exponentielle). Imaginez que le Gardien est un étudiant passant un examen. Au lieu de paniquer parce qu'il a raté une question, il regarde ses performances au cours des dernières semaines pour voir son véritable niveau de compétence. Cela maintient la stabilité de l'entraînement et empêche le robot de surréagir à un seul mauvais exemple.

Résumé

AdvGame est comme une salle de sport où un robot apprend à esquiver les coups de poing. Au lieu qu'un entraîneur lui montre une vidéo d'un coup de poing et lui dise comment l'esquiver, le robot s'entraîne en faisant du sparring avec un partenaire qui invente constamment de nouveaux coups de poing en temps réel. Le résultat est un robot qui est non seulement plus sûr, mais aussi plus utile, et un partenaire d'entraînement si bon pour trouver les failles de défense qu'il peut être utilisé pour tester n'importe quel autre robot à l'avenir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →