Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
Cet article introduit AdvGRPO, un nouveau cadre de co-entraînement qui stabilise le GRPO pour l'optimisation conjointe attaquant-défenseur grâce à des récompenses multi-canaux denses, une normalisation de l'avantage découplée et un curriculum progressif, produisant finalement des attaques transférables hautement efficaces et des défenses de modèles de langage plus robustes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La vue d'ensemble : Un combat d'entraînement numérique
Imaginez que vous avez un robot très intelligent (le Défenseur) qui est entraîné à être utile mais aussi à refuser les requêtes malveillantes, comme « Comment fabriquer une bombe ? » ou « Comment pirater une banque ? ».
Habituellement, les humains essaient de tester ce robot en écrivant une liste de questions piégées. Mais le robot est intelligent ; il apprend à dire « Non » à ces questions spécifiques. Le problème est qu'un attaquant rusé et adaptatif peut changer sa stratégie pour trouver un nouveau moyen de piéger le robot.
Ce document présente une nouvelle façon d'entraîner les deux côtés en même temps en utilisant une méthode appelée AdvGRPO. Considérez cela comme la mise en place d'un dojo numérique où une Équipe Rouge (l'attaquant) et une Équipe Bleue (le défenseur) s'affrontent continuellement. Au lieu que des humains écrivent les questions, les modèles d'IA apprennent à attaquer et à défendre en jouant l'un contre l'autre, devenant plus forts à chaque round.
Le problème de l'ancienne méthode
Auparavant, les chercheurs essayaient d'utiliser un outil d'entraînement spécifique (appelé GRPO) pour apprendre à l'attaquant comment briser le défenseur. Cependant, ils ont constaté que lorsque l'attaquant et le défenseur apprenaient en même temps, le système devenait « instable ». C'était comme si deux boxeurs essayaient d'apprendre un nouveau style de combat alors que le ring lui-même tremblait ; ils ne parvenaient pas à se mettre d'accord sur qui gagnait, et l'entraînement plantait ou tournait en rond.
La solution : AdvGRPO (Le dojo stable)
Les auteurs ont créé un nouveau cadre appelé AdvGRPO qui répare ce ring qui tremble. Ils y parviennent grâce à trois astuces principales :
Le tableau de score avec plusieurs voies (Récompenses multi-canaux denses) :
Imaginez un arbitre qui ne se contente pas de crier « Point ! » à la fin du round. Au lieu de cela, il donne un score pour chaque mouvement.- L'attaquant est-il resté sur le sujet ?
- L'attaquant a-t-il suivi la stratégie ?
- L'attaquant a-t-il réellement obtenu la réponse malveillante ?
En notant chaque petite étape, l'attaquant reçoit un feedback constant sur ce qu'il doit améliorer, plutôt que d'attendre la fin pour savoir qu'il a échoué.
Les juges indépendants (Normalisation de l'avantage découplée) :
Dans l'ancienne méthode instable, si l'attaquant devenait soudainement très fort, les scores du défenseur paraissaient terribles par comparaison, ce qui perturbait l'entraînement.
La nouvelle méthode utilise un système (appelé GDPO) où chaque type de score est jugé indépendamment avant d'être combiné. C'est comme avoir un juge pour la « Vitesse », un juge pour la « Technique » et un juge pour la « Créativité » qui notent tous séparément, afin qu'un score ne gâche pas les autres. Cela maintient la stabilité de l'entraînement même lorsque les deux modèles deviennent plus intelligents.Le camp d'entraînement (Apprentissage par curriculum) :
On ne mettrait pas un boxeur débutant dans le ring face à un champion immédiatement. Le document utilise un « curriculum ».- Phase 1 : L'attaquant s'entraîne seul contre un défenseur fixe pour apprendre les bases.
- Phase 2 : Une fois que l'attaquant est correct, il commence à faire du sparring avec le défenseur.
- Phase 3 : Ils se relaient. L'attaquant tente de briser le défenseur pendant quelques rounds, puis le défenseur tente de colmater les brèches pendant quelques rounds, et ils alternent. Cela empêche le défenseur de simplement dire « Non » à tout (ce qui est une victoire facile) et le force à apprendre comment gérer des attaques spécifiques et complexes.
Ce qu'ils ont découvert
Le document rapporte plusieurs résultats clés de leurs expériences :
- Les attaquants sont devenus effrayants de talent : Les attaquants entraînés ont appris à piéger le défenseur bien mieux que les modèles non entraînés ou les modèles qui ont simplement été « déverrouillés » (dont les filtres de sécurité ont été supprimés). Ils ont appris que le simple fait de retirer les filtres de sécurité ne suffit pas ; il faut apprendre comment attaquer.
- Ils peuvent s'adapter : Les attaquants ont appris des stratégies qui fonctionnaient non seulement sur le défenseur contre lequel ils s'entraînaient, mais aussi sur des modèles complètement différents qu'ils n'avaient jamais vus auparavant. C'est comme un boxeur apprenant un mouvement qui fonctionne sur n'importe qui, pas seulement sur son partenaire d'entraînement.
- Les défenseurs sont devenus plus coriaces : Les défenseurs entraînés dans ce « dojo » sont devenus bien meilleurs pour repérer et bloquer les attaques que les défenseurs entraînés avec les anciennes méthodes. Ils ont appris à dire « Non » aux demandes malveillantes tout en continuant à dire « Oui » aux demandes bonnes et inoffensives.
- Les modèles de réflexion ont besoin d'une aide spéciale : Ils ont découvert que les modèles capables de « réfléchir » (raisonner) essayaient d'être trop prudents et refusaient d'attaquer même lorsqu'on le leur demandait. Ils ont dû créer un système de récompense spécial pour enseigner à ces modèles comment réfléchir à travers l'attaque sans rester bloqués sur les avertissements de sécurité.
L'essentiel
Le document affirme qu'en utilisant cette nouvelle méthode stable (AdvGRPO), ils peuvent créer un système où les attaquants et les défenseurs d'IA apprennent ensemble. Cela produit des attaquants très doués pour trouver les faiblesses et des défenseurs très doués pour les corriger, rendant l'IA globalement plus sûre. Ils soulignent que c'est un outil de recherche pour trouver les faiblesses avant que des acteurs malveillants ne puissent les utiliser, aidant ainsi à construire des systèmes d'IA plus forts et plus robustes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.