Learning diverse attacks on large language models for robust red-teaming and safety tuning
Cet article propose un cadre basé sur les GFlowNets pour le red-teaming automatisé qui surmonte les limitations d'effondrement de mode des approches de renforcement par apprentissage existantes afin de générer des invites d'attaque diverses et efficaces, permettant ainsi la création de modèles de langage de grande taille plus robustes et ajustés pour la sécurité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde en évolution rapide de l'intelligence artificielle, les grands modèles de langage sont devenus des outils puissants capables d'écrire, de raisonner et de converser avec une fluidité quasi humaine. Cependant, cette capacité s'accompagne d'un risque important : ces systèmes peuvent être manipulés pour produire un contenu nuisible, toxique ou dangereux. Pour prévenir cela, les développeurs s'engagent dans une pratique appelée « red-teaming » (test d'intrusion). Imaginez une équipe de sécurité engagée pour forcer l'entrée d'un bâtiment avant que le public ne s'y installe ; dans le domaine numérique, le red-teaming consiste à essayer systématiquement de tromper une intelligence artificielle pour lui faire révéler ses faiblesses. L'objectif est de trouver les questions ou instructions spécifiques, appelées « prompts », qui contournent les filtres de sécurité du modèle et le forcent à générer quelque chose qu'il était conçu pour refuser. Identifier ces vulnérabilités est essentiel pour construire des systèmes plus sûrs, mais les trouver est difficile car l'espace des questions possibles est vaste, et les méthodes utilisées pour les trouver ont souvent tendance à s'enliser dans une routine, répétant les mêmes quelques astuces plutôt que de découvrir de nouvelles façons variées de briser le système.
Une équipe de chercheurs a développé une nouvelle approche à ce problème qui génère avec succès un éventail diversifié de prompts d'attaque efficaces. Au lieu de s'appuyer sur les méthodes traditionnelles qui convergent souvent vers une solution unique et répétitive, ils ont utilisé un cadre probabiliste appelé réseau de flux génératif (generative flow network). Cette méthode traite la recherche de prompts nuisibles non pas comme une simple tâche d'optimisation, mais comme un processus d'échantillonnage à partir d'un vaste paysage de possibilités. Les chercheurs ont entraîné un modèle d'intelligence artificielle pour explorer ce paysage, collectant une large gamme de prompts qui ont réussi à susciter des réponses toxiques de la part de modèles cibles. Ils ont ensuite appliqué une seconde étape de lissage pour affiner leurs découvertes, garantissant que l'ensemble final d'attaques soit à la fois hautement efficace et remarquablement varié. Le résultat est un ensemble d'outils capable de découvrir des vulnérabilités que d'autres méthodes manquent, offrant un filet de sécurité plus complet pour les développeurs.
Le défi central auquel les chercheurs ont été confrontés était un échec commun du red-teaming automatisé : la tendance des systèmes à s'effondrer en ne générant que quelques prompts similaires et répétitifs. Les tentatives précédentes pour corriger cela en ajoutant des règles pour encourager la variété ont souvent échoué, produisant des systèmes qui généraient soit des questions diverses mais inoffensives, soit des attaques efficaces mais identiques. La nouvelle méthode évite ce piège grâce à un processus en deux étapes. Dans la première étape, le système explore l'espace des prompts possibles, guidé par un signal de récompense qui mesure la probabilité qu'un prompt déclenche une réponse nuisible. Cette exploration est conçue pour être large, cherchant de nombreux « modes » ou types d'attaques différents plutôt que simplement le plus facile. Le système collecte un large ensemble de données de ces prompts réussis et diversifiés durant cette phase.
Dans la seconde étape, les chercheurs prennent les prompts collectés et les utilisent pour entraîner à nouveau le modèle, en se concentrant cette fois sur l'apprentissage des schémas qui ont rendu ces prompts spécifiques efficaces. Cette étape agit comme un raffinement, lissant la distribution des attaques afin que le modèle puisse générer de nouvelles variations de haute qualité qui n'ont pas été explicitement vues auparavant, mais qui partagent les mêmes caractéristiques de succès. Cette combinaison d'une exploration large suivie d'un apprentissage ciblé permet au système de maintenir un haut niveau de diversité tout en garantissant que les attaques restent puissantes. Les chercheurs ont testé cette approche sur une variété de modèles de langage différents, y compris certains qui avaient été spécifiquement entraînés pour être sûrs et résistants aux attaques. Ils ont constaté que leur méthode surpassait systématiquement les techniques existantes, générant un pourcentage beaucoup plus élevé de prompts toxiques tout en maintenant une grande variété de formulations et de structures.
L'une des découvertes les plus significatives fut la capacité de ces attaques à se transférer d'un modèle à l'autre. Les prompts générés pour attaquer un modèle spécifique étaient souvent efficaces contre d'autres modèles complètement différents, même ceux contre lesquels les chercheurs n'avaient jamais testé leur système durant la phase d'entraînement. Cela suggère que différents systèmes d'intelligence artificielle partagent des faiblesses communes dans leur entraînement à la sécurité, et qu'un ensemble diversifié d'attaques peut révéler ces vulnérabilités partagées plus efficacement que des attaques étroites et répétitives. Par exemple, lorsque les chercheurs ont entraîné leur système sur un modèle appelé Gemma, les prompts résultants ont pu contourner avec succès les filtres de sécurité de plusieurs autres modèles, notamment Llama et Mistral, avec des taux de réussite élevés. Cette transférabilité est cruciale car elle signifie qu'un seul effort de red-teaming bien conçu peut améliorer la sécurité de nombreux systèmes différents à la fois.
Les chercheurs ont également démontré que l'utilisation de cet ensemble diversifié d'attaques pour entraîner un modèle le rend nettement plus robuste. Lorsqu'ils ont pris un modèle cible et l'ont affiné (fine-tuning) en utilisant les réponses de refus à leurs prompts générés, le modèle résultant est devenu beaucoup plus difficile à briser. En fait, ce modèle doté d'une sécurité renforcée a été capable de résister à des attaques générées par d'autres méthodes de red-teaming moins sophistiquées qui avaient pourtant été efficaces auparavant. Cela indique qu'exposer un modèle à une grande variété de styles d'attaque lors de son entraînement à la sécurité est bien plus efficace que de l'exposer à seulement quelques exemples répétés. L'étude a montré que cette amélioration de la sécurité ne se faisait pas au détriment des capacités générales du modèle ; les modèles dotés d'une sécurité renforcée ont conservé leur capacité à suivre des instructions et à accomplir des tâches efficacement.
Le travail a également mis en lumière les limites des mesures de sécurité actuelles. Les chercheurs ont noté que l'efficacité de leurs attaques dépend du classificateur utilisé pour déterminer si une réponse est toxique, et que le véritable préjudice peut être subjectif et dépend du contexte. Ils ont observé que certaines méthodes, particulièrement celles qui reposent sur une simple optimisation, peuvent tomber dans un piège où elles génèrent des prompts qui semblent toxiques pour un classificateur mais qui ne suscitent pas réellement de réponses nuisibles de la part du modèle, un phénomène connu sous le nom de « reward hacking » (piratage de récompense). Leur approche en deux étapes a aidé à atténuer cela en garantissant que les prompts ne soient pas seulement statistiquement susceptibles de déclencher un classificateur, mais qu'ils soient réellement efficaces pour susciter la réponse souhaitée du modèle cible.
En fin de compte, cette recherche offre un moyen plus fiable de tester la résistance des systèmes d'intelligence artificielle avant leur mise sur le marché. En s'éloignant des méthodes qui s'enferment dans des boucles répétitives et en adoptant une stratégie qui recherche une grande diversité d'attaques, les développeurs peuvent identifier et corriger un éventail plus large de vulnérabilités. La capacité de transférer ces attaques entre différents modèles suggère que les défis de sécurité auxquels ces systèmes font face sont interconnectés, et qu'une approche de red-teaming diversifiée et probabiliste offre un outil puissant pour construire une intelligence artificielle plus résiliente et digne de confiance. Le code et les méthodes développés dans cette étude sont disponibles pour que d'autres puissent les utiliser, dans le but d'accélérer la création de systèmes plus sûrs pour tous.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.