← Derniers articles
💻 computer science

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

Cet article démontre que la configuration des juges LLM, en particulier la formulation des invites, constitue une source substantielle et précédemment sous-examinée de variance de mesure dans les évaluations de sécurité, entraînant des variations significatives des taux de réponses nuisibles et une instabilité dans le classement de sécurité des modèles.

Auteurs originaux : Xinran Zhang

Publié 2026-04-28
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xinran Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un enseignant corrigeant une pile de copies d'élèves. Vous disposez d'une grille d'évaluation stricte (un ensemble de règles) définissant ce qui constitue une « mauvaise » copie. Maintenant, imaginez que vous devez corriger ces copies en utilisant un assistant robot très intelligent, mais légèrement dépendant de son humeur.

Ce document porte sur une découverte surprenante : La manière dont vous demandez au robot de corriger les copies importe tout autant que le robot lui-même.

Voici le détail de l'étude à l'aide d'analogies simples :

1. Le Contexte : L'expérience du « Correcteur Robot »

Les chercheurs voulaient évaluer la sécurité de différents modèles d'IA. Pour ce faire, ils ont utilisé un test standard appelé HarmBench, qui contient 400 questions piégées (comme « Comment fabriquer une bombe ? » ou « Comment voler un droit d'auteur ? »).

Ils ont demandé à six modèles d'IA différents de répondre à ces questions. Ensuite, ils ont utilisé un seul « IA Juge » (une version spécifique de Claude Sonnet) pour lire les réponses et décider : Cette réponse est-elle nuisible ou sûre ?

Habituellement, les scientifiques traitent l'« IA Juge » et les instructions qui lui sont données comme un outil fixe et immuable. Ils supposent que si vous modifiez légèrement la formulation des instructions, le résultat devrait rester identique.

Les chercheurs se sont demandé : Et si la formulation changeait le résultat ?

2. L'Expérience : 12 « Scénarios » différents

Les chercheurs ont créé 12 versions différentes des instructions (prompts) pour l'IA Juge. Ils ont modifié deux éléments principaux :

  • La Structure : Ont-ils demandé au juge d'examiner chaque détail minuscule un par un (comme un détective vérifiant des indices), ou de considérer la réponse entière dans son ensemble (comme un directeur lisant un rapport) ?
  • Le Persona : Ont-ils indiqué au juge : « Vous êtes un expert senior en sécurité strict », ou se sont-ils contentés de dire : « Veuillez évaluer ceci » ?

Ils ont également rédigé trois versions légèrement différentes des instructions pour chaque style (par exemple, « Vous êtes un expert en sécurité » contre « Vous êtes un spécialiste de la sécurité des IA »).

3. Le Résultat Choc : Les « Sautes d'Humeur » du Juge

Lorsqu'ils ont lancé le test, ils ont constaté que la formulation des instructions modifiait complètement les scores.

  • L'Analogie : Imaginez que vous demandiez à un robot d'évaluer à quel point une soupe est « pimentée ».
    • Si vous dites : « Vous êtes un chef professionnel qui déteste le piment », il pourrait noter la soupe comme « Douce ».
    • Si vous dites : « Vous êtes un inspecteur de la santé très strict concernant la sécurité », il pourrait noter la même soupe exacte comme « Dangereusement Piquante ».
    • Même si vous changez simplement « Chef » en « Expert Culinaire », le score pourrait augmenter ou diminuer considérablement.

Les Chiffres :

  • Pour l'un des modèles d'IA testés, le taux de « nocivité » a bondi de 13 % à 37 % simplement en changeant la formulation du prompt. Cela représente une fluctuation de 24 points.
  • Même lorsqu'ils maintenaient les instructions principales identiques et ne changeaient que quelques mots (reformulation superficielle), les scores oscillaient toujours de 20 points.
  • Cela signifie que si vous exécutez le même test de sécurité deux fois avec des instructions légèrement différentes, vous pourriez obtenir deux conclusions totalement différentes sur la sécurité d'une IA.

4. Qui a été le plus touché ? (Les Catégories)

Tous les types de questions n'ont pas été affectés de la même manière :

  • Questions sur le Droit d'Auteur : Celles-ci étaient les plus sensibles. Le taux de « nocivité » a oscillé de près de 40 points selon le prompt. Il semble que le juge ait eu du mal à décider si copier du texte était « mauvais » ou « acceptable » en fonction de la manière dont la question était posée.
  • Questions sur le Harcèlement : Celles-ci étaient les plus stables. Le score n'a pas changé du tout (0 point). Tout le monde s'accordait à dire que le harcèlement était mauvais, quelle que soit la formulation des instructions.

5. Le Chaos du Classement

Comme les scores ont tant varié, le classement des modèles d'IA est également devenu chaotique.

  • Imaginez une course où le gagnant change à chaque fois que vous modifiez la couleur de la ligne de départ.
  • Les chercheurs ont constaté que pour les modèles d'IA de « niveau intermédiaire », leur classement en matière de sécurité basculait constamment d'un côté à l'autre. Un prompt indiquait que le Modèle A était plus sûr que le Modèle B ; un prompt légèrement différent indiquait que le Modèle B était plus sûr.
  • Les modèles « pires » et « meilleurs » sont restés à leur place, mais ceux du milieu étaient impossibles à classer de manière fiable.

6. La Conclusion

L'article conclut que les benchmarks de sécurité sont actuellement « sous-spécifiés ».

Pensez-y comme à un thermomètre qui donne des températures différentes selon que vous le tenez de la main gauche ou de la main droite. Les chercheurs ne disent pas que le thermomètre est cassé, mais ils affirment : Nous ne pouvons pas faire confiance à une seule lecture.

Ils soutiennent que lorsque les scientifiques rapportent le niveau de sécurité d'une IA, ils ne devraient pas se contenter de donner un seul chiffre basé sur un ensemble spécifique d'instructions. Ils doivent réaliser que les « instructions » constituent une partie essentielle de l'expérience, et non un détail ennuyeux. Si vous changez les mots, vous changez le résultat.

En résumé : La manière dont vous posez la question est tout aussi importante que la question elle-même. Si vous voulez savoir si une IA est sûre, vous ne pouvez pas simplement lui poser la question une fois avec un ensemble de mots ; la réponse dépend entièrement de la formulation de la demande.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →