Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators
Cet article étudie les limites des LLM utilisés comme juges dans l'évaluation de la sécurité, révélant que, bien qu'ils puissent apprendre d'un nouveau contexte, ils adhèrent souvent rigidement à leurs a priori de sécurité internes plutôt que de s'adapter à des informations ou des définitions contradictoires.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez engagé une équipe d'arbitres super intelligents (ces modèles d'IA, ou « juges LLM ») pour surveiller un tournoi sportif massif et décider quelles actions sont « équitables » et lesquelles sont de la « triche ».
Le problème est que les règles du jeu changent selon l'endroit où vous jouez. Dans un pays, un mouvement spécifique est une faute ; dans un autre, c'est un coup de génie. De plus, de nouveaux argots et de nouveaux types de ruses sont inventés chaque jour.
Cet article pose une question simple mais effrayante : ces arbitres d'IA suivent-ils réellement les règles que vous venez de leur donner, ou jouent-ils simplement selon leur propre vieux manuel de règles interne ?
Les auteurs ont découvert que les arbitres sont étonnamment têtus. Voici la décomposition en utilisant des analogies simples :
1. Le problème de l'« Arbitre têtu » (Steerability / Capacité de pilotage)
D'habitude, quand vous engagez un arbitre, vous lui donnez un manuel de règles. Vous dites : « Si quelqu'un touche le ballon avec ses mains, c'est une faute. »
- Ce que l'article a découvert : Même lorsque vous écrivez explicitement un nouveau manuel de règles devant l'IA, elle vous ignore souvent. Elle continue de juger en fonction des « règles de sécurité » qu'elle a apprises pendant sa scolarité (pendant son entraînement).
- L'analogie : Imaginez que vous engagiez un arbitre qui a grandi en jouant au football. Vous lui dites : « Aujourd'hui, nous jouons au basket, donc utiliser les mains est autorisé, mais frapper le ballon est une faute. » L'arbitre pourrait quand même siffler pour l'usage des mains parce qu'au fond de lui, il pense : « Non, c'est une faute ! J'ai appris cela au football ! »
- Le rebondissement : L'article a découvert que si vous trompez l'arbitre en disant : « Appelons cela simplement 'Catégorie A' ou 'Catégorie B' au lieu de 'Sûr' ou 'Dangereux' », l'arbitre devient soudainement bien meilleur pour suivre vos nouvelles règles. C'est comme si l'arbitre ne se confondait que lorsque les mots « Sécurité » et « Règles » sont utilisés, déclenchant ses anciennes formations.
2. Le problème de l'« Étudiant distrait » (Susceptibility / Susceptibilité)
Parfois, vous donnez à l'arbitre une fiche de révision ou quelques exemples de ce qu'il doit surveiller juste avant le début du match.
- Ce que l'article a découvert :
- Vieilles ruses : Si vous donnez des exemples de « triche » à l'arbitre, il les ignore la plupart du temps. Il s'en tient à ce qu'il sait déjà.
- Nouvelles connaissances : Cependant, si vous lui donnez des informations sur quelque chose de totalement nouveau qu'il ne connaît pas encore (comme un nouvel argot ou un événement d'actualité de l'année prochaine), il écoutera.
- L'analogie : Imaginez un étudiant passant un examen.
- Si vous lui murmurez : « Rappelle-toi, la réponse est toujours 42 », et que l'étudiant sait déjà que la réponse est 42, il vous ignore.
- Mais si vous lui murmurez : « La réponse à cette question sur une nouvelle planète est 42 », et que l'étudiant n'a jamais entendu parler de cette planète, il vous croira.
- Le piège : L'arbitre n'écoute les nouvelles informations que s'il est incertain sur le sujet. S'il est confiant dans ses anciennes connaissances, il ignorera vos nouvelles instructions, même si vous avez raison.
3. Le mythe du « Taille unique »
L'article a testé 13 arbitres d'IA différents. Ils ont découvert que :
- Être un « bon » arbitre (obtenir des scores élevés sur des tests standards) ne signifie pas que vous êtes « flexible ».
- Être « flexible » (écouter les nouvelles règles) ne signifie pas que vous êtes « précis ».
- Certains arbitres sont naturellement têtus, d'autres sont naturellement suggestibles. Il n'existe pas de « meilleur » arbitre unique pour chaque tâche.
La grande conclusion
Les auteurs concluent que la sécurité est contextuelle, mais que les juges d'IA sont rigides.
Si vous êtes une entreprise essayant d'utiliser une IA pour vérifier si un contenu est sûr pour une culture spécifique ou une situation nouvelle, vous ne pouvez pas simplement supposer que l'IA suivra vos instructions. Elle jugera probablement en fonction de son propre « pressentiment » interne sur ce qui est sûr, ce qui peut être totalement différent de la politique de votre entreprise.
En bref : Vous ne pouvez pas simplement dire à l'IA : « Suis ces règles. » Vous devez comprendre que l'IA possède ses propres habitudes profondément ancrées qui sont très difficiles à changer, à moins de la tromper pour lui faire croire qu'elle joue un jeu complètement différent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.