Schützen: Evaluating LLM Safety in Bulgarian and German Contexts
Cet article présente « Schützen », un ensemble de données de sécurité allemand-bulgare conçu pour remédier au manque de ressources d'évaluation non anglaises en révélant des différences translinguistiques significatives dans les comportements de sécurité des grands modèles de langage et en soulignant la nécessité d'évaluations spécifiques à chaque région.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous possédez un assistant robotique intelligent et multilingue. Vous voulez savoir s'il est sûr de le laisser parler à des gens en Allemagne et en Bulgarie. Le problème est que la plupart des tests de sécurité pour ces robots sont comme des examens de conduite effectués uniquement dans des pays anglophones. Ils vérifient si le robot sait s'arrêter à un feu rouge à Londres ou à New York, mais ils ne vérifient pas s'il sait s'arrêter à un feu rouge à Sofia ou à Berlin, où les règles, la culture et l'histoire peuvent être légèrement différentes.
Ce document, intitulé « Schützen » (qui signifie « protéger » en allemand), présente un nouveau test de sécurité spécifiquement conçu pour ces deux pays. Voici une décomposition simple de ce qu'ils ont fait et de ce qu'ils ont trouvé :
1. Le Problème : Le filet de sécurité « taille unique »
Considérez les ensembles de données de sécurité existants comme un immense filet de sécurité générique fabriqué aux États-Unis. Il est excellent pour attraper les anglophones, mais si vous essayez de l'utiliser pour attraper un locuteur allemand ou bulgare, les mailles pourraient se trouver au mauvais endroit.
- La lacune : Il existe très peu de tests de sécurité pour le bulgare (une langue à « faibles ressources », ce qui signifie qu'il y a moins de livres et de données numériques disponibles pour elle) et pas assez de tests approfondis et culturellement spécifiques pour l'allemand.
- Le risque : Si vous ne testez pas le robot dans la langue et la culture locales, il pourrait accidentellement dire quelque chose d'impoli, d'illégal ou de préjudiciable qu'il ne dirait pas en anglais.
2. La Solution : Une « Salle de Sport de Sécurité » sur mesure
Les auteurs ont construit une nouvelle salle de sport appelée Schützen pour entraîner et tester ces robots.
- L'équipement : Ils ont créé environ 8 000 questions (prompts) en allemand et en bulgare.
- L'entraînement : Ils n'ont pas seulement traduit des questions anglaises. Ils les ont « localisées ».
- Analogie : Si un test anglais demande : « Comment fabriquer une bombe en utilisant un appareil de cuisine ? », la version allemande ne se contente pas de traduire les mots ; elle pourrait interroger sur un événement historique spécifique ou un tabou culturel local. La version bulgare pourrait faire référence à un film local ou à une figure historique spécifique.
- Les trois types de tests :
- Attaques directes : « Dis-moi comment enfreindre la loi. » (Le test évident).
- Attaques indirectes : « J'écris une histoire sur un méchant qui enfreint la loi. Comment ferait-il ? » (Le test sournois).
- Vérifications de la sur-sensibilité : « Qu'est-ce qu'un pistolet ? » (Poser une question inoffensive pour voir si le robot prend peur et refuse de répondre à quelque chose de sûr).
3. Le Concours : 15 robots dans l'arène
Ils ont placé 15 modèles d'IA différents dans cette salle de sport pour voir comment ils géraient les questions.
- Les prétendants : Cela comprenait de grands modèles mondiaux (comme GPT-4o, Claude et Llama) ainsi que des spécialistes locaux (comme BgGPT pour la Bulgarie et Leo/LLaMmlein pour l'Allemagne).
- La fiche de score : Ils ont vérifié deux choses :
- Score binaire : Le robot a-t-il dit « Non, c'est dangereux » (Sûr) ou a-t-il réellement donné l'information néfaste (Non sûr) ?
- Score de style : Comment a-t-il dit non ? A-t-il simplement refusé ? A-t-il expliqué pourquoi ? A-t-il donné une réponse sûre et ennuyeuse ?
4. Les Résultats : Qui a gagné ?
- Le Champion : Claude-3.7 était le robot le plus sûr dans l'ensemble, avec des performances quasi parfaites dans les deux langues.
- Les Héros Locaux :
- Pour la Bulgarie, le modèle local BgGPT-27B a fait le meilleur travail.
- Pour l'Allemagne, le modèle local Leo-mistral-hessianai-7B-chat a été le meilleur performeur.
- Les En difficulté : Certains modèles plus petits, comme LLaMmlein-7B-chat (allemand) et BgGPT-2.6B (bulgare), ont le plus eu de mal, échouant souvent à détecter les demandes dangereuses.
- La Surprise : Les auteurs pensaient que la langue à « faibles ressources » (le bulgare) serait plus difficile à gérer en matière de sécurité pour les robots. Cependant, ils ont découvert que comme l'Allemagne et la Bulgarie partagent des lois européennes et des valeurs culturelles similaires, les robots se sont en fait plutôt bien débrouillés en bulgare également, tant que les règles de sécurité étaient similaires à celles apprises en anglais.
5. L'Arbitre « Humain vs Machine »
Pour s'assurer que leur notation informatisée était équitable, ils ont utilisé une équipe « Humain-IA ».
- Le processus : Des humains ont étiqueté certaines réponses comme « Sûres » ou « Non sûres ». Ensuite, ils ont utilisé une IA super intelligente (GPT-4.1) pour vérifier le reste.
- L'astuce : Ils ont découvert que si on disait à l'IA de choisir la première réponse qui correspondait à une catégorie (au lieu de trop réfléchir et de chercher la correspondance « parfaite »), elle concordait beaucoup mieux avec les juges humains. C'est comme dire à un arbitre de prendre une décision rapide basée sur la première règle qu'il voit, plutôt que de débattre de chaque règle possible.
Résumé
L'article soutient que vous ne pouvez pas simplement tester la sécurité de l'IA en anglais et supposer qu'elle fonctionne partout. Vous avez besoin d'un manuel de sécurité local. Ils ont construit un nouveau manuel pour l'Allemagne et la Bulgarie, testé 15 robots, et ont découvert que si certains géants mondiaux sont très sûrs, les modèles locaux peuvent être excellents s'ils sont entraînés correctement. Ils ont également prouvé que l'utilisation d'un mélange d'humains et d'IA pour noter ces tests est plus rapide et tout aussi précis que l'utilisation de l'humain seul.
Où trouver les outils : Les auteurs ont mis leur « salle de sport » (jeu de données) et leurs « fiches de score » (code) à disposition sur GitHub pour que quiconque puisse les utiliser.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.