← Derniers articles
🤖 AI

LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments

Cette étude démontre que, malgré l'utilisation de codebooks détaillés, les grands modèles de langage ne parviennent pas encore à remplacer de manière fiable les annotateurs humains pour l'analyse thématique de commentaires techniques en sécurité informatique.

Auteurs originaux : Maria Camporese, Fabio Massacci, Yuanjun Gong

Publié 2026-04-14
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Maria Camporese, Fabio Massacci, Yuanjun Gong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🕵️‍♂️ Le Contexte : L'Enquête Humaine

Imaginez que vous organisez une grande enquête de sécurité informatique. Vous montrez à 263 étudiants des bouts de code (des recettes de cuisine numériques) et vous leur demandez : « Où est le problème ? » et « Pourquoi pensez-vous cela ? ».

Les étudiants écrivent leurs réponses à la main. Pour comprendre ces réponses, des experts humains doivent les lire, les analyser et les classer dans des catégories précises (par exemple : « A-t-il mentionné un mot-clé de sécurité ? », « A-t-il trouvé une faille ? », « Est-ce qu'il est confus ? »).

C'est un travail épuisant, comme trier des milliers de lettres manuscrites. C'est long, cher et fatiguant.

🤖 L'Idée : Le Robot Assistant (LLM)

Les chercheurs se sont dit : « Et si on utilisait les Intelligences Artificielles (IA) les plus avancées du monde (les LLMs) pour faire ce travail de tri à la place des humains ? »

L'idée était séduisante : l'IA pourrait lire les commentaires des étudiants instantanément, sans se fatiguer, et classer les réponses aussi bien que les experts humains.

🔍 L'Expérience : Le Test de Vérité

Les chercheurs ont pris les commentaires réels des étudiants et ont demandé à quatre des meilleures IA du moment (GPT-5, Claude-4, DeepSeek, Qwen3-Max) de faire le travail de tri.

Pour être sûrs de ne pas tricher, ils ont donné aux IA des indices progressifs, comme on le ferait avec un nouvel employé :

  1. Niveau 1 : Juste la consigne de base.
  2. Niveau 2 : Un manuel d'instructions détaillé avec des exemples.
  3. Niveau 3 : Des exemples de cas difficiles où les humains étaient en désaccord, pour voir si l'IA comprenait la nuance.

📉 Le Résultat : Le Robot est Perdu

Malheureusement, la nouvelle est décevante : l'IA n'est pas encore prête à remplacer les humains.

Voici pourquoi, avec des analogies :

  1. L'IA lit les mots, mais pas le sens :
    Imaginez que vous demandez à un robot de repérer si quelqu'un parle de "pomme" dans une phrase.

    • Si la phrase est : « J'ai mangé une pomme », le robot dit "Oui".
    • Si la phrase est : « C'est une pomme de terre », le robot dit "Oui" (parce qu'il voit le mot pomme).
    • Mais dans la sécurité informatique, c'est pire. Si un étudiant écrit « Je ne suis pas sûr, peut-être que c'est une faille », l'IA peut se tromper sur le fait que l'étudiant est confus ou s'il a trouvé la faille. Elle confond le mot "faille" avec la réalité d'une faille.
  2. Le problème des "Mots Pièges" :
    Les IA sont comme des élèves qui apprennent par cœur sans comprendre. Si un étudiant écrit « Je ne vois pas de vulnérabilité », l'IA peut penser : « Ah, il a parlé de vulnérabilité, donc je coche la case "Vulnérabilité mentionnée" ».
    Mais en réalité, l'étudiant voulait dire le contraire ! L'IA ne comprend pas la logique derrière les mots, elle ne fait que compter les mots-clés.

  3. Même avec un manuel, ça ne marche pas :
    Les chercheurs ont essayé de donner des instructions de plus en plus précises (le "manuel"). C'est comme donner un guide de cuisine à un robot qui ne sait pas ce qu'est le goût. Même avec des exemples, l'IA reste souvent confuse sur les nuances subtiles de la sécurité.

📊 La Conclusion en Bref

  • Pour les tâches simples : L'IA est bonne pour compter les choses évidentes (ex: « A-t-il mentionné le mot 'variable' ? »). C'est comme compter les pommes dans un panier.
  • Pour les tâches complexes : L'IA échoue lamentablement pour comprendre le raisonnement humain (ex: « Est-ce que l'étudiant est confus ou sûr de lui ? »). C'est comme essayer de deviner pourquoi quelqu'un a pleuré en lisant seulement ses mots, sans entendre son ton de voix.

Le verdict final :
Les IA actuelles ne peuvent pas remplacer les experts humains pour analyser les commentaires de sécurité. Elles sont trop sujettes aux erreurs d'interprétation. Pour l'instant, elles peuvent servir d'assistants pour faire un premier tri rapide, mais un humain doit toujours vérifier le travail final.

En résumé : L'IA est un excellent scribe, mais un très mauvais détective. 🕵️‍♀️🚫🤖

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →