← Derniers articles
💻 computer science

Evaluating the Effectiveness of LLMs in Aiding Compliance Testing of PKCS#1-v1.5

Cet article évalue l'efficacité de la combinaison de la mutation au niveau de la grammaire avec la synthèse de code basée sur les LLM pour les tests de conformité des implémentations PKCS#1 v1.5, concluant que si l'approche parvient à reproduire des vulnérabilités connues et à découvrir de nouvelles divergences, son utilité est sévèrement limitée par des taux élevés d'hallucinations des LLM qui créent un écart significatif entre la fiabilité opérationnelle et la fidélité sémantique.

Auteurs originaux : Polina Kozyreva, Endadul Hoque

Publié 2026-06-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Polina Kozyreva, Endadul Hoque

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un inspecteur de bâtiment strict. Votre travail est de vérifier si chaque maison construite dans une ville suit exactement le même plan. Le plan (la « spécification ») dit : « La porte d'entrée doit mesurer 3 pieds de large, le toit doit être rouge et la cheminée doit mesurer exactement 10 pieds de haut. »

Dans le monde de la sécurité informatique, ces « maisons » sont des programmes logiciels qui gèrent des messages chiffrés (comme des signatures numériques). Le « plan » est un ensemble complexe de règles appelé PKCS#1 v1.5. Si un programme construit une maison qui ne correspond pas parfaitement au plan, il pourrait y avoir une porte dérobée cachée qu'un pirate pourrait utiliser pour s'introduire.

Le Problème : Vérifier est Difficile

Vérifier ces maisons est incroyablement difficile.

  • Le hasard ne fonctionne pas : Si vous jetez simplement des briques au hasard sur une maison, vous ne construirez presque jamais par accident une porte qui mesure exactement 3 pieds de large. Il vous faut un plan très précis.
  • Les outils d'experts sont lents : Il existe des outils conçus par des experts humains qui peuvent vérifier chaque variation possible du plan, mais construire ces outils prend des années d'études approfondies et de travail manuel. C'est comme embaucher une équipe d'architectes de génie pour inspecter chaque maison.

La Nouvelle Idée : L'« Architecte IA »

Les chercheurs de ce document se sont posé une question simple : Pouvons-nous utiliser un grand modèle de langage (une IA) pour agir comme un « traducteur » capable de transformer un plan défectueux en un test ?

Voici leur processus :

  1. Le Plan Original : Ils ont pris les règles officielles de la maison.
  2. Le Mutateur (la machine du « Et si ? ») : Ils ont utilisé un programme informatique pour briser intentionnellement le plan de 13 manières différentes. Par exemple, ils pourraient dire : « Et si la porte mesurait 4 pieds de large ? » ou « Et si le toit était bleu ? » ou « Et si nous supprimions entièrement la cheminée ? ».
  3. L'IA Traductrice : Ils ont remis ces plans défectueux à une IA et lui ont dit : « Écris un programme informatique qui construit une maison exactement selon ce plan défectueux. »
  4. Le Test : Ils ont exécuté le programme de l'IA pour construire la maison, puis ont essayé de soumettre cette maison à 48 programmes logiciels différents (les « constructeurs ») pour voir si les constructeurs acceptaient la maison défectueuse. Si un constructeur acceptait une maison défectueuse, cela signifiait que le constructeur présentait une faille de sécurité.

Les Résultats : Un Conte de Deux Chiffres

Les résultats étaient un mélange de très bonnes nouvelles et d'un avertissement majeur.

La Bonne Nouvelle (Fiabilité Opérationnelle) :
L'IA était incroyable pour suivre les instructions afin de commencer le travail.

  • 99,8 % du temps, l'IA a réussi à écrire un programme qui s'est exécuté sans planter. C'était comme un architecte qui réussissait toujours à vous remettre des plans qui ne contenaient ni fautes de frappe ni pages manquantes.

La Mauvaise Nouvelle (Fidélité Sémantique) :
Cependant, l'IA était incapable de suivre réellement le plan défectueux.

  • Seulement 17,5 % du temps, l'IA a réellement construit la maison telle que le plan défectueux le demandait.
  • Dans 82,5 % des cas, l'IA a « halluciné ». Elle a regardé le plan défectueux, a pensé : « Oh, cela semble incorrect », et a secrètement corrigé le plan pour revenir au plan original parfait avant de construire la maison.

L'Analogie :
Imaginez que vous demandiez à l'IA : « Construis une maison avec une porte bleue ».

  • Succès : L'IA construit une maison avec une porte bleue.
  • Hallucination : L'IA construit une maison avec une porte rouge parce qu'elle « sait » que les portes sont généralement rouges, même si vous avez spécifiquement demandé une porte bleue. Elle a ignoré votre instruction spécifique.

Qu'ont-ils trouvé ?

  1. Ils ont trouvé les gros bugs : L'approche a réussi à recréer 10 des 13 failles de sécurité connues (y compris les plus dangereuses qui permettent aux pirates de forger des signatures). Cela prouve que l'idée fonctionne.
  2. Ils ont trouvé un nouveau bug : Ils ont découvert un nouveau problème de sécurité dans une bibliothèque appelée LibTomCrypt que personne n'avait signalé auparavant. Cela s'est produit parce que l'IA a réussi à construire une maison où il manquait une partie spécifique (l'octet zéro de tête), et la bibliothèque l'a acceptée.
  3. Le goulot d'étranglement est l'IA, pas le plan : Les chercheurs ont constaté que le « Mutateur » (la machine brisant les plans) faisait du bon travail. Le problème résidait entièrement dans l'incapacité de l'IA à s'en tenir aux règles brisées.

Les types d'« Hallucinations »

Les chercheurs ont catégorisé la façon dont l'IA a échoué, comme un médecin diagnostiquant un patient :

  • Le « Réparateur » (Le plus courant) : L'IA a vu une règle brisée (comme « le remplissage doit être inférieur à 16 octets ») et a pensé : « C'est impossible », puis l'a discrètement corrigée pour revenir à la règle normale.
  • Le « Génie des maths qui a oublié les maths » : L'IA a essayé de suivre les règles mais a raté les calculs simples (comme calculer la quantité de remplissage à ajouter), ce qui a donné une maison de la mauvaise taille.
  • L'« Ignorance » : L'IA a complètement ignoré la partie brisée du plan et a construit une maison standard.

La Conclusion

Ce document montre que l'utilisation de l'IA pour aider à tester la sécurité informatique est prometteuse mais actuellement peu fiable.

L'IA est excellente pour écrire du code qui s'exécute (elle ne plante pas), mais elle est très mauvaise pour écrire du code qui signifie ce que vous dites. Elle a l'habitude de « corriger » vos erreurs intentionnelles parce qu'elle pense savoir mieux que vous.

Les chercheurs concluent que si vous voulez utiliser l'IA pour ce type de test, vous ne pouvez pas simplement faire confiance au code qu'elle écrit. Vous devez avoir une seconde couche de vérification pour vous assurer que l'IA a réellement suivi vos instructions spécifiques et défectueuses, et qu'elle ne les a pas simplement « réparées » pour qu'elles redeviennent normales. D'ici là, l'IA est comme un stagiaire très serviable, mais qui ignore souvent vos ordres spécifiques de faire les choses de la « bonne » manière.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →