← Derniers articles
🤖 AI

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

Cet article démontre que si les LLM agentiques font preuve d'une grande stabilité lorsqu'ils reproduisent des vulnérabilités connues, leur capacité à découvrir de nouveaux problèmes est très incohérente, ce qui suggère que les revues de sécurité basées sur les LLM devraient compléter plutôt que remplacer l'analyse statique de sécurité des applications (SAST) déterministe.

Auteurs originaux : Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

Publié 2026-06-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous engagiez un garde de sécurité très strict et respectueux des règles (appelons-le SAST) et une détective brillante, créative, mais parfois distraite (appelons-la LLM). Tous deux sont embauchés pour inspecter le même petit bâtiment JavaScript à la recherche de pièges cachés (vulnérabilités).

Le document « Snyk VulnBench JS 1.0 » pose une question simple mais cruciale : Si vous les envoyez tous les deux inspecter exactement le même bâtiment cinq fois de suite, vous donneront-ils le même rapport à chaque fois ?

Voici ce qu'ils ont trouvé, décomposé en concepts de la vie quotidienne :

1. Le Garde Strict vs La Détective Créative

  • Le Garde Strict (SAST) : Cet outil est comme un robot avec une liste de contrôle. Si le code n'a pas changé, le robot donne exactement le même rapport à chaque fois. Il ne se fatigue jamais, ne se laisse jamais distraire et ne manque jamais deux fois la même chose. Dans cette étude, il était 100 % cohérent.
  • La Détective Créative (LLM) : C'est une IA qui peut « réfléchir » et raisonner. Elle est excellente pour repérer des pièges complexes et étranges qu'un robot pourrait manquer. Cependant, elle est comme un être humain : parfois elle est percutante, parfois elle est fatiguée, et parfois elle voit des choses qui n'existent pas réellement.

2. Le Test des « Cinq Fois »

Les chercheurs ont envoyé la détective IA inspecter le code cinq fois de suite. Voici ce qui s'est passé :

  • Quand l'IA trouvait un piège « connu » : Si l'IA repérait un piège que le Garde Strict avait déjà identifié, elle était très fiable. Elle trouvait ce même piège dans presque toutes les sessions (85 % du temps). Elle était cohérente lorsqu'elle était d'accord avec les règles.
  • Quand l'IA trouvait un « nouveau » piège : C'est là que cela devenait confus. L'IA commençait à signaler de nouveaux pièges uniques que le Garde Strict ne voyait pas.
    • Le Problème : Près de la moitié de ces nouveaux rapports étaient des phénomènes éphémères. Ils n'apparaissaient que dans une seule des cinq sessions, puis disparaissaient.
    • L'Analogie : Imaginez que la détective dise : « J'ai vu un fantôme dans le couloir ! » le lundi. Le mardi, elle dit : « Non, pas de fantôme. » Le mercredi, elle dit : « En fait, c'était juste un porte-manteau. » Le jeudi, elle dit : « Fantôme ! » à nouveau. Si vous êtes le propriétaire du bâtiment, vous ne savez pas si vous devez avoir peur ou si elle est juste en train d'imaginer des choses.

3. Le Facteur de « Bruit »

L'étude a révélé que les rapports « supplémentaires » de l'IA étaient très bruyants.

  • Les rapports « uniques » : Environ 50 % des choses uniques signalées par l'IA n'arrivaient qu'une seule fois. Si vous lanciez le scan cinq fois, vous obtiendriez une liste de mises en garde « supplémentaires » complètement différente selon la session que vous capturiez.
  • Les rapports stables : Les choses sur lesquelles l'IA et le Garde Strict étaient d'accord étaient stables. Elles ne changeaient pas.

4. Plus Grand ne signifie pas Meilleur

Les chercheurs ont testé différentes versions de l'IA, y compris une version « super-coûteuse » et « super-intelligente ».

  • Le Résultat : L'IA la plus chère et la plus puissante n'était pas la plus performante. En fait, elle était plus coûteuse, utilisait plus de puissance informatique et était moins cohérente qu'une version plus petite et moins chère.
  • La Leçon : Ce n'est pas parce que vous payez pour la détective la plus « intelligente » qu'elle vous donnera un rapport plus fiable. Parfois, la détective plus simple et plus ciblée est plus cohérente.

5. Forces Différentes, Angles Morts Différents

Le document conclut que vous ne devriez pas choisir l'un ou l'autre ; vous avez besoin des deux.

  • Le Garde Strict est incroyable pour vérifier systématiquement chaque tuyau et chaque fil pour détecter des fuites (comme la vérification des flux de données répétés). Il ne manque jamais deux fois la même fuite.
  • La Détective Créative est excellente pour repérer des schémas complexes et étranges qui ressemblent à un piège mais qui ne sont pas sur une liste de contrôle (comme repérer une injection SQL suspecte que le garde a manquée).
  • Le Bémol : La détective manque parfois les fuites évidentes et répétées que le garde détecte, et elle se laisse parfois confondre par de faux pièges.

Le Mot de la Fin

Si vous vous reposez uniquement sur la détective IA, vous pourriez obtenir un rapport de sécurité différent à chaque fois que vous vérifiez, et vous devrez passer beaucoup de temps à déterminer quels « fantômes » sont réels et lesquels ne sont que des porte-manteaux.

Si vous vous reposez uniquement sur le Garde Strict, vous pourriez manquer les pièges complexes et créatifs.

La Meilleure Stratégie : Utilisez le Garde Strict pour attraper les fuites évidentes et répétées (car il ne change jamais d'avis), et utilisez la Détective Créative pour trouver les choses inhabituelles et complexes, mais soyez prêt à revérifier ses découvertes « supplémentaires » car elles pourraient être des erreurs passagères. Ils fonctionnent mieux lorsqu'ils s'entraident, plutôt que lorsqu'ils tentent de se remplacer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →