← Derniers articles
💻 computer science

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

Cet article présente un benchmark systématique et un ensemble de données de 336 programmes JavaScript obscurcis et chiffrés pour évaluer la capacité des modèles de langage à retrouver des indicateurs de compromission, révélant que, si les modèles de langage gèrent efficacement des transformations légères comme le renommage de variables et le codage Base64, leurs performances de détection se dégradent sévèrement face à des méthodes de dissimulation cryptographique telles que le XOR et l'AES-256.

Auteurs originaux : Jaime Morales, Sergio Pastrana, Juan Tapiador

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jaime Morales, Sergio Pastrana, Juan Tapiador

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective numérique tentant de trouver un indice caché (comme une adresse IP spécifique) à l'intérieur d'un morceau de code. Habituellement, cela est facile : l'indice est écrit clairement, comme un nom sur un morceau de papier. Mais que se passe-t-il si les méchants cachent cet indice ? Ils pourraient l'écrire dans un code secret, brouiller les lettres, ou le verrouiller à l'intérieur d'un coffre-fort.

Ce document est un bulletin de notes pour les Grands Modèles de Langage (LLM) — les chatbots intelligents que nous utilisons aujourd'hui — sur la façon dont ils peuvent agir en tant que ces détectives lorsque les indices sont cachés.

Voici le détail de leur enquête :

Le Déroulement : Un Jeu de « Cache-Cache »

Les chercheurs ont créé un immense jeu de cache-cache.

  • Les Joueurs : Ils ont testé cinq modèles d'IA célèbres (comme ChatGPT, Gemini, Claude, Grok et Cohere).
  • L'Indice : Un faux « Indicateur de Compromission » (IoC), qui n'est qu'un terme pompeux pour une adresse IP suspecte (comme le numéro de téléphone d'un méchant).
  • Les Endroits de Cachette : Ils ont pris 336 morceaux de code informatique et ont caché l'indice à l'intérieur en utilisant 12 niveaux de difficulté différents.
    • Niveau 1-4 (Les Cachettes Faciles) : Ils ont simplement renommé des variables (appelant « IP_Address » quelque chose comme « x99 »), ajouté du code inutile pour embrouiller l'œil, ou utilisé des encodages simples comme Base64 (ce qui équivaut à écrire un message dans un alphabet secret que n'importe qui peut facilement décoder).
    • Niveau 5-6 (Les Cachettes Difficiles) : Ils ont enfermé l'indice à l'intérieur d'un coffre-fort cryptographique. Ils ont utilisé un chiffrement robuste (XOR et AES-256). Crucialement, ils ont laissé la clé du coffre-fort juste là, dans le code, tout comme un vrai pirate informatique pourrait le faire.
    • Niveau 7-12 (Les Cachettes Cauchemardesques) : Ils ont combiné le coffre-fort verrouillé avec tout le renommage confus et le code inutile.

Les Résultats : L'Effet « Interrupteur Lumineux »

Les résultats étaient surprenants et très clairs. Ils n'ont pas observé un déclin lent des performances ; ils ont vu un interrupteur lumineux.

1. Les Cachettes « Faciles » (Niveaux 1–4) :
Lorsque l'indice était simplement brouillé ou renommé, les détectives IA étaient incroyables.

  • La plupart des modèles ont trouvé l'indice 100 % du temps.
  • Ils étaient comme des enfants jouant au cache-cache qui peuvent facilement repérer une chaussure dépassant derrière un rideau. Ils reconnaissaient les motifs même lorsque les mots étaient changés.

2. Les Cachettes « Difficiles » (Niveaux 5–12) :
Dès que les chercheurs ont utilisé le chiffrement (le coffre-fort), les performances de l'IA se sont effondrées.

  • Même si la clé était assise juste là dans le code, les modèles d'IA ne pouvaient pas ouvrir le coffre-fort.
  • Ils sont passés de trouver l'indice 100 % du temps à le trouver presque 0 % du temps.
  • L'Analogie : Imaginez que vous avez une boîte verrouillée, et que la clé est collée à l'extérieur de la boîte. Un détective humain regarderait la clé, la mettrait dans la serrure et l'ouvrirait. L'IA, cependant, regardait la boîte et la clé, mais au lieu d'essayer de la déverrouiller, elle disait simplement : « Je ne peux pas voir ce qu'il y a dedans », ou devinait un nombre au hasard.

Le Problème de la « Devinette »

Lorsque l'IA ne pouvait pas trouver l'indice, certaines d'entre elles ont commencé à halluciner (inventer des choses).

  • Un modèle (Gemini) a inventé de fausses adresses IP environ 5 % du temps.
  • Le Motif : Lorsque l'IA était bloquée, elle ne disait pas simplement « Je ne sais pas ». Elle devinait souvent une adresse privée très courante (comme 192.168.17.101).
  • La Métaphore : C'est comme un élève passant un examen qui ne connaît pas la réponse. Au lieu de laisser la case vide, il écrit « La réponse est probablement 42 » parce qu'il a vu ce nombre beaucoup de fois dans d'autres examens. L'IA devinait simplement en se basant sur ce qu'elle avait vu auparavant, sans réellement résoudre l'énigme.

La Grande Conclusion

Le document conclut par une vérité simple :

  • L'IA est excellente pour lire une écriture manuscrite illisible. Si le code est simplement brouillé ou renommé, l'IA peut le comprendre.
  • L'IA est terrible pour crocheter des coffres-forts. Si le code est chiffré, l'IA se heurte à un mur. Elle n'a pas la capacité de « réfléchir » à travers les mathématiques du chiffrement, même si la clé est juste devant elle.

En bref : Ces outils d'IA sont excellents pour trouver des indices cachés à vue, mais ils sont actuellement inutiles face à un code qui a été verrouillé avec un chiffrement robuste. Ils ne peuvent pas « déverrouiller » le mystère ; ils ne peuvent lire que ce qui est déjà visible.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →