← Derniers articles
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

Cet article présente SRE-Bench, le premier benchmark réaliste et exempt de contamination pour évaluer les capacités d'ingénierie inverse agentique sur le code binaire, révélant que même les modèles de langage de pointe les plus puissants peinent à atteindre le niveau de performance humain en raison des défis uniques posés par l'analyse de binaires inédits et protégés.

Auteurs originaux : Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

Publié 2026-08-13
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un détective tentant de résoudre un mystère. Habituellement, lorsque vous menez une enquête sur un crime, vous avez la possibilité de lire le journal intime du suspect, ses notes manuscrites et ses e-mails. C'est ce qui ressemble au code source : les instructions originales, lisibles par l'humain, qui disent à un ordinateur quoi faire. Mais dans le monde réel de la cybersécurité, les méchants ne laissent pas leurs journaux intimes en plein de vue. Ils vous tendent une boîte verrouillée et scellée, sans aucune instruction à l'extérieur. C'est un binaire : un fichier composé d'octets informatiques bruts qui ressemble à du charabia pour les humains. Pour découvrir ce qui se trouve à l'intérieur, vous devez pratiquer la rétro-ingénierie — démonter la boîte, pièce par pièce, pour deviner comment le verrou fonctionne et quels sont son contenu.

Maintenant, imaginez que nous ayons construit des détectives IA super intelligents (appelés agents IA) qui sont incroyables pour lire ces journaux intimes. Ils peuvent repérer les mensonges et trouver des indices dans le texte plus vite qu'un humain. Mais ces détectives IA peuvent-ils forcer les boîtes verrouillées ? C'est la grande question. Si l'IA peut seulement lire le journal mais ne peut pas ouvrir la boîte, elle n'est pas un véritable héros de la cybersécurité. Nous devons savoir si ces détectives numériques peuvent réellement accomplir le travail difficile de la rétro-ingénierie, ou s'ils se contentent de s'appuyer sur des motifs issus des données qu'ils ont vues lors de leur entraînement.

Ce document présente un tout nouveau test extrêmement difficile appelé SRE-Bench pour le découvrir. Les chercheurs ont conçu 19 programmes entièrement nouveaux et secrets en partant de zéro — comme la création de 19 jeux vidéo et systèmes de sécurité uniques et complexes qu'aucune IA n'a jamais vus auparavant. Ils ont ensuite verrouillé ces programmes avec 44 types différents de gardes de sécurité de haute technologie (techniques d'obfuscation) pour les rendre incroyablement difficiles à percer. Ils ont testé cinq des modèles d'IA les plus intelligents au monde contre ces boîtes verrouillées, incluant des versions futures comme GPT-5.6-sol et Claude-Opus-5 d'une évaluation de 2026.

Les résultats ont été un signal d'alarme. Même l'IA la plus forte de cette étude, GPT-5.6-sol, n'a réussi à résoudre complètement environ 31,5 % des cas (obtenant un score parfait sur 80 des 262 instances). Les autres IA ont fait encore pire, certaines n'ayant résolu pas une seule instance. L'étude a révélé que ces agents d'IA se comportent très différemment des experts humains. Alors que les humains ont du mal avec des éléments comme l'optimisation de code (qui rend le code efficace mais désordonné), les IA ont à peine remarqué ces obstacles. Au lieu de cela, les IA se sont fortement appuyées sur la présence de noms et d'étiquettes dans le code ; lorsque les chercheurs ont supprimé ces noms, les performances de l'IA se sont effondrées. Plus important encore, l'étude prouve qu'être bon pour lire du code source ne signifie pas qu'une IA est douée pour percer des binaires. La « boîte verrouillée » reste un défi massif et non résolu, et SRE-Bench est le premier test réaliste et équitable pour mesurer où nous en sommes réellement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →