← Derniers articles
🤖 machine learning

ThreatVisionAI: A Hybrid CNN-ViT Framework for Image-Based Malware Classification

ThreatVisionAI est un cadre hybride qui combine des CNN d'images brutes, des CNN basés sur les ondelettes et des Vision Transformers pour atteindre une précision de pointe dans la classification des familles de malwares en capturant efficacement des caractéristiques spatiales, fréquentielles et relationnelles globales complémentaires.

Auteurs originaux : Allyson Taylor, Prashanth BusiReddyGari

Publié 2026-07-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Allyson Taylor, Prashanth BusiReddyGari

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de trier une pile massive de faux billets de banque. Certains ressemblent presque parfaitement aux vrais, tandis que d'autres ont été altérés avec de l'encre invisible ou des textures étranges qu'on ne peut pas facilement repérer à l'œil nu. Les gardes de sécurité traditionnels (les anciens antivirus) se contentent de vérifier une liste de numéros de série connus. Si un nouveau faux billet n'a jamais été vu auparavant, ils le laissent passer.

Le papier « ThreatVisionAI » propose une nouvelle équipe de tri super intelligente pour gérer ce travail. Au lieu de simplement regarder les numéros de série, cette équipe transforme chaque malware (code informatique malveillant) en une image en niveaux de gris, puis utilise trois « experts » différents pour analyser cette image simultanément.

Voici comment les trois experts travaillent, en utilisant des analogies simples :

Les trois experts de l'équipe

  1. Le « Détective de Pixels » (CNN d'image brute) :

    • Ce qu'il fait : Cet expert regarde l'image exactement telle qu'elle est, pixel par pixel. C'est comme un détective qui examine la forme et la couleur d'un billet pour voir si les bords sont dentelés ou s'il y a des motifs répétitifs.
    • Sa force : Il est excellent pour repérer les détails locaux et les formes familières.
    • Sa faiblesse : Il manque parfois de subtilité si deux faux billets se ressemblent presque de loin.
  2. Le « Murmureur de Textures » (CNN basé sur les ondelettes) :

    • Ce qu'il fait : C'est l'innovation majeure du papier. Imaginez que vous preniez ce billet et que vous le passiez à travers un filtre spécial qui décompose l'image en ses fréquences. Il sépare les parties « lisses » des parties « rugueuses », et observe le « grain » horizontal, vertical et diagonal de l'image.
    • Sa force : Il peut repérer de minuscules textures directionnelles que le Détective de Pixels rate. C'est comme être capable de sentir le grain du papier pour distinguer deux faux billets d'apparence identique. Le papier a découvert que cet expert était crucial pour différencier des familles de malwares qui se ressemblent presque de manière identique pour l'œil humain.
  3. L'« Observateur de la Vue d'Ensemble » (Vision Transformer ou ViT) :

    • Ce qu'il fait : Tandis que les deux autres se concentrent sur des points spécifiques, cet expert prend du recul pour regarder l'image entière à la fois. Il relie les points entre le coin supérieur gauche et le coin inférieur droit, comprenant comment les différentes parties de l'image sont liées entre elles de manière globale.
    • Sa force : Il comprend « l'histoire » de l'image complète, et pas seulement les phrases individuelles.

Comment ils travaillent ensemble

Au lieu de laisser un seul expert prendre la décision finale, l'équipe utilise un système de « Vote Pondéré Doux » (Weighted Soft Voting). Imaginez cela comme un jury :

  • Le Détective de Pixels obtient 50 % des voix (il est le plus fiable).
  • Le Murmureur de Textures obtient 40 % des voix (il est très doué pour repérer les différences subtiles).
  • L'Observateur de la Vue d'Ensemble obtient 10 % des voix (il ajoute un peu de contexte supplémentaire).

Ils combinent leurs opinions pour prendre une décision finale.

Les résultats : Quel est leur succès ?

L'équipe a testé ce système sur un jeu de données célèbre d'images de malwares appelé Malimg, qui contient environ 9 500 images de 25 types différents de logiciels malveillants.

  • Le score : L'équipe a atteint une précision de 98,01 %. Cela signifie que sur 100 nouvelles images de malwares, ils ont correctement identifié la famille du logiciel malveillant 98 fois.
  • La victoire : Le « Murmureur de Textures » (Wavelet) a été le joueur vedette. Il a aidé l'équipe à distinguer deux familles de malwares très similaires (Swizzor.gen!E et Swizzor.gen!I) que les autres experts peinaient à séparer. Sans cette vue basée sur la fréquence, l'équipe les aurait confondus plus souvent.

La chose qu'ils n'ont pas pu corriger

Le papier admet qu'il existe un problème persistant. Il y a deux types de malwares, Autorun.K et Yuner.A, qui sont si incroyablement similaires sous forme d'image que même les meilleurs experts humains ne peuvent les distinguer.

  • L'IA a fait de son mieux, mais elle continuait de deviner « Yuner.A » alors qu'il s'agissait en réalité d'« Autorun.K ».
  • Les chercheurs ont utilisé un outil appelé Grad-CAM (qui met en évidence les parties de l'image que l'IA regarde) et ont découvert que l'IA regardait exactement les mêmes endroits pour les deux.
  • Conclusion : Ce n'était pas une erreur de l'IA ; c'est une limitation des données. Les images sont tout simplement trop identiques.

Le revers de la médaille (Limites)

  • Attaques Adverses : Le papier teste ce qui se passe si quelqu'un essaie de tromper l'IA en ajoutant un bruit minuscule et invisible à l'image (comme le tour de passe-passe d'un magicien). La précision du système chute considérablement, montant qu'il peut être trompé si un attaquant connaît précisément le fonctionnement du modèle.
  • Données Anciennes : Les données de test datent de 2011. Bien que la méthode fonctionne bien sur ce vieux jeu de données, les auteurs notent qu'ils n'ont pas encore testé cela sur des ensembles de données modernes et massifs.

Résumé

ThreatVisionAI est un système hybride qui ne se contente pas de regarder les images de malwares ; il écoute leur « texture » et comprend leur « structure globale ». En combinant ces trois manières différentes de voir, il trie les logiciels malveillants avec une très haute précision, prouvant que regarder la « fréquence » d'une image est tout aussi important que de regarder l'image elle-même.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →