← Derniers articles
💻 computer science

Detection of the Malicious URL Using the Language Models

Cet article propose d'utiliser des modèles de langage, particulièrement BERT, pour capturer la signification sémantique des expressions dans les URL malveillantes, atteignant une amélioration significative de la précision de la classification multiclasse jusqu'à 99,7 % par rapport aux méthodes traditionnelles qui reposent uniquement sur des caractéristiques lexicales et statistiques.

Auteurs originaux : Samira Shirmohammadi, Amir Jalaly Bidgoly, Sanaz Allami Farsi, Faezeh Alizadeh

Publié 2026-08-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Samira Shirmohammadi, Amir Jalaly Bidgoly, Sanaz Allami Farsi, Faezeh Alizadeh

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'internet est devenu le système nerveux central de la vie moderne, un vaste réseau où les organisations fournissent des services et les gens partagent des informations via des adresses web. Ces adresses, connues sous le nom d'URL, sont les clés qui déverrouillent des pages spécifiques sur le web. Cependant, tout comme une clé physique peut être forgée pour ouvrir une porte qui ne devrait pas l'être, un lien numérique peut être conçu pour tromper. Les URL malveillantes sont ces clés forgées ; ce sont des liens conçus pour inciter les utilisateurs à visiter des sites qui volent de l'argent, récoltent des informations privées ou installent des logiciels malveillants sur leurs appareils. Si certaines menaces sont évidentes, beaucoup sont subtiles, et distinguer un lien sûr d'un lien dangereux est souvent difficile pour le commun des mortels. Pour se protéger contre ces pièges numériques, les experts en sécurité s'appuent depuis longtemps sur des listes de liens malveillants connus, mais ces listes ne peuvent arrêter que ce qu'elles ont déjà vu. Lorsque surgit une nouvelle menace inconnue, les anciennes listes échouent. Cette limitation a poussé les chercheurs à chercher des moyens plus intelligents d'identifier le danger, en allant au-delà de simples listes de contrôle pour concevoir des systèmes capables de comprendre réellement le sens derrière une adresse web.

Dans une étude récente, des chercheurs de l'Université de Qom et de l'Université Azad Islamique ont relevé ce défi en apprenant aux ordinateurs à lire le sens des mots à l'intérieur d'une adresse web, plutôt que de simplement compter leurs caractères. Pendant des années, des systèmes automatisés ont tenté de repérer les liens malveillants en examinant leur forme et leur structure — en mesurant la longueur de l'adresse, en comptant le nombre de symboles ou en vérifiant si elle contient des chaînes de lettres suspectes. Ces méthodes fonctionnent bien pour de nombreux cas, mais elles manquent de nuance linguistique. Un lien malveillant peut utiliser des mots d'apparence innocente disposés d'une manière qui suggère une escroquerie, tout comme un e-mail de phishing qui utilise un langage poli pour demander un mot de passe. Les chercheurs ont réalisé que pour attraper ces ruses sophistiquées, un système doit comprendre la relation sémantique entre les mots, ou comment ils s'assemblent pour former un sens spécifique. Pour ce faire, ils se sont tournés vers les modèles de langage, qui sont des programmes informatiques avancés entraînés sur de vastes quantités de texte pour comprendre comment les mots se rapportent les uns aux autres dans le langage humain.

L'équipe a testé quatre types différents de ces modèles de langage pour voir lequel pouvait le mieux identifier l'intention derrière une URL. Les deux premiers, Word2vec et GloVe, sont des systèmes qui cartographient les mots dans un espace mathématique basé sur la fréquence avec laquelle ils apparaissent à proximité les uns des autres dans un texte. Ils sont doués pour comprendre que des mots comme « roi » et « reine » sont liés, mais ils traitent chaque mot de manière isolée, sans considérer le contexte complet de la phrase. Le troisième modèle, LASER, a été conçu pour gérer simultanément de nombreuses langues différentes, en cartographiant les phrases dans un espace partagé, bien qu'il se concentre sur la phrase dans son ensemble plutôt que sur les détails fins des mots individuels. Le dernier modèle, BERT, est un outil plus récent et plus puissant qui examine un mot dans le contexte de tous les mots qui l'entourent, tant avant qu'après lui. Cela lui permet de saisir les nuances de sens qui dépendent de l'agencement spécifique d'une phrase. Les chercheurs ont appliqué ces modèles à un ensemble de données contenant plus de 114 000 adresses web, comprenant des liens sûrs ainsi que ceux conçus pour le spam, le phishing, les malwares et la défiguration de sites web.

Pour rendre les adresses web lisibles pour ces modèles de langage, les chercheurs ont d'abord dû les décomposer en morceaux plus petits, un processus appelé tokenisation. Pour les trois premiers modèles, ils ont manuellement supprimé les symboles tels que les barres obliques et les points d'interrogation, traitant les mots restants comme les données de base. Pour le modèle BERT, ils ont utilisé un outil spécialisé qui décompose automatiquement l'adresse en sous-mots et en symboles, conservant la ponctuation comme faisant partie du sens car BERT est conçu pour comprendre comment ces symboles modifient le contexte. Une fois les adresses traitées, les modèles ont généré une représentation numérique unique pour chacune d'elles, capturant son essence sémantique. Ces représentations ont ensuite été injectées dans un réseau neuronal, un type de programme informatique inspiré par le cerveau humain, qui a appris à reconnaître des motifs et à attribuer une étiquette à chaque URL, telle que « sûr », « spam » ou « phishing ».

Les résultats de l'expérience ont montré un vainqueur clair. Bien que tous les modèles de langage aient obtenu de meilleurs résultats que de nombreuses méthodes précédentes reposant uniquement sur des caractéristiques statistiques, le modèle BERT s'est particulièrement distingué. Il a atteint un taux de précision de 99,71 %, identifiant correctement la nature des adresses web dans presque tous les cas. Les autres modèles ont également bien performé, le modèle GloVe atteignant 98,94 % et le modèle Word2vec atteignant 98,62 %, mais ils n'ont pas atteint la précision de BERT. Les chercheurs ont noté que même le modèle le moins performant de leur étude, LASER, surpassait de nombreuses techniques existantes dans le domaine, atteignant une précision de 97,46 %. Cela suggère que le simple fait de déplacer l'attention de la structure physique d'une URL vers le sens de ses mots procure un gain substantiel en matière de sécurité. L'étude démontre qu'en utilisant un modèle capable de comprendre le contexte et les relations entre les mots, les ordinateurs peuvent devenir beaucoup plus efficaces pour repérer les indices linguistiques subtils qui indiquent un lien malveillant.

Les chercheurs ont conclu que leur approche offre une solution robuste à un problème persistant de la sécurité informatique. En modélisant l'espace sémantique des mots trouvés dans les adresses web, ils ont pu capturer l'intention derrière un lien d'une manière que les méthodes traditionnelles ne pouvaient pas. Le succès du modèle BERT, en particulier, souligne la valeur de l'utilisation d'une compréhension du langage profonde et sensible au contexte pour détecter les menaces. Cela ne signifie pas que les anciennes méthodes sont inutiles, mais plutôt que de les combiner avec la capacité de lire le « sens » d'une URL crée une défense beaucoup plus forte. Alors que les cybercriminels continuent de faire évoluer leurs tactiques, rendant leurs liens malveillants de plus en plus semblables à des liens légitimes, la capacité de comprendre le contexte des mots qu'ils utilisent deviendra un outil essentiel pour maintenir l'internet en sécurité. L'étude trace une voie claire pour l'avenir, montant que l'avenir de la détection d'URL réside dans l'apprentissage des machines à lire entre les lignes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →