Contrastive Learning and Correlation Clustering for Sequences of Network Telescope Data
Cet article propose une approche d'apprentissage contrastif basée sur les transformeurs pour intégrer et regrouper des séquences d'enregistrements de flux réseau sans annotations sémantiques, démontrant son efficacité pour identifier les relations entre les scanners Internet et se généraliser à des sources non vues.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez l'internet comme une ville immense et chaotique où des millions de personnes (des ordinateurs) s'envoient constamment des lettres (des paquets de données). La plupart de ces lettres sont du courrier normal. Mais parfois, il y a des « scanners » — comme des vendeurs de porte-à-porte agressifs ou des testeurs de sécurité — qui frappent à toutes les portes de la ville pour voir lesquelles sont déverrouillées.
Le problème pour les experts en sécurité est qu'il y a trop de ces vendeurs, et ils sont tous différents. Certains frappent vite, d'autres lentement, certains utilisent des outils différents. Essayer de déterminer manuellement quel vendeur appartient à quelle entreprise est impossible car ils n'ont pas de badges nominatifs (étiquettes) et la ville est trop grande pour surveiller tout le monde.
Cet article propose une manière ingénieuse de résoudre cela en utilisant un « miroir intelligent » et un « jeu de regroupement ».
Le Miroir Intelligent (Le modèle Transformer)
Les chercheurs ont construit un programme informatique spécial (un modèle Transformer) qui agit comme un miroir intelligent. Au lieu de regarder le contenu des lettres, il regarde le schéma (le pattern) de la façon dont un vendeur spécifique frappe aux portes.
- Comment il apprend : Habituellement, pour apprendre à un ordinateur à reconnaître des schémas, il faut un enseignant pour dire : « Ceci est le Vendeur A, cela est le Vendeur B. » Mais ici, il n'y a pas d'enseignant.
- L'astuce : Le programme utilise une technique appelée Apprentissage Contrastif (Contrastive Learning). Imaginez que vous avez une pile de photos. Vous dites à l'ordinateur : « Prends deux photos de la même personne (même si elle porte des chapeaux différents ou se tient à des endroits différents) et fais en sorte qu'elles se ressemblent beaucoup dans ton esprit. Prends des photos de personnes différentes et fais en sorte qu'elles soient très différentes. »
- Le résultat : L'ordinateur apprend à créer une « empreinte digitale » pour chaque vendeur basée sur ses habitudes de frappe, sans jamais qu'on lui dise qui ils sont. Il apprend que « Frapper à 100 portes en 5 secondes » est un style spécifique, et que « Frapper à 10 portes en 1 minute » en est un autre.
Le Jeu de Regroupement (Clustering de Corrélation)
Une fois que l'ordinateur a créé ces empreintes digitales, les chercheurs jouent à un jeu appelé Clustering de Corrélation (Correlation Clustering).
- Le but : Ils veulent trier tous les vendeurs en groupes basés sur la similitude de leurs empreintes digitales.
- Le défi : Ils ne savent pas combien il devrait y avoir de groupes, et ils ne connaissent pas la taille des groupes.
- La solution : L'algorithme regarde la « distance » entre les empreintes digitales. Si deux vendeurs ont des empreintes très similaires, l'algorithme dit : « Mettez-les dans la même pièce. » S'ils sont différents, il les met dans des pièces différentes. Il fait cela automatiquement, trouvant des grappes (clusters) naturelles sans avoir besoin d'un nombre de groupes prédéfini.
Ce qu'ils ont trouvé
Les chercheurs ont testé cela sur un ensemble massif de données de trafic internet (comme surveiller toute une ville pendant une heure). Voici ce qui s'est passé :
- Reconnaître la même personne : Lorsqu'ils ont montré à l'ordinateur deux ensembles différents de schémas de frappe provenant du même vendeur (qu'ils n'avaient pas vu pendant l'entraînement), l'ordinateur les a correctement identifiés comme étant « similaires ». Il savait qu'il s'agissait de la même personne même si les schémas n'étaient pas identiques.
- Reconnaître des personnes différentes : Lorsqu'ils lui ont montré des schémas provenant de vendeurs différents, l'ordinateur a correctement identifié qu'ils étaient « différents ».
- Regrouper par « Entreprise » : La partie la plus excitante était que lorsqu'ils ont regroupé les vendeurs en fonction de ces empreintes digitales, les groupes correspondaient aux entreprises de scanners réelles (comme Censys ou Shodan) que les chercheurs connaissaient. Même si l'ordinateur n'avait jamais entendu parler de ces entreprises, il a naturellement regroupé les vendeurs de « Censys » ensemble et ceux de « Shodan » ensemble.
Le bémol (La « Zone Grise »)
L'article note que le regroupement n'était pas parfait. Parfois, des vendeurs de différentes entreprises semblaient si similaires (peut-être parce qu'ils utilisaient les mêmes outils ou frappaient aux mêmes portes) que l'ordinateur s'est emmêlé les pinceaux et les a confondus. Cela suggère que, bien que l'ordinateur ait beaucoup appris, l'« empreinte digitale » n'est pas une carte d'identité parfaite ; elle capture le style de l'attaque, qui peut parfois se chevaucher entre différents groupes.
L'essentiel
Cet article montre qu'on peut apprendre à un ordinateur à comprendre la « personnalité » des scanners internet simplement en observant leur comportement, sans avoir besoin de labelliser les données au préalable. En utilisant un miroir intelligent pour apprendre les similitudes et un jeu de regroupement pour trier, ils peuvent organiser automatiquement le trafic internet chaotique en groupes significatifs, aidant les experts en sécurité à repérer des schémas qu'ils ne pouvaient pas voir auparavant.
En bref : Ils ont appris à un ordinateur à reconnaître « qui frappe » et « qui appartient à quel gang » simplement en écoutant le rythme des coups, sans jamais être informé du nom des gangs.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.