← Nieuwste papers
🤖 machine learning

Contrastive Learning and Correlation Clustering for Sequences of Network Telescope Data

Dit artikel stelt een op transformer gebaseerde contrastieve leerbenadering voor om sequenties van netwerkflow-records te embedden en te clusteren zonder semantische annotaties, waarbij de effectiviteit ervan wordt aangetoond bij het identificeren van relaties tussen Internetscanners en het generaliseren naar onbekende bronnen.

Oorspronkelijke auteurs: Jannik Presberger, Alexander Männel, Maynard Koch, Thomas C. Schmidt, Matthias Wählisch, Bjoern Andres

Gepubliceerd 2026-06-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jannik Presberger, Alexander Männel, Maynard Koch, Thomas C. Schmidt, Matthias Wählisch, Bjoern Andres

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorme, chaotische stad waar miljoenen mensen (computers) constant brieven (datapakketjes) naar elkaar sturen. De meeste van deze brieven zijn normale post. Maar soms zijn er "scanners"—zoals agressieve deurenverkopers of beveiligingstesters—die bij elke enkele deur in de stad aankloppen om te zien welke openstaan.

Het probleem voor beveiligingsexperts is dat er te veel van deze verkopers zijn, en ze zijn allemaal verschillend. Sommigen kloppen snel, anderen langzaam, sommigen gebruiken verschillende hulpmiddelen. Proberen handmatig uit te vogelen welke verkoper bij welk bedrijf hoort is onmogelijk omdat ze geen naamkaartjes (labels) dragen en de stad te groot is om iedereen in de gaten te houden.

Dit paper stelt een slimme manier voor om dit op te lossen met een "slimme spiegel" en een "groeperingsspel".

De Slimme Spiegel (Het Transformer-model)

De onderzoekers hebben een speciaal computerprogramma (een Transformer-model) gebouwd dat fungeert als een slimme spiegel. In plaats van naar de inhoud van de brieven te kijken, kijkt het naar het patroon van hoe een specifieke verkoper op de deuren klopt.

  • Hoe het leert: Normaal gesproken heb je om een computer patronen te laten herkennen een leraar nodig die zegt: "Dit is Verkoper A, dat is Verkoper B." Maar hier is geen leraar.
  • De truc: Het programma gebruikt een techniek genaamd Contrastive Learning. Stel je voor dat je een stapel foto's hebt. Je zegt tegen de computer: "Neem twee foto's van dezelfde persoon (zelfs als ze een andere hoed dragen of op een andere plek staan) en maak ze in je hoofd heel erg op elkaar lijken. Neem foto's van verschillende mensen en maak ze in je hoofd heel erg verschillend."
  • Het resultaat: De computer leert een "vingerafdruk" te maken voor elke verkoper op basis van hun klopgewoonten, zonder ooit te worden verteld wie ze zijn. Het leert dat "100 deuren in 5 seconden aankloppen" een specifieke stijl is, en "10 deuren in 1 minuut aankloppen" een andere.

Het Groeperingsspel (Correlation Clustering)

Zodra de computer deze vingerafdrukken heeft gemaakt, spelen de onderzoekers een spel genaamd Correlation Clustering.

  • Het doel: Ze willen alle verkopers in groepen sorteren op basis van hoe vergelijkbaar hun vingerafdrukken zijn.
  • De uitdaging: Ze weten niet hoeveel groepen er zouden moeten zijn, en ze weten niet wat de grootte van de groepen is.
  • De oplossing: Het algoritme kijkt naar de "afstand" tussen de vingerafdrukken. Als twee verkopers zeer vergelijkbare vingerafdrukken hebben, zegt het algoritme: "Zet ze in dezelfde kamer." Als ze verschillend zijn, zet het ze in verschillende kamers. Dit doet het automatisch en vindt natuurlijke clusters zonder dat er een vooraf ingesteld aantal groepen nodig is.

Wat ze vonden

De onderzoekers testten dit op een enorme dataset van internetverkeer (alsof ze een hele stad een uur lang in de gaten hielden). Dit is wat er gebeurde:

  1. Dezelfde persoon herkennen: Wanneer ze de computer twee verschillende sets kloppatronen van dezelfde verkoper lieten zien (die ze tijdens de training nog niet hadden gezien), identificeerde de computer ze correct als "vergelijkbaar". De computer wist dat ze dezelfde persoon waren, ook al waren de patronen niet identiek.
  2. Verschillende mensen herkennen: Wanneer ze patronen van verschillende verkopers lieten zien, identificeerde de computer deze correct als "verschillend".
  3. Groeperen op "bedrijf": Het meest opwindende deel was dat toen ze de verkopers groepeerden op basis van deze vingerafdrukken, de groepen overeenkwamen met echte scannerbedrijven (zoals Censys of Shodan) waarvan de onderzoekers op de hoogte waren. Hoewel de computer nooit de namen van deze bedrijven had gekregen, groepeerde hij de "Censys"-verkopers natuurlijk samen en de "Shodan"-verkopers samen.

De Addertjes (Het "Grijze Gebied")

Het paper merkt op dat de groepering niet perfect was. Soms zagen verkopers van verschillende bedrijven zo sterk op elkaar (misschien omdat ze dezelfde tools gebruikten of op dezelfde deuren klopten), dat de computer in de war raakte en ze door elkaar haalde. Dit suggereert dat, hoewel de computer veel heeft geleerd, de "vingerafdruk" geen perfect ID-kaart is; het legt de stijl van de aanval vast, die soms kan overlappen tussen verschillende groepen.

De Kernboodschap

Dit paper laat zien dat je een computer kunt leren de "persoonlijkheid" van internetscanners te begrijpen door simpelweg hun gedrag te observeren, zonder dat je eerst menselijke labels aan de data hoeft toe te kennen. Door een slimme spiegel te gebruiken om gelijkenissen te leren en een groeperingsspel om te sorteren, kunnen ze chaotisch internetverkeer automatisch organiseren in betekenisvolle groepen, wat beveiligingsexperts helpt om patronen te ontdekken die ze voorheen niet konden zien.

Kortom: Ze hebben een computer geleerd om te herkennen "wie er klopt" en "bij welke bende iemand hoort", simpelweg door te luisteren naar het ritme van het kloppen, zonder ooit de namen van de bendes te hebben gehoord.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →