← Nieuwste papers
💻 computer science

A Lightweight Neural Network Approach for Phishing URL Detection

Dit onderzoek stelt een lichtgewicht neuraal netwerkbenadering voor voor de detectie van phishing-URL's met behulp van de PhiUSIIL-dataset, waarbij wordt aangetoond dat het optimaliseren van hyperparameters en het toepassen van gegevensschaling de classificatienauwkeurigheid aanzienlijk verbetert terwijl de lage computationele complexiteit behouden blijft.

Oorspronkelijke auteurs: Umer Farooq Ali, Syeda Mariam Muzammal, Ruqia Bibi, NZ Jhanjhi, Muhammad Tayyab

Gepubliceerd 2026-07-13
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Umer Farooq Ali, Syeda Mariam Muzammal, Ruqia Bibi, NZ Jhanjhi, Muhammad Tayyab

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Een Lichtgewicht Neuraal Netwerkbenadering voor Phishing URL-detectie

Probleemstelling
Phishing-aanvallen vormen een alomtegenwoordige cyberdreiging waarbij kwaadwillende actoren gebruikers misleiden om gevoelige informatie prijs te geven via frauduleuze websites. Naarmate aanvalstrategieën evolueren — door gebruik te maken van domeinspofing, obfuscatie en verkorte URL's — worstelen traditionele detectiemechanismen zoals blacklisting en op regels gebaseerde systemen met schaalbaarheid en aanpassingsvermogen. Bovendien vereisen bestaande deep learning-oplossingen (bijv. CNN's, LSTM's, hybride modellen) vaak aanzienlijke computationele middelen, wat ze ongeschikt maakt voor real-time implementatie in omgevingen met beperkte middelen, zoals IoT-apparaten, mobiele systemen en edge computing. Er is een kritieke behoefte aan een detectiekader dat een balans vindt tussen hoge classificatienauwkeurigheid en lage computationele complexiteit en minimale verwerkingsoverhead.

Methodologie
Dit onderzoek stelt een lichtgewicht neurale netwerkarchitectuur voor die ontworpen is om URL's te classificeren als ofwel phishing, ofwel legitiem. De studie maakt gebruik van de PhiUSIIL Phishing URL-dataset, die ongeveer 235.795 instanties bevat (134.850 phishing en 100.945 legitieme URL's) met 64 afzonderlijke kenmerken, waaronder domeinlengte, aantal speciale tekens en protocolinformatie.

De experimentele workflow omvat de volgende kerncomponenten:

  1. Data Preprocessing: De dataset wordt opgeschoond om nullen te verwijderen en gesplitst in 70% trainings- en 30% testsets met behulp van gestratificeerde steekproeven. Een cruciale stap in de methodologie is de toepassing van Min-Max scaling om de kenmerkwaarden te normaliseren naar een bereik van 0–1, waarbij de prestaties worden vergeleken met ongeschaalde data.
  2. Modelarchitectuur: Het voorgestelde model is een ondiep, lichtgewicht neuraal netwerk bestaande uit:
    • Een inputlaag die de geschaalde featurevector accepteert.
    • Twee volledig verbonden verborgen lagen die de ReLU-activatiefunctie gebruiken om problemen met verdwijnende gradiënten (vanishing gradient issues) te mitigeren.
    • Regularisatietechnieken: Dropout (rate van 0,5) is tussen de lagen ingevoegd om overfitting te voorkomen, en Batch Normalization wordt na elke verborgen laag toegepast om het trainen te stabiliseren en te versnellen.
    • Een outputlaag met één neuron en sigmoid-activatie voor binaire classificatie.
  3. Trainingsconfiguratie: Het model wordt getraind met Binary Cross-Entropy loss. De studie evalueert twee optimizers: Stochastic Gradient Descent (SGD) en Adam. Hyperparameters, inclusief leersnelheden, momentum, batchgroottes (32, 64, 128) en epoch-aantallen (50, 100, 150), worden afgestemd.
  4. Evaluatie: De studie maakt gebruik van 5-voudige kruisvalidatie en analyseert prestaties aan de hand van Accuracy, Precision, Recall en F1-Score.

Belangrijkste Bijdragen
Het artikel schetst vijf primaire bijdragen aan het vakgebied van cybersecurity en machine learning:

  • Lichtgewicht Architectuur: Het voorstel van een neuraal netwerk met weinig lagen, specifiek ontworpen voor omgevingen met beperkte middelen (IoT, mobiel) zonder in te leveren op detectievermogen.
  • Optimizer Vergelijking: Een vergelijkende analyse van SGD en Adam optimizers, die aantoont dat SGD in combinatie met Batch Normalization superieure stabiliteit en nauwkeurigheid oplevert voor deze specifiec taak.
  • Impact van Data Scaling: Empirisch bewijs dat Min-Max scaling de modelconvergentie, stabiliteit en classificatienauwkeurigheid aanzienlijk verbetert vergeleken met het trainen op ruwe, ongeschaalde data.
  • Regularisatie Ablatie-studie: Kwantitatieve experimenten die de noodzaak van zowel Dropout als L2-regularisatie bevestigen om overfitting te voorkomen en generalisatie te waarborgen.
  • High-Performance Benchmarking: Het behalen van bijna perfecte prestatiemetricen op de PhiUSIIL-dataset, wat de praktische bruikbaarheid van het model valideert.

Resultaten
De experimentele resultaten geven aan dat de voorgestelde lichtgewicht benadering zeer effectief is:

  • Effect van Scaling: Modellen getraind op geschaalde data behaalden 99,47% nauwkeurigheid, vergeleken met 96,57% op ongeschaalde data, wat de cruciale rol van preprocessing benadrukt.
  • Optimizer Prestaties: De Adam optimizer behaalde de hoogste algehele prestaties met 99,98% nauwkeurigheid, 99,97% precisie, 99,99% recall en een 99,98% F1-score.
  • Regularisatie Impact: De inclusie van Batch Normalization verbeterde de nauwkeurigheid van 99,47% naar 99,73%. Evenzo behaalden modellen met Dropout en L2-regularisatie een F1-score van 99,54%.
  • Finale Configuratie: De optimale configuratie (Geschaalde data + Adam optimizer + Batch Normalization + Dropout) resulteerde in een model dat in staat is om phishing URL's te onderscheiden met bijna nul fout-positieven en fout-negatieven.

Betekenis en Claims
De auteurs beweren dat dit onderzoek een levensvatbaar kader biedt voor real-time cybersecurity-toepassingen, zoals browserfilters en mobiele beveiligingsinstrumenten, door de trade-off tussen detectieprecisie en computationele efficiëntie aan te pakken. De studie stelt dat het optimaliseren van eenvoudige neurale netwerken met de juiste hyperparameters en preprocessing-stappen effectief phishing URL's kan detecteren, zelfs binnen grote, diverse datasets.

De betekenis van het werk ligt in de demonstratie dat complexe, resource-intensieve deep learning-modellen niet strikt noodzakelijk zijn voor hoogwaardige phishing-detectie. In plaats daarvan kan een zorgvuldig afgestemde, lichtgewicht architectuur robuuste bescherming bieden tegen online oplichting. De auteurs concluderen dat hun benadering bijdraagt aan de ontwikkeling van effectieve, schaalbare machine learning-modellen voor cybersecurity, waarbij een defensiemechanisme wordt geboden dat zowel computationeel efficiënt als zeer nauwkeurig is, geschikt voor implementatie in omgevingen met beperkte hardwarebronnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →