Advanced Persistent Threat Detection via Adaptive Dynamic Masking and Heterogeneity-Aware Projection
Questo articolo propone AMH-APT, un nuovo framework di rilevamento APT che migliora l'analisi dei grafi di provenienza impiegando una strategia di mascheramento dinamico adattivo per preservare il contesto critico dell'attacco e una proiezione consapevole dell'eterogeneità per mantenere spazi semantici distinti per diversi tipi di entità, superando così i metodi esistenti sia nei compiti di rilevamento a livello di log che a livello di entità.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo digitale, i sistemi di sicurezza sono spesso sopraffatti dal volume enorme di dati che devono monitorare. Ogni secondo, i computer generano flussi infiniti di record che dettagliano chi ha avuto accesso a un file, quale programma è stato eseguito o dove è stata effettuata una connessione di rete. Per decenni, i difensori hanno cercato di individuare gli intrusi cercando comportamenti dannosi specifici e noti, come un ladro che scassina una serratura. Tuttavia, è emersa una nuova sorta di minaccia che non assomiglia affatto a un ladro. Si tratta delle Minacce Avanzate e Persistenti, o APT (Advanced Persistent Threats). Invece di un singolo e rumoroso furto, un'APT è un'infiltrazione lenta e silenziosa che si protrae per settimane o mesi. Gli attaccanti nascondono i loro passi malevoli all'interno del rumore normale e noioso delle operazioni quotidiane del computer, rendendo quasi impossibile distinguere tra un aggiornamento di routine di un file e un furto di dati segreti. Per catturare questi nemici furtivi, i ricercatori hanno iniziato a mappare l'intera cronologia dell'attività di un computer in una gigantesca rete di connessioni, nota come grafo di provenienza. In questa rete, ogni utente, file e programma è un punto, e ogni azione che compiono è una linea che li connette. L'obiettivo è trovare i minuscoli e sospetti schemi nascosti all'interno di questa mappa massiccia e complessa.
Per molto tempo, i migliori strumenti per leggere queste mappe si sono basati su una tecnica chiamata apprendimento auto-supervisionato. Immaginate uno studente che cerca di imparare le regole di una lingua leggendo un libro con molte parole coperte. Lo studente deve indovinare le parole mancanti basandosi sul contesto delle frasi circostanti. Se indovina correttamente, sta imparando la struttura della lingua. Nella sicurezza informatica, i ricercatori utilizzano un metodo simile: nascondono parti della mappa dell'attività del computer e chiedono all'IA di ricostruire i pezzi mancanti. Se l'IA è brava in questo, ha imparato come appare il comportamento "normale". Quando incontra una nuova mappa in cui i pezzi mancanti non possono essere ricostruiti perché il modello è errato, segnala quell'evento come un potenziale attacco. Questo approccio è stato efficace, ma presenta un difetto. Il metodo standard per nascondere parti della mappa è casuale; copre le parole senza pensare se siano importanti o meno. In un sistema informatico, alcune azioni sono solo rumore di fondo, come un programma che controlla l'ora, mentre altre sono collegamenti critici in una catena di eventi, come un utente che apre un file specifico prima che venga stabilita una connessione segreta. Coprire casualmente i collegamenti critici lascia l'IA con una storia frammentata, rendendo più difficile apprendere la vera forma di un attacco.
Un team di ricercatori dell'Università Tecnologica di Xi'an ha sviluppato un nuovo modo per insegnare a questi sistemi, un modo che presta attenzione a ciò che conta. Si sono resi conto che non tutte le parti della mappa dell'attività del computer sono uguali. Alcuni nodi, che rappresentano specifici file o programmi, sono centrali per la storia, mentre altri sono solo dettagli minori. Il loro nuovo metodo, chiamato AMH-APT, cambia le regole del gioco. Invece di coprire casualmente parti della mappa, il sistema calcola prima quanto è importante ogni pezzo. Osserva quanti collegamenti ha un pezzo e quanto sono uniche le sue caratteristiche. Se un pezzo è un nodo principale nella rete o ha un comportamento molto distinto, il sistema decide di lasciarlo visibile. Nasconde solo le parti meno importanti e rumorose della mappa. Ciò assicura che, quando l'IA cerca di indovinare le informazioni mancanti, lavori con il contesto più critico disponibile, preservando lo scheletro del percorso dell'attacco anche durante l'addestramento.
I ricercatori hanno affrontato anche un secondo problema: i diversi tipi di elementi sulla mappa. Un sistema informatico contiene utenti, file, connessioni di rete e processi, tutti i quali si comportano diversamente. I metodi precedenti cercavano di comprimere tutti questi diversi tipi in uno spazio unico e uniforme, il che ne sfumava le caratteristiche uniche. Era come cercare di descrivere un'auto, un uccello e un pesce usando un unico insieme di regole per il movimento. Il nuovo approccio assegna a ogni tipo di entità il proprio spazio dedicato per essere compreso. Quando il sistema nasconde un file, lo tratta come un file nascosto, non solo come un oggetto generico nascosto. Questo impedisce all'IA di usare l'etichetta dell'oggetto per indovinarne il contenuto. Mantenendo le identità distinte di utenti, file e reti separate, pur permettendo loro di comunicare tra loro, il sistema costruisce un quadro molto più chiaro di ciò che sta accadendo.
Per testare se questi cambiamenti funzionassero davvero, i ricercatori hanno testato il loro nuovo sistema su cinque diversi set di dati del mondo reale, che vanno da piccoli attacchi simulati a scenari grandi e complessi che coinvolgono migliaia di eventi. Hanno confrontato i loro risultati con il precedente miglior metodo, che si basava sull'occultamento casuale. I risultati sono stati chiari. Il nuovo sistema ha trovato costantemente più attacchi commettendo molti meno errori. In un test specifico che coinvolgeva un grande dataset chiamato CADETS, il vecchio metodo ha erroneamente segnalato quasi 2.900 attività normali come attacchi, causando molti falsi allarmi. Il nuovo sistema ha ridotto quel numero a poco più di 1.100, tagliando i falsi allarmi di oltre la metà pur continuando a catturare i malintenzionati. In un altro test chiamato Wget, la capacità del sistema di identificare correttamente gli attacchi è migliorata significativamente, passando da un tasso di successo di circa il 94,5% a quasi il 98,1%. Questi miglioramenti non erano semplici piccoli aggiustamenti; rappresentavano un cambiamento fondamentale nel modo in cui il sistema impara a distinguere tra il rumore della vita quotidiana e i passi silenziosi di un intruso sofisticato.
Il successo di questo metodo risiede nella sua capacità di bilanciare difficoltà e chiarezza. I ricercatori hanno scoperto che nascondere semplicemente una quantità fissa di dati non era sufficiente. Invece, hanno introdotto un programma che iniziava con compiti più facili, nascondendo meno cose, e aumentava gradualmente la difficoltà man mano che il sistema imparava. Ciò ha permesso all'IA di padroneggiare prima i modelli locali del comportamento normale prima di essere messa alla prova per comprendere le connessioni complesse a lungo raggio che definiscono un attacco. Combinando questa pianificazione attenta con la strategia di proteggere i nodi importanti e rispettare la natura unica dei diversi tipi di dati, il sistema ha imparato a vedere sia la foresta che gli alberi contemporaneamente. Il risultato è uno strumento di rilevamento che è più sensibile ai segni sottili di una violazione e meno propenso a dare falsi allarmi per attività innocue.
Questo lavoro suggerisce che il futuro della cybersicurezza potrebbe dipendere meno dal trovare nuove e complesse regole e più dall'insegnare alle macchine come prestare attenzione alle cose giuste. Comprendendo che non tutti i punti dati sono uguali e che diversi tipi di oggetti digitali richiedono diversi tipi di comprensione, i ricercatori hanno costruito un sistema che è più bravo a individuare l'invisibile. Lo studio non sostiene di aver risolto interamente il problema delle minacce informatiche, ma offre una potente nuova lente attraverso la quale guardare il caos dell'attività digitale. Dimostra che, perfezionando il modo in cui insegniamo alle macchine di imparare dalla propria storia, possiamo renderle più acuminate, più accurate e più affidabili guardiani del nostro mondo digitale. La strada da seguire consiste nel continuare a perfezionare questi metodi, assicurando che possano adattarsi alle tattiche in continua evoluzione di chiunque voglia fare del male, mantenendo al contempo i falsi allarmi abbastanza bassi da permettere ai difensori umani di concentrarsi sulle minacce reali.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.