SOC Copilot: A Complete, Lightweight, and Explainable Multi-Model Anomaly Detection Engine for Security Log Analysis
Questo articolo introduce SOC Copilot, un motore di rilevamento delle anomalie multi-modello, leggero, non supervisionato e basato esclusivamente su CPU, che fonde una Isolation Forest migliorata e un Deep Autoencoder con la spiegabilità basata su SHAP per raggiungere un'accuratezza del 99,84% nell'analisi dei log di sicurezza HDFS senza richiedere dati etichettati o infrastrutture GPU.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Ogni giorno, i sistemi informatici moderni generano un volume sbalorditivo di record digitali noti come log. Questi sono note automatiche che le macchine scrivono sulle proprie attività, tracciando tutto, da un utente che effettua l'accesso al movimento di un file attraverso una rete. In una grande organizzazione, questi log si accumulano per milioni, creando un flusso massiccio e caotico di informazioni. I team di sicurezza, noti come Security Operations Centers, hanno il compito di sorvegliare questo flusso per individuare segni di problemi. Il problema è che il volume è troppo elevato per essere letto dagli esseri umani, e il vecchio modo di cercare problemi — controllare modelli specifici e noti di comportamenti dannosi — fallisce quando gli attaccanti utilizzano metodi nuovi e mai visti prima. Quando i sistemi sono sopraffatti, o perdono minacce reali o fanno scattare l'allarme per eventi innocui, lasciando gli analisti esausti e confusi. L'obiettivo della moderna ricerca sulla sicurezza è costruire un sistema in grado di setacciare automaticamente questo rumore, trovare gli eventi rari e insoliti che segnalano un attacco e spiegare esattamente perché li ha trovati, il tutto senza la necessità di hardware costoso e specializzato o di un team di esperti per etichettare ogni singolo esempio di crimine.
Un team di ricercatori ha costruito uno strumento chiamato SOC Copilot per risolvere questo specifico problema. Hanno creato un sistema completo che gira su processori informatici standard, il che significa che non richiede le enormi e dispendiose schede grafiche che molti strumenti avanzati di intelligenza artificiale necessitano. Invece di fare affidamento su un database di attacchi noti, il loro sistema impara come appare il comportamento "normale" e segnala qualsiasi cosa si discosti da tale modello. I ricercatori hanno testato il loro motore su un dataset massiccio di oltre undici milioni di righe di log da un Hadoop Distributed File System, una tecnologia comune per l'archiviazione di enormi quantità di dati. Hanno elaborato questi dati in un formato gestibile, raggruppando gli eventi correlati in blocchi e trasformandoli in un elenco di cinquantotto diverse caratteristiche, come quante volte è apparso un tipo specifico di messaggio o quanto è durata una sequenza di eventi.
Il nucleo del loro sistema utilizza due metodi diversi per cercare problemi, lavorando insieme come due esperti con diverse specializzazioni. Il primo metodo è uno strumento statistico che cerca gli outlier, identificando punti dati che si trovano lontani dalla massa. Il secondo metodo è una rete neurale, un tipo di programma informatico progettato per imparare come comprimere le informazioni e poi ricostruirle. Se il programma incontra un modello che non ha mai incontrato prima, fatica a ricostruirlo, e questa difficoltà diventa un segnale che qualcosa non va. I ricercatori hanno addestrato entrambi i metodi solo su esempi di comportamento normale e sicuro. Non hanno mostrato loro alcun esempio di attacchi durante la fase di apprendimento, il che permette al sistema di rilevare nuovi tipi di minacce mai visti prima.
Per rendere il sistema affidabile, i ricercatori non si sono limitati a lasciare che i due metodi votassero su una decisione. Hanno prima regolato i punteggi di ciascun metodo in modo che potessero essere confrontati equamente, e poi li hanno combinati utilizzando una specifica strategia di ponderazione determinata testando su un set di dati separato. Il risultato finale è un punteggio singolo che indica quanto un blocco di log sia sospetto. Se il punteggio supera una certa soglia, il sistema lo segnala come un'anomalia. Fondamentalmente, il sistema non dice solo "questo è male". Esso fornisce una spiegazione dettagliata della sua decisione, evidenziando esattamente quali caratteristiche della voce di log hanno causato l'allarme. Assegna anche un livello di gravità, che va da basso a critico, aiutando gli analisti umani a decidere quali avvisi investigare per primi.
Quando il team ha testato il loro sistema finale su un set di dati che non aveva mai visto prima, i risultati sono stati straordinariamente precisi. Su più di sessantaquattromila blocchi di log, il sistema ha identificato correttamente quasi ogni singola anomalia, mancandone solo una. Ha anche mantenuto molto bassi i falsi allarmi, segnalando solo una minima frazione di attività normale come sospetta. La combinazione dei due metodi si è rivelata più forte di ciascuno dei due presi singolarmente. Sebbene la rete neurale fosse il miglior rilevatore individuale, il metodo statistico ha colto un piccolo numero di minacce che la rete aveva mancato. Fondendo insieme questi due approcci, il sistema ha raggiunto un livello di accuratezza che è raro in questo campo, raggiungendo quasi il novantanove per cento in tutte le principali misure di prestazione.
I ricercatori hanno anche costruito una dashboard visiva che consente agli analisti umani di interagire con il sistema. Questa interfaccia visualizza gli avvisi, i punteggi di gravità e le spiegazioni del perché ogni avviso è stato sollevato. Mostra i modelli di log specifici che hanno attivato l'allarme e le caratteristiche che hanno maggiormente contribuito alla decisione. Questa trasparenza è vitale perché permette a un essere umano di fidarsi del giudizio della macchina e comprendere il contesto della minaccia. L'intero sistema è stato costruito per essere leggero e spiegabile, affrontando le comuni lamentele secondo cui gli strumenti di sicurezza potenti siano troppo costosi da eseguire o troppo opachi da comprendere.
Lo studio conferma che è possibile costruire un motore di sicurezza altamente efficace senza fare affidamento su enormi potenze di calcolo o enormi dataset etichettati di attacchi noti. Concentrandosi sull'apprendimento non supervisionato, dove il sistema impara la forma del comportamento normale, e combinando molteplici metodi di rilevamento, il team ha creato uno strumento che è allo stesso tempo accurato e comprensibile. Hanno dimostrato che un sistema può essere addestrato su dati normali, calibrato con cura e distribuito per catturare quasi ogni anomalia in un enorme flusso di log. Il lavoro non pretende di risolvere ogni problema di sicurezza e riconosce che attualmente funziona meglio su questo specifico tipo di dati di log. Tuttavia, fornisce un esempio chiaro e funzionante di come passare dal controllo reattivo delle regole al rilevamento proattivo e intelligente delle anomalie, che può essere compreso e affidato alle persone che hanno bisogno di utilizzarlo.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.