← Ultimi articoli
💻 computer science

From Telemetry to Techniques: Behavior-Centric MITRE ATTCK Technique Classification Through Sysmon Event Correlation

Questo articolo presenta un framework incentrato sul comportamento per la classificazione delle tecniche MITRE ATT&CK utilizzando la telemetria Sysmon, dimostrando che la correlazione degli eventi basata su GUID, combinata con il modello transformer SecureBERT, supera la correlazione temporale e gli approcci tradizionali di machine learning nell'identificazione delle attività avversarie.

Autori originali: Amir Hossein Hemmati, Babak Sadeghyian, Mahsa Saeidi

Pubblicato 2026-07-29
📖 8 min di lettura🧠 Approfondimento

Autori originali: Amir Hossein Hemmati, Babak Sadeghyian, Mahsa Saeidi

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere un detective che cerca di risolvere un crimine, ma invece di cercare impronte digitali o di scarpe, stai osservando un flusso massiccio e caotico di impronte digitali lasciate da un computer. Questo campo è chiamato cybersecurity, e la "scena del crimine" è il registro interno di un computer. Per molto tempo, i detective hanno cercato di catturare i cattivi cercando "foto segnaletiche" specifiche e note, come un nome di file specifico o l'indirizzo di un hacker noto. Ma gli hacker moderni sono astuti; cambiano continuamente vestiti e maschere, quindi quelle vecchie "foto segnaletiche" spesso falliscono.

Per catturare questi mutaforma, gli scienziati stanno ora provando un approccio diverso: invece di guardare singole impronte, vogliono guardare la storia che le impronte raccontano. Vogliono capire il comportamento dell'intruso. Pensa a questo: se vedi una persona entrare in una banca, poi correre verso una cassaforte, poi rompere una finestra e infine uscire correndo con una borsa, non hai bisogno di conoscere il suo nome per sapere che sta svaligiando la banca. Hai solo bisogno di vedere la sequenza di azioni. Questo articolo esplora come trasformare un mucchio disordinato di log informatici in una storia chiara e leggibile di ciò che un attaccante sta facendo, e poi utilizza programmi informatici intelligenti per capire esattamente che tipo di "trucco" l'attaccante sta mettendo in atto.


Il Nuovo Kit di Attrezzi del Detective Digitale

Nel mondo della sicurezza informatica, esiste un famoso manuale chiamato MITRE ATT&CK. Pensalo come a una gigantesca enciclopedia di tutti i diversi trucchi che gli hacker usano per violare i sistemi. Non si limita a elencare i "cattivi"; categorizza le loro mosse specifiche, come "rubare password", "nascondere file" o "muoversi lateralmente verso altri computer". L'obiettivo di questa ricerca era costruire un sistema in grado di guardare i log delle attività grezze di un computer e dire: "Ah, vedo cosa sta succedendo qui; questo è il trucco del 'Credential Dumping'", oppure "Questo è il trucco del 'Lateral Movement'".

I ricercatori hanno utilizzato uno strumento speciale chiamato Sysmon. Immagina Sysmon come una telecamera di sicurezza super-osservatrice all'interno di un computer che non batte mai ciglio. Registra tutto: ogni programma che parte, ogni file che viene creato, ogni connessione effettuata su Internet e ogni modifica apportata alle impostazioni del sistema. Ma ecco il problema: Sysmon registra tutto, e lo fa in un modo incredibilmente rumoroso e disordinato. È come avere una telecamera di sicurezza che registra ogni battito di ciglia, ogni respiro e ogni passo di ogni persona in una città, ma che non ti dice chi sta camminando con chi o in quale ordine. Se guardi solo un battito di ciglia, non impari nulla. Devi vedere l'intero film.

La Grande Domanda: Come Possiamo Unire i Punti?

I ricercatori si sono posti una domanda semplice ma cruciale: In quale modo possiamo collegare al meglio queste impronte digitali sparse per raccontare una storia coerente?

Hanno testato due modi principali per collegare gli eventi tra loro:

  1. Il Metodo "Chi è il tuo Genitore?" (basato su GUID): In un computer, ogni programma ha un numero ID unico. Quando un programma avvia un altro programma, è come se un genitore avesse un figlio. I ricercatori hanno cercato di collegare gli eventi seguendo questi "alberi genealogici". Se il Programma A ha avviato il Programma B, e il Programma B ha aperto un file, hanno collegato quegli eventi perché appartengono alla stessa "famiglia". Questo è come tracciare una banda criminale seguendo il suo albero genealogico, indipendentemente dall'ora del giorno in cui agiscono.
  2. Il Metodo "Cosa è Successo Prima?" (basato sul tempo): Questo metodo collega gli eventi semplicemente per tempo. Se due cose sono accadute entro un secondo l'una dall'altra, i ricercatori hanno assunto che fossero correlate. È come dire: "Queste due persone erano nella stessa stanza nello stesso momento, quindi devono lavorare insieme".

L'Esperimento: Insegnare ai Computer a Leggere la Storia

Per testare questi metodi, i ricercatori non hanno aspettato che veri hacker violassero una vera banca. Invece, hanno allestito un laboratorio sicuro e controllato e hanno usato uno strumento chiamato Atomic Red Team per simulare attacchi. Hanno messo in scena specifici trucchi dal manuale MITRE ATT&CK, generando migliaia di log di Sysmon che sembravano esattamente un attacco reale.

Hanno poi inserito questi log in due tipi di computer "studenti":

  • Gli Studenti Tradizionali: Questi erano modelli classici di machine learning (come Random Forest e LightGBM). Sono bravi a individuare schemi, ma hanno bisogno che i dati siano prima molto puliti e organizzati.
  • I Super-Lettori: Questi erano modelli di IA avanzati chiamati Transformer (specificamente SecBERT e SecureBERT). Sono come computer che hanno letto l'intero internet e sono esperti nel comprendere il significato e il contesto di parole e sequenze. Possono leggere una frase e comprendere la storia che c'è dietro.

I ricercatori hanno anche dovuto affrontare un problema complicato: l'Imbalance di Classe (Class Imbalance). Nei loro dati, alcuni trucchi (come "System Binary Proxy Execution") accadevano centinaia di volte, mentre altri (come "Subvert Trust Controls") accadevano solo poche volte. È come una classe dove il 90% degli studenti si chiama "John" e solo uno si chiama "Zoe". Se addestri un insegnante a indovinare i nomi, indovinerà "John" ogni volta e otterrà un punteggio alto, ma non imparerà mai chi è Zoe. I ricercatori hanno provato diversi modi per risolvere questo problema, come creare esempi extra dei trucchi rari (una tecnica chiamata SMOTE) o insegnare al computer a prestare un'attenzione extra ai casi rari (usando una matematica speciale chiamata "Focal Loss").

I Risultati: Gli Alberi Genealogici Vincono, e Meno è Meglio

Dopo aver eseguito centinaia di simulazioni, i risultati sono stati chiari e sorprendenti.

1. Il Metodo "Albero Genealogico" è Superiore
La correlazione basata su GUID (seguendo l'albero genealogico dei processi) ha costantemente battuto la correlazione temporale (guardando solo il tempo).

  • Perché? Il documento suggerisce che il semplice fatto di essere vicini nel tempo non è sufficiente per provare che due eventi siano correlati. Un computer potrebbe fare un milione di cose non correlate in un secondo. Ma se il Programma A ha avviato il Programma B, quello è un legame duro e incrollabile. Il metodo dell' "albero genealogico" ha preservato le vere relazioni tra gli eventi, fornendo all'IA una storia molto più chiara da leggere.
  • Il Punteggio: Il miglior modello utilizzando il metodo dell' "albero genealogico" (SecureBERT) ha raggiunto un'accuratezza di 0,586 (il che significa che ha dato la risposta corretta circa il 58,6% delle volte). Il miglior modello usando il metodo del "tempo" ha raggiunto solo lo 0,504.

2. I "Super-Lettori" Battono gli "Studenti Tradizionali"
I modelli di IA avanzati (SecureBERT) hanno costantemente superato i modelli tradizionali di machine learning.

  • Il Punteggio: SecureBERT con il metodo dell' "albero genealogico" ha ottenuto un'accuratezza di 0,586. Il miglior modello tradizionale (LightGBM) ha ottenuto solo lo 0,501.
  • Perché? I "Super-Lettori" erano più bravi a comprendere il contesto complesso della storia. Potevano vedere che una specifica sequenza di eventi significava "hacking", anche se le singole parti sembravano innocue da sole.

3. Il Colpo di Scena Sorprendente: Non Sovra-Insegnare l'IA
I ricercatori si aspettavano che correggere l' "Imbalance di Classe" (il problema dei trucchi rari) avrebbe aiutato l'IA a imparare meglio. Hanno provato a creare esempi extra (SMOTE) per i modelli tradizionali, e ha funzionato bene.

  • Tuttavia, per i "Super-Lettori" avanzati (SecureBERT), non fare nulla era in realtà la strategia migliore.
  • Quando hanno cercato di costringere l'IA a prestare un'attenzione extra ai trucchi rari usando una matematica speciale (Focal Loss), le prestazioni complessive dell'IA sono diminuite.
  • La Scoperta: Il modello base (l'IA standard senza trucchi speciali per correggere l'imbalance) ha ottenuto l'accuratezza più alta (0,586) e il miglior equilibrio complessivo. Il documento suggerisce che le storie complesse e correlate generate dal metodo dell' "albero genealogico" erano così ricche e significative che l'IA poteva imparare i trucchi rari naturalmente senza bisogno di essere forzata o "sovra-corretta".

Cosa Significa per il Futuro

Questo articolo non sostiene di aver risolto tutta la cybersecurity. Non dice che gli hacker sono ora catturati il 100% delle volte. Invece, suggerisce che il modo in cui organizziamo i dati conta più del programma informatico specifico che usiamo per leggerli.

Collegando gli eventi attraverso i loro "alberi genealogici" (relazioni tra processi) anziché solo tramite i loro timestamp, creiamo una storia molto più ricca e accurata di ciò che un attaccante sta facendo. E quando forniamo queste storie ricche ai modelli di IA avanzati, possono imparare a riconoscere i trucchi degli hacker meglio che mai, anche senza bisogno di essere artificialmente spinti a prestare attenzione a quelli rari.

Lo studio evidenzia anche un limite: questi risultati sono stati riscontrati in un laboratorio controllato utilizzando attacchi simulati. I ricercatori ammettono che gli ambienti informatici reali sono più disordinati e complessi. Pertanto, sebbene questa sia una nuova direzione promettente, il passo successivo è vedere se queste storie dell' "albero genealogico" reggono quando il computer è effettivamente utilizzato da persone reali in un vero ufficio, non solo in un laboratorio di test.

In breve, l'articolo ci insegna che per catturare un ladro digitale, non dovresti solo guardare l'orologio; dovresti guardare con chi sta camminando. E a volte, il computer più intelligente è quello che è lasciato imparare al proprio ritmo, senza troppe interferenze.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →