Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies
Questo articolo propone una metodologia innovativa che combina i Large Language Models con ontologie di dominio e vincoli SHACL per creare un agente AI che migliora significativamente l'accuratezza e la spiegabilità dell'estrazione di informazioni strutturate e semanticamente valide dai log di cybersecurity, in particolare per i dati degli honeypot.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di essere un detective che cerca di risolvere un crimine, ma invece di rapporti di polizia chiari, ti vengono consegnate migliaia di pagine di appunti disordinati, scarabocchi e frasi a metà. È così che gli esperti di cybersecurity si trovano ad affrontare quando cercano di leggere i log di sistema. Questi log sono i "diari" dei computer, che registrano ogni azione intrapresa, ma sono spesso non strutturati, confusi e pieni di gergo tecnico.
Questo articolo presenta un nuovo strumento chiamato OntoLogX per aiutare i detective (gli analisti di cybersecurity) a dare un senso a questo caos. Ecco come funziona, scomposto in concetti semplici:
1. Il Problema: La "Stanza Disordinata"
I metodi tradizionali per leggere questi log sono come cercare un giocattolo specifico in una stanza disordinata usando solo una torcia e un elenco fisso di regole. Se il giocattolo è nascosto sotto un mucchio di vestiti o etichettato con un nome strano, la torcia non lo individua.
- Il Problema: I computer generano log non strutturati e ambigui. I vecchi metodi faticano a individuare in modo affidabile i "cattivi" (eventi malevoli).
- Il Nuovo Strumento: Gli autori utilizzano i Large Language Models (LLM). Immagina un LLM come un stagista super-intelligente che ha letto quasi tutto su internet e può comprendere il linguaggio naturale. Tuttavia, questo stagista può essere un po' "sognante": a volte inventa cose o sbaglia leggermente i fatti perché non è strettamente vincolato da regole.
2. La Soluzione: L'"Architetto" e l'"Ispettore"
Per correggere la tendenza dello stagista a sognare, gli autori hanno costruito un sistema chiamato OntoLogX che aggiunge due livelli di controllo cruciali:
- L'Architetto (L'Ontologia): Prima che lo stagista inizi a scrivere, il sistema gli fornisce una pianta rigorosa chiamata Ontologia. È come un set specifico di mattoncini e un regolamento. Dice: "Puoi costruire una casa solo usando questi mattoni specifici (classi) e devi collegarli in questo modo specifico (relazioni)". Costringe l'IA a organizzare i dati disordinati dei log in un formato ordinato e strutturato chiamato Grafo della Conoscenza.
- L'Ispettore (Validazione SHACL): Una volta che lo stagista ha costruito la struttura, un ispettore rigoroso (utilizzando uno strumento chiamato SHACL) verifica il lavoro. L'ispettore chiede: "Hai usato i mattoni giusti? Hai collegato il tetto alle pareti correttamente? C'è una porta mancante?"
- Se l'edificio è sbagliato, l'ispettore lo rimanda allo stagista con un appunto: "Ripara questo".
- Lo stagista riprova. Questo ciclo continua finché l'edificio non è perfetto.
3. Il Processo: Imparare dagli Esempi
Il sistema non si limita a chiedere allo stagista di indovinare. Utilizza un trucco intelligente chiamato Retrieval Augmented Generation.
- Immagina che lo stagista abbia una biblioteca di casi passati di successo. Quando arriva un nuovo log disordinato, il sistema individua i casi passati più simili (esempi) e li mostra allo stagista.
- Dice: "Guarda come abbiamo risolto questo puzzle simile prima. Usa quello stesso stile per risolvere questo nuovo."
- Questo aiuta lo stagista a capire esattamente cosa vuole l'"Architetto" (l'Ontologia), portando a risultati molto migliori.
4. I Risultati: Maggiore Accuratezza, Non Velocità
Gli autori hanno testato questo sistema contro il "vecchio modo" (chiedere semplicemente allo stagista di scrivere senza l'Architetto o l'Ispettore).
- L'Esito: Il nuovo metodo è stato significativamente più accurato. Ha individuato più "cattivi" (maggiore Recall) e ha commesso meno errori (maggiore Precision).
- Il Compromesso: L'articolo afferma esplicitamente che hanno dato priorità alla qualità rispetto alla velocità. Il nuovo metodo richiede un po' più di tempo perché deve verificare il lavoro, ricevere feedback e riprovare. Ma il risultato finale è una mappa delle minacce informatiche molto più affidabile e degna di fiducia.
- Il Vincitore: Tra i diversi modelli di IA testati, Claude 3.5 Sonnet ha ottenuto i risultati migliori, sebbene anche i modelli open-source come Llama 3.3 abbiano ottenuto risultati molto buoni.
Analogia di Sintesi
Se leggere i log di cybersecurity è come cercare di tradurre un diario caotico e scritto a mano in un documento legale formale:
- Metodo Vecchio: Chiedi a un traduttore intelligente di "fare del suo meglio". Potrebbe cogliere il significato, ma il formato sarà disordinato e incoerente.
- OntoLogX: Dai al traduttore un modello legale rigoroso (Ontologia), gli mostri esempi di documenti legali perfetti (esempi few-shot) e fai revisionare ogni bozza da un avvocato rigoroso (SHACL). Se la bozza non è perfetta, l'avvocato la rimanda per le correzioni. Il risultato è un documento legale impeccabile ogni volta, anche se richiede un po' più di tempo per essere prodotto.
Punto Chiave: Questo articolo dimostra che combinare un "IA intelligente" con "regole rigorose" e "controlli di qualità" crea un sistema molto più affidabile per trasformare i log informatici disordinati in intelligence chiara e azionabile sulle minacce informatiche.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.