← Ultimi articoli
💻 computer science

Parser-Free Querying of Security Logs

Il documento introduce Sieve, un sistema che sfrutta modelli linguistici di grandi dimensioni ancorati a un contesto di formato log estratto automaticamente per generare codice eseguibile per query di sicurezza in linguaggio naturale, riducendo significativamente i tassi di errore nell'analisi temporale e trans-evento di log complessi rispetto alla scripting manuale.

Autori originali: Evan Luo, Julien Piet, David Wagner

Pubblicato 2026-05-22
📖 5 min di lettura🧠 Approfondimento

Autori originali: Evan Luo, Julien Piet, David Wagner

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere un detective della sicurezza che cerca di risolvere un crimine. Hai un'enorme pila di prove: milioni di pagine di appunti scritti a mano, ricevute e registri lasciati da persone diverse (server, firewall, account utente). Il problema è che tutti scrivono con una grafia disordinata e incoerente. Una persona scrive le date come "1 gen", un'altra come "01/01" e un'altra ancora scrive semplicemente "lunedì". Alcuni appunti sono su post-it, altri su tovaglioli, e i colori dell'inchiostro variano.

Per risolvere un caso, devi porre domande specifiche come: "Mostrami ogni volta che qualcuno ha cercato di entrare nell'edificio tra le 2 e le 4".

Il vecchio metodo: il bibliotecario sovraccarico

Tradizionalmente, i team di sicurezza cercano di risolvere questo problema assumendo un team di bibliotecari (parser) per leggere ogni singolo appunto, capire lo stile di scrittura e riscrivere tutto in un foglio di calcolo perfetto e uniforme.

  • Il lato positivo: Una volta completato il foglio di calcolo, porre domande è veloce e semplice.
  • Il lato negativo: Costruire il foglio di calcolo richiede un'eternità. Ogni volta che una nuova persona inizia a scrivere appunti in modo leggermente diverso, i bibliotecari devono fermarsi, imparare il nuovo stile e riscrivere le regole. Se appare un nuovo tipo di appunto che nessuno ha mai visto prima, l'intero sistema si blocca finché i bibliotecari non lo riparano.

L'alternativa: il detective grep

L'altra opzione è saltare completamente i bibliotecari. Prendi semplicemente una lente d'ingrandimento (uno strumento come grep) e scansioni tu stesso gli appunti grezzi e disordinati.

  • Il lato positivo: Puoi iniziare immediatamente. Nessuna attesa per i bibliotecari.
  • Il lato negativo: Devi sapere esattamente come appare ogni possibile stile di scrittura. Se ti sfugge una variazione della parola "tentativo di intrusione", perdi l'indizio. Inoltre, porre domande complesse come "Trova le persone che sono entrate da due porte diverse entro 60 secondi" è incredibilmente difficile da fare semplicemente scansionando manualmente righe di testo.

La nuova soluzione: Sieve (il traduttore intelligente)

Il documento introduce Sieve, un sistema che funge da traduttore super-intelligente in grado di scrivere istantaneamente uno strumento personalizzato per te.

Ecco come funziona Sieve, utilizzando una semplice analogia:

  1. La richiesta: Chiedi a Sieve una domanda in inglese semplice: "Trova tutti gli indirizzi IP che hanno tentato di entrare più di 10 volte in una finestra di 5 minuti".
  2. La scansione rapida: Invece di leggere l'intero libro di un milione di pagine, Sieve sfoglia rapidamente le prime pagine per vedere com'è la grafia. Crea un minuscolo "foglio d'imbroglio" dei diversi modi in cui sono scritti gli appunti (ad esempio: "Oh, a volte dicono 'Password non riuscita', a volte dicono 'Errore di autenticazione'").
  3. Lo scrittore di codice: Sieve invia la tua domanda e questo minuscolo foglio d'imbroglio a un'intelligenza artificiale molto intelligente (un Large Language Model). L'IA non legge l'intero libro; usa semplicemente il foglio d'imbroglio per scrivere uno script informatico personalizzato (come un minuscolo programma robotico) specificamente progettato per cercare la tua risposta.
  4. L'esecuzione: Questo script personalizzato viene eseguito sugli appunti grezzi. Poiché è stato scritto dall'IA basandosi sul foglio d'imbroglio, sa esattamente come trovare "Password non riuscita" e "Errore di autenticazione" e come contarli.
  5. Il risultato: Lo script ti fornisce la risposta. Se lo script commette un errore (come un errore di battitura), Sieve rileva l'errore, lo segnala all'IA e le chiede di riscrivere lo script. Riprova fino a quattro volte finché non lo ottiene giusto.

Perché è una grande novità

Il documento ha testato questo approccio su 133 diverse domande di sicurezza relative a 5 tipi diversi di registri. Ecco cosa hanno scoperto:

  • È più intelligente degli umani nei casi difficili: Quando le domande erano semplici (come "trova la parola 'errore'"), Sieve era buono quanto un esperto umano che scriveva uno script rapido. Ma quando le domande erano difficili (come "trova modelli attraverso il tempo e persone diverse"), Sieve ha commesso 3 volte meno errori rispetto agli umani che cercavano di scrivere script da zero.
  • Non ha bisogno di un bibliotecario perfetto in anticipo: Sieve non ha bisogno di un foglio di calcolo preesistente. Funziona direttamente sugli appunti grezzi e disordinati.
  • La semplicità è meglio: Il documento ha scoperto che non serve un'IA costosa e sofisticata per capire prima gli stili di scrittura. Un algoritmo semplice e veloce che conta semplicemente la frequenza di certe frasi funziona tanto bene quanto i metodi complessi.
  • È sicuro e affidabile: L'IA non indovina semplicemente la risposta; scrive codice che viene eseguito come un normale programma informatico. Ciò significa che il risultato è deterministico (la stessa domanda ottiene sempre la stessa risposta) e puoi esaminare il codice per vedere esattamente come ha funzionato.

La conclusione

Sieve colma il divario tra la velocità della ricerca nel testo grezzo e la potenza dei database strutturati. Permette agli analisti di sicurezza di porre domande complesse in inglese semplice e ottenere risposte accurate immediatamente, senza attendere che gli ingegneri costruiscano un nuovo schema di database o lottino per scrivere script complessi da soli. Trasforma il "quaderno disordinato" in un database ricercabile al volo, una domanda alla volta.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →