← Ultimi articoli
💻 computer science

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

Questo documento introduce TorchSight, un sistema locale open-source che utilizza un modello Qwen 3.5 27B fine-tuned addestrato su oltre 78.000 campioni, il quale raggiunge una precisione significativamente superiore (95,0%) nella classificazione di documenti di sicurezza rispetto alle alternative commerciali basate su cloud, garantendo al contempo che i dati rimangano sotto controllo locale.

Autori originali: Ivan Dobrovolskyi

Pubblicato 2026-05-21
📖 5 min di lettura🧠 Approfondimento

Autori originali: Ivan Dobrovolskyi

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Grande Problema: La "Nuvola" contro la "Stanza Sicura"

Immagina di lavorare per una banca o un ospedale. Hai migliaia di documenti e devi trovare quelli che contengono password segrete, numeri di carte di credito o piani militari classificati.

Attualmente, le aziende hanno due modi principali per farlo:

  1. Il Metodo del "Manuale di Regole": Usano un programma informatico che cerca schemi specifici, come una stringa di numeri che assomiglia a un numero di carta di credito. È veloce, ma è stupido. Se scrivi una storia su un numero di carta di credito finto in un tutorial, il programma urla "ALLARME!" anche se è sicuro. Si perde cose che non assomigliano a schemi ma sono comunque pericolose.
  2. Il Metodo della "Nuvola": Inviano tutti i loro documenti a un'intelligenza artificiale gigante e intelligente nella nuvola (come un assistente super-intelligente in una grande azienda tecnologica) per leggerli. Questa AI è molto intelligente e comprende il contesto. Ma, per usarla, devi spedire i tuoi documenti segreti fuori dal tuo edificio verso quello di qualcun altro. Per una banca o per l'esercito, questo è un enorme rischio. Non possono permettere che i loro segreti lascino l'edificio.

La Soluzione del Documento: L'autore ha costruito un sistema chiamato TorchSight. È come assumere una guardia di sicurezza super-intelligente che vive dentro il tuo edificio. Questa guardia è abbastanza intelligente da comprendere il contesto (a differenza del manuale di regole) ma non lascia mai l'edificio (a differenza del servizio in nuvola).

La "Guardia" (Il Modello AI)

L'autore ha preso un cervello AI molto grande e pre-addestrato (chiamato Qwen 3.5) e gli ha dato un speciale "campo di addestramento".

  • L'Addestramento: Non gli hanno mostrato solo documenti casuali. Gli hanno somministrato 78.358 esempi di documenti. Alcuni erano fughe reali, altri erano esempi falsi creati da un'altra AI, e altri ancora erano "trappole" ingannevoli (documenti che sembrano pericolosi ma sono in realtà sicuri, o viceversa).
  • Il Risultato: Questo ha creato una versione specializzata dell'AI chiamata Beam. Ha imparato a distinguere tra un segreto reale e un esempio innocuo, qualcosa con cui il "Manuale di Regole" e persino le AI della "Nuvola" faticavano.

Il Grande Test: Chi è la Migliore Guardia?

L'autore ha messo la nuova guardia Beam contro le migliori guardie della "Nuvola" (come GPT-5, Claude e Gemini) e le vecchie guardie del "Manuale di Regole". Loro hanno dato a tutte le stesse 1.000 documenti da ordinare.

I Risultati:

  • Le Guardie della Nuvola: Hanno avuto ragione circa il 75% - 80%. Erano nella media, ma hanno commesso molti errori.
  • Il Manuale di Regole: Ha avuto ragione solo circa il 53%. Era troppo facilmente confuso.
  • La Guardia Beam (Locale): Ha avuto ragione il 95%.

Il Problema dei "Falsi Allarmi":
La parte più importante di un sistema di sicurezza non è solo catturare i cattivi, ma non urlare "Fuoco!" quando qualcuno sta solo tenendo una candela.

  • Quando le guardie della Nuvola guardavano documenti sicuri (come una ricetta di cucina o un articolo di notizie pubblico), spesso andavano in panico. Pensavano che il 22% - 63% dei documenti sicuri fosse pericoloso. Questo renderebbe folle un team di sicurezza perché dovrebbero controllare ogni singolo file sicuro.
  • Beam ha andato in panico solo sul 2% dei documenti sicuri. Sapeva distinguere una minaccia reale da un file innocuo molto meglio degli altri.

Perché Beam Era Così Brava?

Il documento spiega che l'ingrediente segreto non era solo la dimensione dell'AI, ma come è stata insegnata.

  • L'autore ha creato un insieme specifico di "regole" (una tassonomia) con 51 diversi tipi di segreti (come "Cartelle Cliniche", "Piani Militari", "Password").
  • Le AI della Nuvola erano state istruite a "trovare segreti", ma si inventavano le proprie categorie o si confondevano.
  • Beam è stata affinata per seguire rigorosamente le 51 categorie. Ha imparato a parlare la stessa lingua del team di sicurezza. Era come insegnare a un cane a sedersi, rimanere fermo e recuperare oggetti specifici, piuttosto che dirgli semplicemente "sii buono".

Il Test del "Mondo Esterno"

Per assicurarsi che Beam non stesse solo memorizzando il test di pratica, l'autore l'ha testata su un insieme completamente diverso di 500 documenti che non aveva mai visto prima (come vere email di phishing e cartelle cliniche da database pubblici).

  • Beam ha ancora ottenuto il 93,8%.
  • Le AI della Nuvola sono crollate significativamente, con alcune che hanno ottenuto punteggi bassi come il 65%.
  • Questo dimostra che Beam ha effettivamente imparato il concetto di sicurezza, non solo le risposte specifiche al test di pratica.

La Conclusione

Il documento mostra che non è necessario inviare i tuoi segreti alla nuvola per ottenere un'AI intelligente che li protegga. Addestrando un'AI locale su un enorme dataset attentamente curato, puoi ottenere un sistema che è:

  1. Più Preciso: Trova più minacce reali.
  2. Meno Fastidioso: Fa molti meno falsi allarmi sui file sicuri.
  3. Privato: I documenti non lasciano mai il tuo computer.

L'autore ha reso disponibile l'intero sistema (il codice, i dati di addestramento e il modello AI) gratuitamente in modo che chiunque possa usarlo per costruire la propria guardia di sicurezza della "Stanza Sicura".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →