← Ultimi articoli
💻 computer science

Privacy Preserving Disease Prediction Across Multiple Hospitals Using CKKS Based Homomorphic Federated Learning

Questo articolo propone un framework di apprendimento federato omomorfo basato su CKKS che consente la previsione delle malattie nel rispetto della privacy tra più ospedali, criptando gli aggiornamenti del modello per prevenire attacchi di inferenza sull'appartenenza, sebbene questa sicurezza migliorata comporti il costo di un significativo overhead di comunicazione e una ridotta utilità predittiva rispetto agli approcci in chiaro.

Autori originali: Swatee Nikam, Nilima Kulkarni

Pubblicato 2026-09-18
📖 6 min di lettura🧠 Approfondimento

Autori originali: Swatee Nikam, Nilima Kulkarni

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo moderno della medicina, la capacità di un medico di prevedere la salute futura di un paziente dipende spesso dall'ampiezza dei dati che può visualizzare. Gli algoritmi di apprendimento automatico (machine learning), ovvero i programmi informatici che apprendono dai modelli, stanno diventando strumenti potenti per individuare rischi come le riammissioni ospedaliere o la progressione delle malattie. Tuttavia, questi strumenti sono validi solo quanto le informazioni con cui vengono nutriti. Il problema è che queste informazioni — le cartelle cliniche elettroniche contenenti dettagli sensibili sui pazienti — sono sparse tra migliaia di ospedali, protette da rigide leggi sulla privacy e norme istituzionali. Gli ospedali non possono semplicemente condividere i propri file grezzi con un'autorità centrale per costruire un modello migliore senza violare la fiducia del paziente e le regolamentazioni legali.

Per risolvere questo problema, i ricercatori hanno sviluppato un metodo chiamato apprendimento federato (federated learning). Immaginate un gruppo di chef, ognuno dei quali possiede una ricetta segreta di famiglia. Invece di inviare le loro ricette a una cucina centrale dove potrebbero essere rubate o copiate, concordano di cucinare i loro piatti localmente e inviare solo il sapore finale a un giudice centrale. Il giudice combina questi sapori per creare una ricetta magistrale, che viene poi rispedita agli chef per il loro prossimo tentativo. In questa versione digitale, le "ricette" sono i dati, gli "chef" sono gli ospedali e il "sapore" è l'aggiornamento matematico del modello informatico. I dati grezzi dei pazienti non lasciano mai l'ospedale. Eppure, anche questo metodo presenta un difetto: il "sapore" inviato può talvolta rivelare troppo sugli ingredienti specifici utilizzati, permettendo a un osservatore curioso di indovinare quali pazienti facevano parte del set di addestramento. Per correggere questo aspetto, gli scienziati stanno ora esplorando una tecnica chiamata crittografia omomorfica, che consente di eseguire calcoli su dati che rimangono chiusi in una cassaforte digitale, garantendo che persino la persona che effettua la combinazione non possa vedere i numeri grezzi.

Un team di ricercatori della MIT School of Engineering di Pune, in India, ha recentemente messo alla prova questo concetto in un ambiente simulato progettato per imitare una rete di dieci ospedali. Il loro obiettivo era vedere se fossero in grado di costruire un modello di apprendimento automatico per prevedere se un paziente affetto da diabete sarebbe stato riammesso in ospedale entro trenta giorni, il tutto mantenendo i dati del paziente completamente nascosti e gli aggiornamenti del modello criptati. Hanno utilizzato un tipo specifico di serratura digitale noto come CKKS, che consente calcoli approssimativi su numeri criptati, una caratteristica necessaria perché i dati medici spesso coinvolgono decimali e frazioni piuttosto che semplici numeri interi.

I ricercatori hanno allestito un esperimento virtuale utilizzando un dataset pubblico contenente i record di 130 veri ospedali, che hanno suddiviso in dieci parti separate per rappresentare dieci diverse istituzioni. Ogni ospedale virtuale ha addestrato la propria versione del modello di previsione sui propri dati locali. In uno scenario standard, non criptato, questi ospedali invierebbero i propri aggiornamenti del modello direttamente a un server centrale. In questo nuovo esperimento, tuttavia, gli ospedali hanno prima sigillato i propri aggiornamenti all'interno di una cassaforte digitale utilizzando il metodo CKKS. Il server centrale, agendo come coordinatore "onesto ma curioso", ha ricevuto questi pacchetti sigillati. Ha eseguito i calcoli per mediarli insieme senza mai sbloccare i contributi individuali. Solo dopo che la media è stata completata, il risultato finale è stato inviato a una parte fidata per essere sbloccato e utilizzato per aggiornare il modello globale.

I risultati di questo esperimento hanno rivelato un chiaro e difficile compromesso tra privacy e prestazioni. Quando i ricercatori hanno eseguito lo stesso compito senza crittografia, il sistema è stato incredibilmente efficace, identificando correttamente i rischi di riammissione con un alto grado di precisione. Il modello ha imparato rapidamente e ha prodotto previsioni affidabili. Tuttavia, in questo stato non criptato, il sistema era vulnerabile; un attaccante avrebbe potuto esaminare gli aggiornamenti e indovinare con successo se i dati di un particolare paziente facevano parte dell'addestramento, violando di fatto la promessa di privacy.

Quando i ricercatori hanno attivato la crittografia, la protezione della privacy ha funzionato esattamente come previsto per il percorso di attacco studiato. Il sistema ha ridotto la capacità di un attaccante di indovinare se i dati di un paziente fossero presenti nell'addestramento al livello del caso, raggiungendo un tasso di successo esattamente del cinquanta percento, che è lo stesso che si ottiene lanciando una moneta. Questo risultato è coerente con la protezione contro il protocollo valutato nei confronti di un server onesto ma curioso, sebbene non sia una garanzia di immunità da tutti gli attacchi alla privacy o da tutte le condizioni avversarie. I dati ospedalieri sono rimasti veramente privati e il server centrale non ha visto altro che numeri bloccati.

Tuttavia, questa privacy ha avuto un costo significativo. Il sistema criptato era molto più lento e richiedeva molta più quantità di dati da inviare sulla rete. La dimensione dei pacchetti di dati inviati da ogni ospedale è cresciuta di un fattore di ventiquattro, il che significa che il traffico di comunicazione è passato da circa 3 megabyte a quasi 38 megabyte per ogni round di addestramento. Inoltre, il potere predittivo del modello è diminuito sensibilmente. Mentre il modello non criptato raggiungeva un punteggio elevato nell'identificare correttamente le riammissioni, la versione criptata faticava, con la sua capacità di distinguere tra i pazienti che sarebbero tornati e quelli che non lo sarebbero stati che scendeva a un livello che, pur essendo migliore del caso casuale, era molto meno utile per il processo decisionale clinico. Il modello ha anche impiegato più tempo per stabilizzarsi, mostrando un comportamento più erratico mentre cercava di apprendere dai dati bloccati.

Lo studio conclude che, sebbene sia tecnicamente possibile costruire un sistema che preservi la privacy per la previsione delle malattie in più ospedali utilizzando questo metodo, non si tratta ancora di una soluzione perfetta. La tecnologia riesce a bloccare le specifiche perdite di privacy testate dai ricercatori, ma lo fa rendendo il sistema molto più pesante e meno accurato. I ricercatori hanno scoperto che, per questa specifica configurazione, la perdita di qualità predittiva e il massiccio aumento dei requisiti di trasmissione dei dati sono ostacoli sostanziali. Suggeriscono che, affinché questo approccio sia utile nel mondo reale, il lavoro futuro debba concentrarsi sulla riduzione della dimensione dei dati criptati e sul miglioramento della capacità del modello di apprendere efficacemente nonostante i blocchi digitali. Fino ad allora, la scelta tra un modello altamente accurato che rischia la privacy e un modello perfettamente privato che è meno accurato rimane un difficile equilibrio da affrontare per le istituzioni sanitarie.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →