← Últimos artigos
💻 computer science

Privacy Preserving Disease Prediction Across Multiple Hospitals Using CKKS Based Homomorphic Federated Learning

Este artigo propõe um framework de aprendizado federado homomórfico baseado em CKKS que possibilita a predição de doenças com preservação de privacidade entre múltiplos hospitais ao criptografar as atualizações do modelo para prevenir ataques de inferência de pertinência, embora essa segurança aprimorada venha ao custo de uma sobrecarga de comunicação significativa e utilidade preditiva reduzida em comparação com abordagens em texto simples.

Autores originais: Swatee Nikam, Nilima Kulkarni

Publicado 2026-09-18
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Swatee Nikam, Nilima Kulkarni

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo moderno da medicina, a capacidade de um médico de prever a saúde futura de um paciente depende frequentemente da amplitude de dados que ele consegue visualizar. Algoritmos de aprendizado de máquina, os programas de computador que aprendem a partir de padrões, estão se tornando ferramentas poderosas para identificar riscos como readmissões hospitalares ou a progressão de doenças. No entanto, essas ferramentas são tão boas quanto a informação que lhes é fornecida. O problema é que essa informação — registros eletrônicos de saúde contendo detalhes sensíveis sobre pacientes — está espalhada por milhares de hospitais, trancada por leis de privacidade rigorosas e regras institucionais. Os hospitais não podem simplesmente compartilhar seus arquivos brutos de pacientes com uma autoridade central para construir um modelo melhor sem violar a confiança do paciente e as regulamentações legais.

Para resolver isso, pesquisadores desenvolveram um método chamado aprendizado federado. Imagine um grupo de chefs que cada um possui uma receita de família secreta. Em vez de enviarem suas receitas para uma cozinha central onde poderiam ser roubadas ou copiadas, eles concordam em cozinhar seus pratos localmente e enviar apenas o sabor final para um juiz central. O juiz combina esses sabores para criar uma receita mestre, que é então enviada de volta aos chefs para sua próxima tentativa. Nesta versão digital, as "receitas" são os dados, os "chefs" são os hospitais e o "sabor" é a atualização matemática do modelo de computador. Os dados brutos dos pacientes nunca deixam o hospital. No entanto, mesmo este método tem uma falha: o "sabor" enviado de volta pode, às vezes, revelar demais sobre os ingredientes específicos utilizados, permitindo que um observador curioso adivinhe quais pacientes estavam no conjunto de treinamento. Para corrigir isso, cientistas estão agora explorando uma técnica chamada criptografia homomórfica, que permite que cálculos sejam realizados em dados que permanecem trancados em um cofre digital, garantindo que mesmo a pessoa que faz a combinação não consiga ver os números brutos.

Uma equipe de pesquisadores da Escola de Engenharia do MIT em Pune, Índia, testou recentemente este conceito em um ambiente simulado projetado para imitar uma rede de dez hospitais. O objetivo deles era ver se consegiam construir um modelo de aprendizado de máquina para prever se um paciente com diabetes seria readmitido no hospital dentro de trinta dias, mantendo todos os dados do paciente completamente ocultos e as atualizações do modelo criptografadas. Eles utilizaram um tipo específico de trava digital conhecido como CKKS, que permite matemática aproximada em números criptografados, uma característica necessária porque os dados médicos frequentemente envolvem decimais e frações, em vez de apenas números inteiros.

Os pesquisadores configuraram um experimento virtual usando um conjunto de dados público contendo registros de 130 hospitais reais, o qual dividiram em dez partes separadas para representar dez instituições diferentes. Cada hospital virtual treinou sua própria versão do modelo de previsão em seus dados locais. Em um cenário padrão, não criptografado, esses hospitais enviariam suas atualizações de modelo diretamente para um servidor central. Neste novo experimento, porém, os hospitais primeiro trancaram suas atualizações dentro de um cofre digital usando o método CKKS. O servidor central, atuando como um coordenador honesto-mas-curioso, recebeu esses pacotes trancados. Ele realizou a matemática para calculá-los em média sem nunca destravar as contribuições individuais. Somente após a conclusão da média é que o resultado final foi enviado de volta a uma parte confiável para ser destravado e usado para atualizar o modelo global.

Os resultados deste experimento revelaram um compromisso claro e difícil entre privacidade e desempenho. Quando os pesquisadores realizaram a mesma tarefa sem criptografia, o sistema foi incrivelmente eficaz, identificando corretamente os riscos de readmissão com um alto grau de precisão. O modelo aprendeu rapidamente e produziu previsões confiáveis. No entanto, neste estado não criptografado, o sistema estava vulnerável; um invasor poderia observar as atualizações e identificar com sucesso se os dados de um paciente específico faziam parte do treinamento, efetivamente quebrando a promessa de privacidade.

Quando os pesquisadores ativaram a criptografia, a proteção de privacidade funcionou exatamente como pretendido para a via de ataque específica estudada. O sistema reduziu a capacidade de um invasor de adivinhar se os dados de um paciente estavam no treinamento ao nível do acaso, alcançando uma taxa de sucesso de exatamente cinquenta por cento, que é o mesmo que jogar uma moeda. Este achado é consistente com a proteção do protocolo avaliado contra um servidor honesto-mas-curioso, embora não seja uma garantia de imunidade contra todos os ataques de privacidade ou todas as condições adversas. Os dados hospitalares permaneceram verdadeiramente privados, e o servidor central não viu nada além de números trancados.

Contudo, essa privacidade veio com um custo significativo. O sistema criptografado foi muito mais lento e exigiu muito mais dados para serem enviados pela rede. O tamanho dos pacotes de dados enviados de cada hospital cresceu por um fator de vinte e quatro, o que significa que o tráfego de comunicação saltou de cerca de 3 megabytes para quase 38 megabytes para cada rodada de treinamento. Além disso, o poder preditivo do modelo caiu visivelmente. Enquanto o modelo não criptografado alcançou uma pontuação alta para identificar corretamente as readmissões, a versão criptografada teve dificuldades, com sua capacidade de distinguir entre pacientes que retornariam e os que não retornariam caindo para um nível que, embora fosse melhor do que o acaso, era muito menos útil para a tomada de decisão clínica. O modelo também levou mais tempo para estabilizar, mostrando um comportamento mais errático enquanto tentava aprender com os dados trancados.

O estudo conclui que, embora seja tecnicamente possível construir um sistema de preservação de privacidade para a previsão de doenças em múltiplos hospitais usando este método, ele ainda não é uma solução perfeita. A tecnologia interrompeu com sucesso os vazamentos de privacidade específicos que os pesquisadores testaram, mas o faz tornando o sistema muito mais pesado e menos preciso. Os pesquisadores descobriram que, para esta configuração específica, a perda na qualidade preditiva e o aumento massivo nos requisitos de transmissão de dados são obstáculos substanciais. Eles sugerem que, para que esta abordagem seja útil no mundo real, o trabalho futuro deve focar em reduzir o tamanho dos dados criptografados e melhorar a capacidade do modelo de aprender efetivamente, apesar das travas digitais. Até lá, a escolha entre um modelo altamente preciso que arrisca a privacidade e um modelo perfeitamente privado que é menos preciso continua sendo um equilíbrio difícil para as instituições de saúde estabelecerem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →