← 최신 논문
💻 computer science

Privacy Preserving Disease Prediction Across Multiple Hospitals Using CKKS Based Homomorphic Federated Learning

이 논문은 멤버십 추론 공격을 방지하기 위해 모델 업데이트를 암호화함으로써 여러 병원 간의 프라이버시 보존형 질병 예측을 가능하게 하는 CKKS 기반의 동형 암호 연합 학습 프레케임워크를 제안하지만, 이러한 강화된 보안은 평문 방식에 비해 상당한 통신 오버헤드와 감소된 예측 효용이라는 비용을 수반한다.

원저자: Swatee Nikam, Nilima Kulkarni

게시일 2026-09-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Swatee Nikam, Nilima Kulkarni

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 의학의 세계에서 환자의 미래 건강을 예측하는 의사의 능력은 종종 그들이 볼 수 있는 데이터의 폭에 달려 있습니다. 패턴으로부터 학습하는 컴퓨터 프로그램인 머신러닝 알고리즘은 재입원이나 질병 진행과 같은 위험을 포착하는 강력한 도구가 되고 있습니다. 그러나 이러한 도구는 입력되는 정보만큼만 유능합니다. 문제는 환자에 대한 민감한 세부 정보를 포함하는 전자 건강 기록과 같은 이 정보가 엄격한 개인정보 보호법과 기관 규정에 의해 격리되어 수천 개의 병원에 흩어져 있다는 점입니다. 병원들은 환자의 신뢰를 저버리거나 법적 규정을 위반하지 않고는 더 나은 모델을 구축하기 위해 자신들의 가공되지 않은 환자 파일을 중앙 기관과 단순히 공유할 수 없습니다.

이를 해결하기 위해 연구자들은 연합 학습(federated learning)이라고 불리는 방법을 개발했습니다. 각자 자신만의 비밀 가족 레시피를 가진 요리사 그룹을 상상해 보십시오. 레시피가 도난당하거나 복제될까 봐 중앙 주방으로 레시피를 보내는 대신, 그들은 각자 현지에서 음식을 요리하고 최종적인 맛만을 중앙 심사위원에게 보내기로 합의합니다. 심사위원은 이 맛들을 결합하여 마스터 레시피를 만들고, 이를 다시 다음 시도를 위해 요리사들에게 보냅니다. 이 디지털 버전에서 "레시피"는 데이터이고, "요리사"는 병원이며, "맛"은 컴퓨터 모델에 대한 수학적 업데이트입니다. 가공되지 않은 환자 데이터는 병원을 떠나지 않습니다. 하지만 이 방법에도 결함이 있습니다. 되돌아오는 "맛"이 때로는 사용된 특정 재료에 대해 너무 많은 것을 드러내어, 호기심 많은 관찰자가 특정 환자가 훈련 세트에 포함되었는지 추측할 수 있게 할 수 있기 때문입니다. 이를 고치기 위해 과학자들은 이제 동형 암호(homomorphic encryption)라고 불리는 기술을 탐구하고 있는데, 이는 데이터가 디지털 금고 안에 잠긴 상태로 유지되면서도 계산을 수행할 수 있게 하여, 결합을 수행하는 사람조차 가공되지 않은 숫자를 볼 수 없도록 보장합니다.

인도 푸네에 위치한 MIT 공과대학의 연구팀은 최근 이 개념을 10개의 병원 네트워크를 모방하도록 설계된 시뮬레이션 환경에서 테스트했습니다. 그들의 목표는 환자의 데이터를 완전히 숨기고 모델 업데이트를 암호화한 상태에서, 당뇨병 환자가 30일 이내에 병원에 재입원할지 여부를 예측하는 머신러닝 모델을 구축할 수 있는지 확인하는 것이었습니다. 그들은 소수점과 분수를 포함하는 경우가 많은 의료 데이터의 특성에 필수적인 기능인, 암호화된 숫자 상에서 근사치 수학을 허용하는 CKKS라고 알려진 특정 유형의 디지털 잠금 장치를 사용했습니다.

연구진은 130개 실제 병원의 기록이 담긴 공개 데이터셋을 사용하여, 이를 10개의 서로 다른 기관을 나타내는 10개의 조각으로 나눈 가상 실험을 설정했습니다. 각 가상 병원은 자신의 로컬 데이터로 자체적인 예측 모델 버전을 훈련시켰습니다. 표준적인 비암호화 시나리오에서 이 병원들은 모델 업데이트를 중앙 서버로 직접 전송했을 것입니다. 그러나 이 새로운 실험에서는 병원들이 먼저 CKKS 방식을 사용하여 자신들의 업데이트를 디지털 금고 안에 잠갔습니다. '정직하지만 호기심 많은' 코디네이터 역할을 하는 중앙 서버는 이 잠긴 패키지들을 받았습니다. 서버는 개별 기여분을 한 번도 열어보지 않고도 그것들을 평균 내는 수학적 연산을 수행했습니다. 평균 계산이 완료된 후에야 최종 결과가 신뢰할 수 있는 당사자에게 전달되어 잠금을 해제하고 글로벌 모델을 업데이트하는 데 사용되었습니다.

실험 결과, 프라이버시와 성능 사이에는 명확하고 어려운 트레이드오프(trade-off)가 존재한다는 것이 밝혀졌습니다. 연구진이 암호화 없이 동일한 과업을 실행했을 때, 시스템은 매우 효과적이었으며 높은 정확도로 재입원 위험을 식별해 냈습니다. 모델은 빠르게 학습했고 신뢰할 수 있는 예측을 생성했습니다. 그러나 암호화되지 않은 상태에서는 시스템이 취약했습니다. 공격자가 업데이트를 살펴봄으로써 특정 환자의 데이터가 훈련에 포함되었는지 성공적으로 추측할 수 있었고, 이는 프라이버시 약속을 깨뜨리는 일이었습니다.

연구진이 암호화를 활성화했을 때, 프라이버시 보호는 연구된 특정 공격 경로에 대해 의도한 대로 작동했습니다. 시스템은 공격자가 환자의 데이터가 훈련 세트에 포함되었는지 추측하는 능력을 동전 던지기와 같은 확률인 정확히 50% 수준으로 낮추었습니다. 이 결과는 정직하지만 호기심 많은 서버에 대한 평가된 프로토콜의 보호와 일치하지만, 모든 프라이버시 공격이나 모든 적대적 조건에 대한 면역을 보장하는 것은 아닙니다. 병원 데이터는 진정으로 비공개로 유지되었으며, 중앙 서버는 잠긴 숫자 외에는 아무것도 보지 못했습니다.

그러나 이러한 프라이버시는 상당한 대가를 치렀습니다. 암호화된 시스템은 훨씬 느렸고 네트워크를 통해 전송해야 하는 데이터 양이 훨씬 많았습니다. 각 병원에서 전송되는 데이터 패키지의 크기는 24배 증가하여, 매 훈련 라운드마다 통신 트래픽이 약 3메가바이트에서 거의 38메가바이트로 급증했습니다. 더욱이, 모델의 예측 능력도 눈에 띄게 떨어졌습니다. 비암호화 모델은 재입원을 정확히 식별하는 데 높은 점수를 기록한 반면, 암호화된 버전은 환자가 돌아올지 여부를 구별하는 능력이 임상적 의사결정에 활용하기에는 훨씬 못 미치는 수준으로 떨어졌습니다. 또한 모델이 안정화되는 데 더 오랜 시간이 걸렸으며, 잠긴 데이터로부터 학습하려고 시도하는 과정에서 더 불안정한 모습을 보였습니다.

본 연구는 이 방법을 사용하여 다수 병원 간의 질병 예측을 위한 프라이버시 보존 시스템을 구축하는 것이 기술적으로는 가능하지만, 아직 완벽한 솔루션은 아니라고 결론짓습니다. 이 기술은 연구진이 테스트한 특정 프라이버시 유출을 성공적으로 차단했지만, 그 대가로 시스템을 훨씬 무겁고 덜 정확하게 만들었습니다. 연구진은 이 특정 설정에서 예측 품질의 저하와 막대한 데이터 전송 요구 사항이 상당한 장애물임을 발견했습니다. 이 접근 방식이 현실 세계에서 유용해지려면, 향후 연구는 암호화된 데이터의 크기를 줄이고 디지털 잠금 장치에도 불구하고 모델이 효과적으로 학습할 수 있는 능력을 개선하는 데 집중해야 한다고 제언합니다. 그때까지는 매우 정확하지만 프라이버시를 위험에 빠뜨리는 모델과, 완벽하게 프라이в시를 보호하지만 정확도가 낮은 모델 사이의 선택은 의료 기관이 감당해야 할 어려운 균형 잡기가 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →