← 최신 논문
🤖 AI

Protecting patient privacy in clinical foundation models: Technical and legal perspectives

본 논문은 기존의 HIPAA나 GDPR과 같은 규제들이 이러한 간접적인 위협에 대해 제한적인 지침만을 제공함에 따라, 기술적 및 법적 전략을 상호 보완적으로 활용하여 모델 매개 데이터 유출 문제를 해결함으로써 임상 파운데이션 모델의 개인정보 보호 위험을 평가하고 완화하기 위한 실용적이고 맥락 인식적인 프레임워크를 제안한다.

원저자: Sana Tonekaboni, Lena Stempfle, Sasha Ronaghi, Corinna Coupette, I. Glenn Cohen, Emily Alsentzer, Marzyeh Ghassemi

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sana Tonekaboni, Lena Stempfle, Sasha Ronaghi, Corinna Coupette, I. Glenn Cohen, Emily Alsentzer, Marzyeh Ghassemi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능형 로봇 셰프를 만들었다고 상상해 보세요. 이 로봇이 무엇이든 만들 수 있도록 전 세계의 수백만 가지 레시피와 요리 영상을 학습시켰습니다. 이제 사람들에게 이 로봇을 사용하여 요리를 돕도록 허용하고 싶습니다. 하지만 문제가 하나 있습니다. 로봇이 너무 깊게 학습한 나머지, 훈련 과정에 포함되었던 낯선 이의 특정하고 비밀스러운 가족 레시피를 기억해 내어 실수로 내놓거나, 심지어 특정 인물이 가장 좋아했던 음식이 자신의 학습서에 들어 있었다는 사실을 드러낼 수도 있다는 점입니다. 이것은 단순히 로봇이 파일을 훔치는 문제가 아닙니다. 이는 로보가 알려져서는 안 될 비밀을 '노출하는' 방식으로 행동하는 것에 관한 문제입니다. 이것이 바로 헬스케어 분야에서의 "파운데이션 모델(foundation models)"이 직면한 세상입니다. 이러한 모델들은 의사가 질병을 진단하고, 건강 위험을 예측하며, 치료 계획을 세우는 것을 돕기 위해 의료 기록, X-ray, 검사 결과와 같은 방대한 양의 환자 데이터를 학습한 거대 AI 시스템입니다. 이러한 도구들은 의학에 혁명을 일으킬 것을 약속하지만, 기묘하고 새로운 종류의 개인정보 보호 위험을 동반합니다. 이는 단순히 해커가 데이터베이스를 해킹하는 문제가 아닙니다. 데이터에서 이름이나 주소를 삭제했음에도 불구하고, AI 자체가 그 답변을 통해 민감한 세부 정보를 '유출'할 수 있다는 점이 문제입니다. 핵심적인 질문은 이렇습니다. 어떻게 하면 이 강력한 도구들을 가두어 두지 않으면서도 안전하게 유지할 수 있을까요?

MIT, 스탠퍼드, 하버드와 같은 곳의 연구진이 작성한 이 논문은 정확히 그 문제를 다룹니다. 그들은 현재 미국의 HIPAA나 유럽의 GDPR과 같은 기존의 개인정보 보호 규정들이 마치 자동차를 위한 구식 교통법처럼, 이제는 자율주행 로켓을 운전하고 있는 우리에게는 맞지 않는다고 주장합니다. 기존 법들은 AI에 데이터가 들어가기 '전'의 데이터를 보호하는 데 집중하고 있지만, AI가 훈련된 '후'에 우연히 정보를 흘릴 수 있는 기묘한 방식들에 대해서는 제대로 대처하지 못합니다.

이를 해결하기 위해 저자들은 간단한 두 부분으로 구성된 지도를 사용하여 개인정보 보호 위험을 생각하는 새로운 방식을 제안합니다. 한쪽 축은 "질문을 하는 사람이 이미 얼마나 알고 있는가?"를 묻고, 다른 쪽 축은 "AI가 얼마나 많은 민감한 정보를 제공하는가?"를 묻는 그래프를 상상해 보세요.

  • "사전 지식(Prior Knowledge)" 축: 어떤 경우에는 AI에게 "이야기를 만들어 봐"라고 요청하여 AI가 실수로 실제 환자의 이야기를 하게 만드는 것처럼, AI를 속여 비밀을 털어놓게 하는 데 아무것도 알 필요가 없습니다. 반면에, 특정 약물 이름이나 희귀한 증상 같은 아주 작은 단서를 제공함으로써 특정 인물에 대한 더 자세한 정보를 드러내도록 유도할 수도 있습니다.
  • "유출된 정보(Leaked Info)" 축: 다른 한편으로는, AI가 누군가와 연결될 수 있는 정보(예: 희귀 질환 패턴)를 제공하거나, 혹은 직접적으로 그 사람을 식별할 수 있는 정보(예: 이름이나 특정 전화번호)를 제공할 수도 있습니다.

저자들은 이 지도를 사용하여 상황이 어떻게 잘못될 수 있는지 보여주는 여섯 가지 "유출 시나리오"를 살펴봅니다. 예를 들어:

  1. "복제범(Copycat)" 시나리오: 뇌 스캔 데이터를 학습한 AI에게 일반적인 이미지를 생성하도록 요청했는데, AI가 실수로 실제 환자의 스캔본과 거의 완벽하게 일치하는 이미지를 내놓아 그 사람을 식별할 수 있는 고유한 특징까지 드러내는 경우입니다.
  2. "추억 여행(Memory Lane)" 시나리오: 사용자가 특정 유형의 환자를 위한 병원 기록을 작성해 달라고 요청했을 때, AI가 학습한 실제 기록을 기억해 내어 환자가 공개적으로 공유한 적 없는 사적인 세부 사항을 거의 그대로 똑같이 써 내려가는 경우입니다.
  3. "자동 완성의 함정(Autocomplete Trap)": 의사가 환자 A를 위한 기록을 작성하는 도중, AI가 엉뚱한 기억을 불러와서 환자 B의 이름과 전화번호가 포함된 후속 계획을 제안하는 경우입니다.
  4. "멤버십 유출(Membership Leak)": 연구자가 AI에게 질문을 던졌을 때, AI의 행동이 특정 환자 집단과 이상하리만큼 일관되게 나타나, 이름은 드러나지 않더라도 해당 특정 인물들의 데이터가 모델 훈련에 사용되었음을 입증하게 되는 경우입니다.

논문은 이러한 위험이 병원이 자체 보안 서버에 AI를 보관하는 "로컬(local)" 환경과 누구나 온라인으로 사용할 수 있는 "공개(public)" 환경 모두에서 실제로 발생한다고 지적합니다. 또한 현재의 법률이 다소 모호하다는 점을 발견했습니다. 예를 들어, 미국에서 병원이 AI를 훈련시키기 전에 데이터에서 이름을 제거했다면 HIPAA에 따라 안전하다고 생각할 수 있습니다. 하지만 저자들은 만약 AI가 여전히 특정 인물의 데이터를 드러내도록 속일 수 있다면, 병원이 실제로 데이터가 진정으로 익명화되지 않았다는 것을 알게 된 것으로 간주되어 예상치 못한 법적 문제가 발생할 수 있다고 지적합니다. 마찬가지로 유럽의 규칙은 데이터가 "식별 가능"해야 보호된다고 규정하고 있지만, 저자들은 비록 즉각적으로 사람을 지목할 수는 없더라도, AI가 식별로 이어질 수 있는 희귀한 증상 조합을 드러낸다면 그것 역시 개인정보 침해라고 주장합니다.

그렇다면 해결책은 무엇일까요? 저자들은 모든 것을 즉시 해결할 마법의 지팡이를 제시하는 것이 아닙니다. 대신 기술적, 법적 해결책의 혼합을 제안합니다. 기술적인 측면에서는 더 나은 테스트(해커가 AI를 깨뜨려 정보 유출을 찾아내는 "레드 팀(red teaming)" 활동 등), 수학을 사용하여 AI가 기억하는 양을 제한하는 방법("차분 프라이버시(differential privacy)"), 그리고 AI가 출시된 후 정보를 유출하기 시작하지 않는지 지속적으로 점검하는 방법을 권장합니다. 법적인 측면에서는, 우리가 AI가 사용되는 '맥락'을 고려하여 규칙을 업데이트해야 한다고 주장합니다. 그들은 기업과 병원이 누구와 데이터를 공유할지, 어떻게 모델을 훈련할지에 대해 더 주의를 기울여야 하며, 아마도 새로운 종류의 계약이나 감독이 필요할 것이라고 제안합니다.

궁극적으로 이 논문은 환자를 보호하기 위해 단순히 "이름을 숨기는 것"이라는 오래된 아이디어에만 의존해서는 안 된다고 말합니다. AI가 점점 더 똑똑해지고 우리 삶에 통합됨에 따라, 우리는 위험을 측정하는 더 스마트하고 유연한 방법이 필요합니다. 이는 현관문을 잠그는 것도 좋지만, 창문과 지하실도 확인해야 하며 이웃들이 실수로 당신의 비밀을 외치고 있지는 않은지도 확인해야 한다는 것과 같습니다. 저자들은 새로운 "위험 지도"를 사용함으로써 의료 AI의 놀라운 혜적을 누리는 동시에 환자의 사생활을 보호할 수 있기를 바랍니다. 그들은 법적 환경이 여전히 변화 중이며, EU의 AI 법과 같은 새로운 법들이 이를 따라잡으려 노력하고 있다는 점을 인정하지만, 핵심 메시지는 명확합니다. AI의 개인정보 보호에 있어서 우리는 사후 대응이 아닌 선제적 대응을 해야 한다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →