Context-Window-Mediated Corruption of Large Multimodal Models in Clinical Medicine: A Systematic Review
편향 위험이 높은 10개의 연구를 대상으로 한 이 체계적 문헌 고찰은 임상 의학 분야의 대규모 멀티모달 모델들이 네 가지 뚜렷한 실패 클래스에 걸쳐 입력 기반 오염에 취약하다는 점을 밝혀냈으며, 이러한 위협은 모델의 특성이나 테스트된 방어 기제와 관계없이 지속되며 출력의 무결성을 해치기 위해 적대적 공격자를 필요로 하지 않습니다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대적인 병원에 새로운 종류의 조수가 도착했습니다. 이들은 방대한 양의 텍스트와 이미지를 학습하여 환자의 차트를 읽고, 엑스레이를 해석하며, 진단을 제안할 수 있는 컴퓨터 프로그램인 거대 언어 및 시각 모델입니다. 이들은 의사가 입력하는 내용, 환자가 말하는 내용, 또는 사진이 보여주는 것과 같은 정보의 흐름을 받아들여 이를 하나의 연속적인 흐름으로 처리합니다. 시스템은 그 흐름 중 어느 부분이 신뢰할 수 있는 지침이고, 어느 부분이 배경 소음이나 실수로 적힌 낙서인지 본질적으로 구분하지 못합니다. 컴퓨터에게는 의사가 작성한 명령어나 환자가 흘려 적은 낙서나 모두 동일한 종류의 데이터로 보입니다. 이는 독특한 취약점을 만듭니다. 즉, 기계에 입력되는 정보가 아주 미세하게라도 수정된다면, 기계 자체가 아무리 똑똑하더라도 그 출력값은 극적으로 변할 수 있다는 것입니다.
이것은 컴퓨터가 고장 났거나 잘못 만들어진 문제가 아니라, 어떻게 '듣느냐'의 문제입니다. 매우 숙련된 번역가가 지시를 따르는 데 너무 열성적인 나머지, 작업 중에 누군가 귓속말로 새로운 명령을 전달하면 즉시 하던 일을 멈추고 그 귓속말을 따르는 상황을 상상해 보십시오. 인공지능의 세계에서 이를 '프롬프트 인젝션(prompt injection)'이라 부르며, 입력값 자체가 시스템의 동작을 가로채는 현상을 말합니다. 보안 전문가들은 해커들이 이 기술을 사용하는 것을 오랫동안 우려해 왔지만, 한 새로운 체계적 검토 논문은 의료 분야에 더 불안한 질문을 던집니다. 과연 이 위험에 반드시 해커가 필요할까요? 의료 영상에 찍힌 단순하고 우연한 표식이나, 환자의 다급하지만 혼란스러운 표현이 동일한 실패를 유발할 수 있을까요?
베스 이스라엘 디코네스 의료 센터(Beth Israel Deaconess Medical Center)와 데브레첸 대학교(University of Debrecen)의 연구진은 모든 가용 연구를 수집하여, 의료 모델이 입력값이 변조되었을 때 어떻게 반응하는지를 테스트함으로써 이 질문에 답하고자 했습니다. 이들은 암 진단, 피부 병변 분석부터 환자 조언 및 약물 안내에 이르기까지 2025년에서 2026년 사이에 발표된 10개의 특정 연구를 검토했습니다. 이들의 목표는 이 강력한 도구들이 컴퓨터의 내부 코드를 해킹하거나 비밀 학습 데이터에 접근하지 않고도, 단순히 읽히는 내용이나 보이는 것을 바꿈으로써 타락할 수 있는지 확인하는 것이었습니다.
연구진은 모델들이 실제로 매우 취약하며, 이러한 타락에 악당이 필요하지 않다는 것을 발견했습니다. 실제로 연구들에 따르면, 입력값이 연구자가 의도적으로 설계한 공격이든, 일반적인 임상 자료처럼 보이도록 구성된 비악의적 콘텐츠이든 상관없이 큰 출력 변화가 발생했습니다. 그러나 이 검토 논문은 자연적으로 발생하는 콘텐츠와 의도적인 공격을 동일한 조건에서 비교한 연구가 없음을 명시하고 있으므로, 실제 환경의 사고가 동일한 실패를 일으키는지 여부는 아직 입증되지 않은 상태로 남아 있습니다. 연구진은 이러한 실패들을 네 가지 주요 범주로 분류했습니다. 첫 번째는 숨겨진 명령이 의사의 원래 요청을 무시하는 '지시 계층 구조 실패(instruction-hierarchy failure)'입니다. 두 번째는 모델이 거짓 정보나 허구의 발견을 사실로 받아들이는 '증거 무결성 실패(evidence-integrity failure)'입니다. 세 번째는 이미지를 보는 모델에 특화된 '멀티모달 간섭(multimodal interference)'으로, 의료 영상 위에 쓰여 있거나 내부에 포함된 텍텍스트가 영상 자체의 시각적 증거를 압도하는 경우입니다. 네 번째는 메시지의 어조나 잘못된 전제가 모델의 결정에 영향을 미치는 '상호작용 민감도(interactional sensitivity)'입니다.
결과는 극명했습니다. 피부암 이미지와 관련된 한 연구에서는 사진에 조작된 라벨 하나를 추가하는 것만으로 모델의 진단 정확도가 5862% 범위에서 0.01.9%로 급락했습니다. 또 다른 연구에서는 환자의 메시지 어조를 더 긴박하거나 권위 있게 바꾸자, 환자를 응급실로 보내라고 권고하는 비율이 약 14%에서 높게는 82%까지 치솟았습니다. 더욱 우려스러운 점은 이러한 실패가 구형 버전부터 최신 모델에 이르기까지 다양한 유형의 모델에서 발생했다는 것입니다. 일관되게 안전한 것으로 증명된 모델은 없었습니다. 한 종류의 오류에는 강건했던 시스템이 다른 종류의 오류에는 가장 취약한 모습을 보이기도 했습니다.
연구진은 현재의 방어책들이 이러한 문제를 막을 수 있는지 또한 테스트했습니다. 프롬프트에 안전 지침을 추가하거나, 두 번째 모델이 첫 번째 모델의 작업을 검토하게 하거나, 교정된 사례를 통해 모델을 재학습시키는 전략 등을 살펴보았습니다. 이러한 방법 중 어느 것도 위험을 완전히 제거하지 못했습니다. 일부는 오류를 약간 줄였지만, 어떤 것은 전혀 효과가 없었습니다. 모델을 재학습시키는 방식의 방어책은 거짓 정보를 거부하는 능력을 개선했지만, 동시에 모델이 정당한 요청까지 거부하게 만들어, 본질적으로 한 종류의 실수를 다른 종류의 실수로 맞바꾸는 결과를 초래했습니다. 결정적으로, 테스트된 어떤 방어책도 다양한 유형의 오류에 걸쳐 작동하지 않았습니다. 즉, 한 가지 문제에 대한 해결책이 다른 문제에 대한 보호책이 되지는 못했습니다.
검토 논문의 상당 부분은 이러한 실패에 악의적인 공격자가 필요한지에 초점을 맞췄습니다. 가용한 증거에 기반한 답변은, 연구자가 일반적인 임상 자료(예: 슬라이드 위의 손글씨 메모나 환자 자신의 다급한 표현)처럼 보이도록 설계한 콘텐츠만으로도 시스템을 무너뜨리기에 충분했다는 것입니다. 다만, 논문은 이들이 일상적인 진료 과정에서 추출된 것이 아니며, 자연적으로 발생하는 콘텐츠만을 분리하여 테스트한 연구는 없었다는 점을 분명히 하고 있습니다. 이는 이 위협이 단순한 사이버 공격이 아니라, 모델이 정보를 처리하는 방식의 근본적인 결함임을 시사합니다. 시스템에 들어가는 데이터의 무결성은 모델 자체의 안전성만큼이나 중요합니다.
저자들은 모델을 학습시키고 출력을 모니터링하는 데 집중하는 현재의 의료 인공지능 접근 방식이 중요한 퍼즐 조각 하나를 놓치고 있을 수 있다고 결론짓습니다. 만약 시스템에 입력되는 정보가 단순하고 비악의적인 수단에 의해 오염될 수 있다면, 전체 임상 결정의 안전성은 입력값의 순수성에 달려 있습니다. 데이터가 모델에 도달할 때 조작으로부터 자유롭다는 것을 보장할 수 없고, 모든 유형의 오류에 작동하는 방어책을 갖추기 전까지는, 실제 의료 현장에서 이러한 도구들의 신뢰성은 불확실한 상태로 남을 것입니다. 이 연구 결과는 조기 경보 역할을 합니다. 즉, 이 시스템의 안전성은 기계의 지능뿐만 아니라, 기계가 읽으라고 요청받은 세상의 신뢰성에 달려 있다는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.