When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
이 논문은 임상적 배경에 미세한 교란을 가해 의료용 시각 - 언어 모델이 진단 영역을 무시하고 오류가 있되 현실적인 진단 결과를 내게 하는 고도로 전이 가능한 블랙박스 공격 방법인 MedFocusLeak 을 제안하고, 이를 통해 현대 의료 VLM 의 추론 능력에 존재하는 치명적인 취약점을 규명합니다.
가상의 상황을 상상해 보세요. AI 의사는 환자의 엑스레이나 MRI 사진을 보고 "이 환자는 폐렴입니다"라고 진단을 내립니다. 이 AI 는 매우 똑똑해서 사진 속 병변 (아픈 부분) 을 잘 찾아냅니다.
🕵️♂️ 문제: 기존 해킹은 너무 뻔했다
기존의 해킹 방법들은 마치 환자의 얼굴에 붉은 페인트를 바르거나 사진을 찢어버리는 것과 비슷했습니다.
결과: AI 는 엉뚱한 진단을 내렸지만, 실제 의사나 환자가 보면 "어? 이 사진 왜 이렇게 뚫뚫하고 붉은색이 묻어있지? 이건 조작된 거야!"라고 바로 눈치챘습니다.
한계: 너무 눈에 띄어서 실제 병원에서는 쓸 수 없는 공격이었습니다.
💡 해결책: 'MedFocusLeak' (주의 분산 작전)
이 연구팀은 아주 교묘한 새로운 방법을 고안했습니다. **"병이 있는 곳은 건드리지 않고, 사진의 빈 공간 (배경) 만 살짝 건드려서 AI 의 시선을 돌리는 것"**입니다.
1. 비유: "무대 위의 조명"
상황: 무대 중앙에 배우 (환자의 병변) 가 서 있습니다. 관객 (AI) 은 배우를 보고 극을 이해합니다.
공격: 해커는 배우의 옷을 찢거나 얼굴에 페인트를 바르지 않습니다. 대신 배우 뒤쪽의 어두운 배경 벽에 아주 미세한 빛을 쏘거나, 벽에 아주 작은 그림을 그립니다.
효과: AI 는 그 미세한 빛이나 그림에 꽂혀서, 정작 중요한 배우 (병변) 를 보지 못하고 "아, 저 벽에 뭔가 이상한 게 있네? 저게 중요해!"라고 착각합니다.
결과: AI 는 배경을 보고 "이 환자는 건강한데, 저 벽 때문에 병이 생긴 거야"라고 엉뚱하고도 그럴듯한 (하지만 틀린) 진단을 내립니다.
2. 핵심 기술: "배경에 숨은 암호"
보이지 않는 교란: 연구팀은 AI 가 병변을 보지 못하게 배경 (흰색 공간이나 주변 조직) 에만 아주 미세한 노이즈를 넣었습니다. 인간 눈에는 전혀 보이지 않지만, AI 의 '시각 신경'에는 큰 소음으로 들립니다.
주의 분산 (Attention Distraction): AI 는 보통 "여기에 병이 있구나"라고 집중합니다. 하지만 이 공격은 AI 의 집중력을 "여기가 아니라 저기 (배경) 에 집중해!"라고 속여 넘깁니다.
텍스트와 이미지의 동맹: 단순히 사진만 건드리는 게 아니라, AI 가 읽는 진단 문장도 살짝 바꿔줍니다. "폐렴"이라는 단어를 "정상"으로 바꾸는 게 아니라, "약간의 염증"처럼 미묘하게 바꿔서 AI 가 혼란을 느끼게 합니다.
🎯 왜 이것이 무서운가요? (위험성)
이 공격의 무서운 점은 완벽한 위장입니다.
의사도 속습니다: 실제 의사가 사진을 보면 "아, 이 사진은 깨끗하네. 병변도 명확해."라고 생각합니다. 하지만 AI 는 배경의 미세한 교란 때문에 "이 환자는 암입니다"라고 잘못 진단할 수 있습니다.
실제 사례: 논문에서는 뇌 MRI 사진을 보고 "정상"이라고 진단받아야 할 환자를 "뇌종양이 있다"라고 잘못 진단하게 만들거나, 반대로 "뇌종양"이 있는 환자를 "완전 정상"이라고 속이는 데 성공했습니다.
🛡️ 결론: 우리는 무엇을 배웠나요?
이 연구는 **"AI 가 너무 똑똑해져서, 오히려 사소한 것 (배경) 에 속아 넘어갈 수 있다"**는 사실을 보여줍니다.
현재 상태: 의료 AI 는 아직 안전장치가 부족합니다.
미래: 이 공격 방법을 공개함으로써, 개발자들이 "아, AI 가 배경에 속아 넘어가네? 그럼 배경까지 철저히 검증하는 시스템을 만들어야겠다"라고 생각하게 만들어, 더 안전한 의료 AI 를 만드는 계기가 되기를 바랍니다.
한 줄 요약:
"의사 AI 의 눈을 가리지 않고, 배경에 속삭여 AI 가 중요한 병변을 놓치고 엉뚱한 곳만 보게 만들어 잘못된 진단을 내리게 하는, 완벽하게 숨겨진 해킹 기술입니다."
1. 문제 정의 (Problem Definition)
의료용 비전 - 언어 모델 (VLM) 은 임상 진단, 보고서 생성, 요약 등에 혁신적으로 활용되고 있지만, 적대적 공격 (Adversarial Attacks) 에 대한 견고성 (Robustness) 이 크게 탐구되지 않았습니다. 기존 연구들은 다음과 같은 한계를 가집니다:
의료 특화 공격의 부재: 기존 전이 가능 (Transferable) 한 공격들은 자연 이미지에서 개발되어 의료 영상 (회색조, 좁은 팔레트) 에 적용 시 눈에 띄는 왜곡을 일으켜 임상가가 쉽게 감지합니다.
목표의 한계: 기존 공격들은 모델 탈취 (Model Stealing) 나 프롬프트 인젝션 (Jailbreak) 등 2 차적 목표에 집중하거나, 진단 추론 자체를 훼손하지 않는 경우가 많습니다.
블랙박스 환경의 취약점: 실제 임상 환경은 블랙박스 (Black-box) 설정이 일반적이지만, 이를 가정하고 진단 무결성을 직접적으로 훼손하는 은밀한 공격 연구는 부족합니다.
이 논문은 임상가가 감지하지 못하는 수준 (Imperceptible) 으로 이미지를 변조하면서도, 모델의 주의를 병리학적 영역에서 벗어나게 하여 오진 (Misdiagnosis) 을 유도하는 전이 가능 공격의 필요성을 제기합니다.
2. 제안 방법론: MedFocusLeak
저자들은 MedFocusLeak이라는 새로운 멀티모달 블랙박스 공격 프레임워크를 제안합니다. 이 방법은 모델의 시각적 주의 메커니즘 (Visual Attention Mechanism) 을 표적으로 삼아, 진단에 중요한 병변 영역이 아닌 비진단적 배경 (Background) 영역에 교란을 가합니다.
핵심 구성 요소 및 프로세스:
배경 기반 교란 (Background Constrained Perturbation):
MedSAM을 사용하여 진단적으로 중요한 영역 (Foreground) 을 마스킹하고, 나머지 배경 영역만 공격 대상으로 삼습니다.
동적 프로그래밍을 통해 배경 중 가장 큰 k개의 패치를 선택하고, 이 영역 내에서만 교란 (Perturbation) 을 생성하여 원본 의료 영상의 진단적 무결성을 유지합니다.
멀티모달 적대적 표현 (Multimodal Adversarial Representation):
이미지와 텍스트를 동시에 조작합니다.
이미지: 백색 배경 이미지를 초기화하고, 교란된 텍스트를 오버레이하여 명시적인 교차 모달 대응을 생성합니다.
텍스트: GPT-4 등을 사용하여 원본 진단과 유사하지만 임상적으로 잘못된 (Plausible but incorrect) 적대적 텍스트를 생성합니다.
교차 최적화: 이미지 교란 (Project Gradient Descent) 과 텍스트 토큰 교체 (Greedy Token Substitution) 를 번갈아 수행하여 두 모달리티 간의 시너지를 극대화합니다.
주의 전환 손실 (Attention Shift Loss):
모델이 병변 영역이 아닌 교란된 배경 영역에 집중하도록 유도합니다.
주의 분산 손실 (Attention Distraction Loss): 최종 멀티모달 융합 블록에서 추출한 크로스 어텐션 가중치를 활용하여, 전경 (Foreground) 에 할당된 주의량을 줄이고 배경 (Background) 에 할당된 주의량을 늘리는 로그 비율 손실을 최소화합니다.
이를 통해 모델은 시각적 증거를 무시하고 악성 배경 신호에 기반하여 자신감 있게 잘못된 진단을 내리게 됩니다.
3. 주요 기여 (Key Contributions)
의료 VLM 에 대한 전이 가능 공격의 체계적 연구: 현실적인 블랙박스 위협 모델 하에서 의료 비전 - 언어 설정에서의 전이 가능 적대적 공격의 가능성을 최초로 체계적으로 연구했습니다.
MedFocusLeak 프레임워크 개발:
진단적 이미지 품질을 유지하면서 의미론적으로 인지된 (Semantically aware) 교란을 생성하는 새로운 멀티모달 공격 기법입니다.
배경 영역에만 교란을 가하고 주의 메커니즘을 조작하여, 전문가조차 눈치채기 어려운 은밀한 공격을 가능하게 합니다.
통합 평가 프레임워크 및 새로운 지표:
MTR (Medical Text Adversarial Score): 임상 전문가의 판단을 시뮬레이션하여 진단 오류의 심각도를 평가.
AvgSim: 원본과 적대적 이미지 간의 시각적 유사도 (Med-CLIP 기반).
MAS (Medical Attack Score): 공격 성공률과 은밀성을 종합한 새로운 통합 지표.
광범위한 실험 검증: 6 가지 의료 영상 모달리티 (X-ray, CT, MRI 등) 와 6 가지 다양한 VLM (오픈소스, 의료 특화, 폐쇄형) 에 대한 실험을 통해 SOTA 성능을 입증했습니다.
4. 실험 결과 (Results)
성능: MedFocusLeak 은 기존 공격 기법 (AttackVLM, M-Attack, FOA-Attack 등) 보다 모든 모델에서 **MAS(Medical Attack Score)**와 MTR에서 압도적으로 우수한 성능을 보였습니다.
예: GPT-5 에서 MAS 가 0.408 (기존 최강 0.225 대비 약 2 배), InternVL 에서 0.672 를 기록했습니다.
은밀성 (Imperceptibility): AvgSim 점수가 0.85 이상으로 유지되어, 교란된 이미지가 원본과 시각적으로 구별하기 어렵고 임상적으로 사용 가능함을 입증했습니다.
전이성 (Transferability): 학습된 공격이 훈련된 모델뿐만 아니라, 보지 못한 폐쇄형 모델 (Gemini 2.5 Pro, GPT-5) 과 의료 특화 모델 (MedVLM-R1) 로도 효과적으로 전이되었습니다.
추론 모델의 취약성: 추론 중심 모델 (Reasoning models) 이 일반 모델보다 견고하지만, MedFocusLeak 에 의해 여전히 상당한 수준의 오진을 유도할 수 있음이 확인되었습니다.
방어 기법 우회: 가우시안 노이즈, JPEG 압축, ComDefend 등 다양한 입력 수준 방어 기법 하에서도 기존 방법보다 높은 공격 성공률을 유지했습니다.
5. 의의 및 결론 (Significance)
임상적 위험 경고: 이 연구는 현재 의료 AI 시스템이 시각적 배경에 대한 의존성과 주의 메커니즘의 취약성으로 인해, 미세한 교란만으로도 치명적인 오진 (예: 암을 정상으로 진단하거나, 정상인 것을 악성으로 진단) 을 할 수 있음을 보여줍니다.
보안 강화의 필요성: 의료 VLM 의 안전한 임상 배포를 위해서는 단순한 이미지 품질 검사를 넘어, 모델의 내부 주의 분배와 추론 논리를 검증하는 새로운 방어 메커니즘이 시급히 필요함을 강조합니다.
이중 사용 (Dual-use) 윤리: 강력한 공격 기법이지만, 이는 악용을 방지하기 위한 선제적 취약점 발견 (Red Teaming) 의 목적이며, 더 견고하고 안전한 의료 AI 개발을 촉진하기 위해 코드와 결과를 공개했습니다.
요약하자면, MedFocusLeak은 의료 VLM 이 진단적 핵심 영역이 아닌 '배경'에 의해 쉽게 속아 넘어갈 수 있음을 드러낸 획기적인 연구로, 의료 AI 보안의 새로운 지평을 열었습니다.