An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis
이 논문은 척추관 협착증 진단을 위해 공간적 정밀도를 높이는 패치 크로스 어텐션 모듈과 불균형 데이터 문제를 해결하는 적응형 PID-트버스키 손실 함수를 도입한 설명 가능한 비전 - 언어 모델 프레임워크를 제안하여 높은 진단 정확도와 자동화된 방사선 보고서 생성 능력을 입증했습니다.
원저자:Md. Sajeebul Islam Sk., Md. Mehedi Hasan Shawon, Md. Golam Rabiul Alam
눈의 피로: 척추 뼈 사이가 얼마나 좁아졌는지 (협착) 를 눈으로 직접 재고 판단해야 합니다.
오해의 소지: 사람마다 해석이 달라서, 같은 사진을 봐도 의사 A 는 "약간 좁다"고 하고 의사 B 는 "심각하다"고 할 수 있습니다.
보고서 작성: 진단 결과를 환자에게 설명할 수 있는 보고서 (방사선 보고서) 를 일일이 손으로 써야 합니다.
기존의 AI 는 "이미지만 보고 점수만 매기는 블랙박스"처럼 작동해서, 왜 그렇게 판단했는지 설명해주지 못했습니다.
💡 해결책: "의사처럼 보고, 설명도 해주는 AI"
이 연구팀은 세 가지 핵심 기술을 결합하여 문제를 해결했습니다.
1. "눈과 입"을 동시에 가진 AI (Vision-Language Model)
기존 AI 가 눈 (이미지) 만 봤다면, 이 새로운 AI 는 **눈 (MRI 영상) 과 입 (의학적 텍스트)**을 동시에 사용합니다.
비유: 마치 숙련된 방사선과 전문의가 MRI 를 보며, 옆에 있는 의학 사전 (텍스트) 을 참고해서 진단하는 모습과 같습니다.
이 AI 는 LLaVA-Med, BiomedCLIP, SmolVLM 이라는 최신 모델들을 활용하여, 척추의 모양 (시각) 과 의사가 쓰는 설명 (텍스트) 을 연결합니다.
2. "불균형한 학생들을 위한 맞춤형 선생님" (Adaptive PID-Tversky Loss)
의료 데이터의 가장 큰 문제는 데이터 불균형입니다. "정상인" 사진은 많지만, "심하게 좁아진" 사진은 적습니다.
비유: 교실에 **정상 학생 (다수)**이 100 명 있고, **심각한 환자 (소수)**가 10 명만 있다고 칩시다. 일반적인 AI 는 100 명을 맞추는 데만 집중해서 10 명을 놓쳐버립니다.
이 연구팀은 **PID 제어기 (자동 온도 조절기 같은 원리)**를 적용한 새로운 점수 계산법 (손실 함수) 을 만들었습니다.
AI 가 "심각한 환자"를 놓치면 (오류가 발생하면), 선생님이 **"이건 더 집중해서 공부해!"**라고 신호를 보내 점수 가중치를 자동으로 조절합니다.
반대로 쉽게 맞춘 정상 사례는 점수 비중을 낮춰서, AI 가 어려운 사례에 더 집중하도록 유도합니다.
3. "작은 조각을 맞춰보는 퍼즐" (Spatial Patch Cross-Attention)
기존 AI 는 전체 이미지를 한 번에 보다가 중요한 디테일을 놓치는 경우가 많았습니다.
비유: 거대한 벽화를 한 번에 보지 않고, 작은 타일 조각 (패치) 하나하나를 뜯어보면서 "여기에는 척추 신경이 눌려있네"라고 텍스트와 대조하며 찾아내는 방식입니다.
이렇게 하면 "어디가 좁아졌는지"를 아주 정밀하게 찾아낼 수 있습니다.
🚀 결과: "의사처럼 진단하고, 보고서까지 써주는 AI"
이 시스템은 세 가지 일을 동시에 해냅니다:
정확한 진단: 척추 협착 정도를 '정상 (A)', '약간/중간 (B&C)', '심각 (D)'으로 분류합니다.
특히 **심각한 경우 (D)**와 **정상 (A)**을 구별하는 능력이 매우 뛰어났습니다 (정확도 90% 이상).
정밀한 위치 표시: 척추의 어느 부분이 좁아졌는지 픽셀 단위로 정확히 그려냅니다.
자동 보고서 작성: 단순히 "심각하다"고만 말하는 게 아니라, **"척추관 협착이 43.6% 발생하여 신경이 눌린 것으로 보입니다"**와 같은 전문적인 방사선 보고서를 자동으로 작성합니다.
🌟 핵심 요약 (한 문장으로)
"이 연구는 MRI 영상을 보고 척추 질환을 진단할 때, AI 가 단순히 점수만 매기는 게 아니라, 의사가 복잡한 병변을 찾아내고 (정확한 시각 분석), 그 이유를 설명하며 (텍스트 생성), 어려운 환자 사례에 더 집중하도록 스스로 학습하게 만든 (적응형 학습) 똑똑한 시스템을 개발했습니다."
이 시스템은 앞으로 의사의 업무를 도와주거나, 의료진이 부족한 지역에서도 전문적인 진단을 받을 수 있게 하는 **'AI 보조 의사'**의 역할을 할 것으로 기대됩니다. 물론 최종 확인은 인간 의사가 하도록 설계되어 있어 안전성을 확보했습니다.
1. 연구 배경 및 문제 정의 (Problem)
임상적 과제: 요추관 협착증 (Lumbar Spinal Stenosis, LSS) 은 만성 요통과 다리 통증을 유발하는 흔한 퇴행성 질환으로, 정확한 진단을 위해 다중 뷰 MRI 를 수동으로 해석해야 합니다. 이는 방사선 전문의 간의 판독 편차 (Inter-observer variability) 가 크고 진단 지연을 초래합니다.
기존 기술의 한계:
블랙박스 문제: 기존 딥러닝 모델은 분류 점수나 픽셀 마스크만 제공하여 의료 결정에 필수적인 투명한 근거 (Explainability) 를 제공하지 못합니다.
클래스 불균형: 임상 데이터는 정상 (Majority) 과 병변 (Minority) 간의 심각한 클래스 불균형을 보이며, 표준 손실 함수 (Cross-Entropy 등) 는 다수 클래스에 편향되어 복잡한 소수 병변 (중등도/중증 협착증) 을 제대로 학습하지 못합니다.
공간 정보 손실: 전역 풀링 (Global Pooling) 기법을 사용하는 기존 모델은 해부학적 위계 구조와 정밀한 공간적 세부 정보를 손실하여 협착증 경계 세그멘테이션의 정확도가 떨어집니다.
다중 모달리티 부재: 시각적 특징과 임상적 문맥 (텍스트) 을 통합하여 자동화된 방사선 보고서를 생성하는 엔드 - 투 - 엔드 (End-to-End) 프레임워크가 부족합니다.
2. 제안된 방법론 (Methodology)
저자들은 요추관 협착증의 정확한 진단, 정밀 세그멘테이션, 자동 보고서 생성을 위한 설명 가능한 멀티모달 비전 - 언어 (Vision-Language) 프레임워크를 제안했습니다. 주요 구성 요소는 다음과 같습니다.
가. 데이터 전처리 및 가짜 마스크 생성 (Pseudo-Mask Generation)
노이즈 제거: 비국소 평균 (Non-Local Means, NLM) 필터를 적용하여 MRI 의 아티팩트와 노이즈를 제거합니다.
적응형 가짜 마스크: 라디올로지스트의 임상 보고서 텍스트를 활용하여 Otsu 임계값 및 Canny 에지 검출을 결합하고, 병변의 중증도 (Grade) 에 따라 형태학적 연산 (팽창/침식) 을 수행하여 정밀한 가짜 그라운드 트루스 (Pseudo-ground truth) 마스크를 생성합니다.
나. 멀티모달 특징 추출 및 공간 패치 크로스 어텐션 (Spatial Patch Cross-Attention)
모델 아키텍처: LLaVA-Med, BiomedCLIP, SmolVLM 등 최신 비전 - 언어 모델 (VLM) 을 기반으로 합니다.
공간 패치 어텐션: 기존의 [CLS] 토큰 기반 전역 풀링을 배제하고, Vision Transformer(ViT) 에서 **196 개의 공간 패치 임베딩 (Spatial Patch Embeddings)**을 직접 추출합니다.
텍스트 유도 로컬라이제이션: 임상 텍스트 프롬프트 (Query) 와 공간 패치 특징 (Key, Value) 을 결합하는 커스텀 8-헤드 크로스 어텐션 모듈을 도입하여, 텍스트 기반의 임상적 지시를 통해 척추 이상 부위를 정밀하게 위치시키고 세그멘테이션을 수행합니다.
다. 적응형 PID-Tversky 손실 함수 (Adaptive PID-Tversky Loss)
클래스 불균형 해결: 제어 이론의 PID(비례 - 적분 - 미분) 제어기를 Tversky 지수와 결합한 새로운 손실 함수를 제안합니다.
동적 가중치 조정: 훈련 중 False Positive(FP) 와 False Negative(FN) 의 비율을 실시간으로 모니터링하여 오차 신호 (et) 를 생성합니다.
피드백 루프: PID 제어기를 통해 다음 에포크의 클래스 가중치 (α,β) 를 동적으로 조정하여, 모델이 학습하기 어려운 소수 클래스 (복잡한 협착증 패턴) 에 집중하도록 유도하고 다수 클래스의 가중치는 낮춥니다.
라. 자동 방사선 보고서 생성 (ARRG)
예측된 세그멘테이션 마스크, 병변 면적 비율, 중증도 로짓 (Logits) 을 입력받아 라디올로지스트 스타일의 임상 보고서를 생성합니다.
시각적 특징, 형태학적 표현, 정량적 측정을 통합하여 AI 예측과 임상적 설명 사이의 간극을 해소합니다.
3. 주요 기여 (Key Contributions)
엔드 - 투 - 엔드 멀티모달 프레임워크: LLaVA-Med, BiomedCLIP, SmolVLM 을 통합하여 MRI 스캔으로부터 협착증 중증도 분류, 정밀 세그멘테이션, 자동 보고서 생성을 동시에 수행하는 시스템을 구축했습니다.
Adaptive PID-Tversky Loss: 클래스 불균형 문제를 해결하기 위해 제어 이론을 적용한 동적 손실 함수를 개발하여, 학습 과정에서 어려운 사례에 대한 모델의 주의를 집중시켰습니다.
Spatial Patch Cross-Attention: 전역 풀링의 한계를 극복하고 텍스트 프롬프트에 기반한 정밀한 공간적 병변 로컬라이제이션을 가능하게 하는 새로운 어텐션 모듈을 설계했습니다.
설명 가능성 (Explainability): 복잡한 세그멘테이션 결과를 라디올로지스트가 이해할 수 있는 임상 보고서로 변환하여, AI 의 의사결정 과정을 투명하게 만들었습니다.
4. 실험 결과 (Results)
연구진은 515 명의 환자 (48,345 개의 이미지) 로 구성된 공개 LSS 데이터셋을 사용하여 모델을 평가했습니다.
진단 분류 성능:
LLaVA-Med이 가장 높은 성능을 보였으며, 정확도 90.69%, Macro F1-Score 0.9072를 기록했습니다.
BiomedCLIP(87.77%), SmolVLM(82.66%) 보다 통계적으로 유의미하게 우수한 성능을 보였습니다.
세그멘테이션 성능:
LLaVA-Med가 Dice Score 0.9624, IoU 0.9288로 가장 정밀한 병변 경계 추출을 보여주었습니다.
BiomedCLIP 또한 Dice 0.9512 로 높은 성능을 보였으며, 특히 중증 (Grade D) 및 정상 (Grade A) 사례에서 높은 정확도를 달성했습니다.
Ablation Study: 표준 Cross-Entropy 손실 함수 대비 제안된 Adaptive PID-Tversky Loss를 사용했을 때 BiomedCLIP 의 Dice 점수가 0.7411 에서 0.9512 로 크게 향상되어 클래스 불균형 해결 효과를 입증했습니다.
보고서 생성 (ARRG) 성능:
LLaVA-Med가 CIDEr 점수 92.80, BLEU-1 **88.15%**로 가장 유창하고 정확한 임상 보고서를 생성했습니다.
생성된 보고서의 텍스트 기반 중증도 분류는 실제 라디올로지스트 판독과 높은 일치도를 보였으며 (BiomedCLIP 의 Grade A AUC 0.984 등), AI 가 임상적 맥락을 이해하고 있음을 시사합니다.
5. 의의 및 결론 (Significance)
임상적 투명성: 이 프레임워크는 단순한 분류를 넘어, "왜" 그 진단이 내려졌는지를 텍스트와 시각적 주석으로 설명하여 의료진의 신뢰를 높이고 인간 - AI 협업 (Human-in-the-loop) 을 가능하게 합니다.
불균형 데이터 해결: 의료 영상에서 흔히 발생하는 클래스 불균형 문제를 PID 기반의 동적 손실 함수로 효과적으로 해결하여, 희귀하거나 복잡한 병변에 대한 진단 정확도를 획기적으로 높였습니다.
실용적 가치: LLaVA-Med 와 같은 대형 모델의 높은 정확도와 SmolVLM 과 같은 경량 모델의 효율성 사이에서 균형을 찾을 수 있는 아키텍처를 제시하며, 향후 실제 임상 환경에서의 자동화 진단 시스템 도입을 위한 강력한 기반을 마련했습니다.
이 연구는 의료 영상 분석 분야에서 **정확성 (Accuracy)**과 **해석 가능성 (Interpretability)**을 동시에 달성한 새로운 벤치마크를 제시하며, 요추관 협착증 진단의 자동화 및 표준화에 중요한 기여를 하고 있습니다.