FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment
이 논문은 웰빙 평가를 위한 멀티모달 파운데이션 모델(VLM)의 진단 정확도와 인구통계학적 편향성을 분석하고, 설명 가능한 AI(XAI)를 통한 공정성 개선 시도가 정확도 저하나 편향성 증폭과 같은 한계를 보일 수 있음을 밝히며 정확도, 공정성, 일반화 성능을 동시에 최적화해야 할 필요성을 강조합니다.
최근 AI는 사람의 목소리, 표정, 말하는 내용을 한꺼번에 보고 "이 사람은 우울증인 것 같아요"라고 판단할 수 있을 만큼 똑똑해졌습니다(이것을 VLM이라고 불러요).
하지만 이 AI는 마치 **'속이 보이지 않는 검은 상자(Black Box)'**와 같습니다. 왜 그런 결론을 내렸는지 설명해주지 않거든요. 만약 AI가 어떤 사람에게 "당신은 우울증입니다"라고 했는데, 그 이유가 실제 증상이 아니라 단순히 그 사람의 '성별'이나 '인종' 때문이라면 어떻게 될까요? 이건 아주 위험한 일이죠.
2. 실험 내용: "두 명의 AI 의사 테스트"
연구팀은 두 명의 AI 의사(Qwen과 Phi)를 데려와서 두 가지 환경에서 시험을 치르게 했습니다.
실험실 환경 (AFAR-BSFT): 아주 깨끗하고 통제된 병원 진료실 같은 곳.
실제 생활 환경 (E-DAIC): 집이나 일상적인 공간처럼 소음도 있고 변수가 많은 곳.
3. 발견된 문제점 (비유로 보기)
① "환경에 따라 실력이 널뛰기해요" (환경의 차이) 어떤 AI는 깨끗한 실험실에서는 척척 맞히는데, 실제 생활 환경에 놓으니 갑자기 엉터리 답을 내놓기도 했습니다. 마치 **"교과서 문제만 잘 푸는 학생이 실제 시험장에서는 당황해서 문제를 못 푸는 것"**과 같습니다.
② "편견이라는 안경을 쓰고 있어요" (차별의 문제) 가장 큰 문제는 AI가 특정 집단에 대해 편견을 가지고 있었다는 점입니다.
A 의사(Qwen): "여성"이나 "남성" 같은 성별에 따라 진단이 달라지는 경향이 있었어요.
B 의사(Phi): "인종"에 따라 진단이 달라지는 경향이 있었죠. 마치 **"특정 색깔의 안경을 쓰고 환자를 보는 것"**과 같습니다. 안경 색깔 때문에 환자의 진짜 상태가 아닌, 안경 색깔에 따른 선입견으로 진단을 내리는 것이죠.
③ "설명만 잘한다고 믿을 수 있는 건 아니에요" (XAI의 함정) 연구팀은 AI에게 "왜 그렇게 생각했는지 이유를 설명해봐!"라고 시켰습니다(이것을 XAI라고 합니다). 그런데 결과가 아주 묘했습니다.
어떤 AI는 이유를 아주 논리적으로 설명하기 시작했는데, 정작 진단 결과는 더 편향되게 나왔습니다. **"말만 번지르르하게 하는 궤변가"**가 된 것이죠.
또 어떤 AI는 "공정하게 진단해!"라고 압박했더니, 아예 진단을 포기하고 아무 말이나 내뱉는 **"멘붕(패닉) 상태"**에 빠지기도 했습니다.
💡 이 연구가 주는 교훈 (결론)
이 논문은 우리에게 이렇게 경고합니다.
"AI가 '왜 그렇게 생각했는지' 이유를 말한다고 해서, 그 AI가 반드시 공정하거나 정확한 것은 아니다!"
따라서 AI를 실제 의료 현장에 쓸 때는 다음 세 가지가 꼭 필요하다고 제안합니다:
실전 연습 필수: 교과서(실험실) 데이터만 믿지 말고, 실제 세상의 복잡한 환경에서도 잘 작동하는지 확인해야 합니다.
다각도 검사: 성별 하나, 인종 하나만 볼 게 아니라 여러 가지 편견이 섞여 있는지 꼼꼼히 따져야 합니다.
인간 의사의 최종 확인: AI는 어디까지나 의사를 도와주는 '보조 도구'일 뿐입니다. AI의 설명이 혹시 '그럴듯한 거짓말(환각)'은 아닌지, 편견에 기반한 것은 아닌지 최종 결정은 반드시 사람이 내려야 합니다.
[기술 요약] FAIR_XAI: 웰빙 평가를 위한 설명 가능성을 통한 멀티모달 파운데이션 모델의 공정성 개선
1. 문제 정의 (Problem Statement)
최근 시각-언어 모델(Vision-Language Models, VLMs)의 발전으로 멀티모달 학습을 통한 정신 건강(우울증) 모니터링의 가능성이 커졌습니다. 그러나 임상 현장에 VLM을 도입할 때 두 가지 핵심적인 병목 현상이 존재합니다:
블랙박스 문제 (Black-box Dilemma): 모델의 판단 근거가 불투명하여 임상의가 모델의 예측이 유효한 임상적 지표에 기반한 것인지, 아니면 데이터의 편향(Bias)에 의한 것인지 구분하기 어렵습니다.
공정성 및 신뢰성 문제: 기존 VLM은 인종, 성별 등 인구통계학적 특성에 따라 예측 성능의 차이를 보이는 편향성을 가질 수 있으며, 이러한 편향이 임상 진단에 오용될 경우 심각한 윤리적 문제를 초래할 수 있습니다.
본 연구는 "VLM의 제로샷(Zero-shot) 성능이 환경에 따라 어떻게 변하는가?", "모델 구조에 따라 편향의 양상이 어떻게 다른가?", 그리고 **"설명 가능한 AI(XAI) 기법이 실제 결과의 공정성을 개선할 수 있는가?"**를 탐구합니다.
2. 연구 방법론 (Methodology)
연구진은 두 가지 데이터셋(AFAR-BSFT: 통제된 실험실 환경, E-DAIC: 자연스러운 임상 환경)을 사용하여 두 가지 파이프라인을 구축했습니다.
A. 두 가지 분류 파이프라인
생성형 분류 파이프라인 (Generative Classification Pipeline):
VLM(Qwen2-VL, Phi-3.5-Vision)에 인구통계 정보, 선택된 임상 바이오마커(음성, 얼굴, 텍스트 특징), 작업 지침을 하나의 자연어 프롬프트로 결합하여 입력합니다.
모델이 직접 텍스트로 추론하고 분류 결과를 출력하는 제로샷 방식을 사용합니다.
임베딩 기반 분류 파이프라인 (Embedding-based Classification Pipeline):
VLM의 텍스트 인코더에서 추출한 임베딩과 MLP를 통해 처리된 오디오/얼굴 임베딩을 결합(Early Fusion)하여 이진 분류 헤드를 통해 예측합니다.
B. XAI 기반 개입 프레임워크 (Intervention Framework)
프롬프트 기반 개입 (Prompt-based Intervention): 생성형 파이프라인에 Chain-of-Thought(CoT) 추론 지시와 **공정성 규칙 세트(Fairness Rule Set)**를 추가합니다. 모델이 임상 지표에만 근거하고 인구통계적 요소를 무시하도록 유도합니다.
반사실적 공정성 알고리즘 (Counterfactual Fairness Algorithm, CFA): 임베딩 파이프라인 학습 시, 특정 특징이 민감한 속성(성별 등)과 강하게 상관되어 있으면 이를 페널티로 부여하는 손실 함수(Ltotal=LCE+λLCFA)를 적용합니다.
환경 영향: 실험실 데이터(AFAR-BSFT)에서는 모델들이 높은 재현율(Recall)을 보이며 우울증을 과잉 예측(Over-predict)하는 경향(보수적 스크리닝)을 보였습니다.
모델 격차: E-DAIC 데이터셋에서 Phi-3.5-Vision은 80.4%의 높은 정확도를 보인 반면, Qwen2-VL은 33.9%로 급격한 성능 저하를 보였습니다.
RQ2: 모델 구조별 편향 양상
차별적 편향: 편향의 양상이 모델마다 달랐습니다. Qwen2-VL은 성별 편향이 두드러졌고, Phi-3.5-Vision은 인종 편향이 더 강하게 나타났습니다.
모달리티 결합의 영향: 멀티모달 신호를 결합할 때 편향이 완화되기도 하지만, 특정 조합(예: 텍스트 + 얼굴)에서는 오히려 편향이 증폭되는 현상이 관찰되었습니다.
RQ3: XAI 개입의 효과 (가장 중요한 발견)
절차적 투명성 vs 결과적 공정성의 괴리: XAI 개입(CoT + 공정성 프롬프트)을 통해 모델의 추론 과정은 더 논리적으로 변할 수 있었으나(절차적 일관성 향상), 이것이 반드시 결과의 공정성으로 이어지지는 않았습니다.
부작용: Qwen2-VL의 경우, 추론의 질은 좋아졌으나 인종 편향이 오히려 증폭되거나, E-DAIC에서 공정성을 맞추기 위해 정확도가 처참하게 낮아지는(Fairness through failure) 현상이 발생했습니다. CFA 알고리즘 역시 모델이 모든 샘플을 '정상'으로만 예측하는 **모델 붕괴(Model Collapse)**를 초래했습니다.
4. 연구의 의의 및 결론 (Significance & Conclusion)
본 논문은 VLM을 임상 분야에 도입할 때 발생할 수 있는 위험성을 기술적으로 경고합니다.
XAI의 한계 지적: 설명 가능성(Explainability)이 모델의 내부 편향을 보여주는 '진단 창' 역할은 할 수 있지만, 그 자체로 편향을 교정하는 '치료제'가 될 수는 없음을 입증했습니다.
임상적 가이드라인 제시:
VLM의 출력을 확정적 진단이 아닌 **'스크리닝 신호'**로만 취급해야 합니다.
공정성을 평가할 때 단일 지표가 아닌 성능(κ)과 공정성($EO, DI$)을 동시에 고려해야 합니다.
공정성 개선이 예측 성능의 붕괴를 동반한다면, 이는 실질적인 개선이 아닌 '실패를 통한 공정성'에 불과하므로 거부해야 합니다.
결론: 향후 VLM의 임상 적용을 위해서는 예측 정확도, 인구통계학적 공정성, 그리고 다양한 환경에서의 일반화 성능을 동시에 최적화하는 통합적인 접근이 필수적입니다.