기존의 AI 는 "검은 상자 (Black Box)"처럼, 왜 그런 결론을 내렸는지 알 수 없는 경우가 많았습니다. 이를 해결하기 위해 **'개념 병목 모델 **(CBM)이라는 방식이 개발되었는데, 이는 AI 가 최종 답을 내기 전에 인간이 이해할 수 있는 '개념' (예: "새의 날개", "스포츠 경기장") 을 먼저 파악하게 하는 방식입니다.
하지만 기존 방식에는 두 가지 큰 문제가 있었습니다. 이 논문은 이를 해결하는 새로운 방법인 f-CBM을 제안합니다.
🕵️♂️ 문제: "가짜 개념"과 "숨겨진 정보"
기존 AI 모델이 개념을 사용할 때 발생하는 두 가지 치명적인 결함을 다음과 같이 비유할 수 있습니다.
**개념을 잘못 감지함 **(Detection Failure)
비유: AI 가 "새"를 설명할 때, "날개"라는 개념을 찾아내야 하는데, 오히려 "비행기"를 보고 "날개"라고 잘못 판단하는 경우입니다.
결과: 설명이 틀려서 신뢰할 수 없습니다.
**정보 누출 **(Leakage - 가장 중요한 문제)
비유: AI 가 "날개"라는 개념을 설명할 때, 사실은 "날개" 자체의 의미뿐만 아니라, "이 사진이 스포츠 뉴스인지, 날씨 뉴스인지" 같은 숨겨진 정보까지 몰래 섞어서 전달하는 것입니다.
상황: 마치 시험을 볼 때, 정답을 알려주는 '힌트'를 문제 풀이 과정 (개념 설명) 속에 몰래 숨겨놓은 것과 같습니다.
결과: AI 는 개념을 설명하는 척하지만, 실제로는 그 숨겨진 힌트 때문에 정답을 맞힙니다. 그래서 인간이 "아, 이 개념이 중요하구나"라고 믿고 개입해도 AI 는 엉뚱한 답을 내놓게 됩니다.
💡 해결책: f-CBM (신뢰할 수 있는 멀티모달 모델)
저자들은 이 문제를 해결하기 위해 f-CBM이라는 새로운 시스템을 만들었습니다. 이 시스템은 두 가지 핵심 전략을 사용합니다.
1. "누출 방지 경보 시스템" (Leakage Loss)
비유: AI 가 개념을 설명할 때, "이 설명에 정답을 알려주는 비밀 정보가 섞여 있나?"를 실시간으로 감시하는 경보 시스템을 달았습니다.
작동 원리: 만약 AI 가 "날개" 개념을 설명하면서 "스포츠"라는 힌트를 몰래 섞어 넣으려 하면, 시스템이 "안 돼! 그건 개념이 아니야!"라고 벌점 (손실 함수) 을 줍니다.
효과: AI 는 오직 개념의 순수한 의미만 설명하도록 훈련됩니다.
2. "유연한 해석관" (KAN - 콜모고로프 - 아르놀드 네트워크)
비유: 기존 모델은 개념을 최종 답으로 연결할 때 **단단한 직선 **(Linear)만 사용했습니다. 하지만 세상은 복잡해서 직선으로만 설명하기 어려운 경우가 많습니다.
f-CBM 은 이를 **유연하게 구부러지는 곡선 **(KAN)으로 바꿨습니다.
작동 원리: "날개"가 얼마나 중요할지, "경기장"이 얼마나 중요할지 상황에 따라 유연하게 판단할 수 있게 해줍니다.
효과: AI 가 복잡한 상황을 이해하기 위해 개념에 불필요한 정보를 숨겨 넣을 필요가 없어집니다. (개념이 충분히 유연하게 해석되니까요.)
🌍 왜 이 연구가 특별한가요? (멀티모달)
기존 연구는 주로 이미지나 텍스트 중 하나만 다뤘습니다. 하지만 f-CBM 은 이미지와 텍스트를 동시에 이해합니다.
비유: 뉴스 기사를 볼 때, 사진과 기사 내용을 동시에 보고 "이건 스포츠 뉴스구나"라고 판단하는 것처럼, AI 도 이미지와 글을 함께 보며 개념을 파악합니다.
🏆 실험 결과: "진짜 설명"을 증명하다
연구진은 이 모델이 얼마나 '신뢰할 수 있는지' 검증했습니다.
정답률: 기존 블랙박스 AI 와 똑같이 높은 정답률을 냅니다.
개념 감지: "날개", "경기장" 같은 개념을 훨씬 정확하게 찾아냅니다.
**개입 실험 **(가장 중요!)
상황: 인간이 "이 사진은 스포츠가 아니야, '날개' 개념을 지워줘"라고 AI 에게 직접 개입 (수정) 을 해보았습니다.
기존 모델: 개념을 수정했는데 오히려 정답률이 떨어졌습니다. (왜냐하면 개념 속에 숨겨진 '비밀 힌트'를 AI 가 의존하고 있었기 때문입니다.)
f-CBM: 개념을 수정하자 정답률이 오히려 올라갔습니다.
의미: f-CBM 은 정말로 개념의 의미에만 의존하고 있었기 때문에, 인간이 개념을 고쳐주면 AI 도 올바르게 판단할 수 있었습니다.
📝 한 줄 요약
**"이제 AI 는 개념을 설명할 때, 숨겨진 힌트 **(누출)
이 연구는 AI 가 단순히 정답만 맞추는 것이 아니라, 인간이 이해하고 신뢰할 수 있는 방식으로 사고 과정을 보여주는 길을 열었습니다.
논문 개요: 다중 모달 개념 병목 모델 (f-CBM) 을 통한 충실한 설명 가능성 확보
이 논문은 해석 가능한 인공지능 (XAI) 의 한 분야인 **개념 병목 모델 (Concept Bottleneck Models, CBM)**을 다중 모달 (이미지 + 텍스트) 환경으로 확장하고, 그 **충실성 (Faithfulness)**을 보장하는 새로운 프레임워크인 f-CBM을 제안합니다.
1. 문제 정의 (Problem)
CBM 의 한계: CBM 은 입력을 인간이 이해할 수 있는 '개념 (Concepts)'으로 매핑한 후 최종 예측을 수행하는 구조로 해석성이 높습니다. 그러나 기존 CBM 은 두 가지 주요 한계를 가집니다.
개념 검출 부정확성: 개념 병목 층 (CBL) 에서 개념이 정확하게 감지되지 않을 수 있습니다.
누출 (Leakage): 개념 표현이 의도된 의미뿐만 아니라 작업 관련 정보나 다른 개념 간의 정보를 포함하여 최종 예측에 '밀반입'하는 현상입니다. 이는 **작업 누출 (Task Leakage)**과 **개념 간 누출 (Inter-concept Leakage)**로 나뉩니다.
충실성 (Faithfulness) 의 부재: 누출이 발생하면 모델이 개념에 기반하여 예측하는 것이 아니라, 개념을 우회하는 정보를 이용해 예측하게 되어 설명이 실제 모델의 추론 과정을 왜곡하게 됩니다. 이는 의료 등 고위험 분야에서 신뢰할 수 없는 결과를 초래할 수 있습니다.
다중 모달 환경의 부재: 기존 CBM 연구는 주로 컴퓨터 비전이나 NLP 에 집중되어 있으며, 이미지와 텍스트를 동시에 처리하는 다중 모달 환경에서의 연구는 미흡합니다. 또한, 기존 접근법은 개념 검출과 누출 방지를 분리하여 처리하거나, 한쪽을 개선하는 과정에서 예측 정확도가 떨어지는 트레이드오프 문제가 존재했습니다.
2. 방법론 (Methodology: f-CBM)
저자들은 f-CBM을 제안하며, CLIP 기반의 비전 - 언어 백본을 활용하여 이미지와 텍스트를 통합 처리합니다. 충실성을 극대화하기 위해 두 가지 상호 보완적인 전략을 도입했습니다.
CLIP 기반 다중 모달 아키텍처:
이미지 (xv) 와 텍스트 (xt) 를 CLIP 의 비전 및 텍스트 인코더로 각각 임베딩한 후, 이를 연결하여 단일 벡터 z로 만듭니다.
이 벡터가 개념 병목 층 (CBL) 을 통과하여 개념 활성화 점수 (c^) 를 생성합니다.
전략 1: 차분 가능한 누출 손실 (Differentiable Leakage Loss)
목표: 개념이 작업 레이블에 대한 불필요한 정보를 포함하지 않도록 강제합니다.
구현: 기존 이산적 바인 (binning) 방식의 상호 정보량 (Mutual Information, MI) 추정은 기울기 (gradient) 가 소실되는 문제가 있어, **커널 밀도 추정 (Kernel Density Estimation, KDE)**을 사용하여 MI 를 미분 가능하게 추정합니다.
손실 함수: 예측된 개념과 레이블 간의 MI 가 실제 개념과 레이블 간의 MI 를 초과하는 정도를 패널티로 부과합니다. 이를 통해 개념이 의도된 의미 외의 작업 관련 신호를 '밀반입'하는 것을 방지합니다.
전략 2: KAN (Kolmogorov-Arnold Network) 예측 헤드
문제: 기존 CBM 은 개념에서 클래스로 가는 선형 계층 (Linear Layer) 을 사용하는데, 이는 표현력이 부족하여 모델이 개념 층에 추가 정보를 숨기게 (누출) 만듭니다.
해결: 선형 계층을 KAN으로 대체합니다. KAN 은 노드가 아닌 엣지에 학습 가능한 일변수 함수를 배치하여 높은 표현력 (Expressiveness) 을 제공합니다.
효과: 예측 헤드가 충분히 유연해지면, 개념 층이 불필요한 정보를 숨겨야 할 필요가 줄어들어 개념 검출 정확도가 향상되고 누출이 감소합니다.
전체 학습 목표: L=Lcls+λ~LC+λ~leakαLleak
분류 손실 (Lcls), 개념 예측 손실 (LC), 누출 손실 (Lleak) 을 동시에 최적화합니다. α는 학습 초기에는 0 에서 시작해 점차 1 로 증가하여 개념 학습을 방해하지 않도록 점진적으로 누출 손실을 활성화합니다.
3. 주요 기여 (Key Contributions)
CLIP 기반 다중 모달 CBM 아키텍처 도입: 이미지와 텍스트를 통합하여 개념을 감지하는 새로운 프레임워크를 제시했습니다.
충실성 요소 간 상관관계 분석: 개념 검출 정확도, 작업 누출, 개념 간 누출이 서로 밀접하게 연관되어 있음을 실험적으로 규명했습니다. (개념 검출이 향상되면 누출도 감소함)
미분 가능한 누출 측정 및 최적화: KDE 를 기반으로 한 차분 가능한 누출 손실 함수를 제안하여, 학습 과정에서 누출을 직접적으로 최소화할 수 있게 했습니다.
KAN 기반 예측 헤드: 해석성을 유지하면서 예측 유연성을 높여 개념 검출 성능을 개선하고 누출을 줄이는 새로운 접근법을 제시했습니다.
4. 실험 결과 (Results)
논문은 N24News(다중 모달 뉴스), CUB-200(조류 분류), AGNews, DBpedia 등 4 개의 데이터셋과 CLIP-base/large 백본을 사용하여 실험했습니다.
성능 균형 (Trade-off): f-CBM 은 기존 블랙박스 모델 (Fine-tuned CLIP) 과 유사한 **작업 정확도 (Task Accuracy)**를 유지하면서도, **개념 검출 오류 (c-RMSE)**를 크게 줄이고 **누출 (Leakage)**을 극도로 낮췄습니다.
누출 감소: 다른 모든 경쟁 모델 (Indep.-CBM, Label-free, CT-CBM) 에 비해 작업 누출 (CTL) 과 개념 간 누출 (ICL) 에서 가장 낮은 점수를 기록했습니다. 특히 CT-CBM 대비 누출이 97% 까지 감소한 사례가 있었습니다.
개념 검출 향상: KAN 레이어를 도입한 결과, 개념 검출 정확도가 크게 향상되었습니다. (예: N24News 에서 c-RMSE 51% 감소)
개념 개입 (Intervention) 테스트:
CBM 의 핵심 기능인 '개념 개입' (예측된 개념을 정답으로 수정하여 모델 성능 향상 여부) 에서 f-CBM 은 유일하게 일관된 정확도 향상을 보였습니다.
반면, 누출이 높은 다른 모델들은 개념을 수정했을 때 오히려 성능이 저하되었습니다. 이는 해당 모델들이 개념의 의미 외의 누출된 정보를 의존하고 있었음을 의미하며, f-CBM 이 진정한 충실성을 달성했음을 증명합니다.
해석 가능성: KAN 레이어를 통해 개념 활성화와 클래스 예측 간의 비선형적, 포화 (saturation) 관계를 시각화하여 더 풍부한 해석을 가능하게 했습니다.
5. 의의 및 결론 (Significance)
이론적/실용적 가치: f-CBM 은 CBM 이 단순히 해석 가능한 구조를 갖는 것을 넘어, 그 설명이 모델의 실제 추론 과정을 정확히 반영하는 충실한 (Faithful) 모델임을 입증했습니다.
다중 모달 확장: 이미지와 텍스트를 통합하여 처리함으로써, 현실 세계의 복잡한 다중 모달 데이터에 CBM 을 적용할 수 있는 길을 열었습니다.
신뢰할 수 있는 AI: 특히 의료나 금융 등 고위험 분야에서 모델의 결정 과정을 신뢰하고, 필요시 인간이 개념을 개입하여 수정할 수 있는 실용적인 AI 시스템 구축에 기여합니다.
누출과 검출의 동시 해결: 기존에는 서로 상충되던 '개념 검출 정확도'와 '누출 방지'를 동시에 해결하여, 해석성과 성능을 모두 잡는 최적의 균형 (Pareto Frontier) 을 달성했습니다.
이 연구는 개념 기반 XAI 의 한계를 극복하고, 신뢰할 수 있는 다중 모달 AI 시스템 개발을 위한 중요한 이정표가 됩니다.