Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs
이 논문은 결합된 확산 사전 확률(diffusion priors)과 샤플리 값(Shapley values)을 사용하여 어떤 양상(이미지 또는 텍스트)이 멀티모달 거대 언어 모델의 예측을 주도하는지 정량화함으로써, 기존의 특징 수준 설명 가능성 방법들이 놓치는 안전하지 않은 추론 패턴을 밝혀내는 새로운 프레임워크인 반사실적 양상 기여도(Counterfactual Modality Attribution, CMA)를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 풀려는 탐정이라고 상상해 보세요. 하지만 당신에게는 매우 다른 두 명의 파트너가 있습니다. 한 명은 사진만을 보여주는 사진가이고, 다른 한 명은 말로만 설명하는 이야기꾼입니다. 인공지능의 세계에서, 멀티모달 거대 언어 모델(MLLM)이라 불리는 초고성능 컴퓨터들은 이 탐정 팀처럼 행동합니다. 이들은 이미지와 텍스트를 동시에 보며 환자를 진단하거나 문제를 식별하는 것과 같은 큰 결정을 내립니다. 하지만 여기서 까다로운 점이 있습니다. 컴퓨터가 정답을 맞혔다고 해서 반드시 옳은 방식으로 알아냈다는 뜻은 아니라는 것입니다. 때때로 컴퓨터는 사진을 무시하고 텍스트만 읽거나, 반대로 텍스트를 무시하고 사진에만 의존하는 '지름길(shortcuts)'에 빠질 수 있습니다. 이것은 아주 큰 문제입니다. 만약 우리가 어떤 파트너가 일을 하고 있는지 모른다면, 심각한 상황이 닥쳤을 때 그 탐정을 신뢰할 수 없기 때문입니다. 우리는 이렇게 물어야 합니다. "헤이, 이 문제를 해결한 게 사진이었니, 아니면 이야기였니?"
이것이 바로 사라예보 대학교와 킹스 칼리지 런던의 연구진들이 다루고 있는 새로운 연구 주제입니다. 연구진은 이 AI 탐정들이 핵심적인 정보를 무시한 채 한 가지 단서에만 의존하는 '지름길'을 택할 것을 우려하고 있습니다. 이를 해결하기 위해, 그들은 **반사실적 양상 귀속(Counterfactual Modality Attribution, CMA)**이라는 영리한 새로운 도구를 발명했습니다. CMA는 "만약에?" 기계라고 생각하면 됩니다. 이 도구는 AI에게 다음과 같이 묻습니다. "만약 사진만 보여줬다면 어땠을까?" 그리고 "만약 텍스트만 줬다면 어땠을까?" 이러한 가상의 "만약에" 시나리오를 생성함으로써, 이 도구는 사진이 얼마나 기여했는지, 그리고 텍스트가 얼마나 기여했는지를 정확히 측정할 수 있습니다. 연구진은 이를 가짜 퍼즐과 실제 의료 보고서에 테스트했으며, CMA가 AI가 중요한 정보를 무시하고 있는 상황을 포착하는 데 믿기 힘들 정도로 뛰어나다는 것을 발견했습니다. 실제로 통제된 테스트에서, CMA는 다른 방법들이 놓친 숨겨진 실수를 드러내며 정답의 진짜 출처를 98%의 확률로 정확히 식별해 냈습니다.
탐정의 딜레마
당신이 환자의 폐렴 여부를 판단하려는 의사라고 상상해 보세요. 당신에게는 두 가지 증거가 있습니다: 흉부 X-레이(사진)와 간호사가 작성한 의료 보고서(텍스트)입니다. 간호사의 보고서에는 "환자는 페니실린에 알레르기가 있음"이라고 적혀 있습니다. X-레이는 명확하게 폐렴을 보여줍니다. 똑똑한 AI라면 두 가지를 모두 살펴보고, "네, 폐렴입니다"라고 말한 뒤, 페니실린이 아닌 안전한 항생제를 추천해야 합니다.
하지만 만약 AI가 "지름길에 의존"한다면 어떻게 될까요? 만약 AI가 X-레이를 보고 폐렴을 확인한 뒤, 간호사의 노트를 읽지도 않고 즉시 항생제를 선택한다면 어떨까요? 만약 그 항생제가 하필 페니실린이라면, 환자는 생명을 위협받는 반응을 일으킬 수 있습니다. AI는 진단을 맞혔지만, 텍스트를 무시했기 때문에 안전 검사를 통과하지 못한 것입니다. 이것을 "지름길 학습(shortcut learning)"이라고 부릅니다. 이는 서류상으로는 완벽해 보이지만(진단을 맞혔으므로), 실제 세상에서는 위험할 수 있기 때문에 매우 위험합니다.
문제는 현재 대부분의 AI 검사 도구들이 AI가 어디를 보고 있는지만 확인한다는 점입니다. 그들은 X-레이의 폐렴 부위에 빨간 상자를 그리거나 텍스트의 특정 단어를 강조할 수는 있지만, **어떤 것이 AI를 결정하게 만들었는가?**라는 거대한 질문에는 답할 수 없습니다. 사진이 결정을 주도했나요, 아니면 텍스트가 주도했나요? 아니면 둘이 함께 작동했나요?
"만약에?" 기계
연구진은 이를 해결하기 위해 **반사실적 양상 귀속(CMA)**이라는 새로운 방법을 만들었습니다. "반사실적(Counterfactual)"이라는 단어는 "만약에?"라는 의미를 담은 멋진 표현입니다. CMA는 AI와 "만약에?" 게임을 벌입니다.
작동 방식은 간단한 비유를 들어 설명하겠습니다:
밀가루와 설탕이라는 두 가지 재료로 케이크를 굽는다고 상상해 보세요. 당신은 어떤 재료가 케이크를 달콤하게 만드는지 알고 싶습니다.
- 원래의 케이크: 밀가루와 설탕을 모두 넣어 케이크를 굽습니다. 맛이 달콤합니다.
- "만 if" 시나리오:
- 시나리오 A (이미지만 사용): 설탕 없이 밀가루만 넣고 케이크를 굽습니다.
- 시나리오 B (텍스트만 사용): 밀가루 없이 설탕만 넣고 케이크를 굽습니다.
- 시나리오 C (둘 다 제거): 둘 다 넣지 않고 케이크를 굽습니다.
이 다양한 케이스의 케이크들을 맛봄으로써, 당신은 설탕이 달콤함에 얼마나 기여했는지 정확히 알 수 있습니다. 만약 설탕만 넣은 케이크는 달콤하지만 밀가루만 넣은 케이크는 밋밋하다면, 설탕이 주인공이라는 것을 알게 됩니다.
CMA는 AI를 대상으로 이 작업을 수행하지만, 케이크 대신 이미지와 텍스트를 사용합니다. 이 도구는 텍스트를 제거하되 이미지는 유지하거나, 이미지를 제거하되 텍스트는 유지하는 현실적인 버전의 입력을 만들기 위해 특수한 "마법 생성기"(디퓨전 모델)를 사용합니다. 그런 다음 수정된 이 새로운 버전들에 대해 AI에게 예측을 요청합니다.
스코어보드: 누가 일을 했는가?
AI가 모든 "만약에" 버전들에 대해 예측을 마치면, CMA는 **샤플리 값(Shplay values)**이라는 수학적 점수 체계를 사용하여 계산합니다. 이것은 두 명의 플레이어(이미지와 텍스트)가 한 팀인 비디오 게임의 스코어보드와 같습니다. 스코어보드는 각 플레이어가 팀의 승리에 얼마나 기여했는지 계산합니다.
- 만약 텍스트를 제거했을 때 AI의 생각이 바뀐다면, 텍스트가 높은 점수를 받습니다.
- 만약 이미지를 제거했을 때 AI의 생각이 바뀐다면, 이미지가 높은 점수를 받습니다.
- 만약 AI가 정답을 맞히기 위해 둘 다 필요하다면, 점수를 나누어 갖습니다.
결과는 명확한 백분율로 나타납니다: "이미지 90%, 텍스트 10%". 이는 어떤 양상이 결정을 주도하고 있는지를 정확히 알려줍니다.
연구 결과
연구진은 두 가지 방식으로 CMA를 테스트했습니다:
- 가짜 퍼즐: 연구진은 AI가 오직 사진에만 의존하거나, 혹은 오직 텍스트에만 의존해야 하는 상황을 확실히 알고 있는 게임을 만들었습니다. 이 테스트에서 CMA는 슈퍼스타였습니다. CMA는 "지름길에 의존하는" AI를 98%의 확률로 정확히 식별해 냈습니다. 개별 픽셀이나 단어만을 살펴보는 다른 방법들은 혼란에 빠져 편향을 찾아내는 데 실패했습니다.
- 실제 의료 보고서: 연구진은 흉부 X-레이와 의사의 노트를 포함한 실제 데이터셋에 이를 테스트했습니다. 그 결과, AI가 이상한 지름길에 의존하는 사례들을 발견했습니다. 예를 들어, 한 사례에서 AI는 실제 결절(혹)을 본 것이 아니라 X-레이에 보이는 ECG 리드(전선)를 보고 "결절"을 진단하고 있었습니다. CMA가 전선을 제거했을 때(이미지 지름길 제거), AI의 생각이 바뀌었습니다. 이는 CMA가 다른 도구들이 놓친 위험한 지름길을 찾아낼 수 있음을 증명했습니다.
이것이 왜 중요한가
이 논문이 보여주는 가장 중요한 점은 단순히 정답을 맞히는 것만으로는 충분하지 않다는 것입니다. AI는 잘못된 이유로 정답을 낼 수 있습니다. 만약 우리가 정답이 맞는지 여부만 확인한다면, AI가 중요한 안전 정보(예: 알레르기)를 무시하고 있다는 사실을 놓칠 수 있습니다.
CMA는 AI의 사고 과정을 감사(audit)할 수 있는 방법을 제공합니다. 이 도구는 단순히 AI가 무엇을 결정했는지만 알려주는 것이 아니라, 왜 그렇게 결정했는지를 알려줍니다. 이는 의료, 자율주행 자동차, 법적 결정과 같이 고도의 신뢰가 필요한 상황에서 매우 중요합니다. 우리는 AI가 가진 모든 증거를 사용하는지, 아니면 그저 쉬운 것들만 사용하는지 확신할 수 있어야 하기 때문입니다.
연구진은 이 도구가 실행하는 데 다소 많은 컴퓨터 연산 능력을 필요로 하며 아직 완벽하지는 않다고 인정합니다. 하지만 이는 큰 진전입니다. 이 기술은 AI의 의사결정이라는 '블랙박스'를 우리가 이해하고 신뢰할 수 있는 것으로 바꾸어 놓으며, AI가 "확신합니다"라고 말할 때, 정말로 옳은 이유로 확신하고 있는지 보장해 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.