← 최신 논문
💻 computer science

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

본 논문은 비전 트랜스포머에 Grad-CAM을 적용할 때 발생하는 광범위한 방법론적 모호성과 엄격한 구현 세부 사항의 결여를 드러내기 위해 175개의 연구에 대한 체계적인 분류 및 감사를 제시하며, 이를 CNN의 대응물로부터의 사소한 확장으로 취급하는 것이 재현성과 해석에 영향을 미치는 결정적인 선택들을 가린다고 주장한다.

원저자: Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

게시일 2026-08-07
📖 5 분 읽기🧠 심층 분석

원저자: Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 한 천재적이고 매우 빠른 탐정이 미스터리를 해결하는 과정을 이해하려고 노력하고 있다고 상상해 보세요. 옛날에 이 탐정은 특정한 도구 세트를 사용했습니다. 바로 범죄 현장의 아주 작은 격자 모양 조각들을 하나씩 살펴보는 돋보기였습니다. 이 도구는 Grad-CAM이라고 불렸습니다. 이것은 사진에서 "아하! 이것은 고양이다!" 또는 "이것은 자동차다!"라고 탐정이 결론을 내리는 데 도움이 된 정확한 지점을 밝혀내는 것으로 유명했습니다. 탐정이 사진을 깔끔한 격자 형태로 보았기 때문에, 이 도구는 특정 사각형을 가리키며 "우리는 이 사각형에서 고양이의 귀를 보았다"라고 쉽게 말할 수 있었습니다.

하지만 최근에 이 탐정은 엄청난 업그레이드를 받았습니다. 이제 이 새로운 탐정(이를 Vision Transformer 또는 ViT라고 부릅니다)은 격자를 보는 대신, 전체 그림을 한 번에 보며 이를 "토큰"이라는 긴 노트 목록으로 나눕니다. 이는 지도를 보는 것이 아니라, 모든 단어가 단서가 되는 이야기를 읽는 것과 같습니다. 문제는 오래된 돋보기(Grad-CAM)는 격자를 위해 만들어졌지, 목록을 위해 만들어진 것이 아니라는 점입니다. 이 도구는 목록 속의 어떤 "단어"를 가리키며 "이 단어가 중요하다!"라고 말하는 법을 모릅로 합니다.

그래서 과학자들은 이 새로운 탐정의 노트 목록에 오래된 돋보기를 억지로 적용하려고 시도하기 시작했습니다. 그들은 왜 새로운 탐정이 그런 선택을 했는지 알고 싶어 했습니다. 하지만 함정이 있습니다. 아무도 어떻게 그 작업을 수행해야 하는지에 대해 합의하지 못했다는 것입니다. 어떤 사람들은 첫 번째 노트를 가리켰고, 어떤 사람들은 중간을, 어떤 사람들은 전체 목록을 가리켰으며, 또 어떤 사람들은 그냥 추측했습니다. 이 논문은 마치 이 모든 보고서를 감사하러 온 탐정 조사관과 같습니다. 그들은 알고 싶어 합니다: "우리가 실제로 도구를 올바르게 사용하고 있는가, 아니면 그냥 사용하는 척만 하고 있는 것인가?"


감사: 체계적인 혼란

이 논문의 저자인 케이시 월(Casey Wall)과 그의 팀은 직접 탐정 놀이를 하기로 했습니다. 그들은 새로운 "Vision Transformer" 탐정에게 오래된 "Grad-CAM" 도구를 적용하려고 시도한 모든 논문을 찾기 위해 과학 문헌을 샅샅이 뒤지는 거대한 추적을 시작했습니다. 그들은 550개가 넘는 방대한 논문 더미에서 시작했습니다. 매우 세심한 선별 과정을 거친 끝에, 그들은 이 방법을 실제로 적용하려고 시도한 175개의 논문으로 범위를 좁혔습니다.

그들이 발견한 것은 다소 혼란스러운 상태였습니다. 그들은 대부분의 논문이 새로운 탐정의 노트 목록을 여전히 예전의 격자처럼 취급하고 있다는 것을 발견했습니다. 그들은 이 도구를 사용하면서 그것을 어떻게 맞추어 넣었는지에 대해 제대로 설명하지 않은 채 사용하고 있었습니다.

논문은 "택소노미(taxonomy)"를 소개하는데, 이는 상세한 체크리스트나 선택 메뉴를 뜻하는 멋진 말입니다. 저자들은 Vision Transformer에 Grad-CAM을 적용하려고 할 때 몇 가지 큰 결정을 내려야 하며, 거의 아무도 이를 기록하지 않는다는 사실을 깨달았습니다:

  1. 어디를 볼 것인가: 탐정이 쓴 첫 번째 노트를 볼 것인가? 중간을 볼 것인가? 아니면 최종 요약본을 볼 것인가?
  2. 무엇을 측정할 것인가: 특정 노트가 얼마나 중요한지를 측정할 것인가, 아니면 탐정의 "주된 생각"( [CLS] 토큰)이 다른 노트들을 얼마나 신경 쓰는지를 측정할 것인가?
  3. 어떻게 섞을 것인가: 만약 탐정에게 여러 개의 "헤드"(다양한 관점)가 있다면, 그것들을 모두 평균 낼 것인가, 아니면 하나씩 살펴볼 것인가?

저자들은 이러한 선택들이 얼마나 중요한지를 보여주기 위해 몇 가지 테스트를 실행했습니다. 그들은 표준 모델을 가져와서 그들의 체크리스트에 있는 서로 다른 설정들을 사용하여 동일한 사진을 실행했습니다. 결과는 어땠을까요? "히트맵"(모델이 무엇을 보았는지 보여주는 빛나는 그림)은 어떤 설정을 선택하느냐에 따라 완전히 달라졌습니다. 어떤 설정은 사진 속의 개를 강조하는 반면, 다른 설정은 풀밭을 강조하고, 또 다른 설정은 거의 아무것도 보여주지 않았습니다.

큰 문제: 설명서 없는 "플러그 앤 플레이"

연구 결과, 그들이 살펴본 175개의 논문 중 무려 101개(약 58%)가 기존의 격자 기반 탐정을 위한 원본 논문을 인용했을 뿐, 새로운 목록 기반 탐정에게 어떻게 적응시켰는지 설명하지 않았습니다. 또 다른 17개의 논문은 수학적 원리를 설명하지 않은 채 단순히 코드 라이브러리(GitHub 저장소)만을 가리켰습니다. 실제로 자신의 구체적인 선택을 설명하거나 관련 논문을 인용한 논문은 단 26개(약 15%)뿐이었습니다.

저자들은 이것이 심각한 문제라고 주장합니다. 만약 어떤 과학자가 "우리 모델이 공정하다는 것을 보여주기 위해 Grad-CAM을 사용했다"라고 말하면서, 정작 어떤 버전의 Grad-CAM을 사용했는지 말해주지 않는다면, 당신은 그 결과를 신뢰할 수 없습니다. 이는 마치 요리사가 "나는 케이크를 구웠다"라고 말하면서, 밀가루를 썼는지 모래를 썼는지, 혹은 10분 동안 구웠는지 10시간 동안 구웠는지 말해주지 않는 것과 같습니다. 결과물은 케이크처럼 보일지 모르지만, 그것이 모두가 이야기하는 바로 그 케이크인지 확신할 수 없습니다.

이 논문이 실제로 말하는 것 (그리고 말하지 않는 것)

이 논문은 "이것이 이 작업을 수행하는 단 하나의 올바른 방법이다"라고 말하지 않도록 매우 주의를 기울였습니다. 대신, 그들은 아직 단 하나의 "정답"이 존재하지 않는다고 제안합니다. 그들은 이 분야가 이 방식에 대한 표준을 정립하지 못했다는 것을 발견했습니다.

그들은 단순히 기존 공식을 가져와서 생각 없이 새 모델에 갖다 붙이는 방식이 불가능하다는 점을 명시적으로 배제했습니다. 그들은 그렇게 하는 것이 "방법론적 모호성", 즉 도구가 어떻게 작동하는지에 대한 "혼란"을 야기한다는 것을 보여줍니다.

저자들은 이 분야가 앞으로 나아가기 위해서 연구자들이 Grad-CAM을 이러한 새로운 모델에 적용하는 것을 단순하고 자동적인 단계로 취급해서는 안 된다고 제안합니다. 연구자들은 자신이 어떤 "특징(feature)"을 골랐는지, 어떤 "그래디언트(gradient)"를 측정했는지, 그리고 데이터를 어떻게 다시 그림 형태로 "재구성(reshape)"했는지를 정확하게 기록해야 합니다.

이것이 왜 중요한가

이것은 단순한 학술적 까다로움이 아닙니다. 이 히트맵들은 특히 의료 진단이나 자율 주행 자동차와 같이 중요한 직업에서 AI 모델이 안전하고, 공정하며, 신뢰할 수 있다는 것을 증명하는 데 사용됩니다. 만약 설명이 모호하다면, 우리는 AI가 실제로 올바른 것을 보고 있는지 확신할 수 없습니다. 논문은 과학자들이 자신의 선택에 대해 매우 구체적으로 기록하기 시작하기 전까지, 연구 논문에서 우리가 보는 빛나는 그림들은 진실을 말하기보다는 그저 멋져 보이기 위한 것에 불과할 수 있다고 결론짓습니다.

요약하자면, 이 논문은 우리가 추측하는 것을 멈추고 우리의 레시피를 쓰기 시작해야 한다고 제안합니다. 그때까지 우리가 새로운 AI 모델에서 보는 "Grad-CAM"은 일종의 미스터리이며, 그것이 실제로 우리에게 무엇을 말하고 있는지 우리는 확신할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →