← 최신 논문
🤖 machine learning

Gradient-Skipping Relevance Propagation for Efficient Explainability of Vision Transformers

이 논문은 어텐션 헤드에 가중치를 적응적으로 부여하고 잔차 연결을 통해 관련성을 동적으로 분배함으로써 충실도와 국소화 성능을 개선하는 Vision Transformer를 위한 새로운 관련성 전파 방법인 GradSkip을 소개하며, 기존 방식보다 14배 이상 적은 GFLOPs로 최첨단 성능을 달성한다.

원저자: Christopher Buratti, Michele Marchetti, Federica Parlapiano, Davide Traini, Domenico Ursino, Luca Virgili

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Christopher Buratti, Michele Marchetti, Federica Parlapiano, Davide Traini, Domenico Ursino, Luca Virgili

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 **비전 트랜스포머(Vision Transformer, ViT)**라는 아주 똑똑한 로봇 뇌가 있다고 상상해 보세요. 이 뇌는 사진을 보고 그 안에 무엇이 있는지—예를 들어 무당벌레나 트럭을 찾아내는 일—알려주는 데 매우 놀라운 능력을 갖추고 있습니다. 하지만 문제는 이 로봇이 일종의 "블랙박스"라는 점입니다. 당신이 "왜 저게 트럭이라고 생각했니?"라고 물으면, 로봇은 그저 "그냥 그렇게 생각했으니까요"라고 대답할 뿐입니다. 어떤 부분 때문에 그런 결정을 내렸는지 보여주지 않는 것이죠.

과학자들은 로봇의 생각을 들여다보기 위해 그 내부를 살피려고 노력해 왔지만, 기존의 도구들은 마치 호두를 깨기 위해 대형 망치를 사용하는 것과 같았습니다. 그들은 로봇 뇌의 모든 부분을 똑같이 중요한 것처럼 취급했고, 정보가 변하지 않고 그대로 빠르게 통과하는 "지름길" 와이어들을 무시했습니다. 이로 인해 설명은 지저분해지고 종종 틀리기도 했습니다.

여기에, 이 혼란을 해결하기 위해 크리스토퍼 부라티(Christopher Buratti)와 그의 팀이 발명한 멋진 도구인 GradSkip이 등장합니다. GradSkip을 어떤 부분을 집중적으로 조사할지 알고, 어떤 뉴런이 실제로 힘을 쓰고 있고 어떤 뉴런이 그냥 낮잠을 자고 있는지 정확히 파악하는 스마트한 탐정이라고 생각하면 됩니다.

기존 도구들이 저지른 두 가지 큰 실수

논문은 이전의 탐정들이 저질렀던 두 가지 큰 오류를 지적합니다:

  1. "모두가 평등하다"는 실수: 어떤 합창단을 상상해 보세요. 어떤 가수들은 완벽한 고음을 내는 솔로 가수인 반면, 다른 가수들은 그냥 배경에서 웅얼거리고 있습니다. 기존의 도구들은 모든 가수가 똑같은 음량으로 노래하는 것처럼 취급했습니다. GradSkip은 어떤 "어텐션 헤드(attention heads, 합창단 섹션)"가 결정에 매우 중요한 역할을 하는지, 반면 어떤 것들은 그저 소음일 뿐인지 깨달았습니다. 이 도구는 솔로 가수의 노래에 귀를 기울이고 웅얼거림은 무시하는 법을 배웁니다.
  2. "지름길" 실수: 트랜스포머에는 메시지가 한 방을 건너뛰어 다음 방으로 바로 갈 수 있게 해주는 비밀 통로 같은 멋진 "스킵 연결(skip connections)"이 있습니다. 기존의 도구들은 이 통로들을 아무것도 변하지 않는 빈 복도처럼 취급했습니다. 하지만 때때로 메시지는 메인 방 안에서 변하기도 하고, 때로는 변하지 않기도 합니다. GradSkip은 최초로 확인합니다: "이 메시지가 터널을 통해 그냥 지나갔는가, 아니면 메인 방에서 변형되었는가?" 이를 통해 각 경로에 얼마나 많은 공로를 돌릴지 정확히 계산합니다.

GradSkip이 미스터리를 해결하는 방법

GradSkip은 로봇이 어떻게 생각하는지 알아내기 위해 영리한 2단계 전략을 사용합니다:

  • 1단계: "누가 누구인가" 필터: 로봇의 뇌를 살펴보고 "어떤 어텐션 헤드가 실제로 일을 하고 있는가?"라고 묻습니다. 이 도구는 특수한 수학적 기법(그래디언트 흐름과 "희소성(sparsity)" 측도를 결 조합하여, 마치 스포트라이트가 얼마나 집중되어 있는지 확인하는 것과 같은 방식)을 사용하여 가장 중요한 헤드를 골라냅니다. 이는 마치 클럽의 문지기처럼, 멋지고 관련 있는 뉴런만 들여보내고 소음이 되는 것들은 쫓아내는 것과 같습니다.
  • 2단계: "경로 분할기(Path Splitter)": 탐정이 사고 과정을 역추적할 때, "관련성(결정에 대한 공로)"을 메인 경로와 스킵 경로 사이로 나눕니다. 만약 로봇이 정보를 변형하지 않고 거의 그대로 전달했다면, GradSkip은 스킵 경로에 대부분의 공로를 돌립니다. 만약 로봇이 깊은 생각을 했다면, 메인 경로에 공로를 돌립니다. 이는 역동적이고 공정한 공로 배분 방식입니다.

증명: 효과적이며, 빠릅니다!

팀은 1,000개의 표준 이미지 세트(ImageNet1K)부터 의료용 혈구 사진(BloodMNIST)에 이르기까지 다양한 사진들로 GradSkip을 테스트했습니다. 또한 로봇이 이미지의 모든 부분을 색칠하도록 하는 작업(세그멘테이션)에서도 테스트했습니다.

결과는 다음과 같습니다:

  • 가장 정직한 설명: 그들이 설명이 로봇의 실제 결정과 얼마나 잘 일치하는지 테스트했을 때, GradSkip이 가장 우수했습니다. ImageNet1K 테스트에서 GradSkip은 한 핵심 지표에서 두 번째로 좋은 방법을 12.50% 차이로 앞질렀습니다. 의료용 혈구 테스트에서도 성능이 매우 좋았습니다.
  • 믿기 힘들 정도로 정밀함: 로봇에게 물체를 가리키라고 요청했을 때, GradSkip이 가장 정확했습니다.
  • 속도의 제왕: 이것이 가장 멋진 부분입니다. 기존의 정확한 방법들은 탱크를 운전하는 것과 같았습니다—매우 잘 작동하지만 연료를 엄청나게 사용합니다. GradSkip은 매끈한 스포츠카와 같습니다. GradSkip은 두 번째로 정확한 방법보다 14.45배 적은 GFLOPs(컴퓨터 작업량의 척도)를 사용합니다. 분류(classification) 작업에는 단 69.39 GFLOPs가 필요했고, 세그멘테이션에는 28.52 GFLOPs만 필요했습니다.

GradSkip이 "아닌" 것

논문은 GradSkip이 하지 못하는 것에 대해서도 명확히 밝히고 있습니다:

  • 로봇의 뇌 내부를 볼 수 없다면 작동하지 않습니다. "역방향 패스(backward pass, 그래디언트 확인)"를 실행할 수 있어야 하므로, 내부 기어를 볼 수 없는 모델에는 사용할 수 없습니다.
  • 모든 것을 마법처럼 해결하지는 않습니다. 사진 속에 동일한 종류의 물체가 여러 개 있는 경우처럼 까다로운 사례에서는 여전히 매우 훌륭하지만, 완벽한 점수를 얻기가 더 어렵다는 점을 인정하고 있습니다.
  • "CLS 토큰"(일부 로봇이 전체 이미지를 요약하기 위해 사용하는 특별한 토큰)을 살펴보지 않습니다. 저자들은 이 토큰을 사용하는 표준적인 로봇의 경우, 이를 무시하면 일부 단서를 놓칠 수 있지만, SegFormer와 같은 다른 유형의 경우에는 완벽하게 작동한다고 언급했습니다.

결론

GradSkip은 단순한 미세한 조정이 아닙니다. 로봇의 목소리에 귀를 기울이는 더 스마트한 방법입니다. 모든 뇌 부분이 평등하지 않다는 점을 깨닫고 "지름길" 와이어를 존중함으로써, 비전 트랜스포머가 어떻게 결정을 내리는지에 대해 명확하고 정직하며 매우 빠른 통찰을 제공합니다. 저자들은 이것이 로봇의 진단 이유를 이해하는 것이 진단 자체만큼이나 중요한 의료 영상 분야와 같은 영역에서 게임 체인저가 될 수 있다고 제안합니다. 그리고 가장 좋은 점은, 이 모든 것을 슈퍼컴퓨터 없이도 수행할 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →