← 최신 논문
🤖 AI

Rethinking Global Average Pooling: Your Classifier Is Secretly a Multi-Instance Learner

이 논문은 전역 평균 풀링(global average pooling)을 다중 인스턴스 학습기로 사용하여 표준 이미지 분류기를 재해석함으로써, 이들이 로짓(logits) 내에 본질적으로 복구 가능한 공간적 클래스 증거를 보유하고 있음을 입증하고, 다중 객체 장면의 개선된 분석을 위해 이 정보를 추출하는 사후 진단 방법을 제시한다.

원저자: Aray Karjauv

게시일 2026-06-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aray Karjauv

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 북적이는 공원의 사진을 보고 있다고 상상해 보세요. 사진 속에는 프리스비를 가지고 놀고 있는 골든 리트리버 한 마리, 빨간색 벤치, 그리고 배경에 있는 몇 그루의 초록색 나무들이 있습니다.

오랫동안 현대의 AI 이미지 분류기들은 매우 엄격하고 성급한 매니저처럼 작동해 왔습니다. 이들이 사진을 볼 때, 이들은 '전역 평균 풀링(Global Average Pooling, GAP)' 방식을 사용합니다. 이것은 매니저가 공원에 있는 모든 사람(이미지의 모든 작은 조각들)에게 각자 무엇이 보이는지 외치라고 요구한 뒤, 그 매니저가 최종 결정을 내리기 위해 그 모든 외침의 평균을 내는 것과 같습니다.

만약 개가 "개!"라고 10번 외치고, 벤치가 "벤치!"라고 5번 외치고, 나무가 "나무!"라고 5번 외쳤다고 가정해 봅시다. 만약 개의 크기가 작아서 "개!"라는 외침이 "나무!"라는 외침보다 조금 더 작게 들린다면, 평균은 "나무"나 "공원" 쪽으로 기울 수 있습니다. 매니저는 전체 그림에 대해 단 하나의 추측을 내놓으며, 실제로 그곳에 개가 있다는 사실을 놓치곤 합니다.

위대한 발견
"Rethinking Global Average Pooling"이라는 제목의 이 논문은 AI 모델들이 우리가 생각하는 것보다 훨씬 더 똑똑하다고 주장합니다. 저자들은 AI가 비록 우리에게 단 하나의 최종 답변(예: "이것은 공원이다")만을 제공하더라도, 사실은 모든 것을 평균 내기 전, 이미지의 모든 부분에서 무엇을 보고 있는지에 대한 상세한 일기를 몰래 기록하고 있다는 것을 발견했습니다.

저자들은 이를 다중 인스턴스 학습(Multiple Instance Learning, MIL) 관점이라고 부릅니다. 이미지를 하나의 커다란 덩어리로 보는 대신, 이미지를 "인스턴스들의 가방(bag of instances)"으로 취급하는 것입니다.

  • 과거의 방식: "이 전체 이미지는 무엇인가?" -> "공원이다."
  • 새로운 방식: "이 특정 구석에는 무엇이 있는가? 개. 저 구석에는 무엇이 있는가? 벤치. 하늘에는 무엇이 있는가? 나무."

"비밀 일기" 비유
AI 모델이 사진을 덮고 있는 작은 스파이들의 격자판을 가지고 있다고 상상해 보세요.

  1. 과거의 관점: 우리는 마지막에 모든 것을 요약하여 한 문장으로 보고하는 "수석 스파이"의 말만 듣습니다. 만약 수석 스파이가 요약을 잘못하면, 우리는 팀 전체가 실패했다고 간주합니다.
  2. 새로운 관점: 저자들은 우리가 수석 스파이에게 보고하기 전, 모든 개별 스파이의 노트를 엿볼 수 있다는 사실을 깨달았습니다.

이렇게 했을 때, 그들은 놀라운 사실을 발견했습니다: 스파이들이 정답을 맞혔음에도 불구하고, 수석 스파이는 틀린 답을 내놓는 경우가 많았습니다.

그들이 발견한 것
연구진은 유명한 AI 모델들(ResNet, Swin, ConvNeXt 등)을 표준 데이터셋인 ImageNet을 사용하여 테스트했습니다. 여기서 그들은 다음과 같은 것을 보았습니다:

  • 숨겨진 성공: 많은 경우에서 AI가 "이것은 고양이이다"라고 말했을 때(실제로는 개가 있는 사진임에도 불구하고), 실제 개가 있는 영역에 대한 AI의 "스파이 노트"는 "개!"라고 정확하게 말하고 있었습니다. 최종적인 오답은 "개"라는 노트가 너무 많은 "배경" 노트와 평균화된 결과였습니다.
  • "정원 거미"의 미스터리: 그들은 정원 거미가 거미줄 위에 있는 사진을 살펴보았습니다. AI의 최종 추측은 "정원 거미"였습니다. 하지만 그들이 스파이 노트를 확인했을 때, 웹(거미줄)을 보여주는 이미지의 부분들은 "거미줄"을 올바르게 식별하고 있었고, 거미를 보여주는 부분들은 "정원 거미"를 식별하고 있었습니다. 모델은 두 가지 모두가 거기에 있다는 것을 알고 있었지만, 단지 그것들을 하나의 라벨로 평균 냈을 뿐입니다.
  • 강건성(Robustness): 그들은 표준 AI가 처참하게 실패하는(약 20%의 정확도만 보이는) 까다롭고 자연적인 이미지 세트인 "ImageNet-A"를 테스트했습니다. 그러나 "스파이 노트"(공간 격자)를 살펴보았을 때, 모델들은 실제로 적절한 위치에서 올려 정답 객체들을 약 50~60%의 확률로 포착하고 있었습니다. 실패의 원인은 AI가 객체를 "보지 못해서"가 아니라, "평균화" 단계에서 증거가 씻겨 내려갔기 때문이었습니다.

이것이 왜 중요한가 (논문에 따르면)
이 논문은 문제가 AI가 복잡한 장면 속의 객체를 "보지 못하는" 것이 아니라고 제안합니다. 문제는 증거를 결합하는 데 사용되는 수학적 규칙(전역 평균 풀링)입니다.

  • 결함: 평균을 내는 것은 빨간색과 흰색 물감을 섞어 분홍색을 만드는 것과 같습니다. 만약 당신이 아주 작은 양의 빨간색(객체)과 거대한 양의 흰색(배경)을 가지고 있다면, 결과물은 겨우 분홍빛이 돌 뿐입니다. 당신은 빨간색을 잃어버리게 됩니다.
  • 해결책: 이 논문은 우리가 이미지를 단 하나의 질문으로 취급하는 것을 멈춰야 한다고 제안합니다. 대신, AI가 이미 "다중 인스턴스 학습자"로서 행동하고 있다는 점을 인정해야 합니다. 즉, AI는 이미 객체들의 가방을 보고 있습니다.

그들이 주장하지 않은 것
논문이 실제로 말하는 바에 충실하는 것이 중요합니다:

  • 이 연구가 AI를 완벽하게 만들거나, 이제 이 모델들이 의사나 자율주행 자동차를 대체할 수 있다고 말한 것이 아닙니다.
  • 이 문제를 해결하기 위해 이 모든 모델을 처음부터 다시 훈련시켜야 한다고 주장한 것도 아닙니다.
  • "스파이 노트"가 객체의 정밀한 윤곽을 그릴 수 있는 완벽한 지도라고 말한 것도 아닙니다 (해상도는 여전히 다소 흐릿하거나 거칠 수 있습니다).

핵심 요약
이 논문은 하나의 "진단 도구"입니다. 이는 우리가 이미 보유한 AI 모델들이 특정 위치에서 객체를 찾아내는 일을 비밀리에 아주 잘 수행하고 있음을 보여줍니다. 우리가 보는 "실수"들은 종-종 이미 잘 수행하고 있는 작업마저 숨겨버리는 서툰 평균화 과정의 결과일 뿐입니다. 최종 요약 대신 "스파이 노트"(공간 격자)를 살펴봄으로써, 우리는 AI가 드러내는 것보다 더 많은 것을 알고 있다는 사실을 알 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →