Inducing Spatial Locality in Vision Transformers through the Training Protocol
본 논문은 대규모 사전 학습 없이 처음부터 학습된 비전 트랜스포머의 초기 계층에서 현대적 학습 프로토콜 내의 CutMix 데이터 증강 기법이 공간적 국소성과 집중된 주의를 유도함을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
한 장의 사진에서 다양한 동물을 인식하도록 학생을 가르친다고 상상해 보세요. 학생을 가르치는 두 가지 방법이 있습니다:
- "오래된 방식": 전체 사진을 보여 주며 "이것은 고양이입니다"라고 말합니다. 학생은 전체 이미지를 바라보며 배경에 혼란을 느끼거나 전체적인 분위기에서 답을 추측하려 합니다.
- "현대식": 전체 사진을 보여 주되, 다른 사진에서 가져온 스티커 노트로 사진의 무작위 부분을 가리는 게임을 합니다. 이제 "고양이"를 추측하려면 학생은 남아 있는 고양이의 작고 보이는 부분에 집중해야 하며, 나머지는 무시해야 합니다.
이 논문은 이러한 두 가지 다른 가르침 방식을 사용했을 때 비전 트랜스포머 (Vision Transformer, ViT) 라는 특정 유형의 AI 뇌 내부에서 어떤 일이 일어나는지에 관한 것입니다.
문제: "전체 시선"
비전 트랜스포머는 강력하지만 독특한 특징이 있습니다. 인간의 눈이나 기존 AI 모델인 CNN 과 달리 작은 근접한 세부 사항을 먼저 자연스럽게 바라보는 것이 아니라, ViT 는 모든 것을 한 번에 보도록 설계되었습니다. 이미지의 모든 부분이 즉시 다른 모든 부분과 "대화"할 수 있습니다.
연구자들은 궁금해했습니다. 수백만 장의 사진을 보여 주지 않고도 ViT 에게 고양이 귀와 같은 작고 국소적인 세부 사항을 보도록 가르칠 수 있을까요?
실험: 두 가지 훈련 프로토콜
연구자들은 작고 새로운 AI 모델을 가져와 세 가지 다른 사진 세트 (작은 동물원, 중간 크기 동물원, 큰 동물원) 로 훈련시켰습니다. AI 의 뇌 구조는 정확히 동일하게 유지하면서 가르치는 방법만 변경했습니다.
- 기준선 (오래된 방식): 기본 뒤집기와 자르기만 적용한 이미지를 보여 주었습니다.
- 현대식 ("스티커 노트" 게임): 세 가지 정교한 기법을 추가했습니다.
- AutoAugment: 색과 모양을 자동으로 변경하여 이미지를 다르게 보이게 합니다.
- Label Smoothing: AI 에게 "100% 확신하지 말고 조금 겸손하게 하라"고 말합니다.
- CutMix: 이 기법의 주인공입니다. 한 이미지에서 정사각형을 잘라 다른 이미지에 붙입니다. AI 는 일부가 없거나 대체된 상태에서도 동물을 추측해야 합니다.
발견: "CutMix" 효과
연구자들은 AI 의 주석이 얼마나 "국소적인지" 측정했습니다. 전체 방을 보았는지, 아니면 고양이 귀만 보았는지 말입니다.
- 결과: "현대식" 방법은 AI 의 초기 층 (가장 먼저 "생각"하는 부분) 이 작고 근접한 영역에 매우 집중적으로 초점을 맞추도록 만들었습니다. 이는 인간의 눈이나 전통적인 카메라 렌즈와 훨씬 더 유사해졌습니다.
- 놀라운 사실: "현대식" 방법을 분해하여 어떤 기법이 중추적인 역할을 하는지 확인했을 때, CutMix 만이 중요하다는 것이 밝혀졌습니다.
- "색상 변경" (AutoAugment) 이나 "겸손함" (Label Smoothing) 만 추가하는 것은 AI 가 국소적으로 보게 만드는 데 아무런 효과도 없었습니다.
- 기본 훈련에 CutMix 만 추가하면 AI 는 갑자기 국소적 세부 사항에 집중하기 시작했습니다.
- 정교한 훈련에서 CutMix 를 제거하면 다른 기법들이 남아 있더라도 AI 는 국소적 초점을 맞추는 법을 잊어버렸습니다.
비유: "부분적 시야"의 압박
왜 CutMix 가 작동할까요? 논문은 이것이 압박과 관련이 있다고 제안합니다.
인파 속에서 친구를 식별하려는데 누군가 계속 친구 얼굴 앞에 표지판을 들이댄다고 상상해 보세요. 더 이상 전체 얼굴이나 일반적인 옷차림에 의존할 수 없습니다. 보이는 한쪽 눈이나 귀만 매우 자세히 보게 됩니다. 전체 이미지보다는 국소적이고 구체적인 특징으로 그 사람을 인식하는 법을 배우게 됩니다.
CutMix 는 AI 를 똑같은 상황에 빠뜨립니다. 이미지의 일부가 끊임없이 교체되기 때문에 AI 는 전체 맥락에 의존할 수 없다는 것을 깨닫습니다. 정답을 맞추기 위해 작고 국소적인 영역에서 유용한 정보를 추출하는 법을 반드시 배워야 합니다.
결론
- 발견한 것: 비전 트랜스포머가 국소적 세부 사항에 집중하게 하려면 수백만 장의 이미지가 필요하지 않습니다. CutMix라는 특정 훈련 기법만 사용하면 됩니다.
- 하는 일: AI 의 초기 층이 전체 스캐너가 아닌 국소 감지기 (작은 패치에 집중) 로 작동하도록 강제합니다.
- 하지 않는 일: 다른 인기 있는 훈련 기법들 (색상 변경이나 확신 완화) 은 AI 점수를 향상시키지만, AI 가 이미지를 보는 방식을 바꾸지는 않습니다. 오직 CutMix 만 "시선"을 바꿉니다.
간단히 말해, AI 가 숲보다 나무를 먼저 보도록 배우게 하려면 더 많은 사진을 보여 주는 것이 아니라, 구멍이 난 사진을 보여 주어야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.