← 최신 논문
📊 statistics

Inducing Spatial Locality in Vision Transformers through the Training Protocol

본 논문은 대규모 사전 학습 없이 처음부터 학습된 비전 트랜스포머의 초기 계층에서 현대적 학습 프로토콜 내의 CutMix 데이터 증강 기법이 공간적 국소성과 집중된 주의를 유도함을 보여준다.

원저자: Eduardo Santiago Toledo, Asael Fabian Martínez

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Eduardo Santiago Toledo, Asael Fabian Martínez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 장의 사진에서 다양한 동물을 인식하도록 학생을 가르친다고 상상해 보세요. 학생을 가르치는 두 가지 방법이 있습니다:

  1. "오래된 방식": 전체 사진을 보여 주며 "이것은 고양이입니다"라고 말합니다. 학생은 전체 이미지를 바라보며 배경에 혼란을 느끼거나 전체적인 분위기에서 답을 추측하려 합니다.
  2. "현대식": 전체 사진을 보여 주되, 다른 사진에서 가져온 스티커 노트로 사진의 무작위 부분을 가리는 게임을 합니다. 이제 "고양이"를 추측하려면 학생은 남아 있는 고양이의 작고 보이는 부분에 집중해야 하며, 나머지는 무시해야 합니다.

이 논문은 이러한 두 가지 다른 가르침 방식을 사용했을 때 비전 트랜스포머 (Vision Transformer, ViT) 라는 특정 유형의 AI 뇌 내부에서 어떤 일이 일어나는지에 관한 것입니다.

문제: "전체 시선"

비전 트랜스포머는 강력하지만 독특한 특징이 있습니다. 인간의 눈이나 기존 AI 모델인 CNN 과 달리 작은 근접한 세부 사항을 먼저 자연스럽게 바라보는 것이 아니라, ViT 는 모든 것을 한 번에 보도록 설계되었습니다. 이미지의 모든 부분이 즉시 다른 모든 부분과 "대화"할 수 있습니다.

연구자들은 궁금해했습니다. 수백만 장의 사진을 보여 주지 않고도 ViT 에게 고양이 귀와 같은 작고 국소적인 세부 사항을 보도록 가르칠 수 있을까요?

실험: 두 가지 훈련 프로토콜

연구자들은 작고 새로운 AI 모델을 가져와 세 가지 다른 사진 세트 (작은 동물원, 중간 크기 동물원, 큰 동물원) 로 훈련시켰습니다. AI 의 뇌 구조는 정확히 동일하게 유지하면서 가르치는 방법만 변경했습니다.

  • 기준선 (오래된 방식): 기본 뒤집기와 자르기만 적용한 이미지를 보여 주었습니다.
  • 현대식 ("스티커 노트" 게임): 세 가지 정교한 기법을 추가했습니다.
    1. AutoAugment: 색과 모양을 자동으로 변경하여 이미지를 다르게 보이게 합니다.
    2. Label Smoothing: AI 에게 "100% 확신하지 말고 조금 겸손하게 하라"고 말합니다.
    3. CutMix: 이 기법의 주인공입니다. 한 이미지에서 정사각형을 잘라 다른 이미지에 붙입니다. AI 는 일부가 없거나 대체된 상태에서도 동물을 추측해야 합니다.

발견: "CutMix" 효과

연구자들은 AI 의 주석이 얼마나 "국소적인지" 측정했습니다. 전체 방을 보았는지, 아니면 고양이 귀만 보았는지 말입니다.

  • 결과: "현대식" 방법은 AI 의 초기 층 (가장 먼저 "생각"하는 부분) 이 작고 근접한 영역에 매우 집중적으로 초점을 맞추도록 만들었습니다. 이는 인간의 눈이나 전통적인 카메라 렌즈와 훨씬 더 유사해졌습니다.
  • 놀라운 사실: "현대식" 방법을 분해하여 어떤 기법이 중추적인 역할을 하는지 확인했을 때, CutMix 만이 중요하다는 것이 밝혀졌습니다.
    • "색상 변경" (AutoAugment) 이나 "겸손함" (Label Smoothing) 만 추가하는 것은 AI 가 국소적으로 보게 만드는 데 아무런 효과도 없었습니다.
    • 기본 훈련에 CutMix 만 추가하면 AI 는 갑자기 국소적 세부 사항에 집중하기 시작했습니다.
    • 정교한 훈련에서 CutMix 를 제거하면 다른 기법들이 남아 있더라도 AI 는 국소적 초점을 맞추는 법을 잊어버렸습니다.

비유: "부분적 시야"의 압박

왜 CutMix 가 작동할까요? 논문은 이것이 압박과 관련이 있다고 제안합니다.

인파 속에서 친구를 식별하려는데 누군가 계속 친구 얼굴 앞에 표지판을 들이댄다고 상상해 보세요. 더 이상 전체 얼굴이나 일반적인 옷차림에 의존할 수 없습니다. 보이는 한쪽 눈이나 귀만 매우 자세히 보게 됩니다. 전체 이미지보다는 국소적이고 구체적인 특징으로 그 사람을 인식하는 법을 배우게 됩니다.

CutMix 는 AI 를 똑같은 상황에 빠뜨립니다. 이미지의 일부가 끊임없이 교체되기 때문에 AI 는 전체 맥락에 의존할 수 없다는 것을 깨닫습니다. 정답을 맞추기 위해 작고 국소적인 영역에서 유용한 정보를 추출하는 법을 반드시 배워야 합니다.

결론

  • 발견한 것: 비전 트랜스포머가 국소적 세부 사항에 집중하게 하려면 수백만 장의 이미지가 필요하지 않습니다. CutMix라는 특정 훈련 기법만 사용하면 됩니다.
  • 하는 일: AI 의 초기 층이 전체 스캐너가 아닌 국소 감지기 (작은 패치에 집중) 로 작동하도록 강제합니다.
  • 하지 않는 일: 다른 인기 있는 훈련 기법들 (색상 변경이나 확신 완화) 은 AI 점수를 향상시키지만, AI 가 이미지를 보는 방식을 바꾸지는 않습니다. 오직 CutMix 만 "시선"을 바꿉니다.

간단히 말해, AI 가 숲보다 나무를 먼저 보도록 배우게 하려면 더 많은 사진을 보여 주는 것이 아니라, 구멍이 난 사진을 보여 주어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →