← 최신 논문
💻 computer science

Vision Transformers Need Better Token Interaction

본 논문은 비전 트랜스포머의 장기 학습 과정에서 패치 표현이 저하되는 원인을 '의미 확산'으로 규명하고, 선택적 토큰 상호작용을 가능하게 하기 위해 소프트맥스 어텐션을 엔트맥스-1.5 로 대체함으로써 전역 컨텍스트를 유지하면서 밀도 예측 성능을 크게 향상시킨다고 제안합니다.

원저자: Linxiang Su

게시일 2026-05-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Linxiang Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

문제: "과도한 공유"를 하는 학생

비전 트랜스포머 (ViT) 를 학생들 (토큰) 로 가득 찬 교실이라고 상상해 보세요. 각 학생은 사진의 아주 작은 조각 (패치) 을 봅니다.

  • 목표: 선생님은 반이 두 가지 일을 하기를 원합니다.
    1. 전체 그림을 식별하기 (예: "이것은 개입니다").
    2. 개 모든 부분에 완벽한 윤곽선을 그리기 (예: "이 픽셀은 귀, 이것은 꼬리입니다"). 이를 **밀집 예측 (dense prediction)**이라고 합니다.

문제점:
반이 더 오래 공부할수록 개를 식별하는 능력은 매우 좋아집니다. 하지만 윤곽선을 그리는 능력은 엉망이 됩니다. 학생들은 "과도한 공유"를 시작합니다.

이 논문은 이를 **의미 확산 (Semantic Diffusion)**이라고 부릅니다. 마치 뒷줄에 있는 학생이 정답이 "개"라는 것을 알고, 잔디나 하늘을 보고 있는 학생들에게까지 그 사실을 외쳐대기 시작하는 것과 같습니다.

  • 결과: 잔디를 보고 있는 학생들은 "아, 내가 개的一部分일 수도 있구나!"라고 생각하게 됩니다. 왜냐하면 그들은 전역 정보를 들었기 때문입니다.
  • 결과: "윤곽선"이 흐려집니다. 모델은 배경을 객체의 일부로 생각하게 되어, 경계를 그리는 것과 같은 작업 (분할) 에서 성능이 떨어집니다.

기존 해결책 vs 새로운 아이디어

이전 연구자들은 이를 해결하기 위해 다음과 같은 시도를 했습니다:

  • "노트 테이커" 추가: 다른 학생들이 혼란을 겪지 않도록 추가적인 노이즈를 담을 특별한 학생들 (Register Tokens) 을 반에 배치했습니다.
  • 엄격한 규칙: 학생들에게 "옆에 앉은 사람과만 대화하라"고 지시했습니다 (Local Windows).

저자의 통찰:
저자는 전역 대화를 금지하거나 추가 학생을 배치해서는 안 된다고 주장합니다. 배경에는 유용한 맥락이 존재합니다. 문제는 그들이 모두에게 대화한다는 사실이 아니라, 의미가 없을 때조차도 모두에게 균등하게 대화한다는 점입니다.

해결책: "선택적 대화" (Sparse Attention)
학생들에게 이웃에게만 속삭이도록 강요하는 대신, 저자는 투표 시스템을 변경할 것을 제안합니다.

  • 구 시스템 (Softmax): 모든 학생이 아주 작지만 0 이 아닌 정도의 주의를 받는 투표라고 상상해 보세요. 비록 어떤 학생이 구름을 보고 있더라도, 그 학생은 여전히 반 전체 주의의 0.1% 를 받습니다. 이로 인해 "노이즈"가 살아있게 됩니다.
  • 새 시스템 (Entmax-1.5): 이는 더 똑똑한 투표 시스템입니다. 만약 어떤 학생이 구름을 보고 있다면, 시스템은 "당신은 **0%**의 주의를 받습니다. 무시당합니다"라고 말합니다.
    • 이는 학생들이 방 전체를 보는 것을 막지 않습니다 (전역 연결성은 유지됩니다).
    • 단지 연결이 유용하지 않다면, 그 연결이 완전히 끊어지도록 (영 가중치) 보장할 뿐입니다.

이를 필터라고 생각하세요. "개"에 대한 정보가 "잔디" 영역으로 조금씩 새어 들어오게 하는 대신, 필터는 이를 완전히 차단합니다. 잔디는 잔디로, 개는 개로 남습니다.

시도했을 때의 결과

연구자들은 ImageNet 으로 훈련된 표준 모델 (DINOv1) 에서 이를 테스트했습니다. 그들은 단순히 "투표 시스템" (Softmax) 을 "선택적 필터" (Entmax-1.5) 로 교체했을 뿐, 새로운 구성 요소를 추가하거나 추가 훈련 데이터를 사용하지 않았습니다.

결과:

  1. 전역 인식 ("무엇"): 모델은 단순히 "이것은 개입니다"라고 말하는 데 약간 더 하게 되었습니다 (정확도가 69.50% 에서 70.06% 로 상승).
  2. 밀집 예측 ("어디"): 모델은 윤곽선을 그리는 데 훨씬 더 잘하게 되었습니다.
    • 객체 경계에 대한 표준 테스트인 VOC 데이터셋에서 점수가 크게 상승했습니다 (42.80 에서 48.78 로).
    • ADE20KCityscapes와 같은 다른 복잡한 지도에서도 개선되었습니다.
  3. 시각화: 컴퓨터의 이미지 "정신 지도"를 살펴보면, 새로운 모델은 훨씬 더 깨끗하고 선명한 경계를 가지고 있었습니다. 배경이 더 이상 객체로 번져 들어가지 않았습니다.

결론

이 논문은 비전 트랜스포머가 경계를 그리는 데 엉망이 되는 이유는 전역 정보가 사람에서 사람으로 전달될수록 왜곡되는 소문처럼 너무 자유롭게 퍼지기 때문이라고 주장합니다.

희소 주의 (sparse attention) 메커니즘 (Entmax-1.5) 으로 전환함으로써, 모델은 선택적이 되는 법을 배웁니다. 모델은 큰 그림을 기억하지만, 해당되지 않는 영역으로 "노이즈"가 퍼지는 것을 막습니다. 이는 더 복잡한 아키텍처가 필요하지 않으면서도 객체를 식별하고 정확하게 위치시키는 데 모델의 성능을 향상시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →