← 최신 논문
🤖 AI

Cluster Contrast for Unsupervised Visual Representation Learning

이 논문은 대조 학습(contrastive learning)과 클러스터링 목적 함수를 결öss적으로 결합하여 서로 다른 특징은 분산시키고 유사한 특징은 정렬함으로써 CIFAR 및 ImageNet 벤치마크에서 최첨단 성능을 달anim하는 새로운 비지도 시각적 표현 학습 방법인 Cluster Contrast (CueCo)를 소개한다.

원저자: Nikos Giakoumoglou, Tania Stathaki

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Nikos Giakoumoglou, Tania Stathaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 동물을 인식하는 법을 가르치려 한다고 상상해 보세요. 하지만 당신에게는 산더미 같은 사진들이 있고, 라벨(이름표)은 하나도 없습니다. 로봇에게 "이것은 고양이다" 또는 "이것은 개다"라고 말해줄 수 없습니다. 이것이 바로 **비지도 학습(unsupervised learning)**의 세계입니다. 비지도 학습은 컴퓨터가 선생님의 지시 없이 스스로 세상의 패턴을 배우는 인공지능의 한 분야입니다. 이를 위해 연구자들은 두 가지 주요 기술을 사용합니다. 첫 번째는 **대조 학습(contrastive learning)**으로, 이는 아이에게 차이점을 찾아내는 법을 가르치는 것과 같습니다. "이 사진은 저 사진이 아니야"라고 알려주는 것이죠. 이 기술은 컴퓨터가 머릿속에서 서로 다른 것들을 섞이지 않도록 밀어내게 만듭니다. 두 번째 기술은 **클러스터링(clustering)**으로, 이는 뒤섞인 빨래 더미를 정리하는 것과 같습니다. 컴퓨터는 양말과 셔츠를 살펴보며, 그것들이 무엇인지 이름은 아직 모르더라도 비슷한 것들끼리 묶으려고 노력합니다. 오랫동안 이 두 기술은 서로 다른 방에서 작동해 왔지만, 과학자들은 "만약 이 두 기술을 같은 방에서 함께 작동시켜 시각적 이미지를 이해하는 초지능적인 방법을 만들 수 있다면 어떨까?"라는 의문을 가졌습니다.

여기, 임페리얼 칼리지 런던의 니콜라오스 지아쿠모글루(Nikolaos Giakoumoglou)와 타니아 스타타키(Tania Stathaki)가 제안한 새로운 방법인 CueCo(Cluster Contrast)가 등장했습니다. CueCo를 붐비는 무도회장의 숙련된 안무가라고 생각해보세요. 과거의 안무가들(알고리즘)은 모두에게 최대한 멀리 떨어지라고 지시하거나(대조 학습), 혹은 모두에게 빽빽하게 모여 있으라고 지시했습니다(클러스터링). CueCo는 이 두 가지를 동시에 수행합니다. 이는 마치 자석처럼 "밀고 당기는(push-pull)" 역학을 사용합니다. 서로 다른 종류의 무용수들(예: 고양이와 개)이 충돌하지 않도록 서로 멀리 밀어내는 동시에, 같은 종류의 무용수들(모든 고양이들)을 하나의 촘촘하고 아늑한 원 안으로 끌어당깁니다.

연구진은 두 개의 신경망으로 구성된 시스템을 구축했습니다. 하나는 배우는 역할을 하는 "쿼리(query)" 네트워크이고, 다른 하나는 학습자를 따라다니는 그림자처럼 느리게 움직이는 "키(key)" 네트워크입니다. 그들은 이 시스템을 CIFAR-10, CIFAR-100, ImageNet-100이라는 세 가지 유명한 이미지 데이터셋으로 테스트했습니다. 결과는 인상적이었습니다. 학습을 멈추고 단순한 분류기를 사용하여 이미지를 분류하게 했을 때, CueCo는 CIFAR-10에서 91.40%, CIFAR-100에서 68.56%, ImageNet-100에서 **78.65%**의 정확도를 달est했습니다. 이 수치들은 현재 사용 가능한 최고 수준의 방법들과 어깨를 나란히 하며, 대조의 "밀기"와 클러스터링의 "당기기"를 결합하는 것이 시각적 세계에 대한 더 조직적이고 유용한 지도를 만드는 데 도움이 된다는 것을 증명했습니다.

밀기와 당기기의 마법

CueCo가 어떻게 작동하는지 이해하기 위해, 모든 책이 뒤섞여 있고 제목도 모르는 거대한 도서관을 정리한다고 상상해 보세요. 당신에게는 두 가지 목표가 있습니다. 어떤 두 권의 책도 서로 같아 보이지 않게 만드는 것, 그리고 같은 책의 복사본들은 모두 깔끔하게 쌓아두는 것입니다.

밀기 (대조 학습)
먼저, CueCo는 사진 한 장을 가져와서 사진을 자르거나 약간 회전시키는 방식으로 두 가지 약간 다른 버전을 만듭니다. 그리고 컴퓨터에게 "이 두 모습은 같은 고양이야"라고 말합니다. 하지만 개의 사진을 보고는 "이것들은 완전히 달라"라고 말하기도 합니다. **InfoNCE 손실(loss)**이라는 수학적 규칙을 사용하여, 시스템은 척력(밀어내는 힘)처럼 작용합니다. 이 시스템은 컴퓨터의 메모리 공간에서 "고양이" 특징을 "개"의 특징으로부터 밀어냅니다. 이를 통해 나중에 고양이를 다시 보더라도 컴퓨터가 실수로 개라고 생각하지 않도록 보장합니다. 즉, 서로 다른 클래스들을 멀리 떨어뜨려 뚜렷하게 구분되도록 만듭니다.

당기기 (클러스터링)
하지만 단순히 퍼뜨리는 것만으로는 부족합니다. 비슷한 것들을 그룹화해야 합니다. 여기서 "당기기"가 등장합니다. 컴퓨터는 실제 라벨이 없기 때문에 패턴을 찾아내어 어떤 사진들이 함께 속하는지 추측합니다. 컴퓨터는 "클러스터" 또는 그룹을 만듭니다. 그런 다음 CueCo는 매력적인 힘(끌어당기는 힘)으로 작용하여, 같은 유형의 사진들을 하나의 촘촘한 공 모양으로 끌어당깁니다. 이를 위해 두 가지 특정 도구를 사용합니다:

  1. 센트로이드 대조 손실 (Centroid Contrastive Loss): 모든 사진이 해당 그룹의 "중심점(center of gravity)"과 일치하도록 만듭니다. 이는 마치 모든 고양이 사진이 가상의 "고양이 중심" 바로 옆에 서 있도록 만드는 것과 같습니다.
  2. 분산 손실 (Variance Loss): 그룹이 단순히 느슨한 구름 형태가 아니라, 촘촘하고 압축된 공 모양이 되도록 만듭니다. 사진과 그룹 중심 사이의 거리를 최소화하여, "고양이"들이 흩어져 있지 않고 서로 밀착해 있도록 보장합니다.

무도회장의 역학
연구진은 이를 물리적 힘으로 시각화했습니다. 대조 부분은 척력(두 북극 자석이 서로 밀어내는 것과 같은 힘)으로, 서로 다른 클래스가 합쳐지지 않도록 합니다. 클러스터링 부분은 인력(반대 극이 서로 끌어당기는 것과 같은 힘)으로, 같은 클래스가 응집력을 갖도록 합니다. 목표는 "고양이" 그룹이 "개" 그룹으로부터 멀리 떨어져 있으면서도, 모든 고양이가 서로 손을 잡고 있는 완벽한 균형점에 도달하는 것입니다.

구현 방법

연구진은 단순히 추측한 것이 아니라 특정 프레임워크를 구축했습니다. 그들은 이미지 인식의 표준적이고 신뢰할 수 있는 구조인 ResNet-18 백본을 사용했습니다. 그리고 이를 세 가지 데이터셋으로 학습시켰습니다:

  • CIFAR-10: 10가지 유형의 작은 이미지들.
  • CIFAR-100: 100가지 유형의 작은 이미지들.
  • ImageNet-100: 훨씬 더 크고 복잡한 데이터셋에서 추출한 100가지 유형의 부분 집합.

그들은 **모멘텀 인코더(momentum encoder)**라는 영리한 기법을 사용했습니다. "쿼리" 네트워크가 빠르게 배우는 학생이라면, "키" 네트워크는 학습자를 천천히 따라가는 그림자 같은 선생님이라고 상상해 보세요. 선생님은 학생의 부드럽고 느린 평균값입니다. 이는 시스템이 갑작스러운 변화로 인해 혼란을 겪는 것을 방지하고, "그룹(클러스터)"을 시간이 지나도 안정적으로 유지하도록 돕습니다.

컴퓨터가 잘못된 패턴에 갇히지 않도록(예를 들어 모든 사진을 하나의 거대한 더미로 만드는 것), 그들은 그룹의 중심을 계산하기 위해 이미지 "큐(queue)"를 사용했습니다. 또한 상태를 신선하고 균형 있게 유지하기 위해 1,000단계마다 이 그룹들을 재설정했습니다.

결과: 효과가 있는가?

연구팀은 컴퓨터가 도움 없이 얼마나 잘 이미지를 분류하는지 확인하여 이 방법의 성능을 테스트했습니다. 그들은 CueCo를 MoCo-v2, SimCLR, BYOL과 같은 다른 최상위 방법들과 비교했습니다.

  • CIFAR-10에서 CueCo는 **91.40%**의 정확도에 도달했습니다. 이는 최고 수준의 성능에 매우 근접한 수치로, 간단한 작업을 잘 처리할 수 있음을 보여줍니다.
  • CIFAR-100에서는 **68.56%**를 기록했습니다.
  • ImageNet-100에서는 **78.65%**를 달성했습니다.

진정한 마법은 **비지도 이미지 분류(unsupervised image classification)**에서 일 나타났습니다. 보통 컴퓨터가 라벨 없이 사물을 그룹화할 때는 평범한 성적을 냅니다. 그러나 CueCo는 다른 방법들보다 이미지를 훨씬 더 잘 그룹화할 수 있음을 보여주었습니다. CIFAR-10에서 CueCo는 **75.06%**의 클러스터링 정확도를 달성하며, 재구현된 MoCo-v2(63.51%)와 SimCLR(74.50%)을 앞질렀습니다. CIFAR-100에서도 **33.82%**를 기록하며 다시 한번 경쟁자들을 제쳤습니다.

연구진은 또한 기계의 각 부분이 어떤 역할을 하는지 알아보기 위해 기계를 분해하는 것과 같은 "어블레이션 연구(ablation study)"를 수행했습니다. 그 결과는 다음과 같습니다:

  • "밀기"(대조 손실)만 사용했을 때는 좋은 기준점(baseline)을 제공했습니다.
  • "당기기"(센트로이드 손실)를 추가했을 때 그룹화 성능이 향상되었습니다.
  • "응집력"(분산 손실)을 추가했을 때 결과가 더욱 좋아졌습니다.

이는 그들의 "밀고 당기는" 시스템의 세 가지 요소가 최상의 결과를 얻기 위해 모두 필요하다는 것을 입증했습니다.

이것이 왜 중요한가

이 논문은 이 두 가지 힘을 결합함으로써, 구별 가능하면서도(서로 구분하기 쉽고) 조직적인(그룹화하기 쉬운) 시각적 표현을 만들 수 있다고 시사합니다. 이는 우리가 컴퓨터에게 보는 법을 가르칠 때 인간이 라벨을 붙인 예시가 훨씬 적게 필요할 수도 있다는 점에서 매우 중요한 의미를 갖습니다. 이 방법이 AI 문제를 완전히 해결했다고 주장하는 것은 아니지만, 유망한 새로운 방향을 제시합니다. 약간의 "밀기"와 약간의 "당기기"가 결com되어, 컴퓨터가 단 한 명의 인간 선생님으로부터 "저건 고양이야"라는 말을 듣지 않고도, 넓고 상세하게 세상을 이해하도록 도울 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →