← 최신 논문
🤖 AI

Unsupervised Training of Vision Transformers with Synthetic Negatives

이 논문은 합성된 하드 네거티브 샘플을 자기지도 학습에 통합하는 것이 DeiT-S 및 Swin-T와 같은 비전 트랜스포머 아키텍처의 변별력과 성능을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Nikos Giakoumoglou, Andreas Floros, Kleanthis Marios Papadopoulos, Tania Stathaki

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Nikos Giakoumoglou, Andreas Floros, Kleanthis Marios Papadopoulos, Tania Stathaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기계 속의 보이지 않는 스승

로봇에게 고양이를 인식하는 법을 가르치려 한다고 상상해 보세요. 옛날 방식으로는 수천 장의 사진을 보여주고 각 사진에 일일이 "고양이" 또는 "고양이 아님"이라고 라벨을 붙여줘야 했습니다. 이는 매 수업마다 인간 튜터를 고용하는 것과 같습니다. 하지만 최근 과학자들은 로봇이 인간이 화면을 가리키지 않아도 스스로 학습할 수 있는 방법을 발견했습니다. 이것을 **자기 지도 학습(self-supervised learning)**이라고 부릅니다. 로봇은 이미지를 보고, 그 이미지의 두 가지 약간 다른 버전(예: 자르기나 색상 변경)을 만든 다음, 이 두 버전이 실제로 같은 대상이라는 것을 알아내려고 노력합니다. 로봇은 "친구"(유사한 이미지)와 "낯선 이"(다른 이미지)를 비교하며 학습합니다.

하지만 여기에는 함정이 있습니다. 만약 "낯선 이"가 너무 뻔하다면—예를 들어 고양이 옆에 토스터기 사진을 보여준다면—로봇은 새로운 것을 전혀 배우지 못합니다. 이는 답이 너무 쉬운 퀴즈와 같습니다. 그러면 더 똑똑해질 수 없습니다. 깊이 있게 학습하기 위해서는 로봇에게 "어려운" 낯선 이, 즉 고양이와 거의 비슷하게 생겼지만 실제로는 고양이가 아닌 이미지를 제공해야 합니다. 여기서 **비전 트랜스포머(Vision Transformers)**가 등장합니다. 이것은 컴퓨터를 위한 새로운 형태의 뇌 구조로, 마치 우리가 붐비는 방 안에서 특정 세부 사항에 시선을 집중하는 것처럼 이미지 속 패턴을 찾아내는 데 매우 뛰어납습니다. 연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 적절한 난이도의 연습을 제공함으로써 이 강력한 기계들이 훨씬 더 잘 학습하게 만들 수 있을까?


논문의 핵심 아이디어: 완벽한 "가짜 악당" 만들기

"합성 부정 사례를 이용한 비전 트랜스포머의 비지도 학습(Unsupervised Training of Vision Transformers with Synthetic Negatives)"이라는 제목의 이 논문은 로봇의 뇌를 만드는 완전히 새로운 방법을 발명한 것이 아닙니다. 대신, 저자들(임페리얼 칼리지 런던의 연구진)은 모든 이가 다소 간과해 왔던 학습 과정의 특정 부분, 즉 "부정(negative)" 사례에 주목했습니다.

머신러닝의 세계에서 "부정(negative)"이란 단순히 목표 대상이 아닌 사례를 의미합니다. 만약 당신이 모델에게 개를 인식하도록 가르치고 있다면, 고양이 사진은 부정 사례가 됩니다. 보통 컴퓨터는 다른 이미지 더미에서 무작위로 부정 사례를 가져옵니다. 하지만 저자들은 이러한 무작위 부정 사례들이 종종 너무 쉽다는 점을 깨달았습니다. 이는 특정 유명인을 비교하기 위해 군중 속에서 무작위로 한 사람을 뽑는 것과 같습니다. 그 사람이 유명인과 다르다는 것은 너무나 명백합니다.

저자들은 다음과 같이 질문했습니다. "만약 우리가 '합성된 어려운 부정 사례(synthetic hard negatives)'를 만들 수 있다면 어떨까?" 이것들은 카메라로 찍은 실제 사진이 아닙니다. 대신, 수학적으로 정교하게 만들어진 "가짜" 사례들로, 혼란의 경계선에 딱 걸쳐 있습니다. 이들은 목표 대상과 거의 비슷해 보이기 때문에, 컴퓨터가 정말 눈을 가늘게 뜨고 미세한 차이를 파곡하도록 강요합니다.

이것을 무술 대회 훈련에 비유해 봅시다. 만약 자신보다 훨씬 약한 상대하고만 연습한다면 결코 실력이 늘지 않을 것입니다. 하지만 자신보다 약간 더 강하거나 자신의 동작을 완벽하게 흉내 내는 파트너를 상대로 훈련한다면, 훨씬 더 빠르게 배울 수 있습니다. 저자들의 방법인 SynBY는 스마트한 훈련 파트너 역할을 합니다. 이 방법은 컴퓨터가 이미 보고 있는 "낯선 이" 이미지들을 가져와서, 가장 혼란스러운 것들("가장 어려운" 부정 사례)을 찾아낸 뒤, 이를 서로 섞어서 새롭고 매우 도전적인 사례를 만들어냅니다. 이렇게 만들어진 새로운 사례는 다시 시스템에 입력되어 학습 과정을 더 혹독하고 효과적으로 만듭니다.

테스트 및 결과

연구팀은 이 아이디어를 두 가지 대중적인 비전 트랜스포머 유형인 DeiT-SSwin-T를 사용하여 테스트했습니다. 그들은 수백만 개의 이미지가 포함된 ImageNet이라는 거대한 데이터셋을 사용하여 실험을 진행했습니다. 그들은 자신들의 새로운 방법(SynBY)을 표준적인 방식(MoBY)과 비교했습니다.

결과는 유망했습니다. 합성된 어려운 부정 사례를 사용했을 때, DeiT-S와 Swin-T 모델 모두 이미지를 인식하는 능력이 약간 향상되었습니다. 구체적으로, 모델들은 표준 방식에 비해 정확도가 0.2% 향상되었습니다. 이 수치가 작게 들릴 수도 있지만, 고도의 AI 분야에서 이러한 미세한 상승은 큰 의미를 갖습니다. 이는 모델이 더 "판별적인(discriminative)" 특징을 학습하고 있다는 뜻이며, 즉 고양이를 고양이다 아니라 개가 아니게 만드는 미세한 디테일을 포착하는 능력이 좋아졌음을 의미합니다.

저자들은 또한 모델이 어떻게 생각하는지도 살펴보았습니다. 그들은 모델의 "어텐션(attention, 주의 집중)"을 시각화했습니다(컴퓨터가 이미지의 어느 부분에 집중하는지). 그 결과, 합성 부정 사례를 사용했을 때 모델이 단순히 일반적인 형태를 보는 것이 아니라, 이미지의 더 구체적이고 의미 있는 부분에 집중하기 시작한다는 것을 발견했습니다. 이는 로봇이 전체적인 덩어리를 보고 "저건 동물이다"라고 말하던 단계에서, 수염과 귀를 보고 "저건 확실히 고양이다"라고 말하는 단계로 진화한 것과 같습니다.

제외된 요소와 여전히 알려지지 않은 것들

이 논문에서 가장 흥кси로운 발견 중 하나는 저자들이 무엇을 필요로 하지 않았는지에 대한 것입니다. 이전의 방법들은 학습을 안정적으로 유지하기 위해 데이터를 처리하는 방식을 바꾸거나 매우 구체적인 설정을 사용하는 등 많은 추가적인 "트릭"을 필요로 했습니다. 저자들은 합성된 어려운 부정 사례를 사용함으로써 이러한 많은 추가적인 트릭들을 실제로 제거할 수 있다는 것을 발견했습니다. 이 "가짜" 어려운 사례들이 모델을 가르치는 데 너무나 훌륭했기에, 시스템은 궤도를 유지하기 위해 많은 도움을 필요로 하지 않았습니다. 이는 합성 부정 사례가 강력한 자연적 조절자(regulator) 역할을 하여 전체 과정을 단순화한다는 것을 시사합니다.

하지만 논문은 결과에 대해 과도하게 홍보하지 않도록 주의를 기울였습니다. 저자들은 일부 실험에서 상세한 테스트가 ImageNet-100이라는 더 작은 이미지 하위 집합에서 수행되었음을 인정했으며, 아직 비디오 이해나 이미지와 텍스트의 결합과 같은 더 복잡한 작업에는 테스트하지 않았다고 밝혔습니다. 또한 모델들이 개선되기는 했지만, 인간의 라벨을 가지고 훈련된 모델(지도 학습)만큼 뛰어나지는 않다는 점도 언급했습니다. 이 논문은 이것이 견고한 진전이지만, 모든 것을 해결하는 마법의 탄환은 아니라는 점을 시사합니다.

요약

요컨대, 이 논문은 만약 컴퓨터가 인간의 도움 없이 이미지로부터 정말 잘 배우기를 원한다면, 단순히 무작위 사례를 던져주어서는 안 된다고 제안합니다. 의도적으로 "어려운 것들"을 주어야 합니다. 혼란의 경계선에 위치한 도전적인 "가짜" 사례들을 수학적으로 생성함으로써, 저자들은 비전 트랜스포머가 더 날카로운 초점으로 세상을 보는 법을 배울 수 있음을 보여주었습니다. 이것은 단순하지만 효과적인 조정입니다. 연습을 더 어렵게 만들면, 학생은 더 똑똑해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →