Enhancing Vehicle Detection under Adverse Weather Conditions with Contrastive Learning
이 논문은 눈 덮인 북유럽 지역의 UAV 영상에서 발생하는 시야 제한 및 도메인 변화 문제를 해결하기 위해, 대조 학습(Contrastive Learning)을 활용하여 미라벨링 데이터를 학습하고 이를 경량화된 YOLO11n 모델에 결합함으로써 차량 탐지 성능을 크게 향상시킨 'sideload-CL-adaptation' 프레임워크를 제안합니다.
자율주행 드론이 북유럽의 눈 덮인 산길을 날아다니며 자동차를 찾는다고 상상해 보세요. 그런데 문제가 생겼습니다.
눈이 너무 많이 쌓였어요: 차가 눈에 파묻혀서 배경이랑 구분이 안 됩니다.
너무 작아요: 드론은 높이 떠 있으니 차가 점처럼 작게 보입니다.
공부할 자료가 부족해요: 인공지능을 똑똑하게 만들려면 사람이 일일이 "이건 차야", "이건 나무야"라고 이름표(라벨)를 붙여줘야 하는데, 이게 엄청나게 힘들고 돈이 많이 드는 작업입니다.
2. 해결책: "공부 안 해도 스스로 깨우치는 '눈썰미' (SCLA 방식)" 🧠
연구팀은 아주 똑똑한 전략을 짰습니다. 이름하여 SCLA(사이드로드 대조 학습 적응) 방식입니다. 이걸 **'두 명의 전문가를 한 팀으로 만드는 법'**에 비유해 볼게요.
① 첫 번째 전문가: "세상 만물 박사" (COCO 데이터로 학습된 YOLO11) 이 전문가는 이미 전 세계의 수많은 사진을 보고 "이건 자동차, 이건 사람"이라고 아주 잘 알고 있습니다. 하지만 북유럽의 특수한 눈보라 상황은 아직 경험해 본 적이 없어서 당황할 수 있죠.
② 두 번째 전문가: "현지 적응형 눈썰미 대장" (FM-PaCL 방식) 이 전문가는 이름표가 없는(라벨링 안 된) 수많은 눈밭 영상을 그냥 멍하니 계속 봅니다. 이름표는 없지만, **"아, 눈이 이렇게 쌓이면 이런 모양이구나", "빛이 이렇게 반사되는구나"**를 스스로 깨우칩니다.
비유: 마치 우리가 이름표 없는 풍경 사진을 수만 장 보면서 "아, 저건 눈 덮인 언덕이구나"라고 감을 잡는 것과 같습니다. 특히 이 연구는 사진 전체를 보는 게 아니라, 돋보기를 들고 아주 작은 부분(패치) 하나하나를 꼼꼼히 관찰하며 공부해서 작은 차를 찾는 능력을 키웠습니다.
③ 결합 단계: "최고의 팀워크, SE 게이팅" 🤝 이제 두 전문가를 합쳐야 합니다. 그런데 그냥 합치면 서로 자기 말만 하느라 싸울 수 있죠(성능 저하). 연구팀은 **'SE 게이팅'**이라는 똑똑한 조율사를 붙였습니다.
비유: 조율사는 상황을 보고 **"지금은 눈보라가 심하니까 '현지 전문가'의 의견을 80% 듣고, '만물 박사'의 의견은 20%만 참고해!"**라고 실시간으로 비중을 조절해 줍니다.
3. 결과: "성능이 껑충!" 🚀
이 방식을 사용했더니, 기존 방식보다 자동차를 찾아내는 정확도(mAP50)가 8.9%나 향상되었습니다. 특히, 한 번도 가본 적 없는 새로운 장소나 다른 날씨의 영상에서도 아주 끈질기게 차를 잘 찾아냈습니다.
💡 요약하자면?
문제: 눈 오는 날 드론이 작은 차를 찾기는 너무 힘들고, 공부시킬 데이터(이름표 붙인 사진)는 부족하다.
방법:
이름표 없는 영상으로 **'작은 부분까지 꼼꼼히 보는 눈썰미'**를 먼저 키운다.
이미 똑똑한 기존 AI와 이 '눈썰미 대장'을 '상황에 맞게 비중을 조절하며' 합친다.
결과: 돈 안 들이고(라벨링 없이) 눈보라 속에서도 차를 훨씬 잘 찾는 똑똑한 드론 AI를 만들었다!
[기술 요약] 대조 학습을 이용한 악천후 환경에서의 차량 탐지 성능 향상
1. 문제 정의 (Problem Statement)
UAV(무인 항공기)를 이용한 차량 탐지는 고도에 따른 시점 변화, 작은 객체 크기, 약한 시각적 특징 등의 고유한 어려움이 있습니다. 특히 북유럽(Nordic) 지역과 같은 환경에서는 다음과 같은 문제가 심화됩니다:
악천후 및 도메인 변화: 눈 덮인 지형, 다양한 눈의 피복 정도, 구름 덮임 등으로 인해 차량이 배경과 구분이 어려워지는 시각적 도메인 차이(Domain Shift)가 발생합니다.
데이터 주석(Annotation)의 비용 문제: 비디오 기반의 객체 탐지는 모든 프레임에 바운딩 박스를 그리는 작업이 매우 고비용이며 시간이 많이 소요됩니다. 반면, 주석이 없는(Unannotated) 데이터는 드론 비행을 통해 상대적으로 저렴하게 수집할 수 있습니다.
기존 모델의 한계: 데이터가 부족할 경우 YOLO와 같은 경량 모델은 도메인 변화에 취약하며 일반화 성능이 떨어집니다.
2. 제안 방법론 (Methodology): SCLA 프레임워크
본 논문은 주석이 없는 데이터를 활용하여 경량 탐지 모델의 성능을 높이는 Sideload-Contrastive-Learning-Adaption (SCLA) 프레임워크를 제안합니다. 이 프레임워크는 두 단계로 구성됩니다.
단계 1: FM-PaCL을 이용한 사전 학습 (Pretraining)
주석이 없는 데이터를 사용하여 CNN 기반의 특징 추출기(Feature Extractor)를 사전 학습시킵니다.
FM-PaCL (Feature-Map-Patch Contrastive Learning): 기존의 대조 학습(Contrastive Learning)이 이미지 전체를 하나의 벡터로 압축하는 것과 달리, 본 연구는 특징 맵(Feature Map) 레벨의 패치(Patch) 단위로 학습을 수행합니다.
작동 원리: 특징 맵에 슬라이딩 윈도우를 적용하여 겹치는 패치들을 추출하고, 광학적 변형(Photometric Augmentation)을 가한 두 뷰(View) 사이에서 동일한 위치의 패치들을 대조합니다. 이를 통해 작은 객체 탐지에 필수적인 **미세한 국소 정보(Fine-grained local information)**를 보존하며 학습합니다.
단계 2: 적응형 특징 융합 및 미세 조정 (Fine-tuning)
사전 학습된 특징 추출기를 기존의 YOLO11n 모델에 병렬로 연결(Sideload)하여 사용합니다.
이중 특징 활용: COCO 데이터셋으로 사전 학습된 YOLO11n의 강력한 일반적 특징(Domain-agnostic)과, FM-PaCL을 통해 학습된 북유럽 환경 특화 특징(Domain-specific)을 동시에 활용합니다.
동적 특징 융합 (Dynamic Feature Fusion): 두 특징을 단순히 더하는 것이 아니라, SE(Squeeze-and-Excitation) Gating 메커니즘을 사용하여 채널별 중요도를 학습합니다. 모델은 입력 데이터에 따라 어떤 특징 채널이 더 중요한지 스스로 판단하여 가중치를 부여합니다.
동결 전략 (Freezing Strategy): 사전 학습된 지식의 망각(Catastrophic Forgetting)을 방지하기 위해, 사전 학습된 Side CNN과 COCO 기반 YOLO11n의 백본(Backbone)은 미세 조정 단계에서 고정(Frozen)합니다.
3. 주요 기여 (Key Contributions)
SCLA 프레임워크 제안: 주석이 없는 비디오 데이터를 활용하여 악천후 환경에서의 차량 탐지 성능을 mAP50 기준 8.9% 향상시켰습니다.
FM-PaCL 방법론: 이미지 레벨이 아닌 특징 맵 패치 레벨에서 대조 학습을 수행함으로써, UAV 영상의 핵심 문제인 소형 객체(Small objects) 표현력을 극대화했습니다.
안정적인 지식 통합: 상위 도메인(COCO)의 지식과 하위 도메인(NVD)의 특화 지식을 SE Gating을 통해 효과적으로 결합하는 안정적인 구조를 제시했습니다.
4. 실험 결과 (Results)
NVD 데이터셋 성능: 기존 YOLO11n 베이스라인 대비 mAP50에서 8.9%의 성능 향상을 기록했습니다.
강건성(Robustness): 학습/검증/테스트 데이터가 완전히 다른 비디오로 구성된 실제적인 시나리오(Practical Split)에서도 2.8%의 성능 향상을 보이며 도메인 변화에 대한 강한 저항력을 입증했습니다.
융합 전략 비교: 실험 결과, 단순 합산(Addition)이나 Zero-Conv보다 SE Gating 방식이 가장 우수한 성능과 일관성을 보였습니다. 또한, 특징을 모든 블록에서 융합하는 것보다 백본 끝단에서 한 번에 융합하는 것이 노이즈를 줄이고 성능을 높이는 데 효과적이었습니다.
5. 연구의 의의 (Significance)
본 연구는 "데이터 주석 비용은 낮추면서, 모델의 도메인 적응력은 높이는" 실용적인 해결책을 제시했습니다. 특히 자원이 제한된 UAV 환경에서 경량 모델(YOLO11n)을 유지하면서도, 대조 학습과 적응형 융합 기술을 통해 고성능 탐지 성능을 확보할 수 있음을 증명함으로써, 실제 산업 현장(자율 주행, 보안, 감시 등)에서의 활용 가능성을 높였습니다.