Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning
이 논문은 외부의 무레이블 데이터를 활용하여 클래스 증분 반복 (CIR) 환경에서 모델의 안정성과 가소성을 동시에 향상시키기 위해 다단계 지식 증류와 동적 자기지도 학습을 제안하며, 이를 통해 CVPR 5th CLVISION 챌린지에서 2 위를 달성했다고 요약할 수 있습니다.
원저자:Taeheon Kim, San Kim, Minhyuk Seo, Dongjae Jeon, Wonje Jeung, Jonghyun Choi
이 논문은 기존 **클래스 증분 학습 (Class-Incremental Learning, CIL)**의 한계를 극복하기 위해 **반복적 클래스 증분 학습 (Class-Incremental Learning with Repetition, CIR)**이라는 더 현실적인 시나리오를 다룹니다.
기존 CIL의 한계: 새로운 작업 (Task) 이 도입될 때마다 완전히 새로운 클래스만 등장한다고 가정합니다.
CIR 시나리오: 과거에 학습된 클래스가 미래 작업에서 다시 등장할 수 있으며, 새로운 클래스와 기존 클래스가 혼합되어 나타납니다. 이는 연방 학습의 비-IID 가정이나 온라인 지속 학습의 모호한 작업 경계와 유사합니다.
핵심 제약: 기존 재현 (Rehearsal) 기반 방법은 과거 데이터의 일부를 메모리에 저장하여 재학습하지만, 데이터 프라이버시 및 저장 공간의 제약으로 인해 현실적으로 적용하기 어렵습니다.
해결 방안 제안: 저장된 레이블 데이터를 사용하지 않고, 외부 소스 (인터넷 등) 에서 쉽게 접근 가능한 **레이블 없는 데이터 (Unlabeled Data)**를 활용하여 모델의 **안정성 (Stability, 기존 지식 유지)**과 **가소성 (Plasticity, 새로운 지식 학습)**을 동시에 확보하는 전략을 제안합니다.
2. 방법론 (Methodology)
저자들은 외부 레이블 없는 데이터를 효율적으로 활용하기 위해 두 가지 핵심 컴포넌트를 제안했습니다.
2.1. 다단계 지식 증류 (Multi-Level Knowledge Distillation, MLKD)
기존 지식 증류 (KD) 를 확장하여, 과거의 여러 모델로부터 다양한 관점 (Feature, Logit) 에서 지식을 추출하여 데이터 분포의 변화를 보상합니다.
Feature-Level KD: 이전 모델들의 특징 (Feature) 에서 L2 손실을 통해 지식을 증류합니다. 초기 단계의 특징은 유용한 정보가 적을 수 있으므로, 작업 (Task) 이 진행됨에 따라 Feature KD 손실의 가중치를 선형적으로 증가시킵니다.
Logit-Level KD (Correlation-based): 단순한 인스턴스별 비교는 외부 데이터와 학습 데이터 간의 분포 차이로 인해 해로울 수 있습니다. 이를 해결하기 위해 Gram 행렬을 사용하여 배치 내 인스턴스 간의 상관관계와 클래스 간의 상관관계를 증류합니다.
LLogitKD는 현재 배치의 상관관계 (G) 와 클래스 상관관계 (M) 를 이전 모델과 비교합니다.
Multiple Previous Models & EMA: 단일 모델이 아닌 여러 개의 과거 모델을 유지하고, 현재 모델과 지수 이동 평균 (EMA) 을 통해 점진적으로 업데이트하여 지식 전달의 강건성을 높입니다.
2.2. 동적 자기 지도 학습 (Dynamic Self-Supervised Learning, SSL)
레이블 없는 데이터를 활용하여 모델이 새로운 개념에 적응하는 능력 (가소성) 을 향상시킵니다.
목적: 입력에서 일반화된 특징을 추출하여 미지의 클래스를 식별하고 분류하는 능력을 돕습니다.
동적 가중치 (Dynamic Weighting): SSL 손실이 주 작업 (이미지 분류) 의 성능을 저하시킬 수 있으므로, 작업 번호 t에 따라 SSL 손실의 가중치 α를 동적으로 조절합니다.
α=c⋅ωt (ω<1)
초기에는 SSL 의 영향을 크게 주어 일반화 능력을 키우고, 시간이 지남에 따라 가중치를 줄여 주 작업 (분류) 에 집중하도록 유도합니다.
2.3. 최종 손실 함수 (Final Loss)
기존의 비동기 교차 엔트로피 (ACE), 로짓 제약 (Logit Constraint), 메모리 버퍼 재현 (Feature/Logit Replay) 을 기반으로 MLKD 와 Dynamic SSL 을 결합한 최종 손실 함수를 구성합니다.
3. 주요 기여 (Key Contributions)
CIR 환경에서의 새로운 접근법: 레이블 없는 외부 데이터를 활용하여 프라이버시 문제 없이 지속 학습을 수행하는 프레임워크를 제시했습니다.
MLKD 제안: 여러 과거 모델의 특징과 로짓 상관관계를 다단계로 증류하여 데이터 분포 변화 (Distribution Shift) 를 극복하고 지식 유지력을 극대화했습니다.
Dynamic SSL 전략: SSL 의 일반화 이점을 취하면서도 주 작업의 성능 저하를 막기 위한 동적 가중치 조정 메커니즘을 도입했습니다.
성능 입증: ImageNet-1K 서브셋을 기반으로 한 CVPR 5th CLVISION 챌린지에서 2 위를 차지하며 제안된 방법의 유효성을 입증했습니다.
4. 실험 결과 (Results)
데이터셋: ImageNet-1K 의 130 개 클래스 (새, 해양 생물, 벌레) 로 구성된 50 개의 작업 (Experience) 스트림.
제약 조건: GPU 메모리 8GB, 시간 제한 600 분, 메모리 버퍼 200 개 예시 (각 1,024 float 미만).
성능 비교 (최종 정확도):
Fine-tuning: 5.82% (기억 상실 심각)
Baseline (Local CE + Feature Replay): 19.54%
Baseline + Dynamic SSL: 23.82%
Baseline + MLKD: 39.82%
Ours (Baseline + Dynamic SSL + MLKD): 42.00%
Ablation Study:
MLKD 구성 요소 (Feature KD, EMA, Correlation Logit KD, Multiple Models) 를 모두 결합했을 때 최적의 성능을 보였습니다.
과거 모델 수는 3 개일 때 최적 (42.00%) 이었으며, 4 개 이상은 중복성으로 인해 성능이 약간 하락했습니다.
SSL 방식으로는 회전 예측 (Rotation Prediction) 이 SimCLR, SimSiam 등 다른 최신 방법보다 더 좋은 성능을 보였습니다 (대형 배치 및 긴 학습 시간 제약 때문).
SSL 에 동적 가중치를 적용하지 않을 경우 (40.76%) 보다 적용 시 (42.00%) 성능이 향상되어 동적 조절의 중요성을 입증했습니다.
5. 의의 및 결론 (Significance & Conclusion)
이 논문은 데이터 프라이버시와 저장 공간의 제약이 있는 현실적인 환경에서, 레이블 없는 외부 데이터를 효과적으로 활용하여 지속 학습의 안정성과 가소성을 동시에 해결할 수 있음을 증명했습니다.
MLKD는 과거 지식의 손실을 방지하고 분포 변화를 보정하는 강력한 도구로 작용했습니다.
Dynamic SSL은 새로운 클래스 학습을 가속화하면서도 주 작업의 성능을 유지하는 균형을 잡았습니다.
이 두 가지 기법의 결합은 기존 지속 학습 베이스라인을 크게 개선하여, CVPR 2024 CLVISION 챌린지 2 위라는 성과를 거두었습니다. 이는 외부 데이터를 활용한 재현 없는 (Rehearsal-free) 지속 학습의 가능성을 크게 확장한 의미 있는 결과입니다.