Semantic Visual Representations Emerge from Embodied Self-Supervised Learning
이 논문은 자연스러운 인간의 상호작용으로부터 시간적 일관성과 감각운동 수반성을 활용하여 기존 모델보다 성능이 뛰어나고, 언어 습득 전 아동의 시각 피질과 더 밀접하게 일치하며, 인간의 시각 발달 및 스트림 특수화의 기원에 대한 새로운 통찰을 제공하는 고차원적 의미론적 시각 표현을 생성하는 모델인 체화된 자기지도 학습(E-SSL)을 소개한다.