상상해 보세요. CLIP 과 같은 초지능 로봇 도우미가 그림과 단어 모두를 이해하도록 훈련되었다고 가정해 봅시다. "개 사진 보여줘"라고 요청하면, 그것은 즉시 한 장을 찾아냅니다. 완벽해 보입니다. 하지만 이 논문은 이 로봇이 실제로는 자신의 일을 수행하는 데 필요 없는 쓸모없는 쓰레기로 가득 찬 무거운 배낭을 메고 다니고 있다고 주장합니다.
연구자들이 발견한 내용을 간단한 비유로 정리해 보겠습니다.
1. 신호 속의 '잡음'
로봇의 두뇌를 세계를 듣는 768 개의 서로 다른 채널 (차원) 을 가진 거대한 라디오 수신기로 생각하세요.
좋은 채널: 이 채널들의 대부분은 그림이나 단어의 실제 의미 (예: "개", "교회", 또는 "행복") 인 '신호'에 맞춰져 있습니다.
나쁜 채널: 연구자들은 이 채널 중 약 164 개가 단순히 '잡음'을 송출하고 있음을 발견했습니다. 이는 무작위 노이즈가 아닙니다. 이는 로봇이 보는 모든 그림과 모든 단어에 콘텐츠와 상관없이 나타나는 구체적이고 공유된 형태의 잡음입니다.
2. '유령' 패턴
가장 놀라운 점은 이 '잡음'이 서로 다른 그룹 간에 동일하다는 것입니다.
비유: 시베리아 허스키 사진과 교회 건물 사진을 찍었다고 상상해 보세요. 두 사진은 공통점이 전혀 없습니다. 그럼에도 불구하고 두 이미지 모두에 대한 로봇의 기억 속 '쓰레기' 부분을 살펴보면, 그 쓰레기는 거의 정확히 동일하게 보입니다 (91% 중첩).
발견: 로봇은 자신이 보는 모든 것에 찍히는 '유령' 패턴을 가지고 있습니다. 렌즈에 얼룩이 묻은 프린터가 있는 것과 같습니다. 레시피든 연서든 인쇄하는 모든 문서에 그 같은 얼룩이 모서리에 찍히게 됩니다. 연구자들은 이 얼룩이 매우 일관적이어서 완벽하게 매핑할 수 있음을 발견했습니다.
3. '쓰레기 서랍' 실험
연구자들은 이 '쓰레기 서랍' (164 개의 노이즈 차원) 을 단순히 버려버린다면 어떤 일이 일어나는지 테스트하기로 결정했습니다.
결과: 그들은 로봇에서 해당 164 개의 채널을 제거한 후, 사진 속 동물을 식별하거나 단어와 이미지를 매칭하는 등 평소의 작업을 수행하도록 요청했습니다.
놀라운 점: 로봇의 성능이 나빠지지 않았습니다. 오히려 단어와 이미지를 매칭하는 데 약간 더 잘 수행했습니다. 이는 달리는 사람에게 돌로 가득 찬 배낭을 벗겨준 것과 같습니다. 그들은 느려지지 않았고, 오히려 무거운 짐을 지고 있지 않아 더 빠르게 달렸습니다.
4. 왜 이런 일이 발생할까요?
이 논문은 이 '노이즈'가 코드상의 버그가 아니라 로봇이 구축된 방식의 부작용이라고 제안합니다.
비유: 자동차를 만드는 공장을 상상해 보세요. 엔지니어들이 공정을 매우 효율적으로 설계하여 자동차는 훌륭하지만, 기계의 진동이 우연히 모든 자동차 문에 작고 쓸모없는 스크래치를 남깁니다. 그 스크래치는 자동차가 주행하는 것을 막지 않지만, 모든 자동차에 존재합니다.
연구자들은 이 '스크래치' (노이즈) 가 특정 데이터셋의 실수가 아니라 아키텍처의 근본적인 부분임을 발견했습니다.
요약
이 논문은 CLIP 과 같은 현대 AI 모델이 이미지나 텍스트의 실제 의미와 전혀 관련 없는 거대한 양의 '공유 노이즈'(일부 버전에서는 약 164 차원) 를 메고 다니고 있다고 주장합니다.
좋은 소식: AI 의 성능을 해치지 않고 이 노이즈를 제거할 수 있습니다.
큰 그림: AI 의 '두뇌 공간' 중 상당 부분이 유용한 지식보다는 반복적이고 의미 없는 패턴을 저장하는 데 실제로 사용되고 있습니다. 이를 정리함으로써 AI 는 약간 더 효율적이고 정확하게 됩니다.
기술적 요약: "귀하의 CLIP 은 164 차원의 노이즈를 가지고 있습니다"
문제 제기 CLIP 및 SigLIP 와 같은 대비적 사전 학습 비전 - 언어 모델 (VLM) 은 제로샷 분류부터 교차 모달 검색에 이르기까지 다양한 작업의 특징 추출기로 광범위하게 배포되고 있습니다. 그러나 이러한 공유 잠재 공간은 구조적 이상을 나타내며, 비의미적 다중 모달 노이즈의 저장소 역할을 합니다. 이전 연구가 단일 모달 모델에서'원뿔 효과', '모달리티 간극', '차원 붕괴'와 같은 현상을 식별해 왔지만, 이러한 모델이 고차원 잠재 공간 내에서 어떻게 관련 없는 데이터를 인코딩하는지 이해할 필요가 있습니다. 저자들은 현대 VLM 의 잠재 기하학 상당 부분이 작업 관련 의미론이 아닌 공유된 아키텍처 수준의 노이즈에 의해 지배된다고 주장합니다.
방법론 저자들은 VLM 잠재 공간의 기하학을 분석하기 위해 공분산 행렬의 스펙트럼 분해를 사용합니다.
공분산 추정: 텍스트와 이미지 임베딩에 대해 대규모 데이터셋 (ImageNet-1K 및 LAION-2B) 에서 파생된 각각의 경험적 공분산 행렬 (Σtext 및 Σimg) 을 계산합니다. 결합 잠재 공간을 분석하기 위해 평균 교차 모달 공분산 행렬 (Σavg) 을 정의합니다.
스펙트럼 분해: 행렬을 분해하여 고유값과 고유벡터를 식별합니다. 저자들은 CLIP 및 SigLIP 변형 모델을 포함한 다양한 모델에서 특정 임계값 (약 10−3.6) 을 넘어서면 고유값이 일관되게 급격히 감소하는 것을 관찰합니다.
노이즈 임계값 설정:Σavg에'팔꿈치 방법 (elbow method)'을 적용하여'신호'(상위 고유값) 와'노이즈'(고유값의 하부 대량) 를 분리하는 컷오프 임계값을 식별합니다. 이 임계값 이하인 차원은'공유 노이즈 부분 공간'으로 식별됩니다.
부분 공간 정렬: 이러한 노이즈 차원의 보편성을 검증하기 위해, 저자들은 전역적으로 추출된 노이즈 벡터와 특정 데이터 하위 집합 (예: 개별 ImageNet 클래스) 의 저분산 고유벡터 간의 부분 공간 각도 평균 제곱 코사인 (mSCSA) 을 계산합니다.
가지치기 및 평가: 노이즈 제거 투영 행렬 (P=I−VVT) 을 구성하여 임베딩을 노이즈 부분 공간의 직교 여공간에 투영합니다. 그런 다음 ImageNet 제로샷 분류 및 LAION-2B 이미지 - 텍스트 정렬과 같은 하류 작업에 대한 가지치기의 영향을 평가합니다.
주요 결과
공유 노이즈의 존재: 분석은 공분산 고유값의 하부 대량으로 구성된 명확한'노이즈 부분 공간'의 존재를 드러냅니다. CLIP ViT-L/14 의 경우 이는 768 차원 공간의 21% 에 해당하는 164 차원에 해당합니다.
하위 집단 불변성: 식별된 노이즈 차원은 서로 다른 데이터 하위 집합 전반에 걸쳐 강한 불변성을 보입니다. 전역 노이즈 부분 공간과 클래스별 저분산 부분 공간 간의 mSCSA 점수는 높습니다 (대부분의 대형 모델의 경우 90% 초과). 이는 이러한 노이즈 방향이 보편적이며 단일 클래스나 데이터 하위 집합에 특유하지 않음을 나타냅니다.
가지치기의 영향:
분류: 노이즈 차원을 제거하면 ImageNet 제로샷 Top-5 정확도가 미미하게 감소합니다 (예: CLIP ViT-L/14 는 91.2% 에서 91.1% 로 감소). 동일한 수의 차원을 무작위로 제거하면 성능이 현저히 저하되어, 노이즈 차원이 거의 의미 정보를 담고 있지 않음을 확인합니다.
정렬: 가지치기가 정렬에 해를 끼칠 것이라는 가설과 달리, 저자들은 노이즈 제거 후 LAION-2B 의 이미지 - 텍스트 쌍에서 평균 코사인 유사도가 체계적으로 증가하는 것을 관찰합니다. 이 개선은 잠재 차원의 크기에 비례하여 확대됩니다.
정성적 검사: 노이즈 부분 공간에서 높은 활성을 보이는 샘플에 대한 시각적 검사는 이러한 샘플이 종종 사용 불가능한 이미지 플레이스홀더나 분포 외 아티팩트 (예: ImageNet 단독 추정 시 마블 영화 주제) 에 해당함을 보여줍니다. 이는 이러한 차원의 비의미적 성격을 더욱 뒷받침합니다.
의의 및 주장 이 논문은 현대 VLM 의 표현 구조에 대한 새로운 기계론적 통찰력을 제공한다고 주장합니다. 잠재 공간을 다중 모달 의미 신호와 공유 노이즈 부분 공간으로 공식적으로 분해함으로써, 저자들은 다음을 입증합니다:
대비적 사전 학습 모델의 잠재 기하학 상당 부분은 작업 관련 의미론이 아닌 공유된 아키텍처 수준의 노이즈에 의해 지배됩니다.
이러한 공유 노이즈 차원을 가지치기하는 것은'주로 무해하며', 분류 능력을 저하시키지 않으면서 하류 정렬 성능을 능동적으로 향상시킬 수 있습니다.
차원 붕괴 현상은 현대 VLM 에서 지속되지만, 공간의 완전한 붕괴가 아닌 관련 없는 데이터의 저장소로 나타납니다.
저자들은 최적의 노이즈 임계값이 특정 모델 아키텍처와 데이터 분포에 따라 달라질 수 있음을 인정하며 겸손한 입장을 유지합니다. 고유 스펙트럼의 dip 은 날카롭지만 이전 단일 모달 연구에서 관찰된 위상 전이만큼 즉각적이지는 않다고 지적하며, 잠재 용량 할당을 위한 복잡한 기저 메커니즘이 있음을 시사합니다. 향후 연구는 이러한 평가를 더 넓은 범위의 백본으로 확장하고, 이 노이즈 메커니즘과 모달리티 간극의 출현을 연결하는 공식적 이론적 프레임워크를 수립하는 것을 제안합니다.