← 최신 논문
🤖 machine learning

On the modality gap and the contrastive loss in multi-modal representation learning

이 논문은 CLIP 방식의 대조 학습에서 나타나는 모달리티 격차(modality gap)를 독립적인 인코더를 사용하는 InfoNCE 목적 함수의 저온 실패(low-temperature failure)로 규명하고, 검색 정확도를 희생하지 않으면서도 제로샷 분류 성능을 향상시키는 동시에 이 격차를 제거하는 양방향 모달리티 부정 사례(intra-modality negatives)를 포함한 수정된 손실 함수인 xNCE를 제안한다.

원저자: Fabian Mager, Hiba Nassar, Lars Kai Hansen

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fabian Mager, Hiba Nassar, Lars Kai Hansen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 두 명의 절친한 친구가 있다고 상상해 보세요. 한 명은 오직 "그림"으로만 말하고, 다른 한 명은 오직 "단어"로만 말합니다. 당신은 이들이 서로를 완벽하게 이해할 수 있도록 같은 방(공유된 디지털 공간)에 모이게 하고 싶습니다. 이것이 바로 CLIP과 같은 AI 모델이 하려는 일입니다. 즉, 이미지와 그 설명을 매칭하는 법을 배우는 것이죠.

하지만 이상한 점이 있습니다. 훈련이 끝난 후에도 이 두 친구는 종종 방의 서로 반대편 구석에 서 있게 됩니다. 서로 대화는 할 수 있지만, 결코 섞이지는 않습니다. 이미지 임베딩은 한곳에 뭉쳐 있고, 텍스트 임베딩은 다른 곳에 뭉쳐 있는 것입니다. 이를 **"모달리티 갭(modality gap)"**이라고 부릅니다.

오랫동안 과학자들은 이 분리가 친구들의 서로 다른 성격(무작위 초기화)이나 서로 다른 동네 출신(데이터의 차이) 때문에 발생한다고 생각했습니다. 하지만 Fabian Mager, Hiba Nassar, Lars Kai Hansen의 이 논문은 이렇게 말합니다. "잠깐만요. 그게 아닙니다."

진짜 범인: 서툰 "뜨거운 감자" 게임

저자들은 자신의 주장을 증명하기 위해 영리한 실험을 수행했습니다. 그들은 두 명의 똑같은 쌍둥이(정확히 같은 시작 가중치를 가진 두 개의 독립적인 인코더)를 데려와서, 약간의 변형(회전이나 확대 등)을 가한 동일한 사진들을 보여주었습니다. 완벽한 세상이라면 이 쌍둥이는 동일한 출력을 내놓아야 합니다.

하지만 그들이 특정 설정(AI를 매우 까다롭게 만드는 "낮은 온도")을 사용한 표준 훈련 방식(InfoNCE)을 사용했을 때, 쌍둥이는 여로도 서로 멀어졌습니다. 두 쌍둥이는 같은 것을 보고 있음에도 불구하고, 한 명은 "그림"을 말하고 다른 한 명은 "텍스트"를 말하기 시작했습니다!

이는 갭이 데이터나 시작점 때문에 발생하는 것이 아님을 증명합니다. 대신, 이 논문은 InfoNCE 공식 자체에 결함이 있다고 주장합니다.

이렇게 생각해 보세요. 훈련 게임은 AI에게 이렇게 명령합니다. "짝이 맞는 쌍(이미지+텍스트)은 매우 가깝게 만들고, 짝이 맞지 않는 모든 쌍은 매우 멀리 떨어뜨려 놓아라."

  • 결함: 짝이 맞지 않는 쌍을 "멀리" 떨어뜨리기 위해, AI는 게으른 지름길을 찾아냅니다. 전체 "이미지" 그룹을 방 한쪽 구석으로 밀어내고, 전체 "텍스트" 그룹을 다른 쪽 구석으로 밀어내는 것이죠. 이는 "서로 떨어져 있으라"는 규칙을 만족시키면서도, 실제로 둘을 섞이는 법을 배우지는 않는 방식입니다. 논문은 이를 **"모드 실패(mode-failure)"**라고 부릅니다. AI가 자신이 잘하고 있다고 착각하는 국소 최적점(local minimum)을 찾아냈지만, 실제로는 그저 두 그룹을 별도의 구석에 숨겨둔 것에 불과한 상태입니다.

이 현상은 특히 AI가 매우 엄격하게 설정되었을 때(낮은 온도) 발생합니다. 만약 AI를 더 느슨하게 만든다면(높은 온도), 그룹들이 섞이기는 하지만, 그러면 AI가 서로 다른 사물을 구별하는 능력을 잊어버려 나중에 사물을 인식하는 능력이 망가집니다.

해결책: xNCE (더 "믹솔로지스트"가 된 방식)

저자들은 xNCE라고 불리는 간단한 해결책을 제안합니다.

훈련 게임을 다시 상상해 보세요. 기존 버전에서는 AI가 "맞지 않는" 이미지와 "맞지 않는" 텍스트를 멀리 떨어뜨리려 할 때, 단순히 그들을 반대편 구석으로 밀어냈습니다.
새로운 xNCE 버전에서는 게임의 규칙이 바뀝니다. "너는 텍스트를 이미지로부터 밀어내기만 해서는 안 된다. 너는 텍스트를 다른 텍스트들로부터도 밀어내야 하고, 이미지를 다른 이미지들로부터도 밀어내야 한다."

이처럼 "부정적(negative)" 예시들(AI가 매칭해서는 안 되는 것들)을 섞음으로써, AI는 구석에 숨는 것을 멈추도록 강요받습니다. AI는 특정 매칭은 가깝게 유지하면서도, 그룹들을 섞인 상태로 유지하는 법을 배워야만 합니다.

실험실에서 일어난 일

저자들은 두 가지 테스트를 진행했습니다.

  1. MNIST (손글씨 숫자): 두 인코더를 서로 다른 두 개의 "모달리티"인 것처럼 취급했습니다.
    • 결과: 기존 방식은 낮은 온도에서 두 그룹이 완전히 분리되었습니다(100% 분리 가능). 하지만 xNCE를 사용하자, 그 엄격한 낮은 온도에서도 갭이 극적으로 줄어들었습니다.
  2. COCO (이미지와 캡션): 이것은 실제 환경에서의 테스트입니다.
    • 갭: 표준 방식은 거대한 갭(거리 0.88)을 남겼습니다. 새로운 방식은 아주 조금만 섞었을 때(1%~5%) 갭을 0.12까지 줄였고, 많이 섞었을 때는 0.05까지 줄였습니다.
    • 트레이드오프(절충): 저자들은 최적의 지점을 찾아냈습니다. 부정적 예시를 아주 조금만(1%~5%) 섞으면, 이미지 검색 능력(retrieval)을 해치지 않으면서도 갭을 거의 완전히 닫을 수 있었습니다.
    • 보너스: 가장 중요한 점은, 이 새로운 방식이 학습되지 않은 상태에서 이미지를 추측하는 능력(zero-shot classification)을 향상시켰다는 것입니다. 네 가지 서로 다른 테스트에서, 새로운 방식이 기존 방식을 앞질렀습니다. 예를 들어, CIFAR-100 테스트에서 정확도가 4.2 퍼센트 포인트 향상되었습니다.

이 논문이 말하지 않는

이 논문이 주장하지 않는 내용을 아는 것도 중요합니다.

  • 이 논문은 높은 온도가 정답이라고 말하지 않습니다. 사실, 그룹을 섞기 위해 온도를 높이면 사물을 인식하는 능력이 파괴된다는 것(ImageNet 정확도가 51.9%에서 15.5%로 급락)을 보여줍니다.
  • 또한, 추가적인 "규제(regularization, AI를 균일하게 만드는 것)"를 더하는 것이 최선의 해결책이라고 말하지 않습니다. 저자들은 규제된 버전을 테스트했지만, 그것은 섞는 방식만큼 제로샷 성능을 개선하지 못했습니다.
  • 마지막으로, 이것이 모든 문제에 대한 마법의 탄환이라고 주장하지 않습니다. 논문은 극도의 정밀함이 필요한 작업(예: 정확히 1순위 매칭을 찾는 작업)에는 아주 적게 섞는 것(1~5%)이 좋고, 더 일반적인 이해가 필요한 작업에는 더 많이 섞을 수 있다는 점을 시사합니다.

핵심 요약

이 논문은 "모달리티 갭"이 자연의 신비가 아니라, 표준적인 훈련 레시피에 있는 버그라고 제안합니다. 훈련 게임에서 "부정적" 예시들을 단순히 섞어주는 것만으로도, 저자들은 AI가 단순히 구석에 숨는 것이 아니라 실제로 공유된 언어를 배우도록 강제하는 방법(xNCE)을 만들어냈습니다. 이 작은 변화는 AI를 더 똑똑하고, 더 통합적이며, 세부 사항을 포착하는 데 필수적인 엄격한 "까다로운" 설정을 유지하면서도 새로운 것을 더 잘 추측할 수 있게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →