← 최신 논문
📊 statistics

Similarity search generalisation in contrastive learning with InfoNCE loss

이 논문은 kk개의 부정적 샘플을 가진 InfoNCE 손실이 유사도 검색 편차를 정량화하는 기대 크로스 엔트로피를 근사한다는 것을 입증하고, 리프시츠(Lipschitz) 임베딩 함수에 대해 부정적 샘플의 수를 늘리는 것이 일반화 오차를 안정화함을 보여주기 위해 가토 미분(Gâteaux differentiation)을 통한 새로운 연속성 경계(continuity bound)를 도입한다.

원저자: Nick Whiteley

게시일 2026-07-13
📖 5 분 읽기🧠 심층 분석

원저자: Nick Whiteley

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 "유사하다"는 것이 무엇인지 가르치려 한다고 상상해 보세요. 당신은 로봇에게 고양이 사진 하나(이것을 앵커라고 부릅니다)와 그 고양이의 약간 다른 사진(이것을 포지티브라고 부릅니다)을 보여줍니다. 그리고 개, 자동차, 바나나 등의 사진들을 잔뜩 보여줍니다(이것들을 네거티브라고 부릅니다). 로봇의 임무는 이 두 장의 고양이 사진은 서로 가깝게 끌어당기고, 개 사진들은 멀리 밀어내는 특별한 "임베딩"(수학적 지도)을 학습하는 것입니다.

로봇이 학습을 위해 사용하는 도구는 InfoNCE라고 불립니다. 이것은 로봇이 노이즈(noise)로부터 얼마나 잘 분리해내는지에 따라 점수를 받는 게임과 같습니다. 하지만 여기서 중요한 질문이 생깁니다. 만약 로봇이 당신이 보여준 사진들로 이 게임을 완벽하게 학습한다면, 한 번도 본 적 없는 실제 세상(보지 못한 데이터)에서도 유사한 것을 잘 찾아낼 수 있을까요?

Nick Whiteley가 작성한 이 논문은 이 질문을 깊이 있게 파고듭니다. 이 논문은 단순히 "잘 작동한다"라고 말하는 데 그치지 않고, 왜 그렇게 작동하는지, 그리고 "노이즈" 사진의 개수(네거티브 샘플)가 게임을 어떻게 변화시키는지 설명하려고 노력합니다.

"노이즈" 군중의 마법

InfoNCE 게임에서는 보통 로봇에게 몇 개의 네거티브 샘플(예를 들어 10개 또는 100개)을 줍니다. 하지만 실제 세상에는 무한한 가능성이 존재합니다. 만약 로봇에게 엄청나게 거대한 규모의 네거티브 샘플 집단을 준다면 어떤 일이 벌어질까요?

이 논문은 매우 구체적인 사실을 증명합니다: 네거티브 샘플의 개수(kk)를 늘릴수록, 로봇의 성능은 완벽한 "이상적인" 검색에 점점 더 가까워집니다.

이렇게 생각해 보세요:

  • 이상적인 검색: 세상의 모든 "포지티브" 쌍(예를 들어 고양이와 그 쌍둥이)이 어떻게 생성되는지 정확히 알고 있는 마법 같은 사서가 있다고 상상해 보세요. 이 사서는 어떤 두 대상 사이의 완벽한 유사성도 즉각적으로 판별할 수 있습니다.
  • 로봇의 검색: 로봇은 자신이 학습한 지도를 사용하여 유사성을 추측합니다.
  • 연결 고리: 이 논문은 로봇의 추측과 마법 같은 사서의 완벽한 정답 사이의 차이가 네거티브 샘플을 추가함에 따라 매우 빠르게 줄어든다는 것을 보여줍니다. 구체적으로, 오차는 O(1/k)O(1/k)의 비율로 감소합니다.

이것은 만약 네거티브 샘플을 두 배로 늘리면 오차를 절반으로 줄일 수 있다는 뜻입니다. 만약 1,000개의 네거티브 샘플이 있다면 오차는 매우 작아집니다. 이것은 단순히 추측이 아니라 논문에 명시된 증명된 수학적 사실입니다. 이는 오차가 (마치 1/k1/\sqrt{k}처럼) 더 느리게 감소할 것이라고 제안했던 기존의 아이디어를 바로잡습니다. 저자는 적절한 수학적 접근을 통해 오차가 훨씬 더 빠르게, 즉 1/k1/k로 감소한다는 것을 보여줍니다.

온도 조절 노브 (The Temperature Knob)

이 이야기에는 또 다른 등장인물이 있습니다: 바로 **온도 파라미터(τ\tau)**입니다. 이것을 로봇의 뇌에 있는 "집중 조절 노브"라고 상상해 보세요.

  • 온도가 낮으면, 로봇은 매우 까다로워집니다. 가장 유사한 것들에만 관심을 기울이고 나머지는 무시합니다.
  • 온도가 높으면, 로봇은 더 여유로워지며 더 넓은 범위의 유사성을 고려합니다.

논문은 이 노브가 정규화 도구(regularizer) 역할을 한다는 것을 증명합니다. 온도를 높이면(높게 설정하면), 로봇의 지도는 일반적인 데이터 분포에 더 가깝게 유지되도록 강제되어, 이상한 예외값(outliers)에 과하게 적응(overfitting)하거나 엉뚱한 방향으로 가는 것을 방지합니다. 논문은 온도가 높을수록 로봇의 검색 행동이 일반적인 데이터 분포에 가깝도록 더 강력하게 제약된다는 점을 명시적으로 밝히고 있습니다.

"평균화"의 초능력

가장 흥ся로운 발견 중 하나는 일반화(generalization), 즉 로봇이 보지 못한 새로운 데이터에서 얼마나 잘 수행하는지에 관한 것입니다.

이전의 이론들은 네거티브 샘플을 추가하는 것이 수학적으로 복잡하고 통제하기 어렵게 만들 수 있다고 시사했습니다. 하지만 이 논문은 그 반대라고 주장합니다. 이 논문은 (Gâteaux 미분이라는 도구를 사용하여) 손실 함수 내의 네거티브 샘플들이 만들어내는 "평균화" 효과가 오히려 로봇의 성능을 안정화시킨다는 것을 보여줍니다.

이는 여론 조사를 하는 것과 같습니다. 한 사람에게 물어보면 그 의견은 엉뚱할 수 있습니다. 10명에게 물어보면 더 나아집니다. 1,000명에게 물어보면 그 평균 의견은 매우 안정적이고 신뢰할 수 있게 됩니다. 논문은 InfoNCE 손실 함수가 정확히 이 여론 조사처럼 작동한다고 증명합니다. kk가 커짐에 따라 개별적인 나쁜 샘플들이 만드는 "노이즈"는 평균화되어 사라지고, 새로운 데이터에 대한 로봇의 일반화 능력은 안정화됩니다.

이 논문이 부정하는 것들

이 논문이 답이 아니라고 명시한 부분들도 중요합니다:

  • 오차율이 kk가 커질 때 천천히 떨어질 것(1/k1/\sqrt{k})이라는 생각에 반박합니다. 논문은 오차가 더 빠르게(1/k1/k) 떨어진다는 것을 증명합니다.
  • "포지티브" 샘플과 "네거티브" 샘플이 대칭적인 방식으로 동일한 분포에서 나온다는 가정에 의존하지 않습니다. 논문은 포지티브 쌍이 특정 변환(사진 자르기 등)에 의해 생성된다는 "블랙박스" 현실을 다루면서, 이를 완벽한 대칭성 안에 억지로 끼워 맞추지 않습니다.
  • 로봇이 반드시 특정 유형의 신경망(예: 심층 CNN)이어야 한다고 주장하지 않습니다. 결과는 임의의 "립시츠 연속(Lipschitz)"인 임베딩 함수(즉, 너무 급격하게 변하지 않는 함수)에 대해 유효하며, 여기에는 많은 유형의 네트워크가 포함되지만 증명 자체는 일반적입니다.

얼마나 확실한가?

저자들은 핵심 메커니즘에 대해 매우 확신하고 있습니다. 그들은 엄밀한 미적분과 확률론을 사용하여 수학적으로 증명했습니다:

  1. 로봇의 검색과 이상적인 검색 사이의 오차는 O(1/k)O(1/k)입니다.
  2. kk가 커짐에 따라 평균화 효과 덕분에 일반화 오차는 안정화됩니다.
  3. 온도 파라미터 τ\tau는 검색을 제약하는 구체적이고 예측 가능한 역할을 합니다.

그들은 이러한 주장을 하기 위해 시뮬레이션이나 실험에 의존하지 않았으며, 이는 제1원리(first principles)로부터 도출되었습니다. 다만, 매우 복잡하고 깊은 신경망의 경우, 네트워크가 매우 크거나 데이터가 방대하지 않다면 이 경계값들이 "공허(vacuous)"해질 수 있다고 언급합니다. 그들은 향후 연구에서 이러한 거대 네트워크를 더 잘 다루기 위해 자신들의 새로운 수학을 다른 기술들과 결합할 수 있다고 제안합니다.

큰 그림

단순하게 말해서, 이 논문은 InfoNCE 손실 함수가 매우 견고한 도구라는 것을 알려줍니다. 이것은 단순히 실무에서 "잘 작동하는 것처럼 보이는" 휴리스틱이 아닙니다. 이 함수는 깊은 이론적 토대를 가지고 있습니다:

  • 이상적인 유사성 검색을 근사하도록 학습합니다.
  • 더 많은 네거티브 샘플을 던져줄수록, 그 이상적인 상태로 더 빠르게 수렴합니다.
  • 네거티브 샘플들의 평균화 작라는 모델이 과적합되는 것을 자연스럽게 방지하여, 보지 못한 데이터에 대해서도 신뢰할 수 있게 만듭니다.

따라서 다음에 유사한 이미지나 텍스트를 찾기 위해 대비 학습(contrastive learning)을 사용하는 시스템을 보게 된다면, 그것은 본질적으로 "무엇이 유사한가"에 대한 거대하고 수학적으로 증명된 여론 조사를 수행하고 있는 것이며, 더 많은 사람(네거티브 샘플)에게 물어볼수록 그 답변은 더욱 정확해진다는 점을 기억하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →