← 최신 논문
🤖 machine learning

Improving Relative Representations with Learned Anchors and Whitened Inner Products

본 논문은 시맨틱 앵커 프로토타입을 학습하고 기하학적 인지 유사도 지표를 채택함으로써, 이질적인 신경망 구조 간의 안정적이고 거의 손실 없는 정보 전송을 가능하게 하여 전통적인 상대적 표현(Relative Representations)을 개선하는 강건한 교차 모델 통신 프레임워크를 제안한다.

원저자: Oscar Thorsted Svendsen, Nikolaj Holst Jakobsen, Fabian Mager, Hiba Nassar

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Oscar Thorsted Svendsen, Nikolaj Holst Jakobsen, Fabian Mager, Hiba Nassar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 명의 번역가가 있다고 상상해 보세요. 이들은 같은 언어를 사용하지만, 완전히 다른 사전과 문장 구조를 가지고 있습니다. 한 번역가(모델 A)는 "왕"을 키가 크고 황금빛인 형체로 설명하는 반면, 다른 번역가(모델 B)는 "왕"을 키가 작고 푸른 형체로 설명합니다. 만약 당신이 모델 A가 쓴 노트를 모델 B에게 주려고 한다면, 좌표가 일치하지 않기 때문에 모델 B는 그것을 이해하지 못할 것입니다.

이것이 바로 **상대적 표현(Relative Representations)**이 해결하고자 하는 문제입니다. 모델 A와 모델 B가 "왕"의 정확한 좌표에 대해 합의하도록 강요하는 대신, 그들은 **랜드마크(Landmarks, 앵커)**라는 집합에 합의합니다. 그들은 이렇게 말합니다. "좋아, 각자의 지도를 어떻게 그리든 상관없이, '왕'이 '여왕' 및 '성'과 얼마나 가까운가?" 만약 두 모델이 이러한 랜드마크까지의 거리에 동의한다면, 각자의 내부 지도가 완전히 다르더라도 서로 대화할 수 있습니다.

하지만 기존 방식에는 두 가지 큰 결함이 있었으며, 이 논문은 PARAMWIP라는 새로운 시스템으로 이를 해결합니다.

기존 방식의 문제점

  1. 무작위 랜드마크: 기존 방식은 지도에 다트를 던지듯 무작위로 랜드마크를 선택했습니다. 때때로 다트가 한곳에 몰려 떨어지거나(중복성), 지도의 거대한 영역을 통째로 놓치기도 했습니다. 이는 "번역"을 흐릿하게 만들거나 중요한 세부 정보를 손실하게 만들었습니다.
  2. 잘못된 자(Ruler): 기존 방식은 각도(방향)만 측정하고 거리(크기)는 무시하는 자를 사용했습니다. 바닥이 불균형하게 늘어난 방을 측정한다고 상상해 보세요. 모서리의 각도만 본다면, 늘어난 작은 방을 크고 정상적인 방과 같다고 생각할 수도 있습니다. 이로 인해 모델들이 서로 매우 다를 때(예: 작은 언어 모델이 거대한 모델과 대화할 때) "번로"가 깨지는 현상이 발생했습니다.

새로운 솔루션: PARAM과 WIP

1. PARAM: 최적의 랜드마크 학습하기

무작위로 다트를 던지는 대신, 저자들은 컴퓨터가 최적의 랜드마크를 학습하도록 가르칩니다.

  • 비유: 친구에게 도시를 설명하려고 한다고 상상해 보세요. 무작위로 길모퉁이를 고르는 대신, 도시 자체에 묻습니다. "전체 지역을 대표할 수 있는 가장 중요하고 안정적인 허브는 어디인가?"
  • 작동 원식: 이 시스템은 데이터 포인트들의 그룹을 평균 내어 랜드마크를 생성합니다. 이는 노이즈를 완화합니다(예: 몇 장의 흔들린 사진을 평균 내어 하나의 선명한 사진을 얻는 것과 같습니다). 이 새로운 랜드마크들은 "강건한 의미론적 프로토타입(Robust Semantic Prototypes)"입니다. 즉, 안정적이고, 전체 지도를 고르게 커버하며, 특정 모델의 특이점에 의해 혼동되지 않습니다.

2. WIP: 스마트한 자

저자들은 기존의 "각도 전용" 자를 **백색화된 내적(Whitened Inner Product, WIP)**으로 교체했습니다.

  • 비유: 기존의 자를 잡고 있는 사람에 따라 늘어나거나 줄어드는 고무줄이라고 생각해 보세요. 만약 모델 A가 공간을 늘리고 모델 B가 공간을 찌그러뜨린다면, 고무줄은 잘못된 답을 내놓을 것입니다.
  • 작동 방식: 새로운 WIP 자는 "백색화(Whitened)"되어 있습니다. 측정하기 전에 수학적으로 고무줄을 평평하게 만듭니다. 이는 늘어남, 찌그러짐, 이동을 보정합니다. 결정적으로, 이 방식은 단순히 어느 방향을 가리키는지뿐만 아니라, 신호가 얼마나 강한지(크기)에도 주목합니다. 이를 통해 모델들은 기존 방식이 버렸던 중요한 세부 사항(예: "얼마나 확신하는지")을 유지할 수 있습니다.

결과: "손실 없는(Lossless)" 번역

저자들은 다양한 유형의 AI 모델을 연결함으로써 이를 테스트했습니다:

  • 시각(Vision): CNN(일종의 이미지 모델)과 트랜스포머(더 현대적인 이미지 모델)를 연결했습니다.
  • 언어(Language): 서로 다른 언어(영어, 독일어, 프랑스어 등)를 사용하는 다양한 언어 모델(BERT 변형 모델 등)을 연결했습니다.
  • 작은 모델 vs 큰 모델: 아주 작은 언어 모델을 훨씬 더 큰 모델과 연결했습니다.

결과:
과거에는 이 모델들을 하나로 묶으려는 시도가 재앙(새로운 모델이 무작위로 추측함)으로 이어졌습니다. 하지만 PARAM과 WIP를 사용하면 모델들이 거의 완벽하게 소통했습니다.

  • 그들은 **제로샷 스티칭(Zero-shot Stitching)**을 달성했습니다: 모델 A의 데이터로 도구를 학습시킨 후, 추가 학습 없이 즉시 모델 B의 데이터에 사용할 수 있었습니다.
  • 성능은 원래 모델을 직접 사용하는 것과 거의 동일했습니다. 마치 "번역"이 손실이 없는(Lossless) 것처럼, 과정 중에 정보가 전혀 손실되지 않았습니다.

요약

이 논문은 서로 다른 AI 모델들이 서로 대화하게 만드는 새로운 방법을 소개합니다.

  1. 랜드마크를 추측하지 마라: 가장 안정적인 참조 지점을 학습하십시오 (PARAM).
  2. 더 나은 자를 사용하라: 데이터의 늘어남과 찌그러짐을 고려하는 측정 도구를 사용하십시오 (WIP).

그 결과, AI의 "뇌(인코더)"를 다른 것으로 교체하더라도 나머지 시스템이 재학습 없이도 완벽하게 작동하는 유니버설 "플러그 앤 플레이(Plug-and-play)" 시스템을 구현했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →