Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
이 논문은 비디오, 오디오, 이미지, 텍스트를 단일 표현 공간으로 통합하는 네이티브 멀티모달 임베딩 모델인 Gemini Embedding 2 를 소개하며, 다양한 단일 모드, 교차 모드, 멀티모달 검색 작업에서 최첨단 성능을 달성하면서도 전문 분야에서 강력한 제로샷 능력을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 도서관이 있다고 상상해 보세요. 그곳에는 책, 영화, 음악 녹음, 그리고 사진들이 가득합니다. 지금 당장 영화 장면과 비슷한 특정 노래나, 요리 사진과 일치하는 레시피를 찾고 싶다면, 보통 모든 것을 먼저 텍스트로 변환해야 합니다. 사진에 대한 설명을 작성하고, 오디오를 글자로 변환한 뒤 검색해야 하죠. 이는 페인트 이름 목록만 보고 특정 색상을 찾는 것과 같습니다. 색상의 실제 '느낌'을 잃어버리게 되는 것이죠.
Gemini Embedding 2는 게임의 판을 바꾸는 구글의 새로운 도구입니다. 모든 것을 텍스트로 강제로 변환하는 대신, 그림, 소리, 비디오, 단어가 모두 같은 방언으로 말하는 단일하고 보편적인 '언어'를 만들어냅니다.
간단한 비유를 통해 이것이 어떻게 작동하고 왜 중요한지 살펴보겠습니다.
1. 보편적 번역기 (핵심 아이디어)
과거의 방식을 서로 다른 언어를 위한 서로 다른 사전들을 가지고 있는 것으로 생각해보세요. 프랑스어 책을 독일어 영화와 비교하고 싶다면, 둘 다 먼저 영어로 번역해야 했습니다. 이는 종종 뉘앙스를 잃게 만들었습니다.
Gemini Embedding 2는 '의미'를 말하는 보편적 번역기와 같습니다.
- 비디오, 노래, 사진, 또는 텍스트 단락을 하나의 '신분증'(수학적 벡터) 유형으로 변환합니다.
- 모두 같은 '언어'로 표현되기 때문에, 모델은 개가 짖는 비디오와 "시끄러운 개"라는 텍스트가 관련이 있음을 즉시 파악할 수 있습니다. 하나는 소리이고 다른 하나는 단어이지만 말입니다. 소리를 먼저 단어로 변환할 필요 없이 소리를 직접 이해합니다.
2. '올인원' 셰프
이전 모델들은 한 가지 유형의 음식만 잘 요리할 수 있는 셰프들 같았습니다. 한 셰프는 텍스트를, 다른 셰프는 이미지를, 또 다른 셰프는 비디오를 잘 다뤘습니다. 세 가지가 모두 포함된 식사를 원한다면 세 명의 셰프를 고용해야 했고, 그들이 맛에 대해 동의하기를 바랄 수밖에 없었습니다.
Gemini Embedding 2는 어떤 재료든 다룰 수 있는 마스터 셰프입니다.
- 코드 읽기, 영화 이해, 오디오 청취, 문서 분석 등 거대한 작업 혼합물로 훈련되었습니다.
- 이 방대한 다양성에서 배웠기 때문에 재료를 섞을 때 혼란을 겪지 않습니다. 사진과 문장을 섞어 비디오 클립을 찾아달라고 요청해도 조합을 완벽하게 이해합니다.
3. '제로샷' 초능력
보통 컴퓨터에게 천문학이나 요리처럼 매우 구체적인 주제를 이해하게 하려면, 그 주제에 대해 특별히 가르쳐야 합니다. 이는 학생에게 태양계만 가르치기 위해 개인 교사를 고용하는 것과 같습니다.
Gemini Embedding 2는 이미 모든 것에 전문가인 학생과 같습니다.
- 해당 논문은 이 모델이 추가 훈련 없이 현미경 관찰 (생물학), 천문학, 미술, 요리와 같은 전문 분야에서 놀라울 정도로 잘 작동한다고 보여줍니다.
- 이는 '박스 밖에서 바로 사용 가능한' 상태입니다. 별자리 지도나 복잡한 레시피 사진을 보여주면, 그 중 하나에만 훈련된 전문 모델들보다 즉시 맥락을 더 잘 이해합니다.
4. 오디오의 돌파구 (전사 더 이상 불필요)
오디오 검색의 가장 큰 문제 중 하나는 컴퓨터가 보통 검색할 수 있기 전에 오디오를 먼저 '읽어야'(음성을 텍스트로 전사) 한다는 점입니다. 이는 가사를 읽어서 노래를 찾는 것과 비슷하지만, 가수가 중얼거리거나 억세가 강하면 컴퓨터가 가사를 잘못 알아듣고 결국 노래를 찾지 못하게 됩니다.
Gemini Embedding 2는 중개자를 건너뜁니다.
- 원본 소리를 직접 듣습니다. 단어뿐만 아니라 목소리의 톤, 피치, 감정을 이해합니다.
- 논문은 전사된 텍스트로 검색하는 것보다 원본 오디오로 검색하는 것이 훨씬 정확하다고 밝혔습니다. 이는 그들이 무엇을 말하는지 들을 필요 없이 군중 속에서 친구의 목소리를 알아차리는 것과 같습니다.
5. 구축 방식 (훈련 레시피)
이 '보편적 번역기'를 만들기 위해 팀은 한 번에 한 가지 것만 가르치지 않았습니다. 그들은 세 단계의 요리 과정을 사용했습니다:
- 사전 미세 조정 (Pre-Fine-Tuning): 정보 '인코딩' 개념에 익숙해지도록 텍스트, 코드, 이미지 등 거대하고 지저분한 데이터 더미를 모델에 제공했습니다.
- 미세 조정 (Fine-Tuning): 질문과 답변을 매칭하거나 비디오와 설명을 매칭하는 것과 같이, 항목들을 어떻게 연결할지에 대한 매우 구체적이고 고품질의 예시들을 제공했습니다.
- 모델 수프 (Model Souping): 이는 여러 다른 버전의 훈련된 모델을 가져와 '섞는' 교묘한 기술로, 완벽한 맛을 얻기 위해 다른 수프 배치를 섞는 것과 같습니다. 이로 인해 최종 모델이 더 안정적이 되었고 동시에 다양한 유형의 작업을 처리하는 데 더 능숙해졌습니다.
결론
Gemini Embedding 2는 컴퓨터가 세상을 인간처럼 이해하게 해주는 강력한 새로운 엔진입니다. 즉, 모든 것을 연결된 전체로 보고, 듣고, 읽는 방식입니다. 텍스트 설명을 사용하여 비디오의 특정 순간을 검색하거나, 흥얼거리는 멜로디를 기반으로 노래를 찾거나, 차트와 텍스트가 포함된 문서를 찾을 때, 이 모델은 이러한 작업 중 하나에만 설계된 전문 도구들보다 종종 더 잘 수행하며 하나의 통합된 공간에서 모든 것을 처리합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.