UEmbed: Unified Sparse and Dense Multimodal Embeddings
UEmbed는 단일 인과적 순방향 패스(causal forward pass)를 통해 희소 어휘 및 밀집 표현을 모두 생성하는 통합 디코더 전용 멀티모달 임베딩 모델을 도입하여, 멀티모달 벤치마크에서 최첨단 성능을 달로 달성하는 동시에 효율적인 에이전트 애플리케이션을 가능하게 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 혼란스러운 도서관에서 특정 책을 찾으려고 노력한다고 상상해 보세요. 오랫동안 사서들은 단순한 기술을 사용했습니다. 바로 정확한 단어를 찾는 것이었습니다. 만약 당신이 "고양이(cat)"를 찾는다면, 그들은 오직 "고양이"라는 단어가 포함된 책만을 찾아냈습니다. 이것은 빠르고 쉽지만, 조금은 멍청한 방식입니다. "고양이"라는 단어를 한 번도 사용하지 않은 "묘류(felines)"나 "새끼 고양이(kittens)"에 관한 책들을 놓치기 때문입니다. 이를 해결하기 위해 과학자들은 의미를 이해하는 "똑똑한" 검색 엔진을 발명했습니다. 이 엔진들은 당신의 질문과 책들을 긴 숫자 리스트(이를 "밀집 벡터(dense vectors)"라고 부릅니다)로 변환합니다. 이는 마치 모든 책에 그 책의 분위기와 이야기를 담은 고유한 지문을 부여하는 것과 같습니다. 이것은 이해력 측면에서는 훌륭하지만, 무겁고 느리며, 때로는 왜 특정 책이 선택되었는지 설명하기 어렵다는 단점이 있습니다.
이제, 두 가지 일을 동시에 할 수 있는 새로운 종류의 사서를 상상해 보세요. 그들은 "분위기 지문"과 가장 중요한 키워드 목록을 단 한 번의 눈 깜짝할 사이에 모두 제공할 수 있습니다. 이것이 정보 검색(information retrieval), 즉 디지털 건초더미에서 바늘을 찾는 과학의 세계입니다. 연구자들이 던진 큰 질문은 이것입니다. "우리는 '정확한 단어' 검색과 '의 의미 기반' 검색을 서로 다른 두 개의 번거로운 시스템 없이, 하나의 통합된 초스마트 두뇌로 처리할 수 있을까?" 그리고 이 두뇌는 텍스트뿐만 아니라 사진, 영상, 문서까지 한꺼번에 이해할 수 있을까요? 이것이 바로 UEmbed라는 새로운 발명품의 이야기가 시작되는 지점입니다.
하나의 두뇌 솔루션: UEmbed
UEmbed(Unified Embedding, 통합 임베딩)를 만나보세요. 알리바바, 중국과학원, 예일 대학교의 연구진이 설계한 새로운 종류의 컴퓨터 두뇌입니다. UEmbed을 "단어 마법사"와 "의미 마스터" 사이에서 하나를 선택해야 하는 고민을 거부하는 멀티태스킹 슈퍼히어로라고 생각해보세요. 과거에는 의미를 이해하는 검색 엔진을 원했다면 무겁고 느린 시스템을 사용해야 했고, 키워드를 사용하는 빠른 시스템을 원했다면 더 단순하고 덜 똑똑한 시스템을 사용해야 했습니다. 보통, 특히 이미지와 영상을 다룰 때는 이 두 가지를 한 패키지에 담을 수 없었습니다.
UEmbed는 "디코더 전용(decoder-only)" 구조를 사용하여 게임의 판도를 바꿉니다. 간단한 비유를 들자면, 표준 검색 엔진은 책을 처음부터 끝까지 읽으며 전체 이야기를 이해하기 위해 앞뒤로 왔다 갔다 하는 사람과 같습니다(이를 "양방향(bidirectional)"이라고 합니다). 반면, UEmbed은 마치 이야기 전체를 듣고 난 뒤, 마지막 순간에 즉시 두 가지 방식으로 요약하는 스토리텔러와 같습니다. 첫째, "분위기 점수"(밀집 부분)를 주고, 둘째, 머릿속에 떠오른 가장 중요한 단어 10~20개를 외치는 것입니다. UEmbed은 스위치를 켜듯 단 한 번의 과정으로 이 모든 것을 수행합니다.
작동 원리: 특수 토큰의 마법
그렇다면 이 두뇌는 어떻게 전체 이야기를 이해하면서 동시에 키워드를 외칠 수 있는 걸까요? 그 비결은 "특수 토큰(special tokens)"을 이용한 영리한 트릭에 있습니다.
당신이 이야기를 쓰고 있다고 상상해 보세요. 그리고 이야기의 맨 끝에 몇 개의 보이지 않는 마법 포스트잇을 붙입니다. UEmbed의 경우, 연구자들은 입력값의 끝에 16개의 이러한 특수 포스트잇(토큰)을 붙입니다. 컴퓨터가 읽기를 시작하기 전에, 컴퓨터는 전체 단어 사전(vocabulary)을 마치 거대한 레고 브릭 상자를 16개의 서로 다른 색깔 상자로 분류하듯 16개의 그룹으로 나눕니다.
컴퓨터가 당신의 이미지, 영상 또는 텍스트를 읽으면서 이야기를 처리하는 동안, 마지막에 위치한 16개의 마법 포스트잇에 도달하면 각 포스트잇에는 특정 임무가 부여됩니다. "너는 빨간색 단어 상자를 담당해", "너는 파란색 상자를 담당해"와 같은 식입니다. 각 포스트-잇은 방금 들은 전체 이야기를 살펴보고, "내가 들은 내용에 기반했을 때, 내 색깔 상자에서 가장 중요한 단어들은 이것들이야"라고 결정합니다.
컴퓨터가 작업을 마칠 때쯤이면, 16개의 작은 키워드 리스트가 만들어집니다. 이 리스트들을 모두 합쳐서 거대하고 매우 상세한 키워드 리스트(희소 벡터, sparse vector)를 생성합니다. 동시에, 전체 이야기의 "분위기"를 추출하여 밀집 지문(dense fingerprint)을 만듭니다. 이 영리한 분할 방식은 주요 문제를 해결합니다. 보통 컴퓨터 두뇌는 전체 이야기를 설명하기 위해 하나의 "요약 토큰"만을 사용할 수 있어 모든 키워드를 담기에 부족하지만, UEmbed은 16개의 서로 다른 토큰을 사용하여 작업을 분산함으로써, 키워드도 풍부하고 의미도 깊은 상태를 동시에 유지할 수 있게 합니다.
숫자가 말해주는 것들
연구진은 검색 분야의 가장 까다로운 도전 과제들에 UEmbed을 테스트했습니다. 그들은 단순히 텍택스트만 본 것이 아니라, 이미지, 영상, 복잡한 문서들을 던져주었습니다.
- 높은 점수: 다양한 유형의 미디어를 얼마나 잘 이해하는지 테스트하는 거대 벤치마크인 MMEB-v2에서, 가장 큰 버전인 9B 모델(90억 개의 파라미터 보유)은 "분위기" 검색에서 71.8, "키워드" 검색에서 71.0의 점수를 기록했습니다.
- 비교 결과: 이것은 엄청난 성과입니다. 보통 키워드 기반 검색은 "분위기" 검색보다 뒤처지기 마련입니다. 하지만 여기서 UEmbed의 키워드 모드는 분위기 모드에 육박할 정도로 성능이 좋았으며, 공개 데이터로 학습된 거의 모든 다른 모델을 능가했습니다. 예를 들어, 71.1점을 기록한 70억 파라미터 규모의 RzenEmbed-V2-7B와 68.1점을 기록한 20억 파라미터 규모의 Embed-RL-4B보다 뛰어난 성능을 보였습니다.
- 효율성: UEmbed은 (인기 있는 챗봇에서 사용되는 것과 같은 종류의) "디코더 전용" 모델로 구축되었기 때문에 고속 서버와 잘 맞물려 돌아갑니다. 이 모델은 이러한 이중 결과를 믿을 수 없을 정도로 빠르게 생성할 수 있어 실제 환경에서 사용하기에 매우 실용적입니다.
왜 중요한가: "에이전트"의 이점
논문은 이러한 이중 능력 접근 방식이 단순히 멋진 기술이 아니라, 웹을 탐색하고 업무를 수행하는 스마트 프로그램인 AI "에이전트"의 미래를 위한 실질적인 필수 요소라고 제안합니다.
AI 에이전트가 문제를 해결하려고 할 때, 종로는 "내 주변 최고의 피자 맛집"이나 "누수 수리 방법"처럼 키워드가 강한 짧은 질문을 자주 던집/때가 있습니다. 밀집 "분위기" 검색은 깊은 의미를 찾느라 이런 질문을 놓칠 때가 있고, 키워드 검색은 빠르지만 멍청합니다. UEmbed은 이 두 세계의 장점을 모두 제공합니다. BrowseComp-Plus 벤치마크 테스트에서 연구진은 UEmbed의 키워드 모드를 사용하는 것이 AI 에이전트가 더 적은 검색 시도로 올바른 정보를 찾도록 도와 시간과 컴퓨팅 자원을 절약한다는 것을 발견했습니다.
한계와 미래
저자들은 UEmbed이 아직 완벽하지 않다는 점을 조심스럽게 지적합니다. 모델이 주로 영어와 중국어로 학습되었기 때문에, 다른 언어에서는 다소 혼란을 겪는다는 점을 발견했습니다. 또한, "마법 포스트잇"이 가끔 컴퓨터 내부 사전의 흔적인 이상하거나 표준적이지 않은 단어(예: "_alt" 또는 "_perm")를 외치는 현상도 관찰되었습니다.
하지만 핵심 아이디어는 견고합니다. UEmbed은 속도와 지능 사이에서, 혹은 단어와 의미 사이에서 하나를 선택할 필요가 없다는 것을 증명합니다. 이 두 세계를 단일한 디코더 전용 모델로 통합함으로써, 단 한 줄의 문장부터 전체 길이의 영상에 이르기까지 디지털 세계 전체를 이해할 수 있는 더 빠르고 더 똑똑한 검색 엔진의 문을 열었습니다. 이는 검색 엔진이 단순히 단어를 찾거나 분위기만을 느끼는 것이 아니라, 그 두 가지를 동시에, 즉각적으로 수행하는 새로운 패러다임입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.