← 최신 논문
💬 NLP

Douyin Multimodal Embedding Model Technical Report

본 논문은 대규모 대조 학습 사전 훈련과 증거 기반 추론 및 교차 조건 재구성을 위한 새로운 훈련 시 메커니즘을 결합함으로써, 온라인 추론 속도를 저하시키지 않으면서도 미세한 멀티모달 판별력을 제공하여 최첨단 성능과 생산 효율성을 달성하는 2단계 학습 모델인 Douyin Multimodal Embedding(DME)을 소개한다.

원저자: Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

건초더미 속에서 특정한 바늘 하나를 찾는다고 상상해 보십시오. 하지만 그 건초더미는 인터넷 전체이고, 그 바늘은 비디오, 사진, 문서, 혹은 이 세 가지가 섞인 형태일 수 있습니다. 이것이 현대의 검색 엔진과 추천 시스템이 마주한 일상의 현실입니다. 이를 가능하게 하기 위해 컴퓨터는 **멀티모달 임베딩(multimodal embedding)**이라는 것을 사용합니다. 이것을 당신이 보고, 읽고, 보는 모든 것을 하나의 작고 압축된 "지문"(벡터)으로 변환하는 마법 같은 번역기라고 생각하십시오. 당신이 "모자를 쓴 고양이"라고 검색할 때, 시스템은 단어를 읽는 것이 아니라, 당신의 요청을 지문으로 변환한 뒤 데이터베이스 내에서 그와 아주 유사하게 생긴 다른 지문들을 찾아냅니다.

오랫동안 이러한 시스템들은 어려운 선택을 해야 했습니다. 빠르지만 멍청하거나, 즉 빠르게 유사한 것들을 찾아내긴 하지만 실제로 중요한 미세한 디테일은 놓치거나, 아니면 똑똑하지만 느린 선택지, 즉 답을 내놓기 전 모든 세부 사항을 생각하느라 너무 많은 시간을 소요하여 수십억 명의 사용자가 앱을 스크롤하는 동안에는 너무 느려지는 선택지 말입니다. 이 논문은 바로 이 문제를 다룹니다. 어떻게 하면 검색 엔진을 매우 빠르면서도 믿을 수 없을 정도로 정밀하게 만들어, 두 개의 매우 유사한 비디오나 문서를 속도를 늦추지 않고도 구별해낼 수 있을까요?

바이트댄스(ByteDance)의 도우인(Douyin) 팀과 중국 인민대학교 연구진은 **도우인 멀티모달 임베딩(Douyin Multimodal Embedding, DME)**이라는 새로운 모델을 소개합니다. 저자들은 기존의 방식들이 검색을 더 "똑똑하게" 만들려고 시도할 때, 컴퓨터가 답을 내놓기 전에 긴 설명(예: 단계별 추론 과정)을 써 내려가도록 강요했기 때문에 실패했다고 주장합니다. 이는 답변의 질을 높여주기는 하지만, 실제 사용 환경에서는 너무 느립니다. 대신, DME는 모델이 똑똑해지기 위해 굳이 말을 할 필요가 없도록 하는, 두 단계의 영리한 훈련 과정을 사용하여 "초스마트 지문 생성기"가 되도록 가르칩니다.

먼저, 모델은 전통적인 빠른 검색 엔진처럼 수십억 개의 다양한 콘텐츠(텍스트, 이미지, 비디오, 문서)를 매칭하는 법을 배우는 거대한 "입소 훈련"(1단계)을 거칩니다. 이를 통해 세상에 대한 폭넓은 이해력을 갖게 됩니다. 그다음, 2단계에서 모델은 특별한 업그레이드를 받습니다. 연구진은 모델에게 두 가지 비밀 기술을 가르칩니다. 첫 번째는 **"증거 기반 잠재 추론(Evidence-Grounded Latent Reasoning)"**입니다. 이는 마치 탐정이 긴 보고서를 쓰는 대신, 의견을 형성하기 전 가장 중요한 단서들(예: 표지판의 특정 텍스트나 비디오의 한 프레임)에 집중할 수 있도록 돕는 작고 보이지 않는 정신적 체크리스트를 가지고 있는 것과 같습니다. DME는 검색 속도를 늦추지 않으면서도, 숨겨진 공간 안에서 생각을 정리함으로써 이 과정을 내부적으로 수행합니다.

두 번째 기술은 **"교차 조건 재구성(Cross-Conditional Reconstruction)"**입니다. 이것은 기억력 게임과 같습니다. 모델은 비디오의 "지문"을 보고 그 비디오의 텍스트 설명을 처음부터 다시 "재구축"하도록 훈련받습니다. 만약 모델이 설명을 성공적으로 재구축할 수 있다면, 이는 그 지문에 필요한 모든 세부 정보가 담겨 있음을 증명하는 것입니다. 이는 모델이 지문에 더 많은 정보를 채워 넣도록 강제하여, 검색 결과가 진정으로 관련성 있게끔 만드는 미세한 디테일을 놓치지 않도록 보장합니다.

결과는 인상적입니다. 주요 테스트인 MMEB-v2에서 DME는 20억 개 및 90억 개의 파라미터 버전 모두에서 최고 점수를 기록하며, 비슷한 크기의 다른 모델들을, 특히 까다로운 영역인 비디오 및 시각적 문서 검색 분야에서 능가했습니다. 하지만 진짜 시험대는 실제 환경이었습니다. 도우인에 배포되었을 때, 이 모델은 오프라인 테스트에서 전체 검색 품질을 2.92% 개선했으며, 라이브 온라인 테스트에서는 사용자 참여도를 0.1% 높였습니다. 결정적으로, 이 모든 똑똑함은 속도 저하가 거의 없이 이루어졌습니다. 이 "정신적 체크리스트"가 쿼리당 추가한 지연 시간은 1밀리초(ms) 미만이었습니다.

이 논문은 단순한 인코더의 속도와 깊은 이해력을 가진 추론 모델을 결합함으로써, DME가 효율성과 정밀도 사이의 오랜 트레이드오프 문제를 해결한다고 제안합니다. 이는 컴퓨터가 똑똑해지기 위해 반드시 "말을" 해야 하는 것은 아니라는 점을 입증합니다. 때로는 최선의 추론이 지문 그 자체 안에 숨겨진 침묵 속에서 이루어질 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →