← 최신 논문
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

이 논문은 다양한 협업 신호와 멀티모달 거대 언어 모델을 정렬하여 다중적인 아이템 및 사용자 표현을 생성함으로써 JD 검색 엔진의 이커머스 검색 랭킹 성능과 효율성을 크게 향상시키는 통합 프레임워크인 MMRM을 제안한다.

원저자: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수백만 명의 사람들이 완벽한 청바지를 찾아 헤매는 거대하고 빠른 디지털 쇼핑몰(JD.com과 같은)을 운영하고 있다고 상상해 보십시오. 이들이 원하는 것을 찾을 수 있도록 돕기 위해, 당신은 단순히 제품 태그의 텍스트를 읽는 것을 넘어, 이미지를 "보고", 스타일을 이해하며, 쇼퍼가 정확히 무엇을 찾고 있는지 파악할 수 있는 스마트한 어시스턴트가 필요합니다.

오랫동안 이러한 어시스턴트들은 까다로운 문제에 직면해 있었습니다. 마치 한 번에 하나의 특정 시험만을 공부하는 학생들과 같았습니다. 만약 "검색(Search)"을 공부했다면, 텍스트 쿼리와 제품을 매칭하는 데 탁월했을 것입니다. 만약 "장바구니(Cart)"를 공부했다면, 사람들이 쇼핑 카트에 무엇을 담는지 잘 알았을 것입니다. 하지만 하나의 "슈퍼 학생"(범용 멀티모달 거대 언어 모델)에게 이 모든 다양한 테스트를 한꺼번에 공부하도록 강요하면 보통 혼란스러운 결과가 초래되었습니다. 기존 방식들은 단일한 유형의 신호만을 학습하도록 하나의 "슈퍼 학생"에게 강요하거나, 학생의 노트를 특정 사용자가 다음에 무엇을 원할지 예측하는 데 별로 도움이 되지 않는 일반적인 사실 목록처럼 취급했습니다.

이 논문은 MMRM(Multiplex Multimodal Representation Model)이라는 새로운 시스템을 소개하며, 이를 하나의 하이테크 주방과 네 권의 특화된 레시피 북을 가진 마스터 셰프처럼 사용하여 이 문제를 해결합니다.

핵심 아이디어: 하나의 주방, 네 명의 전문 셰프
모든 태스크를 위해 네 개의 별도 주방(모델)을 만드는 대신, MMRM은 하나의 공유된 "백본(backbone)"(주방 그 자체)을 사용하되, 네 가지의 특별한 "모자" 또는 토큰인 **[SEARCH], [CLICK], [CART], [ORDER]**를 부여합니다.

이것은 다재다능한 배우와 같습니다. 배우가 [SEARCH] 모자를 쓰면, 텍서 힌트를 제품과 매칭하는 탐정처럼 행동합니다. [CART] 모자로 바꾸면, 사람들이 실제로 함께 구매하는 아이템이 무엇인지 아는 스타일리스트처럼 행동합니다. 마법은 이 배우가 무대를 떠날 필요 없이 즉각적으로 모자를 바꿀 수 있다는 점입니다. 단 한 번의 주방 통과 과정에서, 모델은 네 가지 다른 유형의 단서(신호)로부터 동시에 학습합니다:

  1. 검색 클릭(Search clicks): 누군가 "청바지"라고 입력하고 결과를 클릭할 때.
  2. 클릭 세션(Click sessions): 누군가 한 아이템에서 다른 아이템으로 연속해서 클릭할 때.
  3. 장바구니 세션(Cart sessions): 누군가 일련의 아이템을 장바구니에 담을 때.
  4. 주문 세션(Order sessions): 누군가 실제로 일련의 아이템을 구매할 때.

저자들은 이러한 신호들이 매우 다르다는 것을 발견했습니다. 검색 클릭은 광범위한 "관심 있음"과 같은 반면, 주문 세션은 "이 특정 조합을 정말, 정말 원함"과 같습니다. 이러한 차이점을 무시하고 모두 동일하게 취급함으로써, 기존 모델들은 많은 기회를 놓쳤습니다. 그러나 MMRM은 이 네 가지를 동시에 학습하여, 각기 다른 작업에 최적화된 네 가지 별도의 "표현(representation)"(또는 정신적 지도)을 생성합니다.

"멀티플렉스(Multiplex)" 사용자 전략
모델이 제품에 대한 이 네 가지 서로 다른 지도를 갖추고 나면, 이제 당신이 무엇을 원하는지 알아내야 합니다. 논문은 모든 사람에게 하나의 일반적인 지도만 사용할 수는 없다고 주장합니다. 대신, MMRM은 "멀티플렉스 사용자 표현" 전략을 사용합니다.

당신가 쇼핑을 하고 있다고 상상해 보십시오. 시스템은 당신의 기록을 살펴봅니다. 만약 당신이 단순히 검색 중이라면, 시스템은 [SEARCH] 지도를 사용하여 당신이 클릭한 것과 유사한 아이템을 찾습니다. 만약 당신이 장바구니를 채우고 있다면, 시스템은 [CART] 지도로 전환하여 어떤 것들이 보통 함께 어울리는지 확인합니다. 이는 마치 개인 쇼퍼가 당신이 단순히 구경 중인지 아니면 구매할 준비가 되었는지에 따라 전략을 바꾸는 것과 같습니다. 그들은 당신의 특정 행동 시퀀스를 사용하여 제품의 적절한 "모자"와 매칭함으로써 고도로 개인화된 추천을 제공합니다.

거부된 방식들
논문은 두 가지 일반적인 접근 방식에 대해 명시적으로 반박합니다:

  1. 단일 신호 사용: 저자들은 검색 데이터(또는 장바구니 데이터)만으로 모델을 훈련시키는 것이 다른 중요한 관계들을 보지 못하게 만든다는 것을 보여주었습니다. 하나를 선택하고 나머지를 무시할 수는 없습니다.
  2. "원 사이즈 핏 올(One-Size-Fits-All)" 임베딩: 저자들은 단순히 하나의 일반적인 제품 설명을 가져와 랭킹 모델에 밀어 넣는 것이 멀티태스크 시나리오에서 효과적이지 않다는 것을 발견했습니다. 이는 모델이 검색 쿼리와 장바구니 예측에 동시에 같은 노트를 사용하려고 할 때 발생하는 "임베딩 엉킴(embedding entanglement)" 현상을 일으킵니다. MMRM은 각 작업에 대해 표현을 분리(disentangle)함으로써 이를 거부합니다.

증명: 실제 숫자, 실제 결과
저자들은 단순히 추측한 것이 아니라, 대규모로 테스트했습니다.

  • 훈련 데이터: 검색을 위해 6개월 동안 수집된 0.3억 개의 트리플릿(연관된 세 아이템 그룹)과, 장바구니 및 주문 행동을 위한 훨씬 더 큰 데이터셋(주문의 경우 최대 3년 치 데이터)을 사용했습니다.
  • 모델: 8대의 NVIDIA H800 GPU에서 40억 개의 파라미터를 가진 모델(매우 큰 AI)을 훈련시켰습니다.
  • 결과: 테스트에서 MMRM은 기존의 "단일 작업(single-task)" 모델들과 이 특별한 모자 시스템을 사용하지 않은 "멀티태스크(multi-task)" 모델들을 모두 이겼습니다.
  • 실제 세계의 영향: 저자들은 컴퓨터 시뮬레이션에 머물지 않았습니다. 이 시스템을 실제 JD.com 검색 엔진에 배포했습니다. 수백만 명의 일일 사용자를 대상으로 한 일주일간의 테스트에서, 새로운 시스템은 다음을 개선했습니다:
    • 클릭률(CTR) 0.42% 향상
    • 장바구니 추가율(ACR) 0.37% 향상
    • 전환율(CVR) 0.35% 향상

저자들은 이 퍼센트가 작아 보일 수 있지만, 수백만 명의 사용자가 있는 플랫폼에서 **0.10%**의 상승만으로도 막대한 매출 성장을 이끌어낼 수 있다고 언급했습니다. 이러한 입증된 성과 덕분에, 이 시스템은 현재 완전히 라이브되어 수백만 명의 사람들이 제품을 찾는 데 도움을 주고 있습니다.

요약하자면, MMRM은 AI가 쇼핑을 이해하는 법을 가르치는 더 스마트하고 유연한 방법입니다. 이는 "팔방미인(jack of all trades)이지만 제대로 하는 건 없는" 상태가 되려 하지 않고, 하나의 효율적인 뇌에 네 가지 특화된 모드를 갖춤으로써 "많은 분야의 달인(master of many trades)"이 되는 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →