← 최신 논문
💻 computer science

Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL

본 논문은 계층적 의미 클러스터 ID 와 전문가 유도 강화 학습을 활용하여 실제 생산 시스템에서 재현 효율성, 순위 정렬, 그리고 GMV 와 같은 주요 비즈니스 지표에서 상당한 개선을 이루는 이커머스를 위한 실용적 생성 검색 프레임워크인 CQ-SID 와 EG-GRPO 를 소개합니다.

원저자: Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 혼란스러운 창고 (거대한 이커머스 사이트와 같은) 에 들어와 '빨간 러닝화'와 같은 특정 품목을 찾고 있다고 상상해 보세요. 과거에는 창고 관리자가 먼저 사서에게 가능한 신발 목록을 찾아달라고 요청하고 (Recall), 그다음 분류자에게 이를 정리하게 한 후 (Ranking), 마지막으로 영업 사원이 가장 좋은 한 켤레를 보여줬습니다. 이 과정은 빠르지만, 사서가 몇 가지 키워드만 알고 있기 때문에 완벽한 신발을 놓치는 경우가 종종 있었습니다.

최근 과학자들은 새로운 아이디어를 시도했습니다. 사서 대신 당신이 원하는 정확한 신발을 '꿈꾸어' 즉시 선반에서 꺼내오는 초지능 AI 를 고용한 것입니다. 이를 **생성적 검색 (Generative Retrieval)**이라고 합니다. 그러나 수억 개의 품목이 있는 창고에서 이 AI 는 압도당합니다. 모든 신발의 정확한 이름을 추측하려고 시도하기 때문에 시간이 너무 오래 걸리고 종종 실수를 범합니다.

이 논문은 이러한 '꿈꾸는 AI'가 실제 거대한 창고에서 작동하도록 하는 새롭고 더 지적인 방법을 제시합니다. 이를 간단히 설명하면 다음과 같습니다.

1. 문제: 이름은 너무 많고 시간은 부족함

이 AI 를 사용하는 기존 방식은 창고에 있는 모든 신발의 고유한 일련 번호를 외우게 하는 것과 같습니다. 신발이 1 억 켤레라면, AI 는 질문을 받을 때마다 1 억 개의 옵션 중 하나를 선택해야 합니다. 이는 건초 더미에서 바늘을 찾을 때 건초 한 조각씩 하나씩 확인하는 것과 같습니다. 너무 느리고 비용이 많이 듭니다.

2. 해결책: '분위기'로 그룹화 (CQ-SID)

각 신발에 고유한 일련 번호를 부여하는 대신, 저자들은 신발을 **의미적 군집 (Semantic Clusters)**으로 그룹화하기로 결정했습니다.

  • 비유: 창고가 개별 신발 일련 번호가 아니라 '분위기'나 '이웃'으로 조직되어 있다고 상상해 보세요. 모든 '빨간 러닝화'는 '빨간 러너 이웃'에 살고, 모든 '파란 샌들'은 '파란 샌들 이웃'에 삽니다.
  • 작동 원리: 저자들은 CQ-SID라는 시스템을 만들었습니다. AI 에게 정확한 신발을 추측하게 하는 대신, 신발이 사는 *이웃 (군집 ID)*을 추측하게 합니다.
  • 이점: AI 는 수억 개의 신발 대신 수천 개의 이웃 중 하나를 선택하면 됩니다. 이는 '정확한 신발을 찾는다'는 검색을 '빨간 러너 이웃을 찾는다'는 검색으로 좁히는 것과 같습니다. 훨씬 빠르고 컴퓨팅 파워가 덜 필요합니다.

3. 훈련: AI 를 위한 4 단계 학교

이 AI 에게 이웃 목록을 주고 알아내기를 기대할 수는 없습니다. 저자들은 이를 초등학교에서 대학까지 졸업하는 학생처럼 4 단계의 점진적인 과정으로 훈련시켰습니다.

  1. 아이템에서 SID 로: 먼저 AI 는 신발 설명을 보고 "아, 이건 빨간 러너 이웃에 속하네"라고 말하도록 배웁니다.
  2. 쿼리에서 SID 로: 다음으로 인간이 입력한 내용 ('빨간 러닝화') 을 보고 직접 이웃을 추측하도록 배웁니다.
  3. 개인화: 그다음, 누가 질문하는지 고려하도록 배웁니다. 전문 러너가 질문하면 하이테크 러닝 이웃을 추측하고, 캐주얼한 산책자가 질문하면 편안함 이웃을 추측합니다.
  4. '전문가' 코치 (EG-GRPO): 이것이 마지막이자 가장 중요한 단계입니다.

4. '전문가' 코치 (EG-GRPO)

여기가 까다로운 부분입니다. AI 는 이웃을 추측하는 데 뛰어나지만, 때로는 좋은 신발이 몇 개 있는 이웃을 선택하지만 가장 좋은 신발은 놓치는 경우가 있습니다. 과거에는 AI 가 사용자가 클릭한 정확한 신발을 맞췄을 때만 보상을 받았습니다. 하지만 거대한 창고에서는 AI 가 정확한 신발을 추측하지 못했기 때문에 클릭을 놓칠 수 있습니다. 심지어 올바른 이웃을 선택했음에도 불구하고요.

저자들은 **전문가 유도 강화 학습 (Expert-Guided RL)**이라는 방법을 도입했습니다.

  • 비유: AI 가 비디오 게임을 한다고 상상해 보세요. 보통은 표적을 놓치면 '게임 오버'를 맞습니다. 하지만 여기서는 저자들이 코치 역할을 합니다.
  • 작동 원리: 훈련 동안 코치는 AI 에게 속삭입니다. "이봐, 이번에는 클릭을 놓쳤지만 봐! 실제 승리 아이템은 이웃에 있었어. 다음을 위해 기억해."
  • 결과: AI 는 단일 클릭만 쫓는 것이 아니라 다양한 좋은 이웃을 탐색하도록 배웁니다. 이는 AI 가 '게으름'을 피하고 가장 인기 있는 품목만 선택하는 것을 방지합니다 (이는 '매튜 효과'라는 일반적인 문제입니다).

5. 결과: 더 빠르고, 더 지능적이며, 더 많은 판매

이 방법을 중국의 거대한 쇼핑 플랫폼인 실제 틸람 (Tmall) 앱에서 테스트했을 때:

  • 속도: 훨씬 더 작은 '검색 빔' (더 적은 옵션을 보는 것) 을 사용하면서도 올바른 품목을 찾을 수 있었습니다. 이로 인해 검색 시간이 절반으로 줄었습니다.
  • 정확도: AI 는 기존 시스템보다 올바른 '이웃'을 훨씬 더 자주 찾았습니다.
  • 비즈니스 영향: AI 가 더 나은 품목을 더 빠르게 찾았기 때문에 사람들이 더 많이 구매했습니다. 시스템은 매출 (GMV) 을 1.15% 증가시켰고, 구매를 위해 클릭하는 비율 (UCTCVR) 을 0.40% 증가시켰습니다.
  • 지배력: 이 새로운 '꿈꾸는' 채널은 검색 시스템에서 가장 중요한 부분이 되어, 검색 시스템을 통해 이루어진 모든 구매의 72% 이상을 담당하게 되었습니다.

요약하자면:
저자들은 마법 같은 AI 로 전체 검색 시스템을 대체하려고 시도하지 않았습니다. 대신 AI 에게 더 나은 지도 (품목을 이웃으로 그룹화) 와 더 나은 코치 (전문가 유도 강화 학습) 를 주어 학습을 도왔습니다. 이로 인해 검색이 더 빨라지고 정확해졌으며, 회사에 훨씬 더 큰 수익을 창출하게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →