Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce
본 논문은 편향된 로그로부터 궤적 유틸리티를 학습하고 고객이 더 적은 상호작용으로 더 높은 예상 전환율에 도달하도록 돕는 자기회귀적 랭킹 정책을 훈련함으로써, 이커머스 내 이질적인 제품 미디어의 순차적 순서를 최적화하는 2단계 프레임워크인 순차적 멀티모달 증거 최적화(Sequential Multimodal Evidence Optimization, SMEO)를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 온라인 상점의 디지털 선반 위에서, 구매로 향하는 경로는 결코 단 한 번의 눈길로 끝나지 않습니다. 대신, 고객이 하나씩 스와이프하며 넘겨야 하는 이미지, 비디오, 그리고 상호작용 가능한 3차원 모델의 캐러셀(carousel)을 통과하는 여정입니다. 쇼핑객은 제품을 직접 만지거나 들 수 없기 때문에, 이 시각적 단서들의 순차적인 흐름에 의존하여 자신이 무엇을 사고 있는지에 대한 그림을 그려 나갑니다. 그들은 구매를 결정할 만큼 충분한 확신이 생길 때까지, 혹은 노력이 너무 크다고 느껴 떠나기로 결정할 때까지 증거를 하나씩 모아 나갑니다. 이러한 상품을 판매하는 플랫폼들의 과제는 이 단서들이 나타나는 순서가 매우 중요하다는 점입니다. 만약 가장 설득력 있는 정보가 목록의 맨 아래에 묻혀 있다면, 고객은 그것을 보기도 전에 포기할 수 있습니다. 이는 단순히 주의를 끄는 것에 관한 것이 아니라, 결정을 이끄는 하나의 이야기를 통해 사람을 안내하는 것에 관한 것입니다.
프라센지트 데이(Prasenjit Dey), 프랭크 매킨타이어(Frank McIntyre), 아르납 신하(Arnab Sinha)가 이끄는 아마존의 연구진은 이 퍼즐을 풀기 위한 새로운 방법을 개발했습니다. 그들은 이 접근 방식을 '순차적 멀티모달 증거 최적화(Sequential Multimodal Evidence Optimization)', 즉 SMEO라고 부릅니다. 그들은 각 이미지나 비디오를 클릭을 위해 경쟁하는 개별적인 항목으로 취급하는 대신, 단일 제품을 위한 전체 미디어 컬렉션을 완전한 이야기를 전달하기 위해 함께 협력하는 하나의 팀으로 간주합니다. 그들의 목표는 고객이 최소한의 노력으로 '예'라는 결정에 도달하도록 돕는 특정 순서를 찾는 것이었습니다. 수백만 건의 실제 쇼핑 세션을 분석함으로써, 그들은 기존 시스템들이 실제 판매가 발생했는지 여부라는 최종 결과보다는 화면에 얼마나 오래 머무는지와 같은 단기적인 반응에 집중하기 때문에 실패하는 경우가 많다는 것을 발견했습니다.
연구진은 현재의 방식들이 클릭을 많이 유도하는 화려한 이미지가 가장 먼저 보여줘야 할 중요한 이미지라고 생각하는 실수를 저지르는 경우가 많다는 것을 발견했습니다. 그러나 클릭이 반드시 구매를 의미하는 것은 아닙니다. 고객은 호기 curiosity(호기심) 때문에 밝은 사진을 클릭할 수도 있지만, 기술적인 세부 사항이나 비디오 시연을 보지 못해 구매 없이 떠날 수도 있습니다. 새로운 시스템인 SMEO는 고객가 실제로 무엇을 했는지에 대한 이력을 학습합니다. 이 시스템은 고객이 아이템을 구매했는지 또는 탐색을 중단했는지에 따라 그들이 본 미디어의 순서를 살펴봅니다. 그런 다음 특정 맥락에서 어떤 증거 조각들이 가장 설득력이 있었는지 파악합니다. 예를 들어, 커피 메이커의 경우 기계가 작동하는 모습을 보여주는 비디오가 상자 사진보다 훨씬 더 중요하며, 고객이 이탈하는 것을 방지하기 위해 이 비디오를 순서의 초기에 보여주어야 한다는 것을 학습할 수 있습니다.
이를 달성하기 위해 연구팀은 2단계 프로세스를 구축했습니다. 첫째, 판매 여부에 기반하여 미디어 순서의 가치를 이해하도록 모델을 훈련시켰습니다. 이 모델은 과거의 배치 위치에 따른 편향을 무시하고, 실제 콘텐츠와 그것이 고객의 결정에 어떻게 도움이 되었는지에 집중하는 법을 배웠습니다. 둘째, 이러한 이해를 바탕으로 컴퓨터 프로그램이 새로운 제품을 위한 미디어를 배열하는 방법을 가르쳤습니다. 이 프로그램은 편집자처럼 작동하여 이미지와 비디오의 최적의 순서를 선택합니다. 이 프로그램은 가장 결정적인 정보를 가능한 한 빨리 보여주는 것을 우선시하여, 고객이 스와이프하는 데 지치기 전에 가장 중요한 증거를 볼 수 있도록 보장합니다.
이 시스템을 대규모로 테스트한 결과는 상당했습니다. 연구진이 새로운 방식을 온라인 상점에서 사용하는 표준 규칙들과 비교했을 때, 새로운 시스템은 예상 성공 구매율을 5.5% 증가시켰습니다. 더 중요한 것은, 고객이 결정을 내리는 속도를 15% 더 빠르게 만들었다는 점인데, 이는 고객이 원하는 것을 찾기 위해 더 적은 수의 이미지를 스와이프해야 함을 의미합니다. 또한 연구는 시스템이 명시적으로 무엇을 찾으라고 지시받지 않고도 패턴을 인식하는 법을 배웠음을 보여주었습니다. 예를 들어, 가구의 경우 3차원 모델이 다른 제품들보다 훨씬 더 가치 있는 반면, 의류의 경우 원단의 움직임을 보여주는 비디오가 가장 설득력이 있다는 것을 발견했습니다. 이를 통해 시스템은 서로 다른 제품 카테고리의 특정 요구에 맞춰 증거 제시 방식을 자동으로 조정할 수 있었습니다.
이 작업의 가장 강력한 측점 중 하나는 측정하기 어려웠던 문제, 즉 특정 이미지나 비디오가 판매에 어느 정도의 공로를 인정받아야 하는가 하는 문제를 해결한다는 것입니다. 과거에는 첫 번째 사진이 구매를 일으켰는지 다섯 번째 비디오가 일으켰는지 구분하기 어려웠습니다. 새로운 시스템은 직접적으로 "이 이미지가 판매를 유발했다"라는 라벨이 없더라도, 각 미디어의 기여도를 되돌아보고 이해할 수 있는 방법을 제공합니다. 이는 특정 미디어가 제거되거나 이동되었을 때 어떤 일이 일어났을지를 시뮬레이션함으로써, 고객의 여정이 어떻게 변했을지를 관찰하여 수행됩니다. 이러한 통찰력은 상점 주인들이 어떤 자산이 진정으로 가치 있고 어떤 것이 중복되는지를 이해하게 하여, 제품 페이지를 더욱 효과적으로 개선할 수 있도록 돕습니다.
연구진은 전자 제품부터 뷰티 제품에 이르기까지 다양한 카테고리에 걸친 수백만 건의 실제 쇼핑 세션 데이터를 사용하여 아이디어를 엄격하게 테스트했습니다. 그들은 인기 기반의 단순한 규칙이나 다른 고급 랭킹 시스템을 포함한 여러 접근 방식과 자신들의 방법을 비교했습니다. 그들의 방법은 미디어를 경쟁하는 항목의 목록이 아닌 순차적인 이야기로 다루는 것이 더 효과적임을 입증하며 일관되게 이러한 대안들을 능가했습니다. 이 시스템은 오프라인 방식으로 작동하도록 설계되었습니다. 즉, 이미지의 순서가 사전에 준비되어 저장되므로 고객이 웹사이트를 방문할 때 속도를 늦추지 않습니다. 이는 매일 수백만 개의 제품이 정리되어야 하는 대규모 사용 환경에서 실용적입니다.
궁극적으로, 이 작업은 단순히 고객의 눈을 사로잡는 것에서 고객의 시간과 의도를 존중하는 것으로 초점을 전환합니다. 시각적 증거를 신뢰를 빠르게 구축하는 방식으로 배치함으로써, 시스템은 온라인 쇼핑의 마찰을 줄입니다. 이는 고객의 주의력이 제한된 자원임을 인정하고, 목표는 고객이 가능한 최소한의 단계로 필요한 정보를 찾도록 돕는 것임을 인지합니다. 연구 결과는 디지털 상점이 고객의 의사결정 과정을 염두에 두고 조직될 때, 쇼퍼에게는 더 나은 경험을, 판매자에게는 더 효율적인 시장을 제공한다는 것을 시사합니다. 이 연구는 정보의 순서가 단순히 외적인 디테일이 아니라, 사람들이 디지털 세상에서 선택을 내리는 방식의 근본적인 부분임을 확인시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.