Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study
이 논문은 Google Discover의 이질적인 콘텐츠 피드 랭킹에 관한 엔드 투 엔드 산업 사례 연구를 제시하며, 오프라인 지표와 온라인 사용자 참여를 모두 개선하는 동시에 콘텐츠 다양성을 효과적으로 관리하기 위한 적응형 멀티태스크 학습용 HA-MoE 아키텍처와 LENS 관측성 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 혼란스러운 도서관 속으로 걸어 들어가는 모습을 상상해 보세요. 그곳의 서가들은 끊임없이 스스로 재배치됩니다. 어떤 선반에는 진지한 역사서가 있고, 다른 선반에는 우스꽝스러운 고양이 영상이 있으며, 세 번째에는 레시피가, 네 번째에는 최신 뉴스가 있습니다. 이상적인 세상이라면 사서가 당신이 다음에 무엇을 읽고 싶어 하는지, 즉 농담을 원하는지 아니면 역사를 깊이 파고들고 싶은지를 정확히 알 수 있을 것입니다. 하지만 인터넷의 실제 세상에서 이 '도서관'은 구글 디스커버(Google Discover) 피드이며, 이 '사서'는 추천 시스템이라고 불리는 컴퓨터 프로그램입니다.
이 컴퓨터 사서들이 직면한 과제는, 과거에는 음악만 있거나 짧은 영상만 있는 것처럼 매우 조직적이고 단일한 주제를 가진 도서관에서 일했다는 점입니다. 그런 곳에서는 모든 것이 똑같이 보이고 똑같이 작동했습니다. 하지만 구글 디스커버는 다릅니다. 이곳은 오픈 웹 전체에서 콘텐츠를 가져옵니다. 이는 컴퓨터가 긴 기사, 10초짜리 영상, 사용자의 개인적인 게시물, 그리고 AI가 생성한 요약본 사이에서 무엇을 결정해야 할지 고민해야 함을 의미합니다. 이는 마치 한 명의 셰프에게 동일한 식재료와 도구를 사용하면서 동시에 완벽한 스테이크, 섬세한 수플레, 그리고 매콤한 타코를 요리하라고 요구하는 것과 같습니다. 만약 셰프가 스테이크에 너무 집중한다면, 타코는 망가질 수 있습니다. 이 논문은 하나의 컴퓨터 두뇌가 가장 시끄럽고 인기 있는 것들에 치우치지 않으면서, 어떻게 이 다양한 '맛'의 콘텐츠들을 모두 처리할 수 있도록 가르칠 것인가라는 까다로운 문제를 다룹니다.
구글 팀인 이 논문의 저자들은 특정한 문제에 직면했습니다. 그들의 기존 시스템은 마치 '모두에게 똑같은' 셰프와 같았습니다. 모든 것을 순위를 매기기 위해 단 하나의 규칙 세트를 사용하려고 했고, 이는 실수를 초래했습니다. 때때로 시스템은 클릭을 많이 받았다는 이유만으로 저급한 클릭베이트(낚시성) 기사를 밀어 올리는 반면, 사람들이 실제로 보고 싶어 하는 고품질 영상은 묻혀버리게 만들었습니다. 이를 해결하기 위해 그들은 HA-MoE(Heterogeneity-Adaptive Mixture-of-Experts, 이질성 적응형 전문가 혼합)라고 불리는 새로운 시스템을 구축했습니다.
HA-MoE를 단 한 명의 셰프가 아니라, 스마트한 매니저와 전문 요리사 팀이 있는 북적이는 주방이라고 생각해 보세요. 기존 시스템에서는 한 명의 요리사가 모든 것을 하려고 했습니다. 새로운 시스템에서는 '매니저'(게이팅 네트워크)가 주문과 음식의 종류(콘텐츠)를 살펴보고 어떤 전문 요리사가 이를 담당해야 할지 결정합니다. 만약 주문이 영상이라면, 매니저는 그것을 '영상 전문가'에게 보냅니다. 만약 텍스트 기사라면, 그것은 '작가'에게 갑니다. 결정적으로, 매니저는 단순히 추측하는 것이 아니라, "이것은 영상이니 다르게 취급하라!"라고 알려주는 특별한 '이질성 신호(heterogeneity signal)'를 사용합니다. 이를 통해 영상 전문가가 기사 전문가에 의해 묻히지 않고 자신의 역량을 발휘할 수 있도록 보장합니다.
하지만 주방이 실제로 잘 돌아가고 있는지 어떻게 알 수 있을까요? 팀은 단순히 행복한 고객의 총 숫자를 보는 것만으로는 충분하지 않다는 것을 깨달았습니다. 전체적으로는 좋은 날일 수 있지만, 만약 영상 전문가가 실패하고 있다면 당신은 기회를 놓치고 있는 것입니다. 그래서 그들은 DL-AUC(Dual-Level AUC)라고 불리는 새로운 성공 측정 방식을 발명했습니다. 주방을 평가할 때 단순히 제공된 전체 식사 수가 아니라, 영상 전문가가 기사 전문가에 비해 얼마나 잘했는지를 기준으로 평가한다고 상상해 보세요. 이 새로운 점수는 특정 유형의 콘텐츠가 불공평하게 무시되는 문제를 잡아내는 데 도움을 줍니다.
시스템이 시간이 지나도 건강하게 유지되도록 하기 위해, 그들은 또한 LENS라는 도구를 만들었습니다. 이것은 주방을 들여다보는 X선 안경과 같습니다. 엔지니어들이 내부를 들여다보며 어떤 '전문가'가 무엇을 하고 있는지 확인할 수 있게 해줍니다. 만약 시스템이 게을러져서 모든 전문가가 똑같은 일을 하기 시작하면, LENS가 즉시 이를 포착합니다. 이는 팀이 사용자 경험을 망치기 전에 문제를 해결할 수 있도록 도와줍니다.
결과는 유망했습니다. 그들이 방대한 실제 사용자 상호작용 데이터셋을 통해 이 새로운 시스템을 테스트했을 때, 기존 시스템보다 긍정적인 행동(클릭이나 '좋아요' 등)과 부정적인 행동(게시물을 숨기는 것 등)의 순위를 매기는 데 더 뛰어난 성능을 보였습니다. 이 시스템은 인기 있는 콘텐츠 유형이 덜 흔한 유형을 압도하던 '다수 편향(majority bias)'을 성공적으로 차단했습니다. 실제 사용자를 대상으로 한 온라인 테스트에서, 새로운 시스템은 더 많은 사람이 앱을 열고, 더 깊이 스크롤하며, 더 다양한 콘텐츠를 탐색하도록 이끌었습니다. 이 논문은 콘텐츠 유형 간의 차이를 강제로 동일하게 만드는 대신, 컴퓨터에게 그 차이를 존중하도록 명시적으로 가르치는 것이 우리 모두를 위해 더 스마트하고, 공정하며, 즐거운 피드를 구축할 수 있는 방법임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.