← 최신 논문
🤖 AI

WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture

이 논문은 비시퀀스(non-sequence) 특징과 시퀀스(sequence) 특징을 공동으로 모델링하기 위해 새로운 퓨전 메커니즘을 통해 Wukong과 HSTU 백본을 통합하는 확장 가능한 통합 추천 아키텍처인 WHALE을 소개하며, 이를 통해 산업 생산 시스템에서 상당한 오프라인 및 온라인 성능 향상을 달성한다.

원저자: Renqin Cai, Dawei Sun, Yuanjun Yao, Zhiyong Wang, Velvin Fu, Maggie Zhuang, Yu Shi, Zhongnan Fang, Xuan Cao, Jing Qian, Rui Li

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Renqin Cai, Dawei Sun, Yuanjun Yao, Zhiyong Wang, Velvin Fu, Maggie Zhuang, Yu Shi, Zhongnan Fang, Xuan Cao, Jing Qian, Rui Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수백만 명의 사람들이 끊임없이 스크롤하고, 클릭하고, 시청하고 있는 거대하고 북적이는 디지털 도시를 걷고 있다고 상상해 보십시오. 이곳은 당신의 소셜 미디어 피드, 비디오 추천, 쇼핑 목록 뒤에 숨겨진 보이지 않는 엔진인 온라인 추천 시스템의 세계입니다. 이들의 임무는 당신이 다음에 무엇을 보고 싶어 할지 추측하는 것입니다. 이를 위해 그들은 보통 두 가지 매우 다른 유형의 단서들을 살펴봅니다. 첫째, 당신의 "정적(static)" 세부 정보입니다: 당신이 누구인지, 무엇을 좋아하는지, 현재 시간, 그리고 보여지고 있는 특정 아이템 등입니다. 이것은 마치 형사가 용의자의 파일과 범죄 현장을 조사하는 것과 같습니다. 둘째, 당신의 "동적(dynamic)" 행동입니다: 당신이 과거에 클릭하거나, 시청하거나, 구매했던 모든 것들의 길고 어지러운 흔적 말입니다. 이것은 마치 형사가 용의자의 전체 인생 이야기를 실시간으로 지켜보는 것과 같습니다.

오랫동안 추천 시스템은 이 두 가지 단서를 별개로 취급해 왔습니다. 어떤 매우 똑똑한 모델들은 정적 세부 정보(예: "이 사용자는 SF를 좋아함" + "금요일 밤임")를 혼합하는 데 뛰어났고, 다른 모델들은 당신의 과거 행동이라는 긴 이야기를 읽는 데 전문가였습니다(예: "당신이 SF 영화를 세 편 연속으로 봤으니, 아마 네 번째 영화도 원할 것이다"). 여기서 큰 질문이 생깁니다. 우리는 어떻게 하면 너무 느려지거나 비용이 많이 들지 않으면서도, 이 두 가지 모두에 똑같이 탁월한 하나의 슈퍼 모델을 구축할 수 있을까요? 만약 우리가 해낼 수 있다면, 그것은 당신이 누구인지, 그리고 최근에 무엇을 해왔는지에 대해 완벽하게 맞춤화된 콘텐츠를 동시에 보는 것을 의미할 것입니다.

여기에 Meta의 연구진이 이 퍼즐을 풀기 위해 개발한 새로운 아키텍처인 WHALE이 등장합니다. WHALE을 협력하는 거대하고 다층적인 탐정 팀이라고 생각해 보십시오. WHALE은 한 명의 형사가 파일을 읽고 다른 형사가 영상을 보는 방식이 아니라, 모든 레이어(layer)에서 이들을 같은 방에 모아둡니다. 모델의 모든 개별 레이어에는 정적 세부 정보를 혼합하는 전문가인 "Wukong" 팀과 당신의 행동 이력을 읽는 전문가인 "HSTU" 팀이 존재합니다. 하지만 여기서 마법 같은 일이 일어납니다. 그들은 단순히 나란히 일하는 것이 아니라, 끊임없이 대화를 나눕니다. Wukong 팀은 HSTU 팀에게 묻습니다. "헤이, 내가 지금 보고 있는 이 특정 아이템을 기준으로 할 때, 사용자의 긴 이력 중 지금 가장 중요한 부분은 어디일까?" 그러면 HSTU 팀은 그 특정 기억에 초점을 맞추어 정보를 전달합니다. 이 과정은 데이터가 모델을 통과하는 동안 반복적으로 일어나며, 시스템이 이해도를 끊임없이 정교하게 다듬을 수 있게 합니다.

이 논문은 이러한 "점진적 교환(progressive exchange)"이 게임 체인저라고 제안합니다. 연구진이 실제 소셜 미디어 플랫폼의 방대한 데이터를 사용하여 WHALE을 테스트했을 때, 모델을 더 크게 만들고 더 긴 이력을 읽게 할수록 사용자가 클릭할 내용을 예측하는 능력이 일관되게 향상된다는 것을 발견했습니다. 구체적으로, 모델이 볼 수 있는 사용자 이력의 길이를 늘렸을 때 추천의 품질이 향상되었습니다. 또한 모델을 더 깊게(더 많은 레이어) 만들고 더 넓게(더 많은 처리 능력) 만들수록 결과가 계속해서 좋아졌는데, 이는 이 시스템이 잘 확장될 수 있음을 시사합니다.

하지만 연구진은 이 두 종류의 모델을 결합하는 더 단순한 방법인 "얕은 하이브리드(shallow-hybrid)" 접근 방식도 테스트했습니다. 이 오래된 방식에서는 이력을 아주 작은 요약본으로 압축한 뒤 정적 세부 정보와 혼합합니다. 논문은 이것이 세밀한 디테일을 버리는 실수라고 주장합니다. 실험 결과, WHALE의 깊고 레이어 단위로 이루어지는 대화 방식이 이 얕은 접근 방식보다 훨씬 더 뛰어나다는 것이 증명되었으며, 이는 두 팀이 지속적으로 소통하는 상태를 유지하는 것이 중요하다는 것을 입증했습니다.

물럼히, 이렇게 복잡한 시스템을 구축하는 것은 비용이 많이 듭니다. 연구팀은 WHALE이 수백만 명의 사람들에게 동시에 사용될 수 있을 만큼 빠르게 실행될 수 있도록 특수한 커스텀 컴퓨터 코드(소위 "Triton 커널"이라 불리는 것)를 발명해야 했습니다. 실제 환경 테스트에서 WHALE은 사용자 참여의 주요 지표를 개선했지만, 약간의 대가가 따랐습니다: 기존 시스템보다 초당 처리할 수 있는 요청 수가 약 5% 적었습니다. 이러한 약간의 속도 저하에도 불구하고, 추천 품질의 향상은 승리로 간주되었으며, 이 시스템은 이미 실제 서비스에 배포되었습니다. 결론적으로, 모델을 무한히 크게 만든다고 해서 모든 문제가 해결되는 것은 아니지만, 정적 세부 정보와 동적 이력이라는 두 가지 서로 다른 데이터 사고방식을 하나의 상호작용하는 아키텍처로 통합하는 것이 추천 시스템의 미래를 향한 강력하고 실용적인 경로라는 점을 이 논문은 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →