HiGR: Industrial-Scale Hierarchical Generative Slate Recommendation Framework in Tencent
이 논문은 PCRQ-VAE를 통한 구조화된 SID 공간, 효율적인 플래닝을 위한 조립식 계층적 슬레이트 디코더(Hierarchical Slate Decoder), 그리고 ORPO 기반의 정렬 메커니즘을 채택함으로써 기존 방식의 한계를 해결하고, 텐센트 플랫폼에서 추천 품질, 추론 속도 및 실제 사용자 참여도를 크게 개선한 산업 규모의 계층적 생성 프레임워크인 HiGR을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 일간 신문의 편집자라고 상상해 보십시오. 당신의 업무는 단순히 가장 인기 있는 기사 하나를 골라 1면을 장식하는 것이 아닙 아닙니다. 당신은 10개의 서로 다른 기사로 구성된 전체 '슬레이트(slate, 구성안)'를 큐레이션해야 합니다.
문제는 무엇일까요? 만약 단순히 가장 인기 있는 기사 10개를 고른다면, 10개의 기사가 모두 같은 연예인에 관한 것이거나, 같은 유형의 범죄에 관한 것일 수 있습니다. 그러면 독자는 지루함을 느끼거나 '정보의 거품(information bubble)'에 갇혀 있다고 느끼게 됩니다. 당신에게는 적절한 조화가 필요합니다. 약간의 정치, 약간의 스포츠, 약간의 휴먼 스토리, 그리고 독자가 계속 다음 페이지를 넘기게 만드는 순서 배치가 필요합니다.
이것이 바로 HiGR이 텐센트(Tencent)의 뉴스 및 비디오 플랫폼과 같은 앱들을 위해 해결하고자 하는 문제입니다. HiGR은 아이템을 하나씩 고르는 것이 아니라, 페이지 전체를 한꺼번에 계획하는 새로운 'AI 에디터'입니다.
HiGR이 어떻게 작동하는지, 세 가지 간단한 비유를 통해 설명해 드리겠습니다.
1. 정리된 도서관의 책들 (PCRQ-VAE)
AI가 목록을 작성하기 전에, 먼저 모든 아이템(비디오, 뉴스 기사, 소설)이 무엇에 관한 것인지 이해할 방법이 필요합니다.
- 기존 방식: 모든 책에 무작위 번호 태그가 붙어 있는 도서관을 상상해 보십시오. 만약 "SF"를 찾고 싶다면, 번호가 일치하는지 확인하기 위해 모든 책을 일일이 다 뒤져야 합니다. 이는 무질서하고 비효럽습니다.
- HiGR 방식: HiGR은 스마트한 도서관을 구축합니다. 모든 책에 계층적 주소 역할을 하는 특별한 코드(Semantic ID)를 부여합니다.
- 코드의 첫 번째 부분은 장르(예: "SF")를 알려줍니다.
- 두 번째 부분은 하위 장르(예: "스페이스 오페라")를 알려줍니다.
- 마지막 부분은 특정 도서를 식별합니다.
- 핵서(The Magic): HiGR은 Prefix-Contrastive RQ-VAE라는 특별한 학습 방법을 사용하여, 모든 "스페이스 오페라" 책들이 코드의 동일한 앞부분을 공유하도록 보장합니다. 이를 통해 AI는 도서관 전체를 검색할 필요 없이 "스페이스 오페라가 필요해"라고 쉽게 말할 수 있습니다.
2. 2단계 설계자 (Hierarchical Slate Decoder)
이제 AI는 1면을 구성해야 합니다.
- 기존 방식 (느린 건축가): 집 전체를 짓기 위해 벽돌을 하나하나 직접 쌓아야 하는 건축가를 상상해 보십시오. 만약 첫 번째 벽돌을 잘못 놓으면, 전체 벽을 허물고 처음부터 다시 시작해야 합니다. 이는 느릴 뿐만 아니라 전체적인 형태를 파악하는 데 혼란을 줍니다.
- HiGR 방식 (설계자 + 석공): HiGR은 이 업무를 두 가지 역할로 나눕니다.
- 설계자 (Coarse-Grained Planner): 먼저 설계자가 사용자를 보고 이렇게 결정합니다. "좋아, 이 사람을 위한 1면은 1. 스포츠 기사, 2. 테크 기사, 3. 요리 기사로 구성하자." 아직 구체적인 기사를 고르는 것은 아닙니다. 그저 페이지의 *분위기(vibe)*와 구조를 계획합니다. 이는 빠르며 페이지가 균형 있게 보이도록 보장합니다.
- 석공 (Fine-Grained Generator): 설계자가 "스포츠 기사가 필요해"라고 말하면, 석공은 그 자리를 채울 가장 좋은 구체적인 스포츠 기사를 빠르게 찾아냅니다.
- 결과: 설계자가 먼저 전체 레이아웃을 계획하기 때문에, AI는 세부 사항에 매몰되지 않습니다. 이 방식은 훨씬 더 빠르게(5배 더 빠르게!) 페이지를 구축하면서도 완벽한 구조를 유지합니다.
3. 편집자의 비평 (ORPO Preference Alignment)
마지막으로, AI는 단순히 기술적으로 정확한 것이 아니라 무엇이 '좋은' 1면을 만드는지 배워야 합니다.
- 문제점: 만약 AI에게 단지 "다음 단어"를 예측하도록만 가르친다면, 문법적으로는 완벽하지만 지루한 문장을 쓸 수 있습니다. 마찬가지로, AI가 인기 있는 아이템들을 골랐더라도 너무 반복적일 수 있습니다.
- HiGR의 솔루션: HiGR은 ORPO(Odds Ratio Preference Optimization)라는 기술을 사용합니다. 이것을 두 가지 버전의 1면을 검토하는 까다로운 편집자라고 생각하십시오.
- 버전 A (승자): 사용자가 실제로 시청하고, 좋아하고, 끝까지 읽은 페이지.
- 버전 B (패자): 무작위로 섞였거나, 지루한 아이템이 포함되었거나, 너무 반복적인 페이지.
- 교훈: AI는 이 둘을 비교하며 배웁니다. AI는 좋은 페이지가 단순히 인기도에 관한 것이 아니라, 순위(Ranking)(최고의 것을 먼저 배치), 진정한 관심(Genuine Interest)(사용자가 실제로 좋아하는 것을 선택), 그리고 다양성(Diversity)(페이지가 온통 한 가지 주제로만 채워지지 않도록 함)에 관한 것임을 배웁니다.
실질적인 영향
이 논문은 이 시스템이 이미 텐센트 플랫폼에서 수억 명의 사용자에게 서비스되고 있다고 보고합니다.
- 속도: 이전 방식보다 5배 더 빠르게 실행되므로, 사용자는 피드가 로드될 때까지 기다릴 필요가 없습니다.
- 품질: 실제 환경 테스트에서, 이 시스템은 사용자의 영상 시청 시간을 1.22%, 영상 재생 횟수를 1.73% 증가시켰습니다.
- 규모: 이 시스템은 방대한 양의 데이터를 문제없이 처리하며, 이 "설계자 + 석공" 접근 방식이 산업 규모의 추천 시스템에서도 효과적임을 입증했습니다.
요약하자면: HiGR은 아이템을 하나씩 고르려고 애쓰는 대신, 먼저 전체 목록에 대한 균형 잡히고 다양한 계획을 스케치한 다음, 빠르게 세부 사항을 채워 넣어 사용자가 개인화되고 몰입감 있으며 중복되지 않는 경험을 할 수 있도록 보장하는 AI입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.