Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling
본 논문은 희소한 비디오 ID를 압축된 시맨틱 ID로 대체하고 초장기 사용자 행동 시퀀스를 효율적으로 모델링하기 위해 글로벌 인지 압축 트랜스포머(Global-Aware Compression Transformer)를 도입함으로써 기존 시퀀스 모델링의 한계를 극복하고, 계산 비용을 크게 절감하는 동시에 사용자 참여도를 대폭 향상시킨, 10억 명 규모의 사용자 대상 숏폼 비디오 추천을 위한 프로덕션 배포 프레임워크를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 완벽한 책을 추천해 주려는 사서라고 상상해 보세요. 하지만 이 독자는 몇 권의 책이 아니라, 수천, 수만 개의 짧은 영상을 시청했습니다. 당신의 임무는 그 모든 영상을 기억하여 다음에 무엇을 보고 싶어 할지 추측하는 것입니다.
이 논문은 구글이 짧은 형식의 영상(TikTok이나 YouTube Shorts 같은)을 위해 구축한 바로 이 작업을 수행하는 새로운 시스템에 대해 설명합니다. 그들은 이 작업이 거의 불가능에 가깝게 만드는 두 가지 거대한 문제에 직면했고, 두 가지 영리한 기술로 이를 해결했습니다.
두 가지 큰 문제
1. "이름표" 문제 (표현 병목 현상 - Representation Bottleneck)
세상의 모든 영상이 토스터기에 붙은 일련번호처럼 고유하고 무작위적인 ID 번호를 가지고 있다고 상상해 보세요.
- 문제점: 만약 10억 개의 영상이 있다면, 10억 개의 서로 다른 ID 태그가 필요합니다. 이 태그들은 그저 무작위 숫자일 뿐이며, 영상에 대해 아무것도 알려주지 않습니다. "고양이"에 관한 영상과 "자동차"에 관한 영상의 ID가 서로 전혀 닮지 않을 수도 있습니다.
- 결과: 컴퓨터는 모든 상호작용을 하나하나 따로 기억해야 합니다. 이는 마치 10억 개의 무작위 전화번호를 외우려는 것과 같습니다. 또한, 새로운 영상("콜드 스타트")이 등장했을 때, 시스템은 해당 ID를 본 적이 없기 때문에 그 영상이 무엇에 관한 것인지 전혀 알 수 없습니다.
2. "메모리 과부하" 문제 (계산 병목 현상 - Computational Bottleneck)
모든 페이지가 서로 연결되어 있는 책을 읽는다고 상상해 보세요.
- 문제점: 사용자의 2,000개 영상 기록을 이해하기 위해, 표준적인 컴퓨터 뇌(Transformer)는 모든 영상을 서로 비교하려고 시도합니다. 만약 영상의 수가 두 배가 되면, 작업량은 단순히 두 배가 되는 것이 아니라 네 배로 늘어납니다. 이 작업은 너무 무거워져서 컴퓨터의 메모리가 부족해져 시스템이 멈추거나, 답변을 내놓는 데 너무 오랜 시간이 걸리게 됩니다.
해결책: 두 가지 새로운 기술
저자들은 이 두 가지 문제를 동시에 해결하는 시스템을 구축했습니다.
기술 #1: "스마트 카테고리" 시스템 (의미론적 네이티브 ID - Semantic-Native IDs)
무작위 일련번호를 사용하는 대신, 그들은 영상이 실제로 무엇에 관한 것인지에 기반한 의미 있는 라벨을 부여했습니다.
- 비유: 무작위 숫자 대신, 모든 영상에 "카테고리"와 "하위 카테고리"라는 라벨이 붙어 있다고 상상해 보세요.
- 기존 방식: 영상 #99283 (무작위).
- 새로운 방식: 영상 = "게이밍" + "슈팅 게임".
- 작동 원原理: 그들은 특수한 AI를 사용하여 영상을 계층 구조로 그룹화했습니다. 긴 영상 기록의 경우, 이 계층 구조의 상위 두 단계(예: 단지 "게이밍"과 "슈팅 게임")만 사용했습니다.
- 이점:
- 더 작은 라이브러리: 더 이상 10억 개의 태그가 필요하지 않습니다. 그저 카테고리에 대한 태그만 있으면 됩니다. 이는 "사전"을 저장하는 데 필요한 메모리를 줄여줍니다.
- 더 나은 예측: 만약 어떤 사용자가 "게이밍-슈팅 게임" 영상을 좋아한다면, 새로운 "게이밍-슈팅 게임" 영상이 나왔을 때 시스템은 그 영상을 본 적이 없더라도 즉시 추천할 수 있습니다. 이는 "콜드 스타트" 문제를 해결합니다.
기술 #2: "그룹화" 전략 (글로벌 인지 압축 - Global-Aware Compression)
모든 영상을 하나씩 개별적으로 보는 대신, 시스템은 영상들을 "슈퍼 청크(super-chunks)"로 그룹화합니다.
- 비유: 당신이 2,000페이지짜리 일기를 읽고 있다고 상상해 보세요.
- 기존 방식: 모든 단어를 하나하나 읽고 모든 단어를 서로 연결하려고 노력합니다. 매우 지치는 일입니다!
- 새로운 방식: 4페이지씩 묶어서 하나의 "슈퍼 페이지"로 붙입니다. 이제 당신은 읽어야 할 500개의 "슈퍼 페이지"만 가지게 됩니다.
- 작동 원리: 그들은 연속된 4개의 영상을 하나의 커다란 "슈퍼 토큰(Super-Token)"으로 쌓아서 합칩니다. 이를 통해 컴퓨터가 처리해야 할 항목의 수를 4배로 줄입니다.
- 이점:
- 속도: 비교해야 할 항목이 적기 때문에 컴퓨터가 훨씬 빠르게 작동하며 메모리를 훨씬 적게 사용합니다 (92% 감소!).
- 더 똑똑한 읽기: 페이지를 함께 붙임으로써, 컴퓨터는 큰 그림을 유지하면서도 그 그룹 내의 세부 사항(예: 사용자가 특정 영상 시퀀스에 어떻게 반응했는지)을 볼 수 있습니다.
- "글로벌 앵커(Global Anchor)": 목록의 시작 부분에 특별한 "글로벌 질문" 토큰을 추가했습니다. 이것은 마치 사서가 "이 사람의 삶의 전반적인 분위기는 무엇인가?"라고 묻는 것과 같습니다. 이는 시스템이 최근 영상의 세부 사항과 사용자의 장기적인 성향 사이의 균형을 맞추는 데 도움을 줍니다.
결과
그들이 실제 환경에서 수십억 명의 사용자를 대상으로 테스트했을 때의 결과입니다:
- 더 빨라졌습니다: 시스템은 훨씬 적은 컴퓨터 메모리를 사용했고 훨씬 빠르게 실행되었습니다.
- 더 많이 기억했습니다: 더 빨라졌기 때문에, 그들은 단지 800개가 아닌 2,000개의 영상 기록을 입력할 수 있었습니다.
- 사람들이 더 행복해졌습니다: 사용자들이 좋아하는 영상을 더 많이 시청했고, 더 오래 시청했으며, 즐길 수 있는 새로운 콘텐츠를 더 많이 발견했습니다.
요약
이 논문은 머리 아파하지 않고 사용자의 전체 영상 기록을 기억할 수 있는 추천 엔진을 구축하는 것에 관한 것입니다. 그들은 무작위 숫자 대신 영상에 의미 있는 이름을 부여하고, 컴퓨터가 모든 영상을 개별적으로 계산하지 않도록 영상을 덩어리로 그룹화함으로써 이 문제를 해결했습니다. 그 결과, 더 빠르고, 운영 비용이 저렴하며, 더 나은 추천을 제공하는 시스템을 만들었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.