기술 요약: Tokens are All You Need: 추천 시스템의 LLM 수준 I/O 효율성 달성을 위한 이중 목적 시맨틱 ID (Dual-purpose Semantic IDs)
1. 문제 정의
대규모 추천 시스템은 거대한 밀집 부동 소수점 임베딩 테이블(dense floating-point embedding tables)에 대한 의존성으로 인해 발생하는 심각한 "메모리 벽(Memory Wall)" 병목 현상에 직면해 있습니다. 대규모 언어 모델(LLM)이 통일된 이산 토큰 공간과 연산 집약적(compute-bound) 특성 덕분에 효율적으로 확장되는 것과 달리, 추천 시스템은 훈련 및 추론 과정에서 고차원 연속 벡터(예: 사용자 히스토리, 콘텐츠 임베딩)를 수집, 저장 및 결합(join)하는 데 필요한 I/O 및 메모리 대역폭에 의해 제약을 받습니다.
이러한 한계는 사용자 활동 시퀀스의 길이가 104 이상으로 확장되는 환경에서 특히 두드라집니다. 풍부한 콘텐츠 신호를 밀집 임베딩을 통해 통합하려는 기존 방식들은 과도한 데이터 점유율과 서빙 지연 시간을 초래합니다. 또한, "생성형 검색(Generative Retrieval)"이 범주형 ID를 대체하기 위해 시맨틱 토큰을 도입했음에도 불구하고, 기존 방법들은 이 토큰들을 엄격히 식별자(identifier)로만 취급하며, 고차원 연속 콘텐츠 특징을 효율적으로 재구성(reconstruction)하는 데 활용하지 못하고 있습니다.
2. 방법론: 이중 목적 시맨틱 ID (Dual-purpose Semantic IDs)
저자들은 고차원 연속 콘텐츠 임베딩을 압축된 이산 토큰 시퀀스로 변환하는 프레임워크를 제안합니다. 이 접근 방식은 컴퓨터 비전 데이터 압축 기술(특히 VQ-VAE 및 VQGAN)에서 영감을 얻었으며, 연속적인 공간 데이터가 의미를 잃지 않고도 이산 토큰으로 압축될 수 있음을 입증합니다.
핵심 방법론은 생성된 시맨틱 ID(Si)에 대해 다음과 같은 두 가지 동시적인 역할을 부여합니다.
A. 양자화를 통한 시맨틱 ID 생성
고차원 콘텐츠 임베딩(ei∈Rd, 일반적으로 사전 학습된 멀티모달 모델에서 유도됨)은 계층적 양자화(예: Residual Quantization 또는 RQ-VAE)를 사용하여 K개의 이산 토큰 시퀀스로 압축됩니다.
Si=[ti,1,ti,2,…,ti,K]
이를 통해 저장 요구 사항을 d×32 비트에서 K×log2(V) 비트로 줄여, 50~100배의 압축률을 달성합니다.
B. 이중 목적 프레임워크
프레임워크는 이러한 토큰을 추천 모델 내에서 두 가지 기능으로 동시에 활용합니다.
협업 정체성 (In-Graph Learning): 토큰 시퀀스는 범주형 특징으로 취급됩니다. 모델은 각 토큰(또는 n-gram 조합)에 대한 임베딩을 학습하여 사용자-아이템 상호작용 패턴을 포착합니다. 전략은 다음과 같습니다:
- Unigram: 독립적인 토큰 임베딩.
- Overlapping Bigram: 로컬 전이를 포착하기 위한 슬라이딩 윈도우.
- Nested N-gram: 시맨틱 클러스터링을 강제하기 위한 계층적 접두사(예: 모든 "Jazz" 영상은 동일한 최상위 임베딩을 공유함).
- Sentence Piece Model (SPM): 데이터 분포에 따른 적응형 토큰 조합.
이 구성 요소는 특히 콜드 스타트(cold-start) 및 롱테일 아이템에 대해 기억(memorization)과 일반화(generalization)를 처리합니다.
콘텐츠 재구성 (SiDec): 밀집 벡터를 조인(join)하는 I/O 비용 없이 "순수한" 콘텐츠 신호를 복구하기 위해, 시스템은 시맨틱 디코더(fθ)를 사용합니다.
- 프로세스: 이산 토큰 Si를 정적 코드북(ϕ)에서 조회하여 잠재 임베딩을 검색한 후, 이를 경량 디코더(MLP 또는 얕은 Transformer)에 통과시켜 원래 임베딩의 근사치(e^i)를 재구성합니다.
- 통합: 이 재구성은 모델 그래프 내에서 온더플라이(on-the-fly) 방식으로 수행됩니다. 이는 훈련 데이터에 밀집 벡터를 저장하거나 로그를 남길 필요성을 대체합니다. 디코더는 고정(사전 학습된 코드북 사용)되거나 훈련 가능(특정 다운스트림 태스크와 정렬하기 위함)할 수 있습니다.
3. 주요 기여
- 새로운 이중 목적 프레임워크: 본 논문은 표준 시맨틱 ID 학습과 온더플라이 시맨틱 ID 디코딩(SiDec)을 통합하여 "메모리 벽" 문제를 해결하는 시스템을 소개합니다. 이는 아이템별 기억(이산 토큰을 통한)과 콘텐츠 인지적 일반화(재구성된 연속 시맨틱을 통한) 사이의 균형을 맞춥니다.
- I/O 효율성 돌파구: 거대한 벡터 저장소를 온디맨드 재구성으로 대체함으로써, 프레임워크는 데이터 점유율과 시스템 오버헤드를 획기적으로 줄입니다. 이는 시스템의 부담을 디스크 바운드(disk-bound) 밀집 벡터 검색에서 연산 바운드(compute-bound) 온더플라이 재구성으로 전환합니다.
- 프로덕션 규모 검증: 저자들은 주요 동영상 공유 플랫폼(YouTube)에서의 광범-한 벤치마크와 온라인 A/B 테스트를 통해 프레임워크의 효과를 입증했습니다.
4. 실험 결과
프레임워크는 오프라인 벤치마크와 프로덕션 환경의 온라인 A/B 테스트를 통해 평가되었습니다.
오프라인 평가 (검색 모델)
연구는 표현 충실도(fidelity)와 훈련 처리량(throughput) 간의 트레이드오프를 분석하기 위해 5가지 실험군을 비교했습니다:
- Control: 표준 ID, 콘텐츠 임베딩 없음 (최고 처리량: 16.80 steps/s, 최저 품질).
- Arm 1 (Raw Dense): 64차원 임베딩 직접 주입 (품질은 향상되었으나, I/O 병목 현상으로 인해 처리량이 28.2% 감소한 12.07 steps/s 기록).
- Arm 2 & 3 (SiDec): 코드북 디코더 사용 (v0 및 v1). 이 실험군들은 Raw Dense 방식의 품질을 유지하거나 능가하면서도 처리량을 ~15.3 steps/s까지 회복했습니다.
- Arm 4 (SiDec + Scaling): v1 코드북과 아키텍처 스케일링을 결적으로 결합하여 최상의 글로벌 손실(2.681)과 Hit Rate @100 (0.2910)을 달성했으며, Raw Dense 방식 대비 20.4%의 처리량 가속을 보여주었습니다.
결론: 이산 토큰화는 I/O 병목을 성공적으로 타파하여, 모델 깊이와 검색 정확도를 동시에 확장할 수 있게 합니다.
온라인 배포
프레임워크는 멀티태스크 랭킹 및 파운데이션 트랜스포머 검색 모델에 배포되었습니다.
- 랭킹 모델: 기존 시맨틱 ID 특징에 SiDec 콘텐츠 재구성 스트림을 추가했을 때 "온라인 만족도 참여(Online Satisfied Engagement, 시청 시간 및 상호작용의 복합 지표)"에서 유의미한 이득을 얻었습니다.
- Watchpage 랭킹: +0.80% 개선.
- Homepage 랭킹: +0.22% 개선.
- 검색 모델: 홈 페이지에서 +0.13% 개선.
- 영향: 이러한 개선은 통계적으로 유의미했으며, 특히 히스토리가 희소한 신규 계정과 롱테일 콘텐츠에 불균형적으로 큰 혜택을 주어 인기 편향(popularity bias)을 효과적으로 완화했습니다.
5. 의의 및 주장
본 논문은 매우 효율적이고 콘텐츠가 풍부한 추천을 위해 "Tokens are All You Need"라고 주장합니다. 이 연구의 의의는 다음과 같은 철학적, 구조적 변화에 있습니다:
- 연속적 I/O로부터의 탈피: 저자들은 고차원의 연속 분포가 예측력을 유지하기 위해 반드시 네이티브 부동 소수점 형식으로 처리될 필요는 없다고 주장합니다. 전체 특징 공간(사용자 컨텍스트, 히스토리 밀도, 콘텐츠 임베딩 포함)을 단일한 이산 토큰 어휘집으로 양자화함으로써, 추천 시스템은 연속적인 부동 소수점 I/O로부터 독립할 수 있습니다.
- LLM 스케일링 법칙과의 정렬: 이 접근 방식은 추천 시스템을 전통적인 밀집 임베딩의 메모리 바운드 제약에서 벗어나, LLM이 누리는 연산 바운드(compute-bound) 하드웨어 스케일링 법칙에 맞춥니다.
- 이중 용도: 프레임워크는 이산 토큰이 협업 필터링을 위한 구조화된 범주형 특징으로서의 역할과, 온더플라이 콘텐츠 재구성을 위한 압축된 표현으로서의 역할을 동시에 수행할 수 있음을 보여줍니다. 이는 별도의 무거운 임베딩 테이블을 제거합니다.
저자들은 이 패러다임이 전통적인 밀집 벡터 저장 및 검색의 막대한 비용 없이 초장기 사용자 시퀀스와 방대한 특징 공간을 다룰 수 있는 경로을 제공한다고 결론짓습니다.