TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems
TokenMinds는 사전 학습된 LLM 아키텍처를 통해 의미론적으로 근거가 있는 이산적 사용자 토큰과 밀집 임베딩을 모두 생성하도록 PLUM 프레임워크를 확장한 산업 규모의 시스템으로, 대규모 유튜브 랭킹 시스템에서 비용을 절감하는 동시에 상호 보완적인 가치를 입증하며 롱폼 및 숏폼 비디오 행동을 성공적으로 통합합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 한 사람의 영화 취향을 이해하려고 노력하고 있다고 상상해 보세요. 과거의 추천 시스템(유튜브와 같은 것들)은 사용자의 전체 시청 기록을 가져와서 하나의 작고 조밀한 "요약 카드"로 압축하려고 노력했습니다. 이것은 마치 소설 한 권 전체를 포스트잇 한 장에 단 한 문장으로 적으려는 것과 같습니다. 그 과정에서 뉘앙스, 구체적인 세부 사항, 그리고 이야기 고유의 풍미를 모두 잃게 됩니다.
다른 시스템들은 사용자 대신 아주 길고 상세한 문단을 작성하려고 시도했습니다. 하지만 이 문단들은 종종 모호했습니다. 그들은 "그들은 고양이를 좋아함"과 같은 일반적인 주제만을 포착했을 뿐, 그들이 실제로 무엇을 언제 시청했는지에 대한 구체적이고 깊이 있는 패턴은 포착하지 못했습니다.
TokenMinds는 Google DeepMind와 YouTube가 구축한 새로운 시스템으로, 사용자에게 이산적 토큰(discrete tokens)(특정한 의미를 가진 코드 세트)으로 구성된 "디지털 ID 카드"를 제공하는 동시에, 기존의 "요약 카드(조밀한 임베딩)"를 백업용으로 유지함으로써 이 문제를 해결합니다.
이 시스템이 어떻게 작동하는지 쉬운 비유를 통해 나누어 설명하겠습니다.
1. "시맨틱 ID" (마법의 우편번호)
모든 영상에 무작위 숫자(예: "비디오 #49201")를 부여하는 대신, TokenMinds는 모든 영상에 **시맨틱 ID (SID)**를 부여합니다.
- 비유: 모든 영상이 실제 내용에 기반한 "우편번호"를 가지고 있다고 상상해 보세요. "사워도우 빵 굽기"에 관한 영상은
음식-베이킹-빵으로 시작하는 우편번호를 가질 수 있습니다. "싱크대 수리하기"에 관한 영상은가정-배관으로 시작할 수 있습니다. - 도움이 되는 이유: 사용자가 "사워도우" 영상을 시청하면, 시스템은 단순히 무작위 숫자를 보는 것이 아니라, 그 코드의 "음식-베이킹" 부분을 보게 됩니다. 이를 통해 시스템은 단순히 ID를 보는 것이 아니라, 시청 행위 뒤에 숨겨진 의미를 이해할 수 있습니다.
2. "듀얼 출력" 엔진 (두 가지 도구 세트)
TokenMinds는 스위스 아미 나이프처럼 작동하는 특별한 AI 아키텍처(인코더-디코더)를 사용합니다. 이 엔진은 두 가지를 동시에 생성합니다:
- 조밀한 임베딩 (요약 카드): 이는 기존 시스템이 이미 사용하고 있는 연속적인 숫자 벡터입니다. 이는 사용자의 분위기를 빠르게 포착하는 스냅샷과 같습니다.
- SID 토큰 (상세 코드): 이것이 새로운 부분입니다. AI는 사용자의 미래 관심사를 나타내는 구체적인 "우편번호" 목록을 생성합니다. 이는 AI가 "당신이 시청한 내용을 바탕으로, 당신은 다음에
음식-베이킹-빵,기술-코딩-파이썬,스포츠-농구를 원할 가능성이 높습니다"라고 말하는 것과 같습니다.
이점: 시스템은 최선의 결과를 얻습니다. 기존 시스템을 만족시키면서(요약 카드 사용), 동시에 새로운 층위의 정밀한 시맨틱 이해(토큰)를 추가합니다. 연구 결과, 이 둘을 함께 사용하는 것이 하나만 사용하는 것보다 더 효과적이었습니다.
3. "비동기" 전달 (예약 주문 시스템)
이러한 상세한 토큰을 생성하는 것은 복잡한 요리를 만드는 것처럼 힘든 작업입니다. 만약 고객이 카운터에서 기다리는 동안 요리를 하려고 한다면 너무 느릴 것입니다.
- 비유: TokenMinds는 "예약 주문" 시스템을 사용합니다. 사용자가 단순히 브라우징을 하는 동안 배경에서(비동기적으로) 사용자의 "ID 카드"와 "토큰"을 생성합니다. 사용자가 실제로 "추천"을 클릭하면, 시스템은 빠른 보관함에서 미리 만들어진 카드를 가져오기만 하면 됩니다. 이 덕분에 시스템은 속도를 늦추지 않고도 수십억 명의 사용자를 처리할 수 있습니다.
4. "유니버설 번역기" (모든 영상을 위한 하나의 모델)
YouTube에는 두 가지 매우 다른 유형의 영상이 있습니다: 롱폼(Long-Form)(예: 20분짜리 다큐멘터리)과 숏폼(Short-Form)(예: 15초짜리 Shorts). 보통 사람들의 시청 방식이 다르기 때문에 이를 이해하기 위해 두 개의 서로 다른 모델이 필요합니다.
- 비유: TokenMima는 유니버설 번역기와 같습니다. 동일한 "우편번호" 시스템을 롱폼과 숏폼 영상 모두에 사용합니다. 이 시스템은 사용자가 20분짜리 요리 프로그램과 15초짜리 요리 팁 영상을 시청한 기록을 보고, "아, 이 사람은 요리를 좋아하는구나!"라고 깨달을 수 있습니다.
- 결과: 별도의 두 가지 비싼 모델을 훈련하고 실행하는 대신, 하나의 모델로 두 가지 작업을 모두 수행합니다. 이를 통해 품질 저하 없이 훈련 비용은 50%, 서빙 비용은 31% 절감했습니다.
5. 결과 (증거)
팀은 실제 YouTube 트래픽(수십억 명의 사용자)을 대상으로 테스트를 진행했습니다.
- 더 나은 추천: 이 새로운 토큰들을 랭킹 시스템에 추가했을 때, 사람들이 영상에 참여하는 정도와 만족도가 눈에 띄게 증가하는 것을 확인했습니다.
- 효율성: 롱폼과 숏폼 모델을 결합함으로써 엄청난 양의 컴퓨터 전력을 절약했습니다.
- 다양성: 시스템은 똑같은 것만 반복해서 예측하지 않았습니다. 마치 인간 친구가 당신이 좋아할 만한 다양한 것들을 제안하듯, 잠재적 관심사에 대한 다양한 목록을 생성했습니다.
요약하자면: TokenMinds는 사용자가 원하는 것을 더 스마트하고 효율적으로 이해하는 방법입니다. 한 사람의 복잡한 취향을 단 하나의 숫자로 압축하려 하는 대신, 사용자의 관심사를 설명하는 의미 있는 "코드" 세트를 제공하며, 이 모든 과정을 모든 유형의 영상 콘텐츠를 처리할 수 있는 단일하고 비용 효율적인 엔진 위에서 실행합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.