← 最新の論文
🤖 AI

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

TokenMindsは、PLUMフレームワークを拡張し、事前学習済みLLMアーキテクチャを介して、意味論的に裏付けられた離散的なユーザー・トークンと高密度な埋め込みの両方を生成することで、長尺および短尺ビデオの振る舞いを統合し、大規模なYouTubeランキングシステムにおいてコストを削減しつつ相補的な価値を実証することに成功した、産業規模のシステムである。

原著者: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hon
公開日 2026-06-25
📖 1 分で読めます☕ さくっと読める

原著者: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hong, Li Wei, Xinyang Yi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ある人の映画の好みを理解しようとしているところだと想像してください。かつてのレコメンデーションシステム(YouTubeなどのもの)は、その人の視聴履歴全体を取り込み、それを一つの、小さく高密度な「要約カード」へと押し込もうとしていました。これは、小説一冊の内容を、付箋にたった一行の文章で書き写そうとするようなものです。そこでは、ニュアンスや具体的な詳細、そして物語特有の味わいが失われてしまいます。

他のシステムは、ユーザーについて詳細な段落を書こうとしました。しかし、それらの段落は曖昧で、「この人は猫が好き」といった一般的なトピックを捉えるだけで、実際に何をいつ見たのかという、より具体的で深いパターンまでは捉えきれませんでした。

TokenMindsは、Google DeepMindとYouTubeによって構築された新しいシステムであり、ユーザーに離散的なトークン(特定の意味を持つコードのセット)で構成された「デジタルIDカード」を与え、さらに、従来の「要約カード」(高密度埋め込み)をバックアップとして保持することで、この問題を解決します。

仕組みを、シンプルな比喩を用いて解説します。

1. 「セマンティックID」(魔法の郵便番号)

すべての動画にランダムな番号(例:「ビデオ番号#49201」)を与える代わりに、TokenMindsはすべての動画に**セマンティックID(SID)**を与えます。

  • 比喩: すべての動画に、その内容に基づいた「郵便番号」が付いていると考えてください。「サワードウ・ブレッドの焼き方」に関する動画なら、そのコードはFood-Baking-Bread(食文化-製パン-パン)で始まるかもしれません。「シンクの修理」に関する動画なら、Home-Plumbing(住まい-配管)で始まるかもしれません。
  • なぜ役立つのか: ユーザーが「サワードー」に関する動画を見たとき、システムは単なるランダムな数字を見るのではなく、コードの「製パン」の部分を認識します。これにより、システムは単なるIDではなく、視聴の背後にある「意味」を理解できるようになります。

2. 「デュアル出力」エンジン(二つの道具箱)

TokenMindsは、スイスアーミーナイフのように機能する特別なAIアーキテクチャ(エンコーダー・デコーダー)を使用しています。これは同時に二つのものを作り出します。

  • 高密度埋め込み(要約カード): これは、既存のシステムがすでに活用している、連続的な数値ベクトルです。ユーザーの「雰囲気」を素早く捉えたスナップショットのようなものです。
  • SIDトークン(詳細なコード): これが新しい部分です。AIは、ユーザーの将来の関心事を示す具体的な「郵便番号」のリストを生成します。これは、AIが「あなたの視聴履歴に基づくと、あなたは次にこれらを求める可能性が高いです:Food-Baking-BreadTech-Coding-PythonSports-Basketball」と言っているようなものです。

メリット: このシステムは、両方の良いところ取りをしています。既存のシステムを満足させつつ(要約カードを使用)、新しい層である精密な意味的理解(トークン)を追加しています。研究では、どちらか一方のみを使用する場合よりも、両方を併用する方が優れた結果になることが示されました。

3. 「非同期」配信(予約注文システム)

これらの詳細なトークンを生成することは、複雑な料理を作る作業のように、負荷の高い作業です。もし顧客がカウンターで待っている間に料理を作ろうとすれば、あまりにも時間がかかりすぎてしまいます。

  • 比喩: TokenMindsは「予約注文」システムを使用しています。ユーザーがただブラウジングしている間に、バックグラウンドで(非同期に)ユーザーの「IDカード」と「トークン」を生成しておきます。ユーザーが実際に「レコメンドを表示」をクリックしたとき、システムは高速なストレージロッカーから、あらかじめ用意されたカードを取り出すだけです。これにより、システムは数十億人のユーザーを扱う際にも速度を落とすことなく、処理を行うことができます。

4. 「ユニバーサル翻訳機」(すべての動画に対応する一つのモデル)

YouTubeには、大きく分けて二種類の異なるタイプの動画があります:長尺動画(20分間のドキュメンタリーなど)と、短尺動画(15秒間のShortsなど)です。通常、これらは視聴方法が異なるため、それぞれ別のモデルが必要になります。

  • 比喩: TokenMksは、ユニバーサル翻訳機のようです。同じ「郵便番号」システムを、長尺動画と短尺動画の両方に使用します。ユーザーが20分の料理番組を見た履歴と、15秒の料理テクニック動画を見た履歴の両方を見て、「ああ、この人は料理が好きなのだな!」と理解することができます。
  • 結果: 二つの異なる高価なモデルを訓練して実行する代わりに、一つのモデルで両方の仕事をこなします。これにより、品質を損なうことなく、計算コストをトレーニングで50%、サービング(提供)で**31%**削減できました。

5. 結果(証明)

チームは、実際のYouTubeのトラフィック(数十億人のユーザー)を用いてテストを行いました。

  • より優れたレコメンデーション: これらの新しいトークンをランキングシステムに追加したところ、ユーザーのエンゲージメント(関与)や満足度が目に見えて向上することが確認されました。
  • 効率性: 長尺動画と短尺動画のモデルを統合することで、膨大なコンピュータパワーを節約できました。
  • 多様性: システムは同じことを何度も推測するのではなく、人間が友人にさまざまな好みを提案するように、潜在的な関心の多様なリストを生成しました。

要約すると: TokenMindsは、ユーザーが何を求めているかを理解するための、よりスマートで効率的な方法です。それは、一人の複雑な好みを一つの数字に押し込めようとするのではなく、代わりに、ユーザーの関心を記述する一連の意味のある「コード」を提供します。しかも、あらゆる種類のビデオコンテンツを処理できる、コスト効率の高い単一のエンジンで動作しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →