WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture
本論文は、WukongとHSTUのバックボーンを斬新な融合メカニズムを通じて統合し、非シーケンス特徴量とシーケンス特徴量を共同でモデリングすることで、産業用生産システムにおいて顕著なオフラインおよびオンラインの性能向上を実現する、スケーラブルで統一された推薦アーキテクチャであるWHALEを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、何百万人もの人々が絶えずスクロールし、クリックし、視聴している、巨大で賑やかなデジタル都市を歩いているところを想像してみてください。これはオンライン・レコメンデーション・システムの、あなたのソーシャルメディアのフィードや動画の提案、ショッピングリストの背後にある目に見えないエンジンの世界です。彼らの仕事は、あなたが次に何を見たいかを推測することです。これを行うために、彼らは通常、2つの非常に異なる種類のヒントを見ます。第一に、「静的」な詳細があります。それは、あなたが誰であるか、何が好きか、時刻、そして表示されている特定のアイテムです。これは、容疑者のファイルと犯罪現場を見ている探偵のようなものです。第二に、「動的」な行動があります。それは、あなたが過去にクリックしたり、視聴したり、購入したりしたすべての、長く乱雑な足跡です。これは、探偵が容疑者の人生の物語全体がリアルタイムで展開される様子を観察しているようなものです。
長い間、レコメンデーション・システムはこれら2種類のヒントを別々に扱ってきました。ある非常に賢いモデルは、静的な詳細(例:「このユーザーはSFが好き」+「金曜の夜である」)を混ぜ合わせることに長けており、また別のモデルは、あなたの過去の行動の長い物語を読み取るエキスパートでした(例:「あなたはスペース映画を3本連続で見たので、おそらく4本目も見たいはずだ」)。大きな疑問は、これら両方に等しく精通した、かつ、実行する際にあまりにも遅くなったりコストがかかりすぎたりしない、一つのスーパーモデルを構築できるか?ということでした。もしそれができれば、あなた自身が誰であるか、そして最近何をしているか、その両方に同時に完璧に合わせたコンテンツを見せてもらえるようになるかもしれません。
そこで、Metaの研究者によって開発された、このパズルを解こうとする新しいアーキテクチャ、WHALEが登場しました。WHALEを、協力して働く巨大で多層的な探偵チームだと考えてください。モデルが単に一方の探偵にファイルを読ませ、もう一方にビデオを見せるのではなく、WHALEは彼らを同じ部屋に入れ、レイヤーごとに配置します。モデルのあらゆるレイヤーにおいて、「Wukong」チーム(静的な詳細を混ぜるエキスパート)と「HSTU」チーム(あなたの行動の長い履歴を読むエキスパート)が存在します。しかし、ここにある魔法のトリックがあります。彼らはただ並んで作業するのではなく、絶えず「会話」をするのです。WukongチームはHSTUチームにこう尋ねます。「ねえ、私が今見ているこの特定のアイテムに基づくと、ユーザーの長い履歴の中で今最も重要な部分はどこ?」すると、HSTUチームはその特定の記憶にズームインし、それを持ち帰ります。これがデータがモデル内を移動する間、何度も繰り返され、システムが理解を絶えず洗練させることを可能にします。
論文は、この「漸進的な交換(progressive exchange)」がゲームチェンジャーであると示唆しています。研究者が大規模なソーシャルメディア・プラットフォームの膨大な実世界のデータを用いてWHALEをテストしたところ、モデルを大きくし、より長い履歴を読ませるにつれて、ユーザーがクリックする内容の予測精度が一貫して向上することが分かりました。具体的には、モデルが見ることができるユーザー履歴の長さを増やすと、レコメンデーションの質が向上しました。また、モデルをより深く(より多くのレイヤー)し、より広く(より多くの処理能力)することで、引き続き良い結果が得られることも分かり、このシステムがうまくスケールアップすることを示唆しています。
しかし、研究者たちは、これら2種類のモデルを組み合わせるより単純な方法、彼らが「シャロー・ハイブリッド(shallow-hybrid)」と呼ぶ手法もテストしました。この古い手法では、履歴は非常に小さな要約へと圧縮されてから、静的な詳細と混合されます。論文は、これが細かいディテールを捨ててしまうため、間違いであると主張しています。彼らの実験によれば、WHALEの深い、レイヤーごとの対話的なアプローチは、このシャローなアプローチよりも有意に優れており、2つのチームを常にコミュニケーションさせ続けることが極めて重要であることを証明しました。
もちろん、このような複雑なシステムを構築することはコストがかかります。チームは、WHALEを何百万人もの人々に同時に使用できるほど高速に動作させるために、特別なカスタムコンピュータコード(「Tritonカーネル」と呼ばれるものを使用)を考案しなければなりませんでした。現実世界のテストにおいて、WHALEは主要な指標におけるユーザーエンゲージメントを向上させましたが、小さな代償も伴いました。それは、旧システムと比較して、1秒あたりのリクエスト処理数が約5%減少したことです。このわずかな速度低下にもかかわらず、レコメンデーションの質の向上は勝利とみなされ、システムはすでにプロダクション環境にデプロイされています。論文は、問題を解決するためにモデルを無限に大きくすることはできないものの、データの異なる2つの考え方(静的な詳細と動的な履歴)を、単一の相互作用するアーキテクチャへと統合することは、レコメンデーションの未来に向けた強力かつ実用的な道であると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。