Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study
本論文は、Google Discoverにおけるヘテロジニアスなコンテンツフィードのランキングに関するエンドツーエンドの産業事例研究を提示するものであり、適応的なマルチタスク学習のためのHA-MoEアーキテクチャと、オフライン指標およびオンラインのユーザーエンゲージメントの両方を向上させながらコンテンツの多様性を効果的に管理するためのLENSオブザーバビリティフレームワークを導入している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、棚が絶えず組み変わっている巨大で混沌とした図書館に足を踏み入れたところだと想像してみてください。ある棚には真面目な歴史の本があり、別の棚にはおかしな猫の動画があり、3番目の棚にはレシピがあり、4番目の棚には最新ニュースがあります。理想的な世界であれば、司書は、あなたが次に何を読みたいのか、例えばちょっとしたジョークを求めているのか、それとも歴史への深い探求を求めているのかを正確に把握していることでしょう。しかし、インターネットの現実世界において、この「図書館」はGoogle Discoverのフィードであり、この「司書」はレコメンダーシステムと呼ばれるコンピュータプログラムです。
これらのコンピュータ司書が直面している課題は、かつては音楽専門、あるいは短い動画専門といった、非常に整理された単一トピックの図書館で働いていたことです。そのような場所では、すべてが同じように見え、同じように機能していました。しかし、Google Discoverは異なります。これはウェブ全体からコンテンツを引き出してくるからです。つまり、コンピュータは、長い記事、10秒の動画、ユーザーの個人的な投稿、そしてAIによる要約のすべてを同時に判断しなければなりません。それはまるで、一人のシェフに、同じ材料と道具を使いながら、完璧なステーキ、繊細なスフレ、そしてスパイシーなタコスを同時に作るよう求めるようなものです。もしシェフがステーキに集中しすぎれば、タコスは台無しになってしまうかもしれません。この論文は、一つのコンピュータの脳が、混乱したり、最も声の大きい(人気のある)ものばかりを優遇したりすることなく、これらすべての異なる「味わい」のコンテンツを扱う方法を教えるという、非常にトリッキーな問題に取り組んでいます。
この論文の著者であるGoogleのチームは、特定の課題に直面しました。彼らの現在のシステムは、「誰にでも当てはまる」シェフのようなものでした。あらゆるものをランク付けするために単一のルールを使おうとしていたため、ミスを招いていました。時には、クリック数を稼ぐだけで低品質なクリックベイト(釣り記事)を押し上げる一方で、人々が実際に見たいと思っている高品質な動画を埋もれさせてしまうこともありました。これを解決するために、彼らはHA-MoE(Heterogeneity-Adaptive Mixture-of-Experts:不均一性適応型混合エキスパート)と呼ばれる新しいシステムを構築しました。
HA-MoEを、単一のシェフではなく、賢いマネージャーと専門家チームがいる賑やかなキッチンだと考えてみてください。旧システムでは、一人の料理人がすべてをやろうとしていました。新システムでは、「マネージャー」(ゲートネットワーク)が注文と食べ物の種類(コンテンツ)を見て、どの専門家がそれを担当すべきかを決定します。もし注文が動画であれば、マネージャーはそれを「動画スペシャリスト」に送ります。もしテキスト記事であれば、「ライター」に送られます。重要なのは、マネージャーはただ推測するのではなく、特別な「不均一性シグナル」を使用することです。これは、「おい、これは動画だ、扱いを変えろ!」と伝える小さなメモのようなものです。これにより、動画スペシャリストが記事スペシャリストに飲み込まれることなく、その実力を発揮できるようになります。
しかし、キッチンが実際にうまく機能しているかどうかをどうやって知るのでしょうか?チームは、単に「満足した顧客の総数」を見るだけでは不十分であることに気づきました。全体としては素晴らしい一日だったとしても、もし動画スペシャリストが失敗していれば、機会を逃していることになります。そこで、彼らはDL-AUC(Dual-Level AUC)と呼ばれる新しい成功指標を考案しました。キッチンを採点する際、提供された食事の総数だけでなく、記事スペシャリストと比較して動画スペシャリストがどれほど上手くいったかをも評価するイメージです。この新しいスコアは、ある種類のコンテンツが不当に無視されているという問題を検知するのに役立ちます。
システムが長期的に健全であり続けるために、彼らはLENSと呼ばれるツールも構築しました。これはキッチンの内部を覗き見るためのX線メガネのようなものです。これにより、エンジニアはコンピュータの脳の中を覗き込み、どの「スペシャリスト」が何をしているのかを確認できます。もしシステムが怠慢になり、すべてのスペシャリストが同じような動きをし始めた場合、LENSは即座にそれを察知します。これにより、チームはユーザー体験を損なう前に問題を修正することができます。
結果は有望でした。彼らが膨大な実際のユーザーインタラクションのデータセットを用いてこの新システムをテストしたところ、旧システムと比較して、ポジティブなアクション(クリックや「いいね」など)とネガティブなアクション(投稿の非表示化など)の両方をより適切にランク付けできました。システムは、人気のあるコンテンツタイプがよりマイナーなタイプを押しつぶしてしまうという「多数派バイアス」を克服することに成功しました。実際のユーザーを用いたオンラインテストでは、新システムによって、アプリを開く人数が増え、スクロールが深まり、より幅広い種類のコンテンツを探索する人が増えました。この論文は、コンテンツの違いを無理に同一視させるのではなく、その違いを尊重するようにコンピュータを明示的に教えることで、よりスマートで公平、かつ楽しいフィードを構築できることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。