Don't Contrast the Impossible: Region-Constrained Batching for Contrastive User Modeling on a Local Community Platform
本論文は、ローカルコミュニティプラットフォーム向けの新しいバッチング手法であるRegion-Constrained Batch Sampling(RCBS)を提案するものであり、これは地理的に不可能なネガティブサンプルを実行可能なものに置き換えることで、対照的なユーザーモデリングを改善し、それによって本番環境におけるレコメンデーションおよび広告のパフォーマンスを向上させるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットに「人が何を好むか」を理解させる方法を教えようとしていると想像してください。コンピュータサイエンスの世界では、これは「レコメンデーション・システム」と呼ばれ、ロボットの脳は「対照学習(コントラスティブ学習)」と呼ばれる手法を用いて構築されています。これは、「間違い探し」のゲームのようなものだと考えてください。ユーザーが何にクリックしたかをロボットに教えるために、彼らがクリックしたもの(「ポジティブ」)の画像を見せ、次に、彼らがクリックしなかった他のたくさんの画像(「ネガグティブ」)を見せます。ロボットは、「ああ、ユーザーはこの画像は好きだけど、あっちの画像は好きじゃないんだな」と気づくことで学習していきます。
このゲームをうまく機能させるためには、ロボットに見せる「ネガティブ」な画像は、ユーザーが目にすることができたはずなのに、単に無視したもの(選ばなかったもの)でなければなりません。もし、砂漠の真ん中に住んでいてペンギンを見たこともないユーザーに対して、ペンギンの写真を見せてしまったら、ロボットは役に立つ学習を何もできません。ユーザーがペンギンを無視したのは、それが嫌いだったからではなく、そもそも見るのが不可能だったからです。この論文は、ゲームのルールが「誰が何を見られるか」について厳格な制約を持っている場合に、ロボットが混乱してしまうという特定の問題に取り組んでいます。
問題点:不可能な選択肢でロボットを教えること
Karrot(韓国で人気の高い、近所での売買のためのローカルコミュニティアプリ)のようなローカルコミュニティアプリでは、ゲームのルールはAmazonのようなグローバルなストアとは大きく異なります。Karrotでは、自分の近くにあるアイテムしか見ることができません。例えば、ソウルに住んでいれば、たとえブサンの自転車が最高にクールなものであったとしても、その自転車を見ることはできません。このアプリは、距離が「壁」として機能するように設計されています。壁の向こう側にあるアイテムは、あなたには単に見えないのです。
研究者たちは、従来のロボットの訓練方法が大きな間違いを犯していることを発見しました。ロボットは「ミニバッチ」を用いて訓練されていました。ミニバッチとは、ユーザーとアイテムをランダムに混ぜ合わせた小さなグループのことです。この混ぜ方がランダムであったため、ロボットは特定のユーザーにとって物理的に不可能なアイテムを、しばしば提示してしまっていました。例えば、ある近所に住むユーザーに対して、50キロ離れた近所のアイテムを見せてしまうといった具合です。
論文では、これらを「不可能なネガティブ(impossible negatives)」と呼んでいます。ロボットが、ユーザーにとって見るのが不可能だったアイテムをユーザーが無視したのを見たとき、ロボットは「なるほど、このユーザーはこのアイテムが絶対に嫌いなんだ!」と考えてしまいます。しかし、それは間違いです。ユーザーはそれを嫌ったのではなく、単に見ることができなかっただけなのです。これは、まるで教師が、学生が話せない言語で書かれた質問に対して、「答えられないなんて!」と生徒を叱責しているようなものです。論文は、こうした「不可能」な選択肢でトレーニング・ゲームを満たすことは、ロボットの学習を希薄にし、人々が本当に何を求めているのかを予測する能力を低下させると主張しています。
解決策:「同じ近所」のルール
これを修正するために、著者であるハン・スンホ、キム・ビョンチャン、ユ・ジンは、**「領域制約付きバッチサンプリング(Region-Constrained Batch Sampling: RCBS)」**と呼ばれる、トレーニング・ゲームを構成するための新しい方法を提案しました。
全員を一つの大きなバケツに投げ込む代わりに、RCBSは厳格な「近所監視(ネイバーフッド・ウォッチ)」のように機能します。ロボットを訓練するためのユーザーグループを作成する際、RCBSは、同じエリア(または非常に近いエリア)に住んでいるユーザーのみを選び出します。グループ内の全員が近くに住んでいるため、そのグループ内で示されるすべてのアイテムは、そのグループ内の「誰にでも」理論上見えるはずのものです。
この単純な変更は、強力な効果をもたらします。今や、ロボットがユーザーによる無視を目撃したとき、そのアイテムはユーザーが実際に目にすることができたものであると確信できます。それでもクリックされなかった場合、それはユーザーが興味を持っていないという明確なシグナルとなります。これらは「実現可能なネガティブ(feasible negatives)」と呼ばれます。論文は、これらの「実現可能な」選択肢の方が、簡単な「不可能な」選択肢よりも、ロボットにとって学習しにくく、かつ情報量が多いと示唆しています。これは、ロボットのトレーニングを「鍵のかかった箱の中身を推測すること」から、「目の前にある箱の中身を推測すること」へとアップグレードするようなものです。
結果:より優れたロボット
チームはこのアイデアを2つの方法でテストしました。一つは、シミュレーションによるオフラインでのテスト(練習試合のようなもの)、もう一つは、実際のアプリでのリアルユーザーを用いたテスト(ライブA/Bテスト)です。
シミュレーションにおいて、彼らはトレーニンググループの中にどれだけの「不可能」な選択肢が含まれていたかを測定しました。従来のランダムな手法では、驚くべきことに、ネガティブな選択肢の**98%がユーザーにとって見るのが不可能なものでした。彼らの新しいRCBSメソッドを用いることで、その数字を30%**まで抑えることに成功しました。
結果は明白でした。新しい「近所ルール」で訓練されたロボットは、ユーザーを理解する能力が大幅に向上しました。
- オフラインテスト: 新しいロボットは、ホームフィードの検索において約7.56%、広告ランキングにおいて約4.61%、従来のロボットと比較して、適切なアイテムを見つける能力を向上させました。
- ライブテスト: 新しいロボットを実際のアプリに投入したところ、結果はさらにエキサイティングなものとなりました。ホームフィードへのクリック数は**10.0%増加し、フィードが表示される回数(インプレッション)は5.12%増加しました。広告についても、クリックする人の数が7.46%**増加するという優れたパフォーマンスを示しました。
まとめ
論文は、ローカルコミュニティ・プラットフォームにおいては、ユーザーとアイテムを単にランダムに混ぜ合わせることはできないと結論付けています。地理的な状況を尊重しなければなりません。ユーザーが実際に目にすることができるものからのみロボットが学ぶようにすることで、ロボットはより速く、より賢く学習します。著者たちはすでにこの新しい手法をKarrotに導入しており、現在、何百万人ものユーザーが自分たちの近所で本当に欲しいものを見つけるための助けとなっています。彼らは、これが大きな前進ではあるものの、将来的にこれらの「近所」のルールをさらに微調整する方法があるかもしれないと示唆していますが、現時点では、「不可能を対照させない」というシンプルな解決策が勝利を収めたことが証明されました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。