食料品や衣類、日用品を購入する広大なデジタルマーケットプレイスにおいて、一つの製品はしばしば多くの異なる顔を持っています。特定のブランドの牛乳が、ある店では一つの名前で、別の店では全く異なるコードでリストされていることがあります。棚にあるボトルは同一であるにもかかわらずです。この断片化により、コンピュータは、あるバージョンの製品を購入した顧客が他のバージョンにも興味を持つ可能性が高いことを理解するのが困難になります。これを解決するために、研究者たちは、図書館がファイリングシステムを使用するように、製品をカテゴリーに分類しようと長年試みてきました。しかし、これらの人間が作ったカテゴリーは、アイテム間の微妙な違いを捉えるにはあまりに広すぎることがあり、一方で各店舗からの生のデータは、点と点を結びつけるにはあまりに乱雑すぎるのです。課題は、買い物客にとって重要な具体的な詳細を失うことなく、製品間の関係性をコンピュータに教える方法を見つけることにあります。
DoorDashの研究チームは、製品を表現するための新しい方法、すなわち商品のレコメンデーションと検索の両方を支援する共通言語として機能する手法を開発することで、この問題の解決に乗り出しました。彼らは、製品情報を、デジタル指紋のような短くユニークなコードに変換するシステムを開発しました。これらのコードを分析したところ、それらは入れ子状の箱のように、自然に階層構造を形成していることが分かりました。コードの外側の層は製品を広範なカテゴリーにグループ化し、内側の層はますます具体的な詳細へと掘り下げていきます。この構造により、たとえそれらを掲載している店舗が異なる名前を使用していたとしても、二つの製品がコードの冒頭部分を共有しているために互いに関連しているということを、システムが理解できるようになりました。研究者たちは、この単一の階層構造が、閲覧ページで顧客にどの製品を表示するかを決めるタスクと、顧客がクエリを入力した際に、より良い検索語を提案するという、二つの非常に異なるタスクの両方を駆動できるかどうかをテストしました。
研究者たちはまず、この階層構造を、ユーザーが「夏のグリル」や「ビューティー」といったカルーセル形式のアイテムを閲覧するディスカバリーページでの製品ランキングの問題に適用しました。以前は、システムはすべての店舗のリスティングを別々の実体として扱っていたため、顧客の好みを学習することに苦労していました。もしユーザーがある店で特定の種類のコーヒーを購入しても、システムは自動的に、別の店でも同じコーヒーが好きになるかもしれないとは判断できませんでした。新しい階層的コードを使用することで、システムはこれらの類似したアイテムをグループ化し、すべてのアイテムにわたって顧客の履歴を集約することができました。これにより、ランキングアルゴリズムは、単一の店舗のリスティングではなく、製品の「概念」に対する好みを認識できるようになりました。これを実世界でテストしたところ、システムは顧客が何をカートに追加したいと考えているかを予測する能力が大幅に向上しました。結果は、エンゲージメントの顕著な向上を示しており、特に閲覧リストの上位において、顧客がより多くのアイテムをカートに追加したことが確認されました。さらに重要なことに、システムはより幅広い種類の製品を表示するようになり、同じベストセラーを繰り返すのではなく、あまり人気のないアイテムにも注目される機会を与えました。
同じ階層構造が、検索体験の向上、具体的にはユーザーがクエリを入力した際に表示されるサジェスト(提案)にも使用されました。従来、検索システムは、ユーザーの検索履歴の中で次に何が入力されたかを見ることで、新しい用語を提案してきました。このアプローチは、スペルミスや略語、あるいは同じ言葉が文脈によって異なる意味を持ち得るという事実によって混乱が生じやすいため、しばしば失敗します。新しいシステムは、代わりにユーザーの検索を、階層的コードによって定義された「製品概念」へと翻訳します。そして、生の単語の間ではなく、これらの概念間の遷移を探ります。例えば、ユーザーが「ミルク」と検索した場合、システムはこれを製品概念として理解し、ユーザーが過去に実際にクリックしたものに基づいて、「シリアル」へと横方向に移動するか、あるいは「全乳」へと検索を絞り込むことを提案できます。この手法は、従来のアプローチよりも精密であることが証明されました。テストにおいて、新しいシステムはより明確で有用なサジェストを生成し、ユーザーが探しているものをより速く見つけられるよう支援しました。実際のユーザーに展開した際、システムは製品を見つけるために必要なスクロール数とクリック数を減少させ、つまり、買い物客がより少ない労力で目的のアイテムに到達できることを意味しました。
この研究は、学習された単一の製品コードの階層構造が、製品のレコメンデーションと検索クエリの精緻化の両方において、強力な基盤として機能することを示しています。人間が作った硬直的なカテゴリーから離れ、コンピュータがデータから直接学習した構造を使用することで、研究者たちは柔軟性と精密さを兼ね備えたシステムを作り上げました。知見が示唆するのは、コンピュータが複数の詳細レベルで製品間の関係を理解するとき、個々の買い物客の特定のニーズにより良く応えられるということです。結果は単なる理論的なものではなく、新しいシステムが旧来の手法を一貫して上回り、より満足度の高い顧客とより効率的なマーケットプレイスをもたらしたという実世界の実験によって測定されました。この成果は、製品構造に関する共通の理解が、何百万もの異なるリスティングという混沌とした現実と、すべての買い物客が期待するパーソナライズされた体験との間の溝を埋めることができるということを強調しています。
技術要約:一つの階層、二つのシステム
問題提起
マルチマーチャント(複数業者)のeコマースカタログは、根本的な表現上の課題に直面している。すなわち、同等または関連する製品が、異なるマーチャント固有の識別子(ID)の下にリストされていることで、プラットフォーム全体で行動エビデンスが断片化してしまうという問題である。既存のソリューションは、粒度と汎用性のバランスを取ることに苦慮している。
- マーチャント固有のリスティングIDは、正確な同一性を保持するものの、異なるマーチャント間での同等製品への嗜好シグナルの転送に失敗し、信頼できる嗜好を学習するためのデータが疎になる。
- **専門家定義のタクソノミー(分類体系)**は、より広範なエビデンスの共有を可能にするが、きめ細かなパーソナライゼーションやディスカバリー(発見)には粗すぎる場合が多い。
- **クエリ再構成(Query Reformulation)**システムは、生のクエリ文字列の遷移に依存しているため、スペルミス、略語、類義表現によってエビデンスが断片化しやすい。さらに、同一のクエリ文字列であっても、異なるビジネス垂直分野間で異なる意図を混同してしまう可能性がある。
核心となる問題は、パーソナライゼーションに必要な識別性を維持できるほど精緻でありながら、レコメンデーションと検索の両ドメインにおいてエビデンスの集約と意図の洗練をサポートできるほど階層的である、単一の製品表現を特定することである。
メソドロジー
著者らは、パーソナライズされたアイテムランキングとクエリ再構成という二つの異なるシステムのための共通の製品表現として、学習されたセマンティックID(SID)階層を利用した統合フレームワークを提案している。
1. 共有製品階層の構築
階層は、カタログコンテンツを用いて**残差量子化K-means(RQ-K-means)**により構築される。
- 埋め込み(Embedding): 製品プロファイル(商品名、ブランド、サイズ)は、学習済みテキストエンコーダー(
gemini-embedding-001)を使用して、高次元ベクトル(3,072次元)にエンコードされる。
- 量子化(Quantization): ベクトルは、各ステージに512個のセントロイドを持つ3段階の残差量子化を受ける。
- 構造: 各製品には、3つのコードシーケンス si=[ci,0,ci,1,ci,2] が割り当てられる。深さ1、2、3における接頭辞(L1、L2、L3)は、カタログの入れ子状のパーティションを定義する。
- 特性: この階層は、製品コンセプトを段階的な具体性を持って捉える。長い共有接頭辞は、バランスの取れたコード使用量を維持しながら、高い意味的コヒーレンス(一貫性)と優れたグループ分離(低いDavies-Bouldin指数)と相関する。
2. アプリケーションA:パーソナライズされたアイテムランキング
SID階層は、複数のセマンティック解像度で消費者行動を集約することにより、ディスカバリー・サーフェス(例:カテゴリカルーセル)におけるランキングを強化するために使用される。
- 高密度特徴量(Dense Features): 行動統計(注文頻度、購入最新性、パフォーマンス率)は、消費者、サブマーケット、およびグローバルなコンテキストにおけるSID接頭辞(L1、L2、L3)にわたって集約される。これにより、モデルは広範なコンセプトと微細なバリアントの両方に対して嗜好を学習できる。
- シーケンス特徴量: SIDコードは、SentencePiece(BPEの変種)を使用して「SPMトークン」としてトークン化される。これらのトークンは、候補アイテムと消費者履歴(過去180日間の順序付けられた製品)の両方を表す。
- モデルアーキテクチャ: CTR(クリック率)、ATC(カート追加率)、CVR(コンバージョン率)を予測するマルチタスクニューラルネットワークは、これらの高密度集約データとシーケンス埋め込みを取り込む。共有埋め込みテーブルにより、モデルは候補製品のサブワードを履歴上の消費者嗜好に直接関連付けることができる。
3. アプリケーションB:クエリ再構成
階層は、製品コンセプトに基づいて検索クエリを接地(グラウンディング)し、推奨クエリピルの精度を向上させる。
- クエリからコンセプトへの接地: クエリは、曖昧さを解消するためにビジネス垂直条件に基づき、関連するATCイベントに基づいて主要なSID接頭辞(L1またはL2)にマッピングされる。
- 遷移モデリング:
- 横方向のナビゲーション(Lateral Navigation): 接地されたSID接頭辞間の遷移は、正規化相互情報量(NPMI)を用いてモデリングされ、横方向のピボット(例:ミルク → シリアル)を捉える。
- 階層的洗練(Hierarchical Refinement): 並行するパスとして、L2接頭辞からそのL3の子要素へと下降する経路があり、これにより、きめ細かな意図が自己ループへと崩壊することを防ぐ(例:ミルク → 全乳)。
- レンダリングとフィルタリング: 言語モデルがターゲットとなるコンセプトを消費者向けのクエリへとレンダリングする。候補は、提案が実行可能であることを保証するために、マーチャントのアクティブな品揃えに対してフィルタリングされる。
主な貢献
- プロダクション規模の研究: 本論文は、レコメンデーションと検索の両システムにおいて再利用可能な表現として、学習されたSID階層を大規模に展開した事例を提示している。
- タスク特化型の適応: 単一の階層がいかにして二つの異なる目的をサポートできるかを示している。
- ランキング: SID接頭辞上でインタラクションを集約し、複数の粒度で嗜好をモデル化する。
- 再構成: クエリを製品コンセプトに接地し、階層内での遷移をモデリングすることで、横方向のナビゲーションと階層的洗練の両方をサポートする。
- 経験的な優位性: 学習されたSIDは、意図の識別性を保持する点において専門家定義のタクソノミーに、また行動遷移をマイニングする点において生のクエリ文字列に勝ることを実証している。
結果
オフライン評価
- ランキング: アブレーション研究により、SID由来の特徴量を除去した場合(FC-A)は、フルモデル(FC)と比較して大幅な性能低下を招くことが示された。フルモデルは、ベースラインに対して MRR@5 で +6.98%、NDCG@5 で +6.76% の向上を達成したが、アブレーションモデルの向上はそれぞれ +2.10%、+2.92% に留まり、SID特徴量が向上の大部分を牽引していることが示された。
- 再構成: 専門家のタクソノミーと比較して、SIDは意図が崩壊する遷移の割合を 18.8% から 10.9% に減少させた。生のクエリ文字列グラフと比較して、SIDベースのシステムは、ランク1の推奨の判定品質を 0.522 から 0.734 に向上させた。
オンライン評価
- ランキングへの影響: フルな処理(SID特徴量 + 同時更新)により、平均カルーセルATC(カート追加)率が 5.5% 向上し、特にポジション1で +8%、ポジション2で +16% の利得があった。また、小計(subtotal)も 0.31% 増加した。注目すべき点として、この処理は人気集中を抑制し、最初のカルーセルポジションにおけるアイテムの平均的な過去の知名度(popularity)を 18.1% 低減させた。
- 再構成への影響: SIDベースの再構成モジュールは、購入MRR を +0.558% 向上させ、ATCポジションを 1.571% 低減させ、検索スクロール深さを 1.866% 低減させた。これは、ユーザーがより少ない労力で、より早く購入可能な製品に到達できたことを示している。
意義
本論文は、共有されたセマンティック製品階層が、各アプリケーションに必要なタスク固有のコンテキストを保持しながら、レコメンデーションと検索の両方を効果的にサポートできると主張している。階層の構築(カタログコンテンツに基づく)をその適用(行動コンテキストに基づく)から切り離すことにより、システムは、二つのシステムのモデルパラメータや学習目的を共有することなく、クロスマーチャントの嗜好転送と、粗から細へのクエリナビゲーションを可能にする。このアプローチは、マルチマーチャントのeコマース環境における行動エビデンスの断片化に対する、スケーラブルな解決策を提供するものである。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録