← 最新の論文
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

本論文は、多様な協調信号を用いてマルチモーダル大規模言語モデルを整列させ、多重的なアイテムおよびユーザー表現を生成することで、JD検索エンジンにおける電子商取引検索のランキング性能と効率を大幅に向上させる統一フレームワークであるMMRMを提案している。

原著者: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、何百万人もの人々が理想のジーンズを探し求めている巨大で超高速なデジタルモール(JD.comのような)を運営していると想像してください。彼らが求めるものを見つける手助けをするために、単に製品タグのテキストを読み取るだけでなく、画像を「見て」、スタイルを理解し、買い物客が正確に何を求めているのかを知っているスマートなアシスタントが必要です。

長い間、こうしたアシスタントには厄介な問題がありました。それは、一度に一つの特定のテストだけを勉強する学生のようなものでした。「検索」のために勉強すれば、テキストのクエリと製品を一致させることには長けていました。もし「カート」のために勉強すれば、人々がショッピングカートに何を入れたかを知ることに長けていました。しかし、一つの「スーパー学生」(汎用マルチモーダル大規模言語モデル)にこれらすべての異なるテストを同時に学ぼうとすると、通常は混乱した惨状を招きました。従来の手法は、単一の信号から一つの「スーパー学生」を学習させようとしたり、あるいは学生のノートを、特定のユーザーが次に何を欲しがるかを予測するのには役に立たない一般的な事実のリストとして扱ったりしていました。

この論文では、MMRM(Multiplex Multimodal Representation Model)と呼ばれる新しいシステムを紹介しています。これは、一つのハイテクなキッチンと、四つの専門的なレシピ本を持つマスターシェフのように振る舞うことで、この問題を解決します。

大きなアイデア:一つのキッチン、四人の専門シェフ
あらゆるタスクに対して四つの別々のキッチン(モデル)を構築する代わりに、MMRMは一つの共有された「バックボーン」(キッチンそのもの)を使用しますが、そこに四つの特別な「帽子」またはトークン、すなわち [SEARCH][CLICK][CART][ORDER] を与えます。

これは、多才な俳優のようなものです。彼らが [SEARCH] の帽子を被ると、テキストのヒントと製品を一致させる探偵として振る舞います。[CLICK] の帽子に切り替えると、人々がどのアイテムを一緒に購入するかを知っているスタイリストとして振る舞います。魔法は、彼がステージを離れることなく、瞬時に帽子を切り替えられることです。一つのキッチンを通る単一の行程の中で、モデルは四つの異なる種類のヒント(信号)から同時に学びます。

  1. 検索クリック: 誰かが「ジーンズ」と入力して結果をクリックしたとき。
  2. クリックセッション: 誰かが次々とアイテムをクリックしていくとき。
  3. カートセッション: 誰かが一連のアイテムをカートに追加するとき。
  4. 注文セッション: 誰かが実際に一連のアイテムを購入したとき。

著者らは、これらの信号が非常に異なっていることを発見しました。検索クリックは広範な「興味がある」というサインであるのに対し、注文セッションは「この特定の組み合わせが本当に欲しい」というサインです。これらの違いを無視してすべてを同じものとして扱うと、従来のモデルは重要な要素を見逃してしまいます。しかし、MMRMはこれら四つすべてを同時に学習し、それぞれが異なる仕事に適した、四つの異なる「表現」(あるいはメンタルマップ)を作成します。

「マルチプレックス・ユーザー戦略」
これら四つの異なる製品マップを手に入れた後、モデルはそれが「あなた」が何を求めているのかを判断する必要があります。論文では、全員に対して一つの汎用的なマップを使うことはできないと主張しています。代わりに、MMRMは「マルチプレックス・ユーザー表現」戦略を使用します。

あなたがブラウジングしていると想像してください。システムはあなたの履歴を確認します。もしあなたが検索している最中なら、システムは [SEARCH] マップを使用して、あなたがクリックしたアイテムに似たものを探します。もしあなたがカートを作っている最中なら、システムは [CART] マップに切り替えて、どのようなものが通常一緒に購入されるかを確認します。それは、まるでウィンドウショッピングをしているのか、それとも購入の準備ができているのかによって、戦略を変えるパーソナルショッパーがいるようなものです。彼らはあなたの特定の行動シーケンスを取り込み、それを製品の正しい「帽子」と照合することで、高度にパーソナライズされたレコメンデーションを作成します。

彼らが否定したもの
この論文は、二つの一般的なアプローチに対して明確に反対しています。

  1. 単一の信号のみを使用すること: 彼らは、検索データ(あるいはカートデータ)のみでモデルを訓練すると、他の重要な関係性に盲目になることを示しています。一つを選んで他を無視することはできません。
  2. 「ワンサイズ・フィット・オール」の埋め込み: 単一の汎用的な製品説明を取り、それをランキングモデルにそのまま詰め込むことは、マルチタスクのシナリオではうまくいかないことを彼らは発見しました。それは「埋め込みの絡まり(embedding entanglement)」を引き起こし、検索クエリとカートの予測に対して同時に同じメモを使おうとするため、モデルを混乱させます。MMRMは、各タスクに対して表現を分離(デタングル)しておくことで、これを拒絶します。

証明:現実の数字、現実の結果
著者らは単に推測したのではなく、大規模なスケールでテストを行いました。

  • 学習データ: 彼らは、検索用に6か月間で収集された 0.3 億 のトリプレット(関連する3つのアイテムのグループ)を含む巨大なデータセットを使用し、カートや注文の行動についてはさらに大きなデータセット(注文については最大 3 年 分のデータ)を使用しました。
  • モデル: 彼らは、8 台の NVIDIA H800 GPU を使用して、40 億パラメータ のモデル(非常に大規模な AI)を訓練しました。
  • 結果: テストにおいて、MMRM はすべての従来の「シングルタスク」モデルおよび、この特別な帽子システムを使用していない「マルチタスク」モデルを上回りました。
  • 現実世界への影響: 彼らはコンピュータ上のシミュレーションに留まりませんでした。彼らはこのシステムを実際の JD.com の検索エンジンに導入しました。数百万人のデイリーユーザーがいる中で行われた一週間のテストにおいて、新しいシステムは以下の項目を改善しました。
    • クリック率(CTR)を 0.42% 向上
    • カート追加率(ACR)を 0.37% 向上
    • コンバージョン率(CVR)を 0.35% 向上

著者らは、これらのパーセンテージは小さく見えるかもしれないが、数百万人規模のプラットフォームにおいて、わずか 0.10% のリフトアップであっても莫大な収益増につながることを指摘しています。これらの実証された成果により、このシステムは現在完全に稼働しており、何百万人もの人々が製品を見つける手助けをしています。

要約すると、MMRMは、AIがいかにしてショッピングを理解するかを教えるための、よりスマートで柔軟な方法です。それは、「器用貧乏(多くのことをこなすが、どれも中途半端)」になろうとするのではなく、一つの効率的な脳に四つの専門的なモードを持たせることで、「多才な達人」になるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →