← 最新の論文
🤖 AI

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

本論文は、単一モーダルモデルや汎用的な視覚言語モデルの限界を克服するために、Hybrid Semantic IDs、2段階の継続的事前学習戦略、およびハイブリッド推論ポストトレーニング・パイプラインを統合した、Qwenをベースとするネイティブな電子商取引マルチモーダル検索基盤モデルであるPailitao-MMSearchを紹介するものであり、タオバオ(Taobao)のプラットフォームにおいて最大+13.61%のGMV向上という顕著な商業的利益を達成している。

原著者: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xi
公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で無限に続くデジタルモールを歩いているところを想像してみてください。かつて、特定のシャツを見つけたいと思ったら、「赤いコットンTシャツ」のように、非常に具体的な説明を検索バーに入力しなければなりませんでした。もし、街で見かけた写真に合う靴を探したいと思っても、写真を撮って、コンピュータが自分の探しているものを推測してくれることを祈るしかありませんでした。長い間、コンピュータは専門化された労働者のようでした。ある労働者はテキストしか理解できず、別の労働者は画像のみを理解し、三番目の労働者は音声のみを理解していました。彼らは互いに会話をしませんでした。もし、画像と文章を混ぜて与えると、彼らは混乱し、言葉を無視したり、写真の詳細を見落としたりすることがよくありました。

一方で、写真を見てそれについて詩を書くことができる、超スマートな汎用コンピュータも存在します。しかし、これらのジェネラリストは、モールを訪れた「観光客」のようなものです。彼らは一般的な意味での「シャツ」が何であるかは知っていますが、「シルク混」と「コットン100%」の違いや、特定のカメラを買う人は通常特定のタイプのレンズも一緒に買うといったことは知りません。彼らには、ショッピングが実際にどのように機能するかという深い、インサイダーとしての知識が欠けています。科学者たちの大きな疑問はこうです。「どうすれば、優れた買い物上手(商品の細部や人々の好みを熟知している)であり、かつ優れた会話家(複雑で混合された指示を理解できる)であり、さらに思考する方法を忘れない単一の超スマートなコンピュータを構築できるのか?」ということです。

これこそが、Pailitao-MMSearchの開発チームが解決しようとした課題です。彼らは、eコマース専用に設計された新しい種類の「検索脳」を構築しました。画像と単語を別々のツールとして使うのではなく、写真を見、乱雑なテキストの説明を読み、瞬時に完璧な製品のリストを生成できる単一のモデルを作成しました。彼らは既存のモデルを微調整しただけではありません。彼らは製品について語るための新しい言語を教え、何百万ものショッピング習慣で学習させ、そして賢さを忘れないように、その推論スキルを注意深く磨き上げたのです。

問題点:「継ぎはぎ」のショップ vs 「観光客」のガイド

著者らは、現在のオンラインショッピングシステムが少し混乱していると指摘しています。ほとんどの大規模なストアは「継ぎはぎ」のアプローチを採用しています。もし写真で検索すれば、専用の画像検索エンジンが似た画像を探します。もし言葉を入力すれば、テキスト検索エンジンが一致するタイトルを探します。もし「これと同じ写真のような赤いドレスで、でも長袖のものが見つかるように」と言った場合、システムはあなたのリクエストを不器用にバラバラにし、それらを異なる作業者に送り、その後で結果を繋ぎ合わせようとします。これは遅くて複雑であり、画像と言葉がどのように「共に」機能するかをワーカーたちが理解していないため、しばしば本質を見失います。

あるいは、「観光客」のガイド(汎用AIモデル)もいます。彼らは世界を理解することには長けていますが、ショッピングモールの特定のルールを知りません。彼らは「シルク」と「サテン」が異なることや、スマートフォンのケースを買うユーザーはおそらくスクリーンプロテクターを探している可能性が高いといったことに気づかないかもしれません。また、彼らは数十億のカタログの中から特定の製品を直接指し示すことができません。通常、それを行うために別のツールを必要とするため、流れが途切れてしまいます。

解決策:製品のための新しい言語

これを解決するために、チームはPailitao-MMSearch、すなわちネイティブなeコマース検索基盤を作成しました。これは、モールの言語を流暢に話す新しい従業員を訓練することだと考えてください。

1. ハイブリッドID (HybSID): 「郵便番号」と「肖像画」
コンピュータに製品について伝える方法が最大の課題です。想像してみてください、あなたには数十億冊の本がある図書館があります。もし「フィクション - ミステリー」のような「郵便番号」だけを与えたら、膨大な本の山は手に入りますが、まさに欲しいその一冊を見つけることはできません。もし「肖像画」(詳細な記述)だけを与えたら、それらを効率的に整理するのが難しくなります。

チームはHybSID(ハイブリッド・セマンティックID)を発明しました。これは、すべての製品に一度に2つのIDを与えるようなものです。

  • 郵便番号 (離散コード): 製品を広いカテゴリー(例:「サマードレス」)にグループ化する、短くてシンプルなコードです。これにより、コンピュータは検索範囲を素早く絞り込むことができます。
  • 肖像画 (連続埋め込み): 青の正確な色合い、生地の質感、あるいは特定のブランドロゴといった微細なディテールを捉える、詳細で高解像度な製品の「肖像画」です。

これらを組み合わせることで、モデルは迅速に正しい製品の「近隣地域」を見つけ出し、その上でユーザーの具体的で曖昧な説明に一致する正確な一点を選び出すことができます。

2. 二段階のトレーニング:モールを学び、そして脳を維持する
汎用AIにショッピングの専門家になってもらうことはリスクを伴います。単に何百万もの製品説明を読み込ませると、普通の言葉を話したり論理的に推論したりする能力を忘れてしまう可能性があるからです。これは「破滅的忘却」と呼ばれます。

チームは巧妙な二段階のトレーニングプロセスを使用しました。

  • ステージ1 (インターンシップ): 彼らはモデルに、製品の詳細、ユーザーの閲覧方法、どのアイテムとどのアイテムが組み合わさるかといった、ショッピングに関するすべてを教えました。また、製品だけに執着しすぎないよう、通常の会話データも投入しました。
  • ステージ2 (メンターシップ): 彼らは、モデルが一般的な推論において少し「錆びついて」きていることに気づきました。そこで、元のスマートなバージョンのモデルを「メンター(指導者)」として使用しました。新しいモデルが一般的なタスクを練習する間、メンターがそれを見守り、モデルが思考力や複雑な指示に従う能力を失わないよう、優しく修正を行いました。これにより、最終的なモデルはショッピングの専門家でありながら、スマートな会話家でもあることが保証されました。

3. 推論エンジン:話す前に考える
ショッピングは常に単純なわけではありません。時には、「これに似たドレスがいいんだけど、ネイビーブルーで、結婚式に適したものにして」と言うこともあります。これは複雑なリクエストです。
チームは、難しい質問に対して**Chain-of-Thought(思考の連鎖)**による推論を使うようモデルに教えました。単に答えを推測するのではなく、モデルは問題を以下のように分解することを学びます。

  1. 写真を分析する: 「これは花柄のドレスだ。」
  2. リクエストを読む: 「色をネイビーに変え、スタイルをフォーマルに変える。」
  3. 一致するものを見つける: 「よし、ネイビーでフォーマルな花柄のドレスが必要だ。」
    単純な質問については、時間を節約するために思考をスキップして直接答えへと進みます。

結果:現実世界での成功

チームはこれをラボの中だけでテストしたわけではありません。彼らは、1日あたり数千万人のユーザーが利用するTaobaoのPailitaoプラットフォームにこれを導入しました。彼らは大規模なテスト(A/Bテスト)を実施し、一部のユーザーには従来の検索システムを、他のユーザーには新しいPoliatlo-MMSearchを提供しました。

結果は目覚ましいものでした。新システムは以下の向上をもたらしました。

  • 総販売額(GMV)の**13.61%**増加。
  • 取引件数の**8.21%**増加。

これは、コンピュータがあなたの意図(写真、言葉、そしてショッピング習慣の組み合わせ)を真に理解したとき、あなたが求めるものを正確に見つける手助けとなり、結果としてより多くの購入につながることを示唆しています。

次なるステップは?

著者らは、このシステムはまだ完璧ではないと認めています。ユーザーが変な角度から撮ったぼやけた写真をアップロードしたり、タイポ(打ち間違い)だらけの文章を書いたりすると、モデルは依然として混乱することがあります。彼らは、こうした雑多な現実世界の状況に対しても、より優れた推論ができるようにモデルを改良していく計画です。また、このスマートな検索モデルが、服装を見つけ、天気をチェックし、それらを一度に注文するといったマルチステップのタスクを実行できる「自律的なショッピングエージェント」の「脳」として機能する未来も見据えています。

要約すると、Pailitao-MMSearchは、コンピュータが単にキーワードを一致させるだけでなく、あなたの意図、スタイル、そしてニーズを一つのシームレスな会話の中で真に理解する、ショッピング体験への一歩なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →