← 最新の論文
💬 NLP

Douyin Multimodal Embedding Model Technical Report

本論文は、大規模な対照学習による事前学習と、根拠に基づいた推論および相互条件再構成のための新たな学習時メカニズムを組み合わせることで、オンライン推論速度を損なうことなく微細なマルチモーダル識別を実現し、最先端の性能とプロダクション効率を達成する2段階学習モデルであるDouyin Multimodal Embedding (DME) を導入する。

原著者: Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、干し草の山の中から特定の針を探そうとしていると想像してください。しかし、その干し草の山はインターネット全体であり、針は動画、写真、文書、あるいはそれらの混合物かもしれません。これが、現代の検索エンジンやレコメンデーション・システムが直面している日常的な現実です。これを可能にするために、コンピュータは**マルチモーダル・エンベディング(多峰性埋め込み)**と呼ばれるものを使用します。これは、目で見たり、読んだり、視聴したりするあらゆるものを、単一のコンパクトな「指紋」(ベクトル)へと変換する、魔法の翻訳者のようなものです。あなたが「帽子をかぶった猫」と検索するとき、システムは言葉を読み取るのではなく、あなたのリクエストを指紋へと変換し、データベース内にあるその指紋と似ている他の指紋を探し出します。

長い間、これらのシステムには難しい選択肢がありました。彼らは、高速ではあるが愚かな、大まかな類似性は素早く見つけられるものの、実際に重要な微細なディテールを見落としてしまうシステムか、あるいは、賢い遅い、答えを出す前にあらゆる詳細をじっくりと考えすぎてしまい、何十億ものユーザーがアプリをスクロールしている中では遅すぎるシステムか、という選択を迫られてきました。この論文は、まさにその問題に取り組んでいます。つまり、どのようにすれば、検索エンジンを驚異的な速さと並外れた精度を兼ね備え、二つの非常に似た動画や文書の違いを見分けることができるように構築できるのか、という問題です。

ByteDanceのDouyinチームと中国人民大学の研究者たちは、Doukin Multimodal Embedding (DME) と呼ばれる新しいモデルを紹介しています。彼らは、従来の検索をより「賢く」しようとする試みの多くが失敗してきた理由は、コンピュータに答えを出す前に長い説明(ステップ・バイ・ステップの推論チェーンのようなもの)を書かせようとしたからだと主張しています。これは答えの質を高めますが、実社会での利用には遅すぎます。代わりに、DMEは、モデルが「話さずとも賢い」超スマートな指紋作成者になれるよう、巧妙な2段階のトレーニングプロセスを用いて教えていきます。

まず、モデルは膨大な「ブートキャンプ」(ステージ1)を経て、従来の高速な検索エンジンのように、テキスト、画像、動画、文書といった数十億通りの異なるコンテンツを一致させる方法を学びます。これにより、世界に対する幅広い理解が得られます。次に、ステージ2で、モデルは特別なアップグレードを受けます。研究者たちは、モデルに2つの秘密のトリックを教えます。1つ目は、**「エビデンスに基づいた潜在的推論(Evidence-Grounded Latent Reasoning)」**です。これは、長い報告書を書くのではなく、代わりに、意見を形成する前に最も重要な手がかり(看板の特定のテキストや動画の一フレームなど)に集中するための、小さく目に見えないチェックリストを持っている探偵を想像してください。DMEは、検索を遅らせることなく、隠れた空間の中で思考を整理することで、これを内部的に実行します。

2つ目のトリックは、**「相互条件付き再構成(Cross-Conditional Reconstruction)」**です。これは記憶ゲームのようなものです。モデルは、動画の「指紋」を見て、その動画のテキストによる説明をゼロから「再構築」するように訓練されます。もし説明をうまく再構築できれば、その指紋にすべての必要な詳細が含まれていることが証明されます。これにより、モデルは指紋により多くの情報を詰め込むようになり、検索結果を真に適切なものにするための微細なディテールを逃さないように強制されます。

結果は目覚ましいものです。主要なテストであるMMEB-v2において、DMEは20億および90億パラメータのバージョンでトップスコアを記録し、同規模の他のモデル、特に動画や視覚的文書の検索といった難しい領域において、それらを打ち負かしました。しかし、本当のテストは実世界にありました。Douyinに導入された際、DMEはオフラインテストで全体的な検索品質を2.92%向上させ、ライブオンラインテストではユーザーエンゲージメントを0.1%向上させました。極めて重要なのは、これらすべての知能が、クエリあたりの遅延を1ミリ秒未満に抑えたまま実現されたことです。

この論文は、単純なエンコーダーの速度と、深い理解を持つ推論モデルを組み合わせることで、DMEが効率性と精度の間の長年のトレードオフを解決したことを示唆しています。コンピュータに「話す」ことを強いることなく、思考させることは可能であると証明しています。時には、最善の推論は、指紋の中に隠された、静寂の中で行われるものなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →