← 最新の論文
🤖 AI

Navigating User Behavior toward Personalized Multimodal Generation

本論文は、行動のエンコーディングと指示作成における課題を克服するために、二重の識別子と二段階のSFT+RLパイプラインを採用することで、ユーザーのインタラクション履歴をパーソナライズされたマルチモーダル生成のための実行可能な指示へと変換するフレームワークであるNaviGenを提案する。

原著者: Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

公開日 2026-06-24
📖 1 分で読めます☕ さくっと読める

原著者: Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの手元には、あなたの指示に基づいて美しい絵を描いたり、素晴らしい動画を作成したりできる、非常に才能豊かでハイテクなアーティスト(AI)がいます。問題は、このアーティストが極めて「字義通り」に受け取ってしまうことです。もしあなたが「ファンタジーのシーンを描いて」と言えば、彼らはあなたの特定の好みに必ずしも一致しない、ありきたりなものを描くかもしれません。ほとんどの人はプロのアーティストではないため、自分の望むものを正確に伝えるために必要な、詳細で完璧な指示を書くことはできません。

大きな問題点:
私たちは、ユーザーが実際に好むもの(クリック、視聴、または購入したものに基づく)と、AIに指示を出すために必要な具体的な記述との間に、巨大なギャップを抱えています。ユーザーはめったに「夕暮れ時のローマのコロッセウムを、ボリュームメトリックフォグ(霧)と共にシネマティックなワイドショットで描いて」などとは言いません。彼らはただ、いくつかのクールな動画をクリックしたり、ゲームを購入したりするだけです。AIは、これらのクリックをどのようにして完璧な指示へと翻訳するかを理解する必要があります。

解決策:NaviGen
研究者たちは、あなたの過去の行動とAIアーティストとの間の「翻訳機」として機能する、NaviGen(Navigation + Generation)と呼ばれるシステムを開発しました。その仕組みを、簡単な比喩を用いて説明します。

1. デュアルIDシステム(「名札」と「履歴書」)

NaviGenは、あなたを理解するために、あなたが関わったすべてのアイテム(ゲームや動画など)に対して、2つの特別な「IDカード」を付与します。

  • 協調的識別子 (Collaborative Identifier: CID): これは行動の指紋のようなものです。「これを好んだ人は、あれも好む」ということを示すコードです。テキストを読み取ることなく、あなたの好みの「パターン」を捉えます。これは、AIに対して「このアイテムは『アドベンチャー』ファミリーに属している」と伝える秘密のコードのようなものです。
  • テキスト的識別子 (Textual Identifier: TID): これは凝縮された履歴書のようなものです。そのアイテムが実際にどのような内容であるかを示す、簡潔で整理されたキーワード(「ファンタジー」「ロマンス」「アクション」など)のリストです。

これらを組み合わせることで、NaviGenはAIに対し、コンパクトな「行動基盤(コード)」と「意味的な架け橋(キーワード)」を一つのパッケージとして提供します。これにより、AIは単に「何を」好きだったかだけでなく、「なぜ」それを好きだったのかを理解できるようになります。

2. 学習プロセス(「書き方」を学ぶ)

AIは、二つのことを学ぶ必要があります。すなわち、「ユーザーの好みを理解する方法」と「優れた指示を書く方法」です。NaviGenはこれを二段階で教えます。

  • ステージ1:教師あり微調整(「学習室」):
    このシステムは、**進化論的探索(Evolutionary Search)**と呼ばれる巧妙なトリックを使用します。想像してみてください。一連のライターたちが、ユーザーにとって完璧な指示を推測しようとしています。彼らはまず、3つの異なるスタイル(保守的、バランス型、探索型)からスタートします。彼らはアイデアを混ぜ合わせ(植物の交配のように)、「エディター(別のAI)」が次の世代の指示を作成するために、最も優れたものを選び出します。
    モデルは、これらの「進化した」指示から学びます。また、ユーザーの好みが「面白いエルフの動画」から「ロマンチックなアニメのシーン」へとどのように変化したのかを、「思考の連鎖(Chain-of-Thought)」を通じて説明しながら、そのプロセスを学びます。

  • ステージ2:強化学習(「ゲームショー」):
    指示を書けるようになった後、モデルはより上手くなるためにゲームを行います。モデルは以下の項目に対してポイント(報酬)を獲得します。

    • 正確性: 次にユーザーが好みそうなアイテムに対して、正しい「行動コード(CID)」を予測できたか?
    • 品質: 指示は具体的かつ創造的であり、かつ画像・動画生成器が実際に作成可能なものか?
    • 一貫性: 指示が予測されたアイテムと一致しているか、そして予測されたアイテムがユーザーの履歴と一致しているか?

3. 結果

研究者たちは、ショッピング(製品)ゲーミングショート動画という3つの異なる世界でテストを行いました。

  • より優れたアート: NaviGenが指示を書いた場合、生成された画像や動画は、他の手法による指示よりも、ユーザーの特定の好みに即しており、審美性が高く、かつ創造的でした。
  • より優れた予測: また、ユーザーが次にクリックするであろうアイテムを予測することにおいても優れており、ユーザーの「行動の指紋」を真に理解していることが証明されました。
  • 「アハ体験」の瞬間: あるケーススタディでは、ユーザーの履歴は「面白いエルフの動画」から「ロマンチックなアニメ」へと移行していました。他のシステムは単に「アニメ」としか認識しませんでしたが、NaviGenは「遷移」を捉え、「学生のカップルが登場するロマンチックなアニメのシーン」という指示を書き出しました。これは、ユーザーが実際に求めていたものに非常に近いものでした。

まとめ

NaviGenは、あなたが何を楽しんでいるかを観察し、あなたの隠れた好みのパターンを見抜き、そしてAIアーティストがあなたが心から愛するコンテンツを作り出すための、完璧で詳細なプロンプトを書き上げる「パーソナルアシスタント」のような存在です。それは、あなたの静かなクリックと、AIが魔法を生み出すために必要とする雄弁で詳細な指示との間の溝を埋めるものです。

注:本論文は、ユーザー行動に基づく画像および動画の生成にのみ焦点を当てています。医療診断、臨床療法、またはその他の非クリエイティブな用途に使用されることを主張するものではありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →