Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation
本論文は、受動的なランキングを、3層構造によるリアルタイムかつ対話的な共同キュレーションへと置き換えるLLMベースのエージェントシステムであるShape Your Feed(SYF)を紹介し、オフラインのアライメント精度と大規模なオンラインA/Bテストの両方を通じて、フィードの関連性とユーザーセンチメントにおける大幅な向上を実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのスマートフォンが、動画や投稿、ストーリーといったコンテンツが提供される、魔法のような無限のビュッフェ形式のレストランだと想像してみてください。そこでは、非常に忙しい「見えないシェフ」が料理を振る舞っています。長年、このシェフはあなたが以前食べたものだけを頼りに、あなたが何を好むかを暗闇の中で推測してきました。もしあなたが猫の写真の前で立ち止まれば、シェフは「もっと猫が見たいのだろう」と判断します。もしレシピをスクロールして飛ばせば、「料理には興味がないのだな」と判断します。これは「パッシブ・ランキング(受動的な順位付け)」と呼ばれます。この方法は推測には優れていますが、あなたの「声」を聞くことができないため、的外れになることがよくあります。あなたが本当にその猫を見たかったのか、それとも単に自分の猫を愛でるために立ち止まっただけなのか、シェフには分からないのです。
最近、大規模言語モデル(LLM)と呼ばれる新しいテクノロジーが登場しました。これらは、単にあなたが何をクリックしたかだけでなく、あなたが何を「言った」かをも理解できる、非常にスマートで話し好きなアシスタントのようなものです。彼らはあなたの声を聴き、テキストメッセージを読み、あなたの気分やニュアンスさえも理解できます。推薦システムの開発者たちが直面している大きな問いは、「この話し好きなアシスタントにキッチンを引き継ぐことができるだろうか?」ということです。私たちに「実は今日は猫には飽きたから、宇宙の事実をいくつか持ってきて」と言えるようにし、シェフが即座にメニューを変更できるようにできるでしょうか? これが「対話型レコメンデーション(Conversational Recommendation)」という挑戦です。つまり、あなたの好みを推測するシステムから、あなたの注文に耳を傾けるシステムへの移行です。
「Shape Your Feed」システム:耳を傾けるシェフ
研究論文の中で、Metaのチームは「Shape Your Feed (SYF)」と呼ばれる新しいシステムを紹介しています。彼らは、シェフがただ推測するだけでなく、あなたの直接的な指示に基づいて、リアルタイムで耳を傾け、学び、メニューを調整するデジタルキッチンを構築しました。SYFは、ユーザーが「低評価」をクリックするのを待つだけの受動的なシステムではなく、「エージェンティック(代理的)」なシステムです。これは、賢いアシスタントのように、あなたの代わりにアクションを起こすことができる、という少し専門的な言い方です。
研究者たちは、おしゃべりなAIと従来のレコメンデーションエンジンを組み合わせることで、より「あなた専用」と感じられるフィードを作成できることを発見しました。ユーザーがシステムに話しかけたり、スマートボタンを使って望むものを正確に伝えたりできる場合、システムはより適切なコンテンツを表示できることが示されました。
魔法はどう起きるのか:3つのフローを持つキッチン
SYFシステムは、それぞれ特定の役割を持つ3つのチームのように機能します。
1. パーセプション・フロー(耳と脳)
これはシステムがあなたの声を聞く場所です。あなたは「料理の動画をもっと見たいけど、辛い料理はなしで」と入力したり、「政治の話は減らして」と声に出したり、「このトピックには飽きた」というスマートボタンをタップしたりできます。パーセプション・フローは、これらの乱雑で人間らしい指示を取り込み、明確で整理された「セマンティック・プロファイル(意味論的プロファイル)」へと変換します。これは、シェフがあなたのとりとめもない注文をもとに、整然とした買い物リストを作成するようなものです。システムはあなたの履歴を記憶しており、昨日「政治はなし」と言い、今日「テックをもっと」と言えば、その通りにリストを更新します。さらに、あなたが話している間に、新しい「材料」(動画や投稿)を静かに集めに行きます。
2. サービング・フロー(盛り付けと配膳)
リストの準備ができたら、サービング・フローが引き継ぎます。システムが通常表示する膨大なコンテンツの山(候補プール)を見渡し、シェフの新しい買い物リストに基づいて以下の作業を行います。
- 追加: 新しい関心に一致する新鮮なアイテムを取り込む。
- 削減: あなたのルールに違反するもの(禁止した政治的な投稿など)を排除する。
- 再ランク付け: プレートの順番を並べ替え、リクエストされたものが一番上にくるようにする。
重要なのは、これが非常に高速に行われることです。システムは単に推測するのではなく、あなたの新しいリクエストによって順位をどれほど変えるべきかを決定するために、スマートなスコアリング手法を使用します。これにより、あなたの新しい要望と、システムが元々持っている「あなたの好み」の知識を融合させ、少しの変化を求めただけでお気に入りのコンテンツがすべて消えてしまうという事態を防ぎます。
3. セルフ・エボリューション・フロー(味見係)
これはシステムが時間をかけて賢くなっていく部分です。システムはあなたに食事を提供した後、あなたの行動を観察します。あなたは新しい料理動画を食べましたか? それともテック系の投稿を捨てましたか? また、システムは「判定用AI」のチームを使用して、自身の決定が適切であったかをチェックします。もしシステムが間違いを犯した場合、そこから学びます。研究者たちは、味を完璧にするために厳しいフードクリティック(食通の批評家)と共に練習するシェフのような手法として、「直接選好最適化(DPO)」という技術を用いました。このループにより、システムは一度指示に従うだけでなく、毎回指示に従う精度を高めていくことができます。
分かったこと:答えはプディングの中にある(結果は明白である)
研究者たちは単にシステムを構築しただけでなく、それが実際に機能するかどうかをテストしました。
オフライン・テスト(練習試合)
まず、投稿がリクエストに一致しているかを判断する「アライメント・スコアリング」モジュールをテストしました。彼らは、いくつかの例に基づいて推測する古い手法と比較しました。
- 古い「フューショット(数例学習)」手法は、決定の約**83.84%**を正解しました。
- 彼らの新しいシステムは、判定用AIによるトレーニングと、実際のユーザーデータを用いた微調整(SFT + DPO)を経て、決定の**98.85%**を正解しました。
- さらに、これは驚異的な速さで行われ、リスト内のアイテムをスコアリングするのにわずか323ミリ秒しかかかりませんでした。これは、スマートフォンの動作を遅延させないのに十分な速さです。
オンライン・テスト(本番の食事)
次に、米国とカナダの実際のユーザーに対して、数ヶ月間にわたりSYFを展開しました。ユーザーを2つのグループに分けました。一方は従来の静的なシステムを使用し、もう一方は新しい「Shape Your Feed」システムを使用しました。
- ユーザーは新しいコントロールを支持しました: 従来の固定されたボタンと、新しい「コンテキスト認識型フィードバック・ピル(見ている内容に応じて変化するスマートボタン)」のどちらかを選択できる場合、**76.02%**のユーザーが新しいスマートなボタンを選びました。
- 嫌悪感の減少: 新しいシステムは、ユーザーが投稿を非表示にしたり、低評価したりする割合を減少させることに成功しました。「投稿の非表示(Post Dismiss)」率は**1.70%低下し、「低評価(Post Dislike)」率は2.74%**低下しました。これは、システムがユーザーの望まないものをフィルタリングする能力が高まったことを意味します。
- 発見の増加: ユーザーは新しい関心を探索する機会が増え、「関心消費(Interest Consumption)」が**0.16%**増加しました。これは、システムが単に何かを隠しているのではなく、ユーザーが実際に好む新しいものを見つける手助けをしていることを示唆しています。
まとめ
この論文は、過去のクリックに基づいて好みを推測するだけのシステムから脱却できることを示しています。言葉を理解し、それに基づいて行動できるAIの層を加えることで、よりパーソナライズされ、ストレスの少ないフィードを作ることができます。研究者たちは、このアプローチが現実世界でも効果的に機能し、ユーザーをより満足させ、スキップしなければならないコンテンツの量を減らすことを証明しました。
しかし、著者らは、このシステムはあなたが「声を上げる」ことに依存している点に注意を促しています。もしあなたがシステムに何を望むかを伝えないのであれば、システムは以前のような受動的な推測へと戻ります。彼らは、将来のバージョンでは、よりプロアクティブ(先回り的)である必要があると考えています。例えば、ユーザーが退屈を感じる前に質問を投げかけるなど、フィードバックを与えるのが苦手な人々を助ける仕組みです。しかし現時点では、Shape Your Feedは、「耳を傾けるレコメンデーション・システムこそが、より優れたシステムである」ということを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。