Decoupled Temporal Encoding for Generative Recommendation
本論文は、広範な時間的パターンを捉えるパーソナライズされたマクロ時間モジュールと、密な局所的相互作用を捉えるタイムゲート型マイクロシーケンシャルモジュールの2つの相補的なモジュールを通じて、時間的ダイナミクスをアイテムの順序から分離することにより既存の手法を改善する、生成型レコメンデーションのための軽量なフレームワークであるDecoupled Temporal Encoding (DTE) を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
デジタル世界において、レコメンデーションシステムは、次に何を見るべきか、何を買うべきか、あるいは何を食べるべきかを提案することで、私たちの日常生活の静かなキュレーターとして機能しています。長年、これらのシステムは、シーケンス(順序)の理解に長けた「Transformer」として知られる強力な人工知能の一種に依存してきました。ユーザーの履歴を一つの物語と考えてみてください。システムは、その人がこれまでにインタラクションしたアイテムの「章」を読み解くことで、次の章を予測します。物語を理解するためには、AIは単に「何が」起きたかだけでなく、「いつ」、そして「どのような順序で」起きたかを知る必要があります。AIにこの順序感覚を教えるための標準的な手法は、言語モデルから借用されたもので、リスト内のすべてのアイテムを、文章の中の単語のように、シーケンスにおける単純なステップとして扱ってきました。しかし、現実世界における人間の行動は、単純なリストよりもはるかに複雑です。それは時計、カレンダー、そして日常生活のリズムによって形作られます。ランチタイムの空腹感、週末のショッピング習慣、あるいは突然のセールに対する反応などは、標準的な手法では単純なイベントの順序とともに捉えることが困難な、時間的なパターンなのです。
AlibabaのRajax Network Technologyの研究者たちは、Taobaoアプリのフードデリバリーおよび即時小売サービスという高圧的な環境の中で、これらのシステムが時間の理解において生じているギャップを特定しました。彼らは、ユーザーの行動が、しばしば混ざり合ってしまう2つの異なる力によって駆動されていることを観察しました。一つは、時間の広範で大きなコンテキスト(文脈)です。つまり、今日は火曜日であること、今はランチタイムに近いこと、あるいは特定のショップに急激なトラフィックの増加が発生しているといった事実です。もう一つは、緊密で即時的なアクションのシーケンスです。ユーザーが数分間のうちに、ヌードルショップをクリックし、次に飲み物、次にデザートをクリックしたという事実です。既存のシステムは、これら両方の信号を単一の統一されたチャネルを通じてAIに送り込もうとしていました。それは、風速だけを測定して、雨については無視することで嵐を説明しようとするようなものです。このアプローチでは、その日の全体的なムードと、ユーザーがその瞬間にしている具体的な、立て続けの選択とを区別することが困難でした。
この問題を解決するために、チームは「Decoupled Temporal Encoding(分離型時間エンコーディング)」と呼ばれる新しいフレームワークを開発しました。AIに時間と順序を同じソースから学習させるのではなく、彼らは調和して機能する2つの独立した軽量なモジュールを構築しました。第一のモジュールは「マクロ・テンポラル・エンコーダー(広域時間エンコーダー)」と呼ばれ、大局的な側面に焦点を当てます。これは、時刻、曜日、および前回のインタラクションからどれだけの時間が経過したかをAIに伝えるためのコンパクトな信号をシステムに注入します。これにより、モデルは、金曜日の午後7時に夕食を注文するユーザーが、月曜日の正午にランチを注文するユーザーとは異なる心理状態にあることを理解できるようになります。第二のモジュールである「マイクロ・シーケンシャル・エンコーダー(微細シーケンス・エンコーダー)」は、細部を扱います。これはゲートキーパーとして機能し、タイムスタンプだけでは情報の境界が曖昧になるほどインタラクションが急速に発生した場合にのみ、イベントの厳密な順序を強調するために介入します。ユーザーが短時間にいくつかのアイテムを次々とクリックする場合、このモジュールは、単にそれらが近い時間に行われたという事実だけでなく、それらのクリックの正確なシーケンスにAIが注意を払うようにします。
研究者たちは、Taobaoアプリからの数十億件のインタラクションを含む大規模なデータセット、およびビデオレコメンデーションの公開ベンチマークを用いてこのアプローチをテストしました。結果として、これら2種類の時間情報を分離することが、ユーザーが次に何を欲するかを予測するシステムの能力を大幅に向上させることが示されました。オフラインテストにおいて、この新しい手法は従来のあらゆる最先端モデルを上回り、クリック予測の精度を高め、エラーを減少させました。決定的なことに、チームは、ユーザーが定期的なランチの注文など、明確で繰り返されるパターンを持っている場合や、インタラクションが非常に密集している場合に、このシステムが最も効果的に機能することを発見しました。AIの内部のアテンション・パターンに関する分析により、システムは即時のシーケンスを見失うことなく、周期的な習慣を強化することを学習したことが明らかになりました。
この研究の真の試練は、チームがこのシステムをTaobaoアプリのライブトラフィックにデプロイした際に訪れました。数百万人の実際のユーザーを対象とした厳格な3週間の実験において、新しい手法は測定可能なビジネス上の改善をもたらしました。システムへの応答遅延をほとんど増やすことなく、クリック率を1.8パーセント、1,000インプレッションあたりの収益を3.0パーセント向上させました。これらの利得が一貫しており、システムが安定していたため、同社は2026年1月にShangou広告レコメンデーションシステムへのトラフィックの100パーセントに対してこのアップデートをロールアウトしました。このデプロイメントは、時間の広範なコンテキストを具体的なアクションの順序から切り離すことで、レコメンデーションシステムが人間の生活の複雑でリズムのある性質により適応でき、単にタイムリーなだけでなく、真にパーソナルな提案を提供できることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。