CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer
本論文は、LinkedInに導入されている、マルチタワー・ポストスコアリング・モデリングや自己ゲート型アテンションといった革新技術を通じて広告CTR予測における主要な課題を克服し、プロダクションのベースラインに対して11.04%のCTRリフトを達成した、コンテキスト条件付きデコーダーのみのトランスフォーマーであるCADETを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、研究論文の要約と、自動チェッカーによって発見された欠陥です。
=== 要約 ===
巨大で賑やかなデジタルマーケットプレイスを歩いているところを想像してみてください。毎秒、何千ものデジタル看板があなたの目を引こうと点滅しています。ある看板は靴の広告、あるのは求人、またあるのはコーヒーの広告です。このマーケットプレイスを運営している人々には難しい仕事があります。それは、あなたが実際に足を止めて見る前に、どの看板に目が留まるかを予測することです。この予測ゲームは「クリック率(CTR)」予測と呼ばれます。長い間、最高の予測器たちは、あなたの過去の習慣と看板の詳細なリストを見て計算を行う、非常に賢い会計士のような存在でした。しかし最近、映画や音楽のレコメンデーションなど他の分野で、新しい種類の「生成型」AIが登場し始めました。これらの新しいAIは、単に数字を処理するのではなく、あなたのこれまでの行動という一つの「物語」を読み解き、次に何が起こるかを予測するストーリーテラー(語り手)のようなものです。マーケットプレイスのオーナーにとっての大きな疑問は、「ゲームのルールが予測の後で変わったとしても、この新しい『ストーリーテラー』AIを使って、どの広告にあなたがクリックするかを予測できるのか?」ということでした。
これは、LinkedInのチームが、CADETと呼ばれる新しいシステムを用いて解決しようとした課題そのものです。彼らは「デコーダーのみのトランスフォーマー(decoder-only transformer)」を構築しました。これは、簡単に言えば、一連のイベント(過去のクリックや閲覧など)を読み取り、一つのスムーズなプロセスで未来を予測するAIを作成したことを意味します。しかし、広告は一筋縄ではいきません。映画のレコメンデーションとは異なり、広告の成功は、AIが予測を行った「後」に判明する要素、例えば画面上のどこに広告が表示されるかといったことに左右されます。もしAIが、広告がページの上部ではなく下部に表示されることを知らなかったために予測を誤った場合、システム全体が混乱してしまいます。
研究者たちは、AIに特別なツールセットを与えることで、このパズルを解けることを発見しました。彼らは、広告がどこに配置されるかという「もしも」のシナリオを想像するようにモデルを教え、ノイズや混乱を招く情報からAIを遠ざける「ボディーガード」として機能する「セルフゲーティング(自己制御)」メカニズムを構築しました。また、AIに特別な「時間の感覚」を与え、5分前のクリックと5ヶ月前のクリックは異なるものであることを理解させました。最も重要なのは、トレーニング中に、現実世界では持ち得ない情報を使用しないように徹底したことです。この新しいシステムを実際のLinkedInのマーケットプレイスでテストしたところ、単に機能しただけでなく、彼らが置き換えた古い複雑なシステムよりも大幅に優れたパフォーマンスを発揮しました。新しいAIは、ユーザーが広告をクリックする確率が11.04%高まると示唆しており、統一されたストーリーテリングのアプローチが、従来の多機能なシステムを凌駕できることを証明しました。
CADETの物語:広告のためのストーリーテラー
では、彼らはどのようにしてこれを構築したのでしょうか?CADET(Context-Conditioned Ads Decoder-Only Transformer)の魔法を、シンプルで日常的な概念に分解してみましょう。
「鶏と卵」の問題
あなたがシェフで、顧客が食事をどれくらい楽しんでくれるかを予想しようとしていると想像してください。しかし、ここでの落とし穴は、テーブルがどこに設置されているかを知る前に、楽しみ具合を予想しなければならないということです。もしテーブルがキッチンのすぐ隣にあれば、顧客は空腹で興奮しているかもしれません。もし暗い隅の方にあれば、彼らは不機安を感じているかもしれません。広告の世界において、「テーブル」とは画面上の広告の位置のことです。AIはあなたが広告をクリックするかどうかを予測しなければなりませんが、その広告が画面の最上部にあるのか、それともずっと下部にあるのかをまだ知りません。これが「鶏と卵」の問題です。予測は位置に依存しますが、位置もまた予測に依存するのです。
CADETは、「もしも」のシナリオの達人になることでこれを解決します。単一の予測を行う代わりに、複数の「予測ヘッド(prediction heads)」(キッチンにいる異なるシェフと考えてください)を持っています。一人のシェフは、「もしこの広告が上部にあったら、あなたはクリックしますか?」と予想します。別のシェフは、「もし下部にあったら、あなたはクリックしますか?」と予想します。モデルはこれらすべての答えを一度に生成することを学習します。実際に広告が配置されるとき、システムは場所について正解したシェフの答えを選ぶだけです。こうすることで、AIは広告がどこに配置されるかという謎によって混乱することがありません。
ボディーガード(セルフゲーテッド・アテンション)
混雑した部屋では、時として一人の大きな声が他の全員をかき消してしまうことがあります。AIの世界では、これは「アテンション・シンク(注意の沈み込み)」と呼ばれ、モデルが特定のトークン(データの断片)に集中しすぎて他の情報を無視してしまい、予測を誤る現象を指します。研究者たちは、CADETにセルフゲーテッド・アテンション・メカニズムという「ボディーガード」を与えました。
AIの脳を、忙しい廊下だと考えてみてください。情報が通過しようとするたびに、ボディーガードがそれをチェックします。もし情報がノイズであったり、あまり役に立たないものであったりする場合、ボディーガードはその光を弱め(ゲートダウン)、モデルの邪魔をしないようにします。もし情報が重要であれば、ボディーガードはその光を輝かせます。これは二段階で行われます。一つは情報が最初に到着したとき(表現レベル)、もう一つはAIが異なる情報の断片同士を繋ぎ合わせようとするとき(相互作用レベル)です。これにより、トレーニングがスムーズかつ安定し、AIが暴走したり、悪いパターンに固執したりするのを防ぎます。
タイムマシン(タイムスタンプRoPE)
ほとんどのAIモデルはステップを数えます。「ステップ1、ステップ2、ステップ3」といった具合に。しかし、現実世界では、時間は単なるステップではなく、「いつ」起きたかが重要です。10秒前に起きたクリックと、10ヶ月前に起きたクリックは全く別物です。
CADETは、**タイムスタンプに基づく回転位置エンコーディング(Timestamp-based Rotary Positional Embedding: RoPE)**という特別な「タイムマシン」を使用しています。ステップを数える代わりに、AIはすべてのイベントの実際の時刻(Unixタイムスタンプ)を見ます。これにより、AIは二つのイベント間の間隔が短い(数秒間など)のか、あるいは長い(数ヶ月間など)のかを理解できます。これは、人間の行動が時間の経過とともに変化することをモデルに認識させるのに役立ちますます。昨日求人広告をクリックしたなら、今日もまだ興味があるかもしれませんが、6ヶ月前にクリックしたなら、おそらくもう興味はないでしょう。この「時間感覚」により、AIは直近の瞬間から長期的なトレンドまで、異なるスケールにわたるパターンを学習することができます。
「カンニング禁止」ルール(セッション・マスキング)
AIをトレーニングするとき、学生のように学ばせたいのであって、カンニングをさせたいのではありません。現実世界では、広告が表示されたとき、システムは即座にあなたがそれをクリックしたかどうかを知ることはできません。データが転送されるまでのわずかな遅延(数秒や数分)があります。もしAIが、本来見るべきではないタイミングでクリックの結果が見えてしまうようなデータでトレーニングされると、不適切な学習をしてしまいます。AIは「あ、結果を見たからクリックされたことがわかったぞ!」と考えてしまいますが、現実世界ではその情報は手に入りません。
これを防ぐために、研究者たちは**セッション・マスキング(session masking)**を採用しました。先生がテストの解答用紙を隠している様子を想像してください。トレーニング中、AIは「その瞬間に利用可能であった情報」のみを見るように強制されます。もし30秒後にクリックが発生したとしても、現在の時点のトレーニングにおいて、AIはそのクリックに対して盲目となります。これにより、AIが実世界(オンライン・サービング)に出たときに、実際には見ることができない情報に頼ってしまい、混乱したり誤った予測をしたりすることがなくなります。
スピードアップ(プロダクション・エンジニアリング)
最後に、スマートなAIを作ることは一つのことですが、それを毎日数十億件の広告を処理できるほど高速にすることはまた別の問題です。チームはいくつかの巧妙なエンジニアリング技術を用いました。データを隙間なく詰め込み、スーツケースを整理するように無駄なスペースをなくすことで、トレーニングを大幅に高速化しました。また、カスタムの「FlashAttention」エンジン(特殊なソフトウェア部品)を構築し、数百の広告を一つずつチェックするのではなく、一度の高速なパスで一括してスコアリングできるようにしました。
結果:LinkedInにおける大きな勝利
チームがLinkedInのメインフィードでCADETをテストした際、その結果は驚くべきものでした。彼らは、自分たちの古い、高度に最適化されたシステム(複数の異なるモデルが連携して動く仕組み)と比較しました。新しいCADETモデルは、単に旧システムと同等の性能を示すだけでなく、圧倒的な差をつけました。
大規模なオンラインテストにおいて、CADETは従来のシステムと比較して11.04%のクリック率向上を達成しました。これは、100件の広告が表示されるごとに、より多くの人が足を止めて注目したことを意味します。興味深いことに、LinkedInの広告主は通常、予算を自動的に使い切るため、総支出額は大きく変わりませんでしたが、クリックの「価値」は向上しました。クリック単価(CPC)は10.9%低下しており、これは広告主にとって投資に対するリターンが高まったことを意味します。
この論文は、この成功が、統一された「ストーリーテリング」AIと、広告特有の問題(位置や時間など)に対するスマートな修正策を組み合わせたことによるものであると示唆しています。これは、単一の、よく設計されたモデルが、複雑な旧式のモデル群を打ち負かせることを示しています。研究者たちは、さらに多くの「もしも」のシナリオを扱うといった課題が残っていることも認めていますが、彼らの研究は、デコーダーのみのトランスフォーマーがオンライン広告の世界で主導権を握る準備ができていることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。