← 最新の論文
🤖 AI

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

本論文は、タスクへの適応と報酬ベースの最適化を分離することで、推薦のための基盤モデルをビジネス指標に効果的に適合させる、3段階の漸進的なポストトレーニング・フレームワーク(線形プロービング、フル・ファインチューニング、および強化学習によるファインチューニング)を提案しており、オフライン実験および大規模なオンラインA/Bテストの両方において優れた性能を実証している。

原著者: Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、本が言葉を返してくる巨大で魔法のような図書館に足を踏み入れたところです。これは単なる図書館ではありません。「基盤モデル(Foundation Model)」ライブラリーなのです。このモデルは、何十億もの物語を読み、人々がどのように本を探しているかを熟知している、超スマートで経験豊富な旅慣れた司書だと考えてください。この司書は、物語の一般的なルールや人間の好奇心の仕組みをすでに学習しています。しかし、ここからが厄切なところです。司書が「本を見つける方法」を知っているからといって、それが「図書館のオーナー」が本当に望んでいることまで知っているとは限らないのです。オーナーは、人々がどれだけ本を手に取ったかではなく、どれだけ長く図書館に滞在したか、あるいはどれだけの人が有料会員になったかということを重視しているかもしれません。

コンピュータサイエンスの世界、特に「レコメンデーション・システム(推薦システム)」においては、これが日常的な苦闘となっています。私たちは、非常に優れた事前学習済みAIモデル(司書)を持っていますが、彼らはあなたが次に何をクリックするかを予測することには長けています。しかし、ビジネスが求めているのはクリック以上のものです。例えば、コミックのシリーズを最後まで読み切るような深いエンゲージメントや、プレミアムコンテンツへの課金などです。問題は、「クリック」の信号は至る所にあり簡単に見つけられる一方で、「深い満足度」の信号は稀であり、見つけるのが難しいということです。もし、この稀な信号を直接追いかけるように司書を教え込もうとすると、彼らは混乱し、すでに持っていた知識を忘れ、奇妙なものを推薦し始めてしまいます。この論文は、デジタル司書が単にクリックを予測するだけでなく、ユーザーが長期的に愛着を持てる物語を見つける手助けができるよう、賢明かつ段階的なトレーニング方法を模索しています。


3ステップのダンス:推薦司書の訓練方法

NAVER WEBTOONの技術者たちは、AIにすべてを一度に教えようとすることは失敗への近道であることに気づきました。彼らは「プログレッシブ・アライメント(漸進的整合)」フレームワークを提案しました。これは、汎用AIをビジネスに精通した推薦エキスパートへと変貌させるための、いわば3段階のトレーニングキャンプです。これによって、AIの「脳」を壊すことなく進化させることができます。

フェーズ1:ウォーミングアップ(線形プロービング / Linear Probing)
あらゆる料理を作れるマスターシェフ(事前学習済み基盤モデル)がいると想像してください。あなたは彼に、新しいレストランのための特定の新しい料理を作ってほしいと考えていますが、既存のあらゆる調理法を忘れてほしくはありません。もし、彼に全く新しい、ランダムなナイフやフライパン(「ダウンストリーム・モジュール」)を渡し、すぐに調理を開始しろと言ったら、彼はパニックに陥り、既存のスキルを台無しにしてしまうかもしれません。

そこで、最初のステップは**線形プロービング(LP)**です。このフェーズでは、マスターシェフの脳は凍結されており、基本的な調理スタイルを変えることはできません。あなたは新しいナイフやフライパンの使い方を練習させるだけです。これにより、新しい道具がシェフの手になじみ、コアとなるレシピを壊すことなく、新しい道具に慣れることができます。これは、新しい従業員がコンロに触れる許可を得る前に、1週間ほどボスに同行して学ぶようなものです。これにより、AIの膨大な知識と、コミック推薦という特定のタスクとの接続が安定します。

フェーズ2:本格的な練習(フル・ファインチューニング / Full Fine-Tuning)
新しい道具が安定したら、次はシェフに自由な調理をさせる時です。これが**フル・ファインチューニング(FFT)**です。ここでモデル全体が解禁されます。シェフは、この特定のレストランのメニューに特化するために、自身の調理スタイル全体を微調整することができます。フェーズ1で新しい道具に慣れているため、シェフが圧倒されることはありません。彼らは、自身の強固な基礎知識を維持しながら、顧客の特定の好み(「ダウンストリーム・タスク」)を学ぶことができます。研究者たちは、このプロセスを2つのステップ(LPの後にFFT)で行うことが、一度にすべてをやろうとするよりもはるかに優れていることを発見しました。一度にやろうとすると、AIが特定のタスクに集中しすぎるあまり、賢さを失ってしまう「破滅的忘却(catastrophic forgetting)」が起こりやすいためです。

フェーズ3:報酬ゲーム(強化学習によるファインチューニング / Reinforcement Fine-Tuning)
ここで魔法が起こります。シェフはメニューの作り方を習得しましたが、果たして「オーナー」が本当に望むものを料理できているでしょうか?オーナーが求めているのは、単なる「ちょっとした間食(単一のクリック)」ではなく、「深い満足度(コミックのシーズン全巻購入など)」です。しかし、深い満足感は稀なものです。ほとんどの人はただ閲覧しているだけなのです。

もし、シェフに「深い満足度」という稀な勝利だけを目指すよう教えようとすれば、彼らは無謀な推測を始めるかもしれません。そこで研究者たちは、**報酬モデル(Reward Model)**を使用しました。これは、特別なスコアカードを持つ「味見係」のようなものです。味見係は、稀で深いインタラクションを観察し、それらに「報酬スコア」を割り当てます。

第3フェーズである**強化学習によるファインチューニング(RFT)**において、シェフは単に大衆を喜ばせるために料理を作るのではなく、味見係のスコアを喜ばせるために料理を作ります。AIは一連の推薦を生成し、味見係(報酬モデル)が深いエンゲージメントにつながる可能性に基づいてスコアを与え、AIはそのスコアを高めるために戦略を調整することを学びます。決定的なのは、AIはフェーズ2で学んだ「高密度」な信号(クリックなど)を使用して「何を」推薦すべきかを知り続けつつ、「報酬」信号によって、長期的な幸福を最大化するために「どのように」それらをランク付けするかを導かれるという点です。

彼らが発見したこと(そして「ノー」と言ったこと)

チームは、この3ステップの手法を、自社のWebtoonプラットフォームからの膨大な実ユーザーインタラクションのデータセットを用いてテストしました。彼らは、この新しい手法を従来の方法と比較しました。

「やってはいけないこと」リスト:
論文では、2つの一般的なショートカットに対して明確に反対しています。

  1. 希少なビジネス目標を直接学習させてはいけない: もし最初から「有料コンテンツの完読」といった目標に向けてAIを最適化しようとすれば、汎化に失敗します。それは、掛け算を学ぶ前に高度な微積分を解かせようとするようなものです。信号が希薄すぎる(少なすぎる)ため、モデルは迷走してしまいます。
  2. 報酬モデルをそのままレコメンダーとして使ってはならない: 研究者たちは、「味見係(報酬モデル)」を直接推薦を行う担当者として使うことも試みました。このモデルは深いエンゲージメントを見抜くことには長けていましたが、数百万もの利用可能なコミックの中から最適なものをランク付けすることには極めて不向きでした。膨大なリストから最良のアイテムを選び出すために必要な「識別力」が欠けていたのです。論文は、報酬モデルはプレイヤーではなく、あくまで「コーチ」として使うのがベストであると示唆しています。

勝利の戦略:
「プログレッシブ・アライメント(LP → FFT → RFT)」が最も優れた結果を出しました。

  • オフラインテスト: 過去のデータを用いたシミュレーションを実行した際、この3フェーズのモデルは単一フェーズのモデルを上回りました。特に、学習された報酬モデルを用いたGRPO(特定の強化学習アルゴリズムの一種)を使用したバージョンが最高スコアを記録しました。これは、高いクリック率(Rank NDCG)を維持しながら、ユーザーをコンテンツの深部へと押し込むこと(Funnel NDCG)に成功しました。
  • 現実世界での証明: 彼らはシミュレーションだけで終わりませんでした。ライブプラットフォーム上で大規模なA/Bテストを実施しました。新しいAIを、標準的な非基盤モデルと比較しました。その結果、この新しいフレームワークがユーザーエンゲージメントを一貫して向上させることが示されました。特に「報酬モデルを用いたGRPO」バージョンは、ユーザーにさらに読み進めさせ、有料エピソードへ到達させる能力に優れており、「DPO」(別のアルゴリズム)バージョンは、最初のクリックを得る能力においてわずかに優れていました。

まとめ

この論文は、強力なAIレコメンダーを作る秘訣は、単により多くのデータを投げ込んだり、最も困難な目標に対して即座に最適化を試みたりすることではないと示唆しています。それは「段階」にあります。まず、新しい道具を安定させる。次に、モデルを専門化させる。そして、学習された「報酬」信号を使用して、優れた即時的な選択能力を失うことなく、ビジネスの長期的な目標へとモデルを優しく導くのです。

「タスクの学習」と「ビジネス目標への整合」を切り離すことで、研究者たちはAIをスマートかつ収益性の高いものにする方法を見出しました。これは、最高の結果を得るためには、ゴールに向かって全力疾走するのではなく、一歩ずつ、ゆっくりと進むことが重要であるという教訓を残しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →