SAGE: Scalable AI Governance & Evaluation
SAGEは、ポリシー、先例、およびLLMサロゲートジャッジッジによる双方向のキャリブレーションループを通じて高品質な人間の判断を運用化し、コスト効率の高い蒸留を活用することでLinkedIn検索におけるポリシーに沿ったモデル評価を可能にし、最終的にデイリーアクティブユーザー数を0.25%増加させた、スケーラブルなAIガバナンスフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、毎日数百万件の記事(求人やプロフィール)を公開する大規模な新聞社(LinkedIn)の編集長であると想像してください。あなたの目標は、読者が例えば「エントリーレベルのデータアナリスト」のように特定のものを検索したときに、単にその言葉が含まれているだけの無関係な記事ではなく、「完璧な」記事を表示させることです。
問題は何でしょうか?記事も多すぎれば、読者も多すぎます。すべての検索結果が「良いものかどうか」を確認するために、人間のエディターが一つひとつ読むことは不可能です。もし単純な計算(例えば、リンクが何回クリックされたかを数えるなど)に頼ろうとすれば、関連性のないのに人気があるだけの記事に騙されてしまうかもしれません。
これは、この問題を解決するためにLinkedInが構築した新しいシステム、SAGEの物語です。SAGEを、**「スーパー・エディター(超・編集者)」**だと考えてください。それは人間の専門家のように考えることを学びつつ、ロボットのスピードで働く存在です。
仕組みは以下の通りです。
1. 問題:「人間 vs ロボット」のギャップ
通常、企業が検索エンジンを構築する際、2つの要素に依存します。
- 人間のエディター: 彼らは品質を判断することには長けていますが、遅くてコストがかかります。何百万もの結果をすべて読むことはできません。
- エンゲージメント指標: これらはクリック数や閲覧数をカウントします。しかし、これは映画を興行収入だけで判断するようなものです。間違ってクリックされただけの質の低い映画でも、興行収入は高く見えることがあります。これでは、その映画が「本当に良いものか」までは教えてくれません。
LinkedInは、人間の品質判断と機械のスピードを両立させる方法を必要としていました。
2. 解決策:「SAGE」フレームワーク
SAGEは、検索結果を判定するための完璧な「ルールブック」を作成するために連携する、3つのパートからなるチームです。
パートA:ポリシー(ルールブック)
これは、平易な英語で書かれた一連のルールです。「キーワードを一致させる」と言う代わりに、「ユーザーがエントリーレベルの仕事を求めている場合、その結果は10年の経験を必要としてはならない」といった具合に定義します。これにより、「何が良いのか」を明確に定義します。
パートB:プレシデント(サンプル回答)
教師が学生に、満点と解説が付いた数枚の模範解答を見せている場面を想像してください。SAGEは、人間の専門家によって作成された、厳選された「ゴールドスタンダード(最高水準)」の例を使用します。これらの例は、AIに対して、トリッキーな状況においてルールブックをどのように適用すべきかを正確に示します。
パートC:サロゲート・ジャッジ(代理の審判)
これは、審判として機能するAI(大規模言語モデル)です。このAIは検索結果を読み取り、ルールブックおよびサンプル回答と比較します。
3. 秘訣:「双方向トレーニング」
以前は、単にルールをAIに伝え、理解してくれるのを待つだけでした。しかし、SAGEは**「双方向キャリブレーション・ループ」**を使用します。
- 人間からAIへ: 人間がAIにルールを教え、例を示します。
- AIから人間へ: AIは、実際に人間を**批判(クリティーク)**します!
- もしAIが、人間の専門家が(長い求人票の中にある隠れた詳細を見落とすなどの)ミスをしたのを見つけた場合、それをフラグ立てします。
- もしAIが、ルールが曖昧なために混乱した場合、人間に「ねえ、あなたのルールブックはこの特定のケースをカバーしていませんよ」と伝えます。
これにより、ルールブック、例、そしてAI審判が共に賢くなり、互いに修正し合うサイクルが生まれます。彼らがほぼ完全に一致するまで(人間による評価との一致率は約77%であり、この分野では「実質的」であると見なされます)、互いの間違いを修正し続けます。
4. スピードのトリック:「蒸留(ディスティレーション)」(先生から生徒へ)
「先生」となるAI(人間から学んだもの)は非常に賢いですが、動作が遅く、コストもかかります。それは、論文の採点に何時間もかける天才教授のようなものです。LinkedInは、毎秒数百万件の論文を採点する必要があります。
そこで、彼らは**「蒸留(ディスティレーション)」**という手法を用いました。
- 想像してみてください。先生(天才教授)が、自分の思考プロセスを生徒(効率的なインターン)に説明している様子を。
- 生徒は、先生の論理を模倣することを学びますが、より小さく、より高速になります。
- 結果: この「生徒」となる審判は、「先生」よりも92倍安価で高速でありながら、依然として人間の専門家と同じ頻度で正しい答えを導き出します。
5. それがLinkedInをどう変えたか
この高速でスマートな「生徒」となる審判を構築した後、彼らはこれを3つの強力な方法で使用しました。
- セーフティネット(オフライン・テスト): 新しい検索機能をリリースする前に、それらを「生徒」の審判に通します。もしAIが「この新機能は質の低い結果を表示しています」と言えば、すぐに停止できます。ユーザーからの苦情を待つ必要はありません。これにより、テスト期間を2週間から3日に短縮できました。
- リアルタイムの門番(オンライン・サービング): 彼らはこのAIをさらに圧縮し、リアルタイムで動作するほど極小化しました。現在、あなたが検索するたびに、この小さなバージョンのAIが、結果がルールに従っているかどうかを瞬時にチェックしています。
- 早期警戒システム: 彼らはこのAIを使用して、システムを24時間体制で見守っています。時には、検索のアップデートがクリック数ベースでは問題なさそうに見えても、AIが「品質」の低下を察知することがあります。AIは、人間による指標が見逃した問題を捉え、ユーザー体験の悪化を防ぎました。
結論
このシステムを使用することで、LinkedInは検索を単に「速く」しただけでなく、**「よりスマートで信頼できるもの」**にしました。
論文によれば、高品質なルールを強制するためにSAGEを使用することで、LinkedInの日間アクティブユーザー数(DAU)が0.25%増加したとされています。何億人ものユーザーを抱えるプラットフォームの世界では、このわずかなパーセンテージは、多くの人々が探していたものを見つけ、サイトに留まり、戻ってこれたという膨大な数に相当します。
要約すると: SAGEは、「何が良い検索結果かを決める」という、混沌としていて主観的な仕事を、明確で自動化された、ミスから学び続け、進化し続けるスケーラブルなプロセスへと変えたのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。