Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
本論文は、Nubankにおいて開発された、構造化されたコンテキスト・エンジニアリング、ヒューマン・イン・ザ・ループによる反復、および厳格なLLMジャッジ評価を統合した、評価駆動型の統一フレームワークを提示するものであり、これにより5つのドメインにおいて1億人以上のユーザーに向けてプロダクションレベルのカスタマーサポートAIエージェントを導入することに成功し、満足度とセルフサービス率の大幅な向上を実現するとともに、オフライン指標とオンラインへの影響との間の強い相関関係を実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、1億人の顧客を抱える巨大な銀行を経営していると想像してください。毎日、何百万人もの人々が、「私のクレジットカードはどこにありますか?」や「なぜこんなに支払額が多いのですか?」といった質問をするために、電話やチャットをしてきます。
かつては、これらに答えるために軍隊のような数の人間のエージェントが必要でした。しかし今、あなたはこれらの会話を処理するための、超スマートなAIロボットを作りたいと考えています。問題は、もしロボットが間違った答えを出してしまったら、顧客は怒り、信頼を失い、去ってしまうということです。ロボットが優れているかどうかを「推測」するわけにはいきません。実在の人間に話させる前に、100%確信を持つ必要があるのです。
この論文は、Nubank(巨大な銀行)が、どのようにして安全かつ成功裏にAIロボットを構築したかを示す設計図です。その手法を分かりやすく説明します。
1. 問題点:クラッシュテストのないロボット作り
通常、人々がAIを作る際は、指示を書き、少しテストを行い、あとはうまくいくことを祈ります。著者たちは、これは「エアバッグが機能するかどうかを確認するために、車を組み立てて崖から運転して落ちるようなものだ」と述べています。カスタマーサポートにおいて、「クラッシュ(失敗)」はコストが高すぎます。
彼らは、ロボットを実在の人間に話させる前に、シミュレーターの中で何千回もテストする方法を必要としていました。
2. 解決策:「評価駆動型」の工場
単に指示を書くのではなく、彼らは4つのステーションを持つ工場ラインを構築しました。これは、レーシングカーのチューニングのようなものです。
ステーション1:モジュール式キット(コンテキスト・エンジニアリング)
ロボットに対して一つの巨大で乱雑な指示マニュアルを書く代わりに、彼らはそれをレゴブロックのように分解しました。- ルール: ロボットがどのように話すべきか(丁寧、簡潔)。
- プレイブック: 特定の問題に対するステップバイステップのガイド(例:「カードを紛失した場合は、ステップAを行い、次にステップBを行う」)。
- ツール: ロボットが実際にできることのリスト(データベースのチェックやカードの再発行など)。
- メモリ: チャット中に学んだことを書き留めるためのメモ帳。
- なぜ重要か: もしロボットの挨拶が間違っていたとしても、「挨拶のレゴブロック」を入れ替えるだけで済みます。車全体を作り直す必要はありません。
ステーション2:ロボット審判員(LLM-as-a-Judge)
ロボットがうまくやっているかどうかをどうやって知るのでしょうか? ロボット自身に採点させることはできません。そこで、彼らは別のAI(「審判」)を使用して、最初のロボットの回答を採点させました。- 落とし穴: 時として、審判AIには偏りや怠慢が生じることがあります。これを修正するために、彼らはGEPAと呼ばれる特別なテクニックを使用しました。これは、コーチが審判AIがテストを採点している様子を見守り、審判が厳しすぎると気づいた場合に、より公平になるよう採点基準を書き換えるようなものです。彼らは、採点が非常に一貫性を持つようになるまで、これを自動的に行いました。
ステーション3:人間のセーフティネット(検者間信頼性)
AI審判を信頼する前に、彼らは実在の人間を使って同じ回答を採点させました。彼らは、人間同士がどの程度一致しているかを確認しました。もし人間が90%の確率で一致していれば、そのテストが公平であることを意味します。そして、AI審判が人間と同じくらい一致するように調整しました。ステーション4:実世界でのテスト(A/Bテスト)
シミュレーターのテストに合格した後、彼らはごく一部の実際の顧客(ユーザーの1%など)にロボットを対話させました。彼らはこの新しいロボットを古いシステムと比較しました。もし新しいロボットが顧客をより幸せにしたなら、より多くの人に話させるようにしました。
3. 結果:ロボットの勝利
彼らはこのシステムを5つの異なる種類の問題に対してテストしました:
- カード配送: 「私のカードはどこですか?」
- 債務管理: 「ローンを完済するにはどうすればいいですか?」
- 利用限度額: 「限度額を上げられますか?」
- カード管理: 「PINコードを変更したい」
- 製品説明: 「この機能は何ですか?」
魔法の数字:
- 幸福度: 「カード配送」ロボットにおいて、顧客の幸福度(tNPSと呼ばれるスコアで測定)は37ポイント上昇しました。これは劇的な改善です。
- セルフサービス率: より多くの人々が、人間を介さずに問題を解決できるようになりました。「セルフサービス率」は29ポイント上昇しました。
- 人間 vs ロボット: 5つのケースのうち4つにおいて、ロボットはトップクラスの人間エキスパートとほぼ同等の成績(数パーセント以内の差)を収めました。唯一苦戦したのは、非常に複雑な「債務管理」の領域でしたが、これは高度な数学と共感が必要なため、理にかなっています。
4. 大きな教訓:「測定できるなら、修正できる」
この論文の最も重要な教訓は、**「あなたのテストの質が、改善のスピードを決定する」**ということです。
彼らが非常に厳格なテストシステム(シミュレーター)を構築したおかげで、ロボットの指示を変更した際に、それが良くなったのか悪くなったのかを即座に知ることができました。顧客が喜んでいるかどうかを確認するために数週間待つ必要はなかったのです。彼らはシミュレーターの中でロボットを数十回繰り返し改善(イテレーション)することができ、最終的にリリースしたときには、ロボットはすでにチャンピオンとなっていました。
要約すると: 彼らは単にスマートなAIを作ったのではありません。AIのためのスマートなテスト研究所を作ったのです。そして、その研究所が非常に優秀であったため、世界に送り出されたロボットは驚くほど信頼でき、人々を幸せにし、1億人のユーザーに対応できる準備ができていたのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。