✨ 要約🔬 技術概要
巨大で忙しい銀行を、大規模な救急外来と想像してみてください。毎日、何千人もの人々が、さまざまな問題を抱えて訪れます(または電話をかけてきます)。中には詐欺の被害に遭った人もいれば、不正取引を疑っている人も、単に取引内容に混乱している人もいます。
かつての銀行では、「メニューシステム」(詐欺なら「1」、紛争なら「2」など)を使用するか、疲れ果てた人間のスタッフがすべての話を聞き、どの専門チームに送るべきかを推測していました。これは遅く、顧客にとって苛立たしく、しばしば人を間違った医師のもとへ送り、待ち時間を長くし、怒りを増幅させる結果となっていました。
この問題を解決するため、NatWest AI リサーチは、高度な大規模言語モデル(LLM)を用いて顧客と対話する、スマートで AI 搭載の受付係 (「トリアージエージェント」と呼ばれる)を構築しました。その仕組みをシンプルに分解すると以下のようになります。
1. スマートな受付係(エージェント)
ロボットのようなメニューの代わりに、このエージェントは自然な会話ができるように高度に訓練された探偵のようです。
話し方 : 「これは詐欺ですか?」とただ尋ねるだけではありません。人間のように、フォローアップ質問を行い、注意深く聞き、話を組み立てます。
規則書 : AI は単に推測しているわけではありません。銀行の内部方針という厳格な「規則書」を与えられており、何を尋ね、何を言ってはならないかを正確に指示されています。それは丁寧で、事実に基づき、安全である方法を知っています。
目標 : その仕事は、ケースが「詐欺」「不正」「紛争」のいずれか、あるいは「不明」なのかを特定し、直ちに顧客を適切な専門チームへ送ることです。
2. 「デジタルツイン」(練習患者)
新しい受付係を実際の人間と話す前にどうテストしますか?単に推測することはできません。
解決策 : 銀行は**「デジタルツイン」**を作成しました。これらは、実際の顧客と全く同じように行動するようにプログラムされたビデオゲームのキャラクターだと想像してください。チームは、AI に何千もの過去の通話録音と取引記録を投入し、これらのツインが実際の人間がどのように話し、パニックを起こし、混乱するかを学習させました。
テスト : AI 受付係は、これらの「デジタルツイン」と数百万回の会話を練習しました。これにより、銀行は実際の顧客の体験を危険にさらすことなく、AI が困難な状況にどのように対応するかを確認できました。
3. 安全網(ガードレール)
新しい医師を監督なしで手術させることはあり得ませんし、銀行も安全網なしで AI を信頼しませんでした。
ボーダー : システムには、AI が危険なこと、失礼なこと、あるいは違法なことを言うのを防ぐ「ガードレール」(クラブのボーダーのようなもの)があります。顧客が AI をだまして銀行の秘密の規則を明かそうとしたり、ヘイトスピーチを使ったりした場合、ガードレールがそれをブロックします。
引き継ぎ : 顧客が過度に動揺している、脆弱である、あるいは単に人間と話したい場合、特別な「迂回エージェント」がこれを検知し、優しく実際の人間の専門家へ導きます。これにより、誰一人として見落とされることはありません。
4. 結果:機能しましたか?
チームは、この新しいシステムを、顧客役として行動した「デジタルツイン」と実際の人間専門家(主題専門家)の両方を用いて、旧来の方法と比較してテストしました。
精度の向上 : AI は、旧来のシステムと比較して、問題の種類を正しく特定する能力が30.6% 向上 しました。顧客を間違ったチームへ送る可能性は大幅に減少しました。
満足する顧客 : 専門家は、AI の丁寧さ、明確さ、有用性を高く評価しました。
安全性 : 安全網はほぼ完璧に機能し、システムをだまそうとする悪意ある試みの 98% 以上を捕捉しました。
結論
この銀行は、単に質問に答えるだけでなく、実際にそれらを調査 するチャットボットを構築しました。「デジタルツイン」顧客によるトレーニングと厳格な安全規則による包囲によって、彼らは銀行の問題を旧来の方法よりも迅速かつ正確に分類するシステムを創出しました。それは、混沌とした待合室から、誰もがはるかに早く適切な支援を受けられる、整理されたスマートなトリアージセンターへのアップグレードのようなものです。
技術概要:苦境にある顧客への支援 – 会話、探求、振り分けを行う LLM 駆動のエージェント
問題定義 英国の金融セクターは、未承認の詐欺、詐欺行為、および取引の異議申し立ての急増に直面しており、前年比で 10% 以上増加しています。メニューベースのインタラクティブ音声応答(IVR)システムや手動による人的振り分けといった従来の顧客サービス手法は、その柔軟性の欠如、処理時間の遅延、および誤った振り分けの多さにより、持続不可能になりつつあります。これらの非効率性は、顧客の不満と運用上のボトルネックを引き起こし、専門チームが複雑な調査に集中するのを妨げています。顧客体験の中でこれらのケースを効果的に振り分けるために、スケーラブルで正確かつコンプライアンスに準拠した自動化ソリューションが緊急に必要とされています。
手法 著者らは、多回会話を実行し、ターゲットを絞った探求質問を提起し、ケースを特定のカテゴリ(詐欺、詐欺行為、異議申し立て、または結論不明)に分類するように設計された、大規模言語モデル(LLM)を駆動する顧客向け AI 振り分けエージェントを提案します。
エージェントアーキテクチャ: システムは、ファインチューニングではなくプロンプトエンジニアリングを介して、Claude、Gemini、GPT シリーズなどの第三者 LLM を利用します。これにより、柔軟性の確保とデータリスクの低減が図られています。エージェントは、エージェントの役割、行動指示、調査ワークフロー、および禁止事項(「してはいけないこと」)を定義する専門的なサブプロンプトを含むプロンプトマネージャーによってオーケストレーションされます。これらのプロンプトは、銀行の内部方針をエージェントの推論に直接埋め込みます。
安全性と引き継ぎ: システムは、層状の安全性ガードレールを採用しています。AWS Bedrock が基盤となるフィルタリングを提供し、これに、未承認の製品リクエスト、内部プロセスの探求、および非英語メッセージをブロックするカスタム入力制御が追加されます。専用の「逸脱エージェント」が脆弱性の指標や会話終了を望むユーザーの意図を検出すると、直通電話回線を通じて専門家の人間担当者への引き継ぎがトリガーされます。
評価フレームワーク(デジタルツイン): 学習およびテスト用のラベル付きチャットログが不足しているという課題に対処するため、著者らは合成された「デジタルツイン」顧客を用いたスケーラブルな評価パイプラインを開発しました。これらのエージェントは、OpenAI Agent SDK を使用して生成され、過去の電話記録やレガシーなケースデータに基づき、実際の顧客の行動、言語、および相互作用スタイルを模倣します。
検証戦略: パフォーマンスは、以下の組み合わせアプローチを通じて評価されます。
合成テスト: 約 3,000 のトランスクリプトベースのケースの大規模シミュレーション。
人間による評価: 専門知識を持つ専門家(SME)が Web インターフェースを介して多回対話を行い、満足度、共感、コンプライアンス、事実性、要約の質などの指標に基づいてエージェントを評価します。
自動評価: 「LLM を裁判官として活用する(LLM-as-a-judge)」パイプライン(GPT-4.1)が、同じ指標に基づいて会話を評価し、スケーラブルな二値評価と根拠を提供します。
レッドチームング: プロンプトインジェクション、コード操作、および抽出の試行に対する堅牢性を評価するための対抗的テストが実施されました。
主な貢献
配備された振り分けエージェント: 正確なケース分類のための多回対話が可能で、統合された引き継ぎプロトコルと層状の安全性ガードレールを備えた機能的な LLM ベースのエージェント。
スケーラブルな評価パイプライン: 運用データと合成された「デジタルツイン」顧客を統合する再現可能なフレームワークであり、既存のラベル付きチャットログに依存せずに徹底的な検証を可能にします。
ハイブリッド検証戦略: 継続的なプロンプト調整と品質保証のための人間と自動化(LLM)を組み合わせた検証アプローチであり、実世界の銀行業務への配備の準備が整っていることを示しています。
結果 エージェントは、合成シナリオおよび SME 主導のテストにおいて、レガシーな IVR ベースラインと比較して評価されました。
分類精度: システムは大幅な精度向上を達成しました。GPT-5 はレガシーベースラインに対して**+30.6%の最も高い改善を示し、次いで GPT-4.1(+27.7%)、Gemini-1.5-Pro(+28.4%)、GPT-4.1-mini(+21.3%)、Claude Sonnet 3(+20.0%)となりました。SME によるテストでは、平均 +16.0%**の改善が確認されました。
運用指標: コンプライアンス、満足度、要約の質を含む主要指標は、一貫して**75–80%**の閾値を超えました。
引き継ぎパフォーマンス: 引き継ぎエージェントは、人間の介入が必要となる場合を効果的に検出し、精度と再現率が**90%**を超えました。
安全性とガードレール: 入力ガードレールは、プロンプトインジェクションとヘイトスピーチを98% 以上 の精度で検出しました。出力ガードレールは、幻覚的なコンテンツを95% 以上 の精度で特定しました。レッドチームング演習は、敵対的プロンプトのブロックと内部推論の開示防止におけるシステムの能力を確認しました。
評価の一致: 自動化された評価と人間による評価は、コンプライアンス、事実性、関連性などの客観的指標において強い一致(79–92%)を示しましたが、共感や苛立ちなどの主観的側面については一致度が低く(約 60%)、感情的に微妙なケースには人間によるループ内検証が必要であることを示唆しています。
重要性 本論文は、提案された LLM 駆動の振り分けエージェントが、現在の銀行における詐欺および異議申し立て処理のスケーラビリティと精度の課題を成功裏に解決していると主張しています。評価のために合成されたデジタルツインを活用することで、著者らはラベル付きデータが不足している規制環境において AI エージェントを検証するための堅牢な手法を実証しています。結果は、多回対話によるターゲットを絞った探求がより効果的な振り分けにつながり、顧客の苛立ちと運用上の遅延を軽減することを示しています。高い精度、厳格な安全性ガードレール、内部方針への準拠を兼ね備えた本システムは、高リスクかつ規制の厳しい金融分野での配備に適していることが確認されました。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×