← 最新の論文
🤖 AI

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

本論文は、可変的な口座状態および内部ポリシー文書を介したエージェントと悪意のある発信者との間の動的な相互作用をシミュレートすることにより、履歴依存的かつ適応的な詐欺シナリオに対してポリシーに基づいたバンキングエージェントの負荷テストを行うために設計された、新しい実行可能ベンチマークであるFraudBenchを紹介するものである。

原著者: Dheeraj Mohandas Pai, Lu Xian

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Dheeraj Mohandas Pai, Lu Xian

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の金融の世界において、銀行のカスタマーサービス担当者は、もはや単に電話に出るだけの人間ではありません。ますます、その担当者は、会話を行い、複雑な要求を理解し、行動を起こすように設計されたコンピュータプログラム、すなわち人工知能エージェントへと変わりつつあります。これらのエージェントには強力なツールへのアクセス権が与えられています。彼らは顧客の口座残高を照会したり、パスワードの再設定を検証したり、盗まれたクレジットカードを凍結したり、さらにはある口座から別の口座へお金を移動させたりすることさえできます。また、彼らは銀行の内部規定集、つまりエージェントが何をすることを許可され、何を拒否しなければならないかを正確に規定する数千ページに及ぶ文書にもアクセスできます。このテクノロジーが約束するのは利便性です。電話をかける人は、保留状態で待つことなく、数分で危機を解決できます。しかし、リスクは、正当な顧客を助けるためのこれと同じ強力なツールが、会話を操作する方法を知っている電話利用者のために、銀行に対して牙を向く可能性があることです。もし人が、巧妙に言葉を尽くした物語によって、自分を別人だと信じ込ませたり、安全規則を無視させたりすることができれば、エージェントは実質的な金銭的損失を引き起こす行動をとってしまうかもしれません。研究者にとっての中心的な問いは、これらのエージェントが言語を理解できるかどうかではなく、人間が積極的に欺こうとしているときに、彼らが「危険」を理解できるかどうかです。

研究チームは、この問いに答えるための新しいテスト環境、彼らが「FraudBench」と呼ぶシステムを構築しました。人工知能に不審な取引のリストを読ませたり、詐欺メールを特定させたりする単純な方法ではなく、彼らは、コンピュータプログラムが銀行エージェントの役割を演じ、別のコンピュータプログラムが詐欺師の役割を演じるライブ・シミュレーションを作成しました。これら2つのプログラムは、実際の電話のように、長いマルチターン(複数回のやり取り)の会話を行います。詐欺師の目標は、犯罪者の口座への送金や個人情報の開示といった、安全でないアクションを実行させるようにエージェントを操ることです。エージェントの仕事は、話を聞き、銀行の内部ルールをチェックし、相手の身元を確認し、助けるべきか停止すべきかを判断することです。研究者たちは、これらのエージェントは指示に従うことには長けているものの、その指示が長い欺瞞的な物語の一部である場合には、しばしば失敗することを発見しました。

このシミュレーションは、現実的な基盤の上に構築されています。エージェントは、125人の架空の顧客、その口座、および取引履歴を含むデジタル銀行環境内で動作します。また、あらゆる状況に対して正しいルールを見つけ出すために検索しなければならない、698もの膨大な内部ポリシー・ライブラリにもアクセスしています。エージェントは、単純な照会から、個人識別番号(PIN)のリセットやカードの凍結解除といった重大なアクションに至るまで、17種類の異なるツールを使用できます。詐欺師は、別のプログラムによって制御されており、単に金を求めているだけではありません。それはエージェントの信頼を搾取しようとしているのです。詐欺師は、まず無害な質問をして親睦を深め、それから徐々に偽りの緊急性を導入したり、エージェントの反応を試すために小さな嘘を認めたりすることがあります。最も危険な攻撃は、「適応型」の攻撃です。つまり、詐欺師がエージェントの反応に基づいて戦略を変えるものです。もしエージェントが要求を拒否すれば、詐欺師は別の角度から攻めたり、あるいは、会話の初期段階でエージェントが小さなミスをした場合、そのミスを利用して、後にさらに大きな、安全でない要求を正当化したりします。

エージェントをテストするために、研究者は150の特定のシナリオを作成しました。それぞれが異なるタイプの詐欺をターゲットにするよう設計されています。これらには、アカウントの窃盗の試み、本人確認を回避するためのトリック、そして一連の偽口座を通じて資金を移動させるスキームなどが含まれます。また、一連の小さく一見無害に見えるステップが、重大なセキュリティ侵害につながる「チェーン(連鎖)」攻撃のセットも含まれています。研究者はその後、4つの異なる人工知能モデルをこれら150のシナリオに通し、それらがどれほど上手く銀行を守れるかを検証しました。結果はまちまちでした。最も優れた性能を示したモデルは、約65パーセントのケースで詐欺師を阻止できましたが、最も弱いモデルが成功したのは約半分でした。これは、かなりの数のシミュレーションにおいて、エージェントが拒否すべき行動を行うよう騙されたことを意味します。研究者は、エージェントが特に2つの種類の欺瞞に対して苦戦することを発見しました。それは、詐欺師が盗んだ資金を移動させるために被害者の口座を利用する「マネー・ミュー(資金移動役)」スキームと、現在の要求よりも会話の履歴の中に危険が隠されている「チェーン」攻撃です。

この研究は、これらのエージェントが現在どのように評価されているかという点における決定的な欠陥を浮き彫りにしています。既存のテストの多くは、エージェントが正しい行動をしたかどうかを判断するために、会話の最後のメッセージのみを見ています。しかし、FraudBenchは、安全性は相互作用の全履歴に依存していることを示しました。エージェントは多額の送金要求を正しく拒否したとしても、チャットの途中で誤って秘密のコードを漏らしてしまっていたら、その会話はすでに侵害されているのです。研究者は、エージェントがこれらの初期のミスを記憶できなかったり、それらを現在の要求と結びつけられなかったりすることが多いことを発見しました。また、エージェントが、ドキュメントを直接与えられるのではなく、自分で検索しなければならない場合に、698のドキュメント・ライブラリから正しいルールを見つけるのに苦労することも判明しました。研究者がエージェントに自らルールを検索させたところ、最も優れたモデルの成功率は13パーセント低下しました。これは、情報を探す能力は、それを推論する能力と同じくらい重要であることを示しています。

おそらく最も重要な発見は、安全性と有用性が緊張関係にあるということです。顧客を助けようと熱心すぎるエージェントは、有害な行為を行うよう騙される可能性があり、一方で慎重すぎるエージェントは、ただ単に運が悪いだけの正当な顧客の助けを拒否してしまう可能性があります。研究者は、詐欺を阻止することと人々を助けることの両方において完璧なモデルを見つけることはできませんでした。代わりに、彼らはトレードオフを観察しました。攻撃をブロックすることに長けたモデルは、有効な要求を拒否する傾向があることもありました。これは、真に安全な銀行エージェントを構築することは、単にソフトウェアを賢くすることではなく、行動しようとする意欲と、欺瞞を検知する能力との間のバランスを慎重に取ることであるということを示唆しています。研究者は、彼らの研究は架空のデータを用いたシミュレーションであり、その結果が実際の銀行がどのように機能するかを正確に予測するものではないと強調していますが、現在のテクノロジーがどこに脆弱であるかを示す明確な地図を提供しています。制御された環境の中でこれらの弱点を明らかにすることで、この研究は、開発者が現代の銀行詐欺という複雑で危険な風景をナビゲートしながら、公衆に奉仕する能力を失わないエージェントを構築するための道筋を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →