AI foundation model choice and false positive variation in Anti Money Laundering transaction screening
本研究は、アンチマネーロンダリングの取引スクリーニングにおいて異なる大規模言語モデルを選択することが、偽陽性率および業務負荷に劇的な変化をもたらすことを示しており、モデルの選択が、明示的なガバナンスとモニタリングを必要とする極めて重要なオペレーショナルリスクのパラメータであることを立証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
毎年、膨大な額の資金が世界の金融システムを通じて移動しており、その中には違法な利益の出所を隠すことを目的としたものも含まれています。これを阻止するため、銀行やその他の金融機関は、マネーロンダリングを示唆するパターンを探しながら、顧客の取引を注意深く監視することが求められています。何十年もの間、彼らはこの初期段階の監視を行うためにコンピュータ・システムに頼ってきました。これらのシステムは、少しでも怪しいと思われるものをすべて捕らえて人間の調査員に確認を求める「ふるい」のような役割を果たしています。問題は、これらのふるいがしばしば粗すぎることにあります。これらは真の脅威とともに、膨大な量の無害な活動までをも捕らえてしまい、大量の誤報を生み出しています。その結果、アナリストは無実の人々を調査するために何時間も費やすことになり、リソースを浪費し、顧客に不必要なストレスを与えています。
最近、新しいタイプの人工知能が議論に登場しました。これらは大規模言語モデルであり、あらゆるシナリオに対して特定のルールを教えられなくても、複雑な状況を理解し、推論することができる、膨大な量のテキストで学習された強力なツールです。これらのモデルは取引履歴を読み取り、数字の背後にある物語を理解できるため、多くの専門家は、彼らが誤報の問題を解決できると期待しました。その考えは、これらのモデルが従来のルールベースのシステムよりも賢く、正当なビジネス決済と疑わしい送金をより高い精度で見分けることができるというものでした。しかし、ある決定的な疑問が未解決のまま残っていました。もし銀行が一方のモデルではなく別のモデルを選択した場合、それは本当に重要なのでしょうか? それとも、それらはすべて単なる異なるバージョンのツールであり、互換性があり予測可能なものなのでしょうか?
一連の独立した研究者たちは、モデルの選択を単なるソフトウェアの決定としてではなく、銀行の業務における根本的なリスクとして扱うことで、その答えを見つけようと試みました。彼らは、2つの主要なテクノロジー・プロバイダーから提供されている、市販の5つの異なる大規模言語モデルを集めました。彼らはこれらのモデルを銀行のデータで学習させたり、設定を微調整したりはしませんでした。代わりに、それぞれのモデルに対し、既存の知識のみに基づいて判断を下す「ゼロショット・スクリーナー」として振る舞うよう求めました。公平なテストを行うために、研究者たちは600件の合成取引ケースを含む制御されたセットを作成しました。300件のケースは既知のマネーロンダリングの手口と全く同じように設計されており、残りの300件は、注意深いシステムさえも欺くほど怪しく見えるように作られた、完全に合法的な取引でした。これらが「ハード・ネガティブ(困難な負例)」、つまり誤ってフラグを立てられがちな無実の取引です。
研究者たちは、これら600件すべてのケースを5つのモデルすべてに投入し、各モデルにその取引が疑わしいかどうかを判断させました。結果は驚くべきものでした。モデルが300件の合法的な取引を見たとき、その挙動は大きく異なりました。あるモデルは、それらのうちごくわずかな割合しか怪しいと判定しませんでしたが、別のモデルは大多数を怪しいと判定しました。実際、最良のパフォーマンスを示したモデルと最低のパフォーマンスを示したモデルの間では、誤報の発生率に莫大な差がありました。同じ無実の取引に対して、あるモデルは100回に1回未満しかミスをしませんでしたが、別のモデルは10回中8回以上ミスをしました。モデルは単にいくつかのトリッキーなケースで意見が分かれただけでなく、合法的な取引の約90パーセントにおいて意見が一致しませんでした。特定の無実の顧客が調査対象としてフラグを立てられるかどうかは、ほとんどの場合、どの特定のコンピュータ・モデルがスクリーニングを行っているかに依存していました。
この研究はまた、各会社が提供するモデルのファミリー内における明確なパターンも明らかにしました。どちらのケースにおいても、より小型で安価なモデルは、より強力で高価なモデルよりもはるかに攻撃的であり、無害な活動に対して高い割合でフラグを立てる傾向がありました。研究者たちは、これらのモデルが単に同じタスクにおいて優れているか劣っているかではなく、全く異なる「警戒のスペクトラム」上の地点で動作していることを発見しました。あるモデルは犯罪者を捕まえようとするあまり、ほぼ全員を容疑者として扱い、別のモデルは無実の人々を煩わせることを避けるために、疑わしい活動を見逃してしまうほど慎重でした。このトレードオフは、モデルの選択が単なる技術的な選択ではなく、銀行のスタッフが毎日どれだけの誤報に対処しなければならないかという選択であることを意味していました。
実世界の銀行にとってこれが何を意味するかを理解するために、研究者たちは、ある金融機関が1日に100万件の取引を処理し、そのうち極めて低い割合が実際に疑わしいものであるというシナリオを想定しました。このような条件下では、モデルの選択の違いは、作業量における劇的な差へと直結します。最も慎重なモデルは、調査員がレビューすべきアラートの数を管理可能な範囲に留めます。しかし、最も攻撃的なモデルは、調査員が対応すべきキューを200倍近くも大きくしてしまいます。このシナリオでは、最も攻撃的なモデルは誤報の洪水を生み出し、アラートのほとんどすべてが間違いとなり、少数の真の脅威をかき消してしまうことになります。これは、モデルの選択がコンプライアンス・チームの日常を根本的に変え、彼らを「集中した調査」の状態から「圧倒的なノイズ」の状態へと変貌させてしまうことを示しました。
研究者たちはまた、これらのモデルが同じ方法で失敗するのかどうか、すなわち「アルゴリズムのモノカルチャー(単一文化)」と呼ばれる懸念についても調査しました。これは、誰もが同じツールに依存することで、全員が同じ間違いを犯してしまう現象です。彼らは、これが当てはまらないことを発見しました。モデルは同じ疑わしい取引を見逃すのではなく、それぞれ異なる取引を見逃していたのです。真の危険は、彼らが全員で犯罪者を逃してしまうことではなく、誰が無実であるかについて意見が食い違うことでした。この相違は、異なるモデルを使用している2つの銀行が、同じ顧客の活動に対して全く異なる見解を持つ可能性があることを意味します。ある銀行は通常のビジネスパターンと見なし、別の銀行は犯罪とみなすかもしれません。
研究は、これらの大規模言語モデルを互換性のあるコンポーネントとして扱うことは危険な間違いであると結論付けました。ユーザーによってコードが固定され制御されている従来のソフトウェアとは異なり、これらの商用モデルは、プロバイダーによってユーザーの直接的な知識なしに更新、置換、または変更される可能性があります。今日うまく機能しているモデルが、明日、全く異なる挙動をする別のバージョンに置き換わり、銀行自身のシステムに変更を加えることなく、銀行の業務全体を高度な精密さの状態から混沌とした状態へと移行させてしまうかもしれません。研究者たちは、銀行はモデルの具体的なアイデンティティをリスク管理の重要な要素として扱う必要があると主張しました。銀行は、使用している正確なバージョンを把握し、その挙動を定期的に監視し、モデルを変更することは、犯罪を検挙する能力を損なうことなく顧客を困惑させる可能性のある重大なイベントであることを理解する必要があります。モデルの選択は単なる調達の詳細ではなく、システムが世界をどのように見るかを決定する、まさにその設定なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。