← 最新の論文
💰 quantitative finance

Agentic AI Systems and Financial Stability, From Model Risk to Systemic Risk

本論文は、予測型AIからエージェンティック(能動的)AIシステムへの移行が、金融リスクを分散可能な個別的エラーから非分散的なシステム的脅威へと変容させることを論じ、6つの数学的枠組みを通じて、こうしたリスクは検知や事後制御によって軽減することはできず、事前の構造的な防止策を必要とすることを実証するものである。

原著者: Sriram Nagaraj, Seung Jung Lee

公開日 2026-10-08
📖 1 分で読めます☕ さくっと読める

原著者: Sriram Nagaraj, Seung Jung Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

金融の安定性は、ある心地よい仮定に基づいている。それは、システムの一部が壊れても、残りの部分がその衝撃を吸収できるというものである。もし一つの銀行が破綻しても、他の銀行は生き残る。もし一人のトレーダーがミスをしても、市場は自らを修正する。これは、失敗が通常、特定の機関に固有のものであり、分散され、無関係であるために機能する。しかし、このセーフティネットを打ち砕く新しい種類のリスクが浮上している。それは「エージェンティック(代理的)」な人工知能から来るものである。これらは単に未来を予測するだけでなく、資金を移動させ、コードを書き、あるいは患者のケアを管理するといった、現実世界で行動を起こすシステムである。これらのエージェントの多くが同じ基礎となるソフトウェアに基づいている場合、単一のエラーや単一のハッキングは局所的なものにとどまらない。代わりに、それは一度にすべてのエージェントを襲い、小さな不具合をシステム全体の崩壊へと変えてしまう。

連邦準備制度の調査員たちは、融資のデフォルト(債務不履行)の可能性を測定し、損失をカバーするための資金を積み立てるという、伝統的な銀行業務におけるリスク管理の方法を長年研究してきた。彼らは現在、これら新しいAIシステムに対しても、この厳格な思考を適用しているが、従来のルールは通用しないことを見出した。核心的な問題は、これらのAIエージェントが人間の労働者や従来のソフトウェアとは異なる点にある。彼らは速度と自律性を持って行動し、ミスを犯したとき、その被害はしばしば不可逆的である。「不正な電信送金を『取り消す』」ことはできず、「重要なデータベースを『削除を取り消す』」こともできない。被害が永久的であり、かつ瞬時に発生するため、バックアッププランを用意したり、反応する前に状況を見守ったりするといった、通常のセーフティネットは役に立たないのである。調査員たちは、破滅を止める唯一の方法は、システムが稼働する前に、危険な能力をあらかじめ取り除くことで、破滅が起こり得ないようにすることであると発見した。

6つの異なる数学的調査にわたるこの研究は、まず単一のAIエージェントを見ることから始まる。伝統的な金融では、リスクはイベントの確率に損失の大きさを掛けることで計算される。調査員たちはこれをAI向けに適応させ、危害を3つの要素に分解した。すなわち、エージェントが有害な行動をとる可能性、その行動の深刻さ、そしてその影響がどこまで及ぶかである。彼らは、エージェントが攻撃を受けているとき、これら3つの要因は独立して機能しないことを突き止めた。単一の悪意あるイベントが、同時にエージェントの行動の可能性を高め、ダメージを悪化させ、さらにはダメージの範囲を拡大させるのである。これにより、危険が急速に複合していく「逆方向(wrong-way)」のリスクが生じる。最も重要な点は、不可逆的な危害に対しては、いくらモニタリングを行ったりミスを修正したりしても解決できないことを彼らが証明したことである。行動が取り消せない以上、唯一の解決策は、エージェントがその行動をとる能力自体を持たないようにすることである。

次に、調査員たちは視点を単一のエージェントから、同じ基礎モデル上で動作する数千のフリート(艦隊)へと広げた。ここでリスクは真にシステム的なものとなる。通常のポートフォリオでは、多くの異なる投資先を持っていれば、一つの失敗が他のものに影響を与えることはない。しかし、もしフリート内のすべてのエージェントが同じ「脳」を共有しているならば、その脳の欠陥はすべてに同時に影響を及ぼす。調査員たちは、フリートにどれほど多くのエージェントを追加しても、リスクは下がらないことを示した。代わりに、リスクは分散不可能な「底(フロア)」に達する。たとえエージェントが異なる企業や異なる国々に存在していても、もし彼らが同じ基礎ソフトウェアに依存しているならば、単一の失敗がグループ全体を崩壊させかねない。これが彼らの言う「モノカルチャー(単一栽培)」、つまり全員が全く同じ脅威に対して脆弱であるシステムである。

また、この研究はこれらのエージェントが互いにどのように相互作用するかについても調査した。現実世界では、エージェントはしばしば互いに情報を共有したり、タスクを調整したりしながら対話を行う。調査員たちは、この相互作用が新たな隠れた危険を生み出すことを発見した。たとえエージェントが異なるソフトウェアで構築されていたとしても、もし彼らが互いの声を聞くようにプログラムされていれば、危機に際して足並みを揃えて動き始める可能性がある。一つのエージェントがパニックに陥って行動を変えると、他のエージェントもそれに従い、リスクを広げる連鎖反応を引き起こす。これは、共通のソフトウェアの欠陥がなくても起こり得る。さらに、侵害されたエージェントは、言語を用いて仲間を説得し、有害な行動へと導くことができ、コードではなく会話を通じて伝染病のような広がりを見せる。これは、技術的なネットワークを分離するだけでは不十分であることを意味する。エージェントがどのようにコミュニケーションを取るかも制御されなければならない。

これらのリスクが時間の経過とともにどのように展開するかを理解するために、調査員たちは、地震や金融崩壊の研究と同様に、システムを連続的なイベントの流れとしてモデル化した。彼らは、リスクが緩やかな漂流ではなく、稀に起こる大規模な跳躍(ジャンプ)として振る舞うことを発見した。システムは長い間安定しているように見え、その後突然崩壊する。また、彼らは「ガードレール」を用いて、実行中のシステムを制御する方法についても検討した。彼らは、不可逆的なイベントに対しては、実行時の制御は根本的に限界があることを証明した。ある行動がすでに不可逆的である場合、それを検知して停止するのを待つのでは遅すぎるのである。災害の確率は、システムの監視がいかに優れているかではなく、システムの初期設計に完全に依存している。設計段階に組み込まれた欠陥を、監視によって修正することはできない。

研究の最終章では、高度なAIを使用する「敵対者(ハッカーまたは攻撃者)」を導入した。調査員たちは、攻撃者が最も弱い点を突き、防御者がそれを阻止しようとするゲームとしてこれを扱った。彼らは、攻撃者がAIを使用する場合、システムはより魅力的な標的になることを発見した。共有されたソフトウェアの基盤は、建物のすべてのドアを開けることができる「たった一つの鍵」のようなものである。もし泥棒がその鍵を見つけ出せば、一度にいたるところへ侵入できてしまう。研究によれば、各企業が個別に防衛を図る分散型の市場においては、誰もが最も重要な安全策である「構造的予防」への投資を過小評価することになる。企業は検知や反応といった、目に見えやすく測定しやすいものには資金を投じるが、危険な能力そのものを完全に取り除くという困難な作業は無視してしまう。これがシステム全体を脆弱な状態に置くのである。

調査員たちは、このリスクを管理する唯一の効果的な方法は「構造的予防」であると結論づけた。これは、事象が発生した後に捕まえようと期待するのではなく、破滅的な行動が物理的に実行不可能なようにシステムを設計することを意味する。これには、危険なツールの除去、権限の制限、そしてエージェントが不可逆的な危害を引き起こす可能性のある部分にアクセスできないようにすることなどが含まれる。このアプローチこそが、成長し続ける知的な敵対者に対して機能する唯一の方法であると、研究は証明している。AI技術が向上し、攻撃者がより有能になるにつれ、あらゆる新しい脅威を検知・反応するためのコストは無限大に膨らんでいく。対照的に、危険な能力を取り除くためのコストは、攻撃者がどれほど賢くなろうともシステムを永遠に保護する、一度限りの投資なのである。

論文は、規制当局やシステム設計者に向けて明確なメッセージを発している。AI時代の金融の安定は、個々の機関をより厳密に監視したり、単一の失敗が広がらないことを願ったりすることでは達成できない。リスクはあまりにも深く、あまりにも相互に連結している。システムを確保する唯一の方法は、システムが稼働し始める前に、構造的な選択を行うことである。これは、単一のソフトウェア基盤への依存度を制限し、エージェントが不可逆的な行動をとれないようにし、単一の故障点がネットワーク全体を崩壊させることができないように設計することを意味する。数学的な事実は明白である。共有された欠陥を分散によって回避することはできず、不可逆的なミスを検知によって回避することもできず、調整された攻撃を止めるために迅速に反応することもできない。唯一の解決策は、災厄が起こる隙を与えないようなシステムを構築することである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →