← 最新论文
💰 quantitative finance

Agentic AI Systems and Financial Stability, From Model Risk to Systemic Risk

本文认为,从预测型人工智能向代理型人工智能的转变,将金融风险从可分散的特异性误差转变为不可分散的系统性威胁,并通过六个数学框架论证了此类风险无法通过检测或事后控制来缓解,而需要事前性的结构性预防。

原作者: Sriram Nagaraj, Seung Jung Lee

发布于 2026-10-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sriram Nagaraj, Seung Jung Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

金融稳定依赖于一个令人宽慰的假设:当系统的某个部分发生故障时,其余部分可以吸收冲击。如果一家银行倒闭,其他银行仍能生存;如果一名交易员犯错,市场会自动纠正。这之所以奏效,是因为失败通常是特定机构所独有的,是分散且互不相关的。但一种新型风险正在出现,它打破了这种安全网。这种风险来自于“代理型”(agentic)人工智能——这些系统不仅能预测未来,还能在现实世界中采取行动,例如移动资金、编写代码或管理患者护理。当许多此类代理都构建在相同的底层软件基础上时,单一的错误或单一的黑客攻击将不再局限于局部,而是会同时打击每一个代理,将一个小小的故障演变成系统性的崩溃。

美联储的研究人员多年来一直致力于研究如何管理传统银行业的风险,他们通过衡量贷款违约的可能性并预留资金以覆盖损失。他们现在将这种严谨的思维应用于这些新型人工智能系统,但发现旧有的规则并不适用。核心问题在于,这些人工智能代理与人类员工或传统软件不同。它们行动迅速且具有自主性,一旦出错,造成的损害往往是不可逆转的。你无法“撤回”一笔欺诈性的电汇,也无法“撤销”一个被删除的关键数据库。由于伤害是永久性的且发生瞬时,传统的安全网——如制定备选方案或观察事态发展后再做出反应——都变得毫无用处。研究人员发现,阻止灾难的唯一方法是在系统运行之前就防止其发生,即在系统运行前就移除那些危险的能力。

这项研究涵盖了六个不同的数学调查,首先从观察单个人工智能代理开始。在传统金融中,风险是通过将事件发生的概率与损失规模相乘来计算的。研究人员针对人工智能对这一过程进行了改编,将伤害分解为三个部分:代理采取有害行动的可能性、该行动的严重程度以及其影响范围的广度。他们发现,当一个代理受到攻击时,这三个因素并非独立运作。一次恶意的事件可以同时提高代理采取行动的可能性、加剧破坏程度并扩大破坏范围。这创造了一种“反向”风险(wrong-way risk),即危险会迅速复合叠加。最重要的是,他们证明了对于不可逆转的伤害,任何监控或纠错能力都无法解决问题。如果一个行为无法被撤销,唯一的解决方案就是确保代理根本不具备执行该行为的能力。

随后,研究人员将视野从单个代理扩展到了拥有数千个代理的集群,而这些代理都运行在同一个基础模型之上。这正是风险演变为系统性风险的地方。在正常的投资组合中,如果你持有许多不同的投资,其中一个的失败不会影响其他投资。但如果集群中的每个代理都共享同一个“大脑”,那么这个大脑的一个缺陷就会同时影响它们所有人。研究人员表明,无论你在集群中增加多少个代理,风险都不会降低。相反,它会触及一个无法通过多样化来消除的“底线”。即使这些代理属于不同的公司或位于不同的国家,只要它们依赖于相同的底层软件,单一的故障就能导致整个群体的崩溃。这就是他们所说的“单一种植”(monoculture):一个每个人都对同一种威胁感到脆弱的系统。

研究还考察了这些代理如何相互作用。在现实世界中,代理经常相互交流,分享信息或协调任务。研究人员发现,这种互动创造了一种新的、隐藏的危险。即使代理是基于不同的软件构建的,如果它们被编程为相互倾听,它们就会在危机期间开始步调一致地行动。如果一个代理产生恐慌并改变行为,其他代理也会随之跟进,从而引发扩散风险的连锁反应。即便没有共同的软件缺陷,这种情况也会发生。此外,一个受损的代理可以利用语言说服其同伴去做一些有害的事情,从而创造出一种通过对话而非代码传播的传染。这意味着仅仅隔离技术网络是不够的;代理之间的通信方式也必须受到控制。

为了理解这些风险如何随时间演变,研究人员将系统建模为一个连续的事件流,类似于研究地震或金融危机的方式。他们发现,风险的表现更像是一个罕见的、巨大的跳跃,而非缓慢的漂移。系统可能看起来长期稳定,然后突然崩塌。他们还研究了如何在系统运行时使用“护栏”来控制这些系统。他们证明,对于不可逆转的事件,这些运行时控制在本质上是有限的。如果一个行为已经变得不可逆转,那么等待检测到它并阻止它就已经太晚了。灾难发生的概率完全取决于系统的初始设计,而不是取决于你在运行时如何观察它。任何监控都无法修复一个从一开始就内置其中的缺陷。

研究的最后章节引入了一个对手——一个同样使用先进人工智能的黑客或攻击者。研究人员将此视为一场博弈:攻击者试图寻找最薄弱的点,而防御者则试图封堵它。他们发现,当攻击者使用人工智能时,系统会变成一个极具吸引力的目标。共享的软件基础就像一把能打开大楼里每一扇门的钥匙;如果窃贼找到了这把钥匙,他们就可以同时进入所有地方。研究表明,在去中心化的市场中,由于每家公司都试图单独保护自己,每个人都会在最重要的安全措施——结构性预防上投入不足。他们会把钱花在检测和反应上,因为这些措施更容易观察和衡量,但他们会忽视彻底移除危险能力的艰巨工作。这使得整个系统变得脆弱不堪。

研究人员得出结论,管理这种风险的唯一有效方法是进行“结构性预防”。这意味着在设计系统时,要让灾难性的行为在物理上变得不可能执行,而不是寄希望于在发生后将其拦截。这包括移除危险工具、限制权限,并确保代理无法访问那些可能导致不可逆转伤害的部分。研究证明,面对日益增长的智能对手,这种方法是唯一行之有效的。随着人工智能技术的进步和攻击者能力的增强,尝试检测并应对每一个新威胁的成本将变得无穷大。相比之下,移除一项危险能力是一次性的投资,无论攻击者变得多么聪明,都能永久保护系统。

论文最后向监管机构和系统设计者传达了一个明确的信息。在人工智能时代,金融稳定不能通过更严密地监督每个机构或寄希望于单一故障不会扩散来实现。这种风险过于深层且高度互联。确保系统安全的唯一方法是在系统运行之前就做出结构性的选择。这意味着要限制对单一软件基础的依赖程度,确保代理无法采取不可逆转的行为,并设计系统使单一故障点无法拖垮整个网络。数学逻辑非常清晰:你无法通过多样化来消除共享的缺陷,你无法通过检测来挽救不可逆转的错误,你也无法通过反应速度来阻止一场协同攻击。唯一的解决方案是构建一个让灾难根本没有机会发生的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →