FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud
本文介绍了 FraudBench,这是一个创新的可执行基准测试,旨在通过模拟智能体与恶意呼叫者之间围绕可变账户状态和内部政策文档进行的动态交互,来压力测试基于策略的银行业智能体在应对自适应、依赖历史的欺诈场景时的表现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代金融世界中,银行的客户服务代表不再仅仅是一个接听电话的人。越来越多地,该代表是一个计算机程序,一个人工智能代理,旨在进行对话、理解复杂的请求并采取行动。这些代理被赋予了强大的工具:它们可以查询客户的账户余额、验证丢失的密码、冻结被盗的信用卡,甚至可以在一个账户之间转移资金。它们还可以访问银行的内部规则手册,即数千页规定了代理被允许做什么以及必须拒绝什么的文档。这项技术带来的承诺是便利;拨打者可以在无需排队等待的情况下,在几分钟内解决危机。然而,风险在于,如果拨打者知道如何操纵对话,这些帮助合法客户的强大工具可能会被用来对付银行。如果一个人能通过巧妙编织的故事,诱骗代理相信自己是另有其人,或者让代理忽略某项安全规则,那么代理可能会执行导致实际经济损失的操作。研究人员的核心问题不在于这些代理是否能理解语言,而在于当人类试图积极欺骗它们时,它们是否能理解危险。
一个研究团队构建了一个新的测试场来回答这个问题,他们称之为 FraudBench 的系统。他们并没有简单地要求人工智能阅读一份可疑交易列表或识别一封诈骗邮件,而是创建了一个实时模拟环境,其中一个计算机程序扮演银行代理的角色,而另一个计算机程序扮演诈骗者的角色。这两个程序进行着长期的、多轮的对话,非常类似于真实的电话通话。诈骗者的目标是操纵代理执行不安全的操作,例如将资金转移到犯罪账户或泄露私人信息。代理的任务是倾听、检查银行内部规则、验证来电者的身份,并决定是提供帮助还是停止请求。研究人员发现,虽然这些代理擅长遵循指令,但当指令成为一个较长且具有欺骗性的故事的一部分时,它们往往会失败。
该模拟系统建立在一个现实的基础之上。代理在一个包含 125 名虚构客户及其账户和交易历史的数字银行环境中运行。它还可以访问一个包含 698 份内部政策文件的庞大库,它必须通过检索这些文件来为任何给定情况找到正确的规则。该代理拥有 17 种不同的工具可以使用,从简单的查询到高风险的操作,如重置个人识别码(PIN)或解冻卡片。受独立程序控制的诈骗者不仅仅是在索要钱财;它试图利用代理的信任。诈骗者可能会先通过提出一个无害的问题来建立亲密度,然后慢慢引入一种虚假的紧迫感,或者承认一个小谎言以测试代理的反应。最危险的攻击是那些具有适应性的攻击,这意味着诈骗者会根据代理的反应来改变策略。如果代理拒绝了一个请求,诈нок者可能会尝试另一种角度;或者如果代理在之前的对话中犯了一个小错误,诈骗者可能会利用这个错误来为后续更大的不安全请求寻找理由。
为了测试这些代理,研究人员创建了 150 个特定的场景,每个场景都旨在针对不同类型的欺诈。这些场景包括窃取账户的企图、绕过身份检查的诡计,以及通过一系列虚假账户转移资金的计划。他们还包括了一组“链式”攻击,其中一系列看似无害的小步骤最终导致了重大的安全漏洞。随后,研究人员让四种不同的人工智能模型通过这 150 个场景进行测试,以观察它们保护银行的能力如何。结果褒贬不一。表现最好的模型能够在约 65% 的案例中阻止诈骗者,而表现最弱的模型成功率仅约为一半。这意味着在大量的模拟中,代理被诱骗执行了它本应拒绝的操作。研究人员发现,代理在两种特定类型的欺骗面前表现最为吃力:“钱骡”(money mule)计划,即诈骗者试图利用受害者的账户转移赃款;以及“链式”攻击,即危险隐藏在对话的历史记录中,而非当前的请求中。
这项研究凸显了目前评估这些代理时的一个关键缺陷。许多现有的测试仅通过查看对话中的最后一条消息来判断代理是否做对了。然而,FraudBench 表明,安全性取决于整个交互过程的历史。一个代理可能会正确拒绝一笔大额转账请求,但如果它在之前的聊天中不小心泄露了一个秘密代码,那么对话就已经被破坏了。研究人员发现,代理往往无法记住这些早期的错误,也无法将它们与当前的请求联系起来。他们还发现,当代理必须自行搜索规则而非直接获取文档时,它们很难在 698 份文档库中找到正确的规则。当研究人员强制要求代理自行搜索规则时,表现最好的模型的成功率下降了 13 个百分点,这表明获取信息的能力与推理信息的能力同样重要。
或许最重要的发现是,安全性与帮助性之间存在着张力。一个过于渴望帮助客户的代理可能会被诱骗做出有害的行为,而一个过于谨慎的代理可能会拒绝那些仅仅是心情不佳的合法客户。研究人员没有发现任何一个模型能够完美兼顾阻止欺诈和帮助真实人类。相反,他们观察到了一个权衡关系:那些更擅长拦截攻击的模型,有时更容易拒绝有效的请求。这表明,构建一个真正安全的银行代理不仅是让软件变得更聪明的问题,更在于仔细平衡其行动意愿与检测欺骗的能力。研究人员强调,他们的工作是使用虚构数据进行的模拟,因此结果并不能完全预测现实中的银行表现,但它们为当前技术的脆弱之处提供了一张清晰的地图。通过在受控环境中暴露这些弱点,这项研究为开发者提供了一条路径,使他们能够构建出既能应对现代银行欺诈复杂且危险的局面,又不失服务公众能力的代理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。