在现代金融世界中,贷款决策已从银行家的办公桌转移到了算法之中。当你通过点对点(P2P)平台申请贷款时,计算机系统会立即分析你的收入、债务和历史记录,以判断你是否值得信赖。这些系统依赖于机器学习,这是人工智能的一个分支,通过在海量数据中寻找模式来进行预测。几十年来,这些模型的评价标准一直是它们在正常情况下的表现,其前提是假设借款人提供的信息是诚实且准确的。然而,研究人员日益关注的一个问题是,当这一假设失效时会发生什么。正如保安可能会被巧妙的伪装所蒙蔽一样,信用评分算法也可能被欺骗——如果申请人策略性地微调他们申报的数据。这一被称为对抗性机器学习的研究领域,调查了这些数字决策者在面对蓄意、精算的欺骗尝试时会如何反应。
荷兰特文特大学的一个研究小组致力于测试这些信用评分系统在面对此类欺骗时的韧性。他们将目光投向了点对点贷款市场,即个人在没有传统银行作为中间人的情况下,将钱贷给其他个人的市场。利用一个包含近40 0万条贷款记录的海量数据集,该团队模拟了一个场景:申请人试图操纵其个人资料,以获得原本可能无法获得的贷款批准。他们不仅测试了一种类型的诡计;他们采用了四种不同的操纵方法。其中两种方法依赖于计算出精确的数学方向,通过微调数据来改变结果;另一种涉及随机翻转数据值以制造混乱;第四种则寻求将拒绝结果转变为批准所需的最小改动。研究人员随后训练了三种不同类型的计算机模型——一个简单的线性模型、一个复杂的神经网络以及一个现代的 Transformer 模型——来应对这些攻击。
他们实验的核心是一个严谨的训练与测试过程。他们通过在学习阶段向模型输入被操纵的数据示例,教会模型识别这些特定的诡计,这种技术被称为对抗性训练。随后,他们测试了这些经过训练的模型在面对相同的诡计以及从未见过的其他诡计时的表现。结果揭示了一个清晰的模式:当一个模型专门针对某种类型的操纵进行训练时,它在识别该特定诡计方面表现得非常出色。例如,一个经过训练以抵御特定类型计算性微调的模型,会对同一种微调具有极强的抵抗力,即使数据被篡改也能保持其准确性。然而,这种保护并不会自动延伸到其他类型的欺骗。一个经过训练以抵御计算性微调的模型,在面对随机的、混乱的数据损坏时仍然显得异常脆弱,反之亦然。
或许最显著的发现是,依赖单一类型的防御会产生一种虚假的安全感。研究人员发现,针对一种攻击类型进行训练的模型,在面对其他攻击时仍会暴露弱点,就像一把锁虽然能防住万能钥匙,但在面对撞击钥匙时却很脆弱。为了解决这个问题,他们测试了一种混合训练策略,即让模型同时接触所有四种操纵类型。这种方法产生了最均衡的结果。这些模型在处理正常的、诚实的申请时保持了高准确率,同时也对各种攻击(无论是计算性的还是混乱性的)表现出了强大的抵抗力。这项研究表明,对于金融机构而言,构建更安全系统的路径不在于完善针对单一已知威胁的防御,而在于针对多样化的潜在欺骗进行压力测试。通过这样做,放贷者可以建立起更加稳健的系统,使其在申请人试图钻系统漏洞时依然保持可靠,从而确保服务于经济的技术与它所服务的民众一样坚韧。
技术摘要:用于表格型信用评分的对抗性训练
问题陈述
基于机器学习的信用评分在点对点(P2P)借贷中日益重要,但其对对抗性操纵的韧性仍未得到充分理解。在这种背景下,申请人可能会策略性地修改自报的输入信息,以获取更有利的贷款决策。虽然对抗鲁棒性在图像和文本领域已得到广泛研究,但在表格型信用数据方面的证据却非常有限。现有文献通常仅评估单一攻击与匹配防御之间的关系,未能解决防御如何跨不同攻击类型进行泛化,或在混合威胁场景下的表现如何。此外,实际操作中的攻击者不太可能仅遵循单一威胁模型,这表明“一对一”的攻击-防御评估可能会高估现实世界的韧性。
方法论
本研究采用了一个系统的训练-测试鲁型基准测试,使用了 Lending Club 数据集的一个大型子集(近 40 万条观测值)。实验设计遵循受 CRISP-ML 启发的流水线,重点关注推理阶段的规避攻击。
- 模型: 评估了三种不同的模型族:逻辑回归(线性基准)、前馈神经网络(NN)以及基于 Transformer 的表格数据模型(FT-Transformer)。
- 对抗攻击: 实现并测试了四种特定的攻击算法,并将攻击限制在申请人可修改的特征上(例如:annual_inc、dti、revol_bal、revol_util、purpose、zip_code):
- 快速梯度上升法 (FGSM): 一种白盒、基于梯度的攻击。
- 投影梯度下降法 (PGD): 一种迭代式白盒、基于梯度的攻击。
- DeepFool: 一种寻找边界的攻击,通过计算跨越决策边界所需的最小扰动。
- 椒盐噪声 (S&P Noise): 一种非梯度扰动,模拟数据损坏或粗略的操作。
- 混合机制 (Mixed Regime): 一种结合多种攻击类型的训练策略。
- 实验设计: 研究利用了完整的训练与测试配置网格。模型分别在干净数据以及经特定攻击类型(FGSM、PGD、S&P、DeepFool 或 Mixed)增强后的数据上进行训练。随后,这些模型在干净测试集以及受五种攻击类型扰动的测试集上进行评估。
- 约束条件: 扰动严格限制在申请人可以合理操纵的特征内,以确保攻击场景的真实性。梯度攻击使用二进制掩码(binary masks)以防止更新不可变特征。
- 指标: 性能通过 ROC AUC、准确率(accuracy)、精确率(precision)、召回率(recall)和 F1 分数进行衡量,并特别关注类别 0 指标(违约检测),因为误判违约的成本更高。研究采用了分层 5 折交叉验证以确保估计的稳定性。
关键结果
- 干净基准: 所有三个模型族在干净数据上均表现出强大的判别能力(ROC AUC 为 0.903–0.906),其中 Transformer 和逻辑回归的准确率(0.826)略高于神经网络(0.822)。
- 干净模型的脆弱性: 在未经对抗训练的模型在受扰动测试集上评估时,表现出中度退化。基于梯度的攻击(FGSM/PGD)和 DeepFool 使 ROC AUC 降至约 0.85–0.87。S&P 噪声也导致了类似的下降。值得注意的是,针对性攻击(FGM/PGD)系统性地减少了预测的违约数量,将案例向“全额偿还”(Fully Paid)类别转移。
- 对抗训练效能:
- 匹配攻击: 当训练攻击与测试攻击匹配时,对抗训练显著提高了鲁棒性。例如,在 FGSM/PGD 上训练的神经网络在相应的测试集上实现了 0.952–0.959 的 ROC AUC 分数,明显优于干净训练的基准模型。
- 跨攻击泛化(梯度类): 鲁棒性在基于梯度的家族内部转移良好;在 FGSM 上训练的模型在接受 PGD 测试时的表现与在 PGD 上训练的模型几乎一致。
- 跨攻击泛化(非梯度类): 向非梯度破坏(S&P)的转移较弱。在基于梯度攻击上训练的模型并未显著提高对 S&P 噪声的鲁棒性,反之亦然。
- 混合训练: 混合训练机制(在训练期间结合多种攻击类型)提供了最均衡的鲁棒性。它在保持干净测试性能的同时,为 FGSM/PGD 提供了强大的韧性,并且与单攻击防御相比,在 DeepFool 和 S&P 下表现出更好的稳定性。
- 干净性能权衡: 对于高容量模型(神经网络和 Transformer),提高鲁棒性并不需要以牺牲干净数据的性能为代价。在某些情况下,经过对抗训练的变体甚至维持或略微超过了干净基准的准确率。
意义与贡献
本文对信用风险和对抗性机器学习领域的文献做出了三个主要贡献:
- 经验基准: 它提供了对 P2P 信用风险评估中对抗机器学习(AML)的全面评估,测试了多种性质不同的扰动机制(基于梯度和非梯度),同时将攻击限制在真实的、可修改的申请人特征上。
- 混合训练分析: 它引入并评估了混合训练-测试策略,证明了单一攻击防御可能会高估现实世界的韧性。研究表明,在攻击者策略不确定或具有异质性的场景下,混合训练提供了更可靠的默认方案。
- 实践指导: 通过针对真实借贷数据的基准测试,该研究为模型治理提供了实践指导。它表明,虽然对抗训练可以增强模型针对特定威胁的鲁棒性,但必须采用多攻击压力测试方法,才能确保系统在面对现实世界中多样且不断变化的对手策略时保持韧性。
作者得出结论,虽然对抗训练能有效强化模型抵御特定威胁的能力,但对于运营中的信用评分流水线,仅依赖单一攻击防御是不够的。相反,他们主张采用混合训练策略,并将对抗压力测试整合到模型治理中,以确保系统在现实且异质的威胁场景下保持稳健。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。