← 最新论文
📈 economics

Hard and Soft Label Assignment for Cost-Sensitive Semi-Supervised Reject Inference in Credit Scoring

本文提出了 RI-CSCEM,一种成本敏感的半监督期望最大化框架,该框架通过为信用评分中被拒绝的申请人分配硬伪标签或软伪标签,有效地缓解了样本选择偏差和不对称误分类成本,从而在 Lending Club 数据集上表现优于仅基于已接受样本的基准模型。

原作者: Abderrahim EL AMRANI, Mounir EL ANNAS, Badreddine BENYACOUB, Mohammed EL HAJ TIRARI

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Abderrahim EL AMRANI, Mounir EL ANNAS, Badreddine BENYACOUB, Mohammed EL HAJ TIRARI

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在决定谁能获得贷款的银行经理。你面前有一份庞大的申请人名单,但你只见过那些被你接受的人的结果。你知道谁还清了贷款,谁违约了。但是,对于那成千上万被你拒绝的人呢?你完全不知道他们原本会是优秀的借款人还是糟糕的借款人。你直接把他们丢弃了。

这造成了一个盲点。如果你只从那些被你接受的人身上学习,你的“风险评分”可能会带有偏差,因为你从未在那些被你说“不”的人身上测试过你的规则。这被称为拒绝推断(Reject Inference):试图猜测那些被你拒绝的人原本会发生什么。

然而,这里存在第二个问题:在贷款业务中,犯错的代价是不相等的。

  • 错误 A: 你拒绝了一个优秀的人。你损失了一点利息收入。
  • 错误 B: 你接受了一个糟糕的人(违约者)。他们没有偿还贷款,你损失了全部的贷款金额。
    错误 B 的代价要高得多。大多数标准的计算机模型将这两类错误视为同等对待,这就像是在说失去一美元和失去一栋房子是一样一样的。

解决方案:RI-CSCEM

该论文的作者构建了一个名为 RI-CSCEM 的新工具。把它想象成一个聪明的、具备成本意识的老师,它既能从通过的学生(被接受的申请人)身上学习,也能从被踢出教室的学生(被拒绝的申请人)身上学习。

它是如何运作的,这里使用简单的类比:

1. “软”预测 vs. “硬”预测

当模型观察一个被拒绝的申请人时,它必须猜测:“这个人原本会还清贷款吗?”

  • “硬”方法(旧方法): 模型强行做一个二元选择。它说:“这个人肯定是好的还款者,”或者“这个人肯定是坏的还款者。”这就像一名裁判吹响哨声,以 100% 的确定性判定一次判罚是“安全”还是“出界”。问题在于,如果裁判并不确定,强行做出决定会毁掉比赛。
  • “软”方法(本文的创新): 模型会说:“这个人有 60% 的概率是好的还款者,40% 的概率是坏的还款者。”它分配了一个软责任(soft responsibility)。它没有使用单一的标签,而是将申请人分布在两种可能性之中。
    • 类比: 想象一个陪审团。他们不是投票“有罪”或“无罪”,而是投票“60% 有罪,40% 无罪”。这保留了细微差别和不确定性,有助于模型更好地学习模式。

2. “成本敏感型”平衡

模型知道捕捉到“坏还款者”比避免“虚假警报”更重要。

  • 它使用了一个特殊的比例尺。如果模型认为某人可能是违约者,它会比认为某人可能是好还款者时,赋予后者更重的权重。
  • 它还有一个保持平衡的规则。它确保模型在被拒绝群体中猜测出的“坏还款者”数量,与它在被接受群体中实际看到的坏还款者比例相匹配。这可以防止模型为了保险起见而变得极端,从而判定所有人都是坏还款者。

3. 学习循环(“老师”法)

该模型使用了一种称为**分类 EM(Classification EM)**的技术。想象一位老师试图为一份有一半答案缺失的试卷评分:

  1. 第一步(猜测): 老师根据目前掌握的信息,对缺失的答案做出最佳猜测。
  2. 第二步(教学): 老师利用这些猜测来重新学习整个班级(包括已知答案和猜测的答案),以改进其评分规则。
  3. 第三步(重复): 老师基于改进后的规则做出新的、更好的猜测,如此循环往复,直到评分规则趋于完美。

他们发现了什么?

作者在 Lending Club(一个大型在线贷款平台)的真实数据上测试了该模型。他们将这个新工具与 12 种其他方法进行了对比,其中包括标准模型和其他“拒绝推断”技巧。

  • 结果: 他们的工具(RI-CSCEM)表现得与仅观察被接受申请人的最佳模型一样出色。它并没有神奇地变得超人,但它成功地利用了“被拒绝”的数据,且没有损害性能。
  • 关键发现: “软”方法是成功的秘诀。当他们强迫模型做出“硬”猜测(确定是好人或坏人)时,模型会变得混乱,并丧失区分好坏借款人的能力。当他们使用“软”猜测(概率)时,模型的区分能力(称为 AUC)显著提升。
  • “为什么”: 论文解释说,由于银行的拒绝规则是基于可见数据(如信用评分)制定的,因此“被拒绝”的群体并非隐藏着天才或罪犯。他们只是一个与被接受群体相似的混合体。因此,模型不需要成为魔术师来猜测他们的结果;它只需要小心不要犯下昂贵的错误。

核心结论

这篇论文介绍了一种让银行从被拒绝的人身上学习的更聪明的方法。通过将被拒绝的申请人视为“可能好,也可能坏”(软标签),而不是强行做出是非判断,并充分考虑损失资金的成本,该模型变得更加稳健。当拒绝规则是公平的时候,它并不一定会比现有方法更好地预测未来,但它确保了模型在尝试从不完整数据中学习时不会崩溃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →