← 最新论文
🤖 machine learning

Focused PU learning from imbalanced data

本文提出了一种针对正例 - 未标记(PU)学习的新聚焦经验风险估计器,该估计器通过有效利用正例和未标记样本训练二分类器,在高度不平衡数据集上实现了最先进的性能,并在受控场景和现实世界的财务错报检测中均验证了其成功。

原作者: Elias Zavitsanos, Georgios Paliouras

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Elias Zavitsanos, Georgios Paliouras

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图在一堆庞大而混乱的普通岩石(“未标记”数据)中,找出几颗稀有且隐藏的宝石(“正例”)。问题在于,你只拥有一份他人先前找到的、微小且不完整的宝石清单。这堆岩石的其余部分是个谜:其中大部分是岩石,但也包含许多尚未被发现的更多宝石。

这就是PU 学习(正例 - 未标记学习)的世界。从发现银行欺诈到识别疾病基因,这是现实世界中常见的难题。通常,机器学习侦探需要一份包含“好人”和“坏人”的清单,才能学会如何区分它们。但在这里,他们只有一份“好人”清单和一个装满混合物品的大袋子。

问题:那些“难以察觉”的宝石

本文作者注意到了一种特定且棘手的情况:

  1. 宝石很稀有:这堆岩石中 overwhelmingly 充满了岩石(数据不平衡)。
  2. 宝石被伪装了:有些隐藏的宝石看起来与岩石如此相似,以至于最初的清单制定者都错过了它们。它们太难被发现了。

大多数现有的侦探方法假设隐藏的宝石是随机分布的或容易找到的。但在现实中,最难找到的宝石往往看起来最像岩石。当数据不平衡且“好”物品被伪装时,标准方法会感到困惑并失败。

解决方案:一副“聚焦”的放大镜

作者提出了一种名为iFPU(不平衡聚焦 PU)的新方法。这相当于给侦探一副特殊的、能够改变他们审视证据方式的“聚焦”放大镜。

这种方法不再同等对待每一个错误,而是使用一种名为Focal Loss(焦点损失)的工具。请看这个类比:

  • 标准学习:想象一位老师在批改试卷。如果学生答对了一道简单题,老师会给予轻微的“做得好”;如果答错了一道难题,老师会给予轻微的“再试试”。老师对所有题目一视同仁。
  • iFPU 方法:这位新老师更聪明。他们意识到答对简单题目很无聊,且帮助不大。但答对(或答错)困难题目至关重要。因此,他们忽略简单的部分,将所有精力集中在困难的问题上

从技术术语来说,该方法对简单样本(明显的岩石)进行“降权”,对困难样本(伪装的宝石)进行“升权”。这迫使计算机格外关注那些最可能是隐藏宝石的棘手案例。

他们如何测试

作者不仅谈论理论,还通过两种方式对他们的“新侦探”进行了测试:

  1. 训练场(14 个数据集):他们选取了 14 个不同的真实世界数据集(如医疗记录、信用卡数据和卫星图像),并人为地隐藏了一些“好”物品以模拟该问题。他们将他们的方法与其他顶级侦探工具进行了测试。

    • 结果:他们的“聚焦”方法始终比其他方法发现更多的隐藏宝石,特别是在数据非常不平衡且“好”物品难以被发现的情况下。其表现几乎与现有最佳方法相当,但在处理“伪装”宝石方面表现更佳。
  2. 现实案例(金融欺诈):他们将该方法应用于一个真实场景:发现财务误述(公司报告中的错误或谎言)。

    • 挑战:审计师往往在数年后才知道报告是错误的。因此,在训练 AI 时,许多“错误”报告仍被标记为“未知”(未标记),而已知的“错误”报告非常稀少。
    • 结果:他们的方法优于之前的最先进模型。它更擅长对报告进行排序,以便人类审计员能优先发现最可疑的报告。

核心结论

本文介绍了一种更聪明的方法,用于教导计算机在常见物品的海洋中寻找稀有且隐藏的事物,特别是当这些隐藏事物难以与常见事物区分时。通过采用一种忽略简单部分、专注于困难且被伪装案例的“聚焦”方法,该方法在受控测试和现实世界的金融欺诈检测中均取得了更好的结果。

关键要点:如果你在干草堆里找一根针,而这根针看起来和干草一模一样,不要只是随机扫描整个干草堆。使用一种能专门突出干草堆中可能是针的部分、而忽略明显干草的工具。这就是本文所做的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →