Calibratable Disambiguation Loss for Multi-Instance Partial-Label Learning
本文提出了一种即插即用的可校准消歧损失(CDL),该损失通过调节基于间隔的目标函数,在多实例部分标签学习中同时提高分类准确率和模型校准度,从而解决现有 MIPL 方法中固有的可靠性问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜团的侦探,但你面临两个大难题。首先,你无法一次看到完整的犯罪现场;你只能看到零散、细小的线索(照片中的局部区域),并且必须据此推测整个房间发生了什么。其次,当你向人群询问嫌疑人的名字时,他们并没有给你一个确切的名字。他们给了你一个名单,上面有三四个名字,并说:“可能是其中之一!”但他们不会告诉你哪一个才是真正的罪犯。
这就是**多实例部分标签学习(Multi-Instance Partial-Label Learning, MIPL)**的混乱现实。这是一种计算机从不完美数据中学习的极其棘手的方式。你正在阅读的论文针对了其中的一个特定痛点:置信度(confidence)。
问题所在:过度自信(或缺乏自信)的侦探
在过去,试图解决这些 MIPL 谜题的计算机就像是那些要么畏首畏尾不敢下结论,要么在错误时又过于自大的侦探。
作者发现,现有的方法(如 DEMIPL、ELIMIPL 和 MIPLMA)在判断自己“有多确定”方面表现得很糟糕。如果计算机说:“我有 90% 的把握这是肿瘤”,它实际正确的概率往往只有 60%。或者,如果它说:“我只有 25% 的把握”,它实际正确的概率可能高达 80%。
在现实世界中,这是非常危险的。想象一下医生使用 AI 来观察病理切片(细胞图像)的情景。如果 AI 说:“我有 90% 的把握这是癌症”,医生可能会匆忙开始治疗。但如果 AI 实际只有 60% 的正确率,那将是一场灾难。计算机必须是经过校准的(calibrated):如果它说“90%”,那么它在 90% 的情况下都应该是正确的。
论文明确反对了一个人们最初尝试过的简单修复方案:仅仅是将标准的“Focal Loss”(一种通常用于已知精确答案的工具)直接套用到这个混乱的 MIPL 问题上。作者展示了这种天真的做法会让计算机变得要么过于胆怯(置信度不足),要么过于傲慢(过度自信),并且实际上会让计算机获取正确答案的能力变差。
解决方案:“顶尖 vs 竞争者”的间距
那么,作者发明了什么呢?他们创造了一个名为**可校准消歧损失(Calibratable Disbiguations Loss, CDL)**的新工具。
把计算机的大脑想象成一个正在参加多选题考试的学生,而老师只给了他一组可能的选项(“候选集”)。学生必须从这个列表中选出正确的一个。
在旧的方法中,学生只是试图大喊:“我知道答案!”并尽可能快地将所选答案推向 100% 的置信度。这导致了“过度自信”的问题。
新的 CDL 方法则像是一位严厉的老师,他会说:“不要只对着你的答案大喊大叫。看看你的竞争者。”
- 竞争者(The Competitor): 这是计算机做出的第二好的猜测。
- 规则: 只有当计算机的第一选择明显优于第二好的选择时,它才被允许获得极高的置信度。
如果计算机正处于挣扎阶段,且它的第一选择和第二选择不相上下(间距很小),CDL 会说:“好吧,继续努力,先别自以为是。”但如果第一选择远超竞争者,CDL 则会说:“做得好!你现在可以放松并保持自信了。”
这创造了该工具的两种版本:
- CDL-CC: 将第一选择与第二好的候选者进行比较(就像比较赛跑中的第 1 名和第 2 名)。
- CDL-CN: 将第一选择与最强的非候选者进行比较(就像将第 1 名选手与那些甚至没被允许参赛的人进行比较)。
结果:用数据说话
作者并不仅仅是凭直觉认为这行得通;他们在包括真实世界的结直肠癌病理图像和标准图像数据集(如 MNIST)在内的许多数据集上进行了测试。
以下是他们的发现,包含了实验中的准确数字:
- 更高的准确率: 在 Birdsong-MIPL 数据集上,旧的最佳方法(DEMIPL)达到了 74.36% 的准确率。他们的新方法(DAMCN)跃升至 80.38%。在包含三个错误标签的 SIVAL-MIPL 数据集上,他们比旧方法在准确率上实现了巨大的 18.58% 的提升。
- 更好的校准度: 这是最大的胜利。旧方法在“期望校准误差”(Expected Calibration Error, ECE)方面表现很差,该指标衡量的是其置信度与现实之间的差距。
- 在带有三个错误标签的 Birdsong-MIPL 数据集上,旧方法(DEMIPL)的 ECE 为 53.42%。这表明其宣称的置信度与事实之间存在巨大鸿沟。
- 他们的新方法(DAMCN)将该误差大幅削减至 4.52%。
- 总之,在基准数据集的 60 个不同测试案例中,他们的方法在 26 个案例中将校准误差降低了超过 50%。平均降幅为 44.76%。
结论
论文证明,通过加入这种“间距”规则——即迫使计算机检查其最佳猜测相对于亚军而言究竟优秀了多少——你可以在不损害获取正确答案能力的前提下,修复计算机的置信度问题。
他们展示了这种方法适用于从简单的图像拼图到复杂的医学图像的所有场景,在这些场景中,他们利用深度学习将图像分解为 9、16 甚至 25 个微小的补丁。图像越复杂,他们的新方法帮助越大,在最困难的癌症数据集上,某些版本的校准误差降低了 33.32%。
所以,下次当你看到 AI 进行医疗诊断时,你可以希望它使用的是类似这样的方法:一种知道自己到底有多确定的方法,因为它学会了在开始大喊“我对了!”之前,先尊重它的竞争对手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。