Density-Informed Pseudo-Counts for Calibrated Evidential Deep Learning
本文通过引入密度知觉伪计数证据深度学习(DIP-EDL),即一种通过边缘协变量密度将类别预测与不确定性估计解耦的方法,解决了标准证据深度学习在分布外数据上过度自信的问题,从而实现了更佳的校准不确定性和分布偏移下的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人识别动物。你给它看了成千上万张猫和狗的照片,它学会了非常有信心地说出“猫”或“狗”。但当你给它看一张烤面包机的照片时,会发生什么呢?一个标准的机器人可能仍然会以 99% 的确定度大喊“是猫!”,完全确信自己是对的,尽管它看到的是一个厨房电器。这是人工智能领域的一个重大问题:机器往往不擅长知道自己“不知道”什么。它们会过度自信,尤其是在看到它们从未训练过的东西时。
为了解决这个问题,科学家们使用了一种叫做**证据深度学习(Evidential Deep Learning, EDL)**的技术。把 EDL 想象成给机器人一个除了答案之外的“信心计”。它不仅仅是在瞎猜,机器人还会尝试估算它拥有多少“证据”。如果它见过一百万只猫,它就拥有一座证据之山。如果它看到一个烤面包机,它应该拥有很少的证据并说:“我不确定。”然而,研究人员发现,当前版本的信心计是损坏的。它混淆了两种不同类型的确定性:一种是由数据本身很乱(比如模糊的照片)引起的,另一种是由于机器人根本没见过这类物体。因为这种混淆,机器人即使在看到完全陌生的事物时,依然会固执地保持高度自信。
这篇题为《用于校准证据深度学习的密度信息伪计数》(Density-Informed Pseudo-Counts for Calibrated Evidential Deep Learning)的论文解决了这个损坏的信心计问题。作者们——来自德克萨斯大学奥斯汀分校的 Pietro Carlotti、Nevena Gligić 和 Arya Farahi——首先从数学上证明了旧方法为什么会失败。他们证明了机器人的信心实际上是由人类程序员选择的一个随机设置所控制的,而不是由实际数据控制的。为了修复这个问题,他们发明了一种新方法,称为 DIP-EDL。DIP-EDL 不仅仅是猜测,它教会机器人两项单独的技能:首先,如何识别动物(分类);第二,如何绘制数据的“邻域”图谱,以观察该区域是拥挤还是空旷(密度)。如果机器人在地图中一个非常空旷、陌生的区域看到了一个烤面包机,DIP-EDL 会迫使它承认:“我不知道这是什么”,而不是胡乱猜测。
破碎的指南针与新地图
想象你是一名试图破解谜团的侦探。你有一个笔记本用来记录线索。在旧系统中(标准 EDL),每当你发现一个线索,你就会把它记下来并立即大喊:“我解开了!”但问题在于:这个笔记本有一个奇怪的规则。无论你找到了多少线索,你感受到的“信心”都由你在案件开始时设置的一个旋钮决定。如果你把旋钮调到“高信心”,即使你只找到了一个微小且摇晃的线索,你也会感到超级笃定。如果你把它调到“低信心”,即使你面对着一座证据之山,你也可能会怀疑自己。论文作者证明,这正是标准 AI 所发生的情况。AI 的“不确定性”实际上并不是在测量它知道多少,而是在遵循人类转动的那个旋钮。这意味着 AI 无法区分一张模糊的猫的照片(这本质上是难以看清的)和一张烤面包机的照片(这是一个完全陌生的物体)。它会对烤面包机过度自信,从而导致危险的错误。
两步走的侦探
为了修复这个问题,作者创建了一个新的侦探:DIP-EDL。这个新侦探不再使用一个带有损坏旋钮的单一笔记本,而是使用两个协同工作的独立工具。
首先,侦探有一个分类器(Classifier)。这部分负责观察图片并说:“那看起来像一只猫。”它在这项工作上表现出色。
其次,侦探有一个密度估计器(Density Estimator)。这就像是一张城市地图。它不在乎猫或狗,它只关心街道有多拥挤。它知道“猫区”住满了房子,但“烤面包机区”是一片广袤荒凉的沙漠。
这就是神奇之处:新侦探将这两者结合了起来。当分类器在拥挤的“猫区”看到一只猫时,它会说:“我很确定!”因为它周围有很多类似的房子。但当分类器在空旷的“烤面包机区”看到一个烤面包机时,密度估计器会低声提醒:“嘿,这个区域是空的!我们从未在这里见过这样的东西。”新侦探会听取这个耳语,并立即降低其信心。它会说:“我不知道这是什么”,而不是进行盲目猜测。
他们的发现
作者不仅提出了这个想法,还对其进行了严格测试。他们在三个数据集上运行了实验:
- MNIST:手写数字集合(如 0 到 9)。
- CIFAR-10:各种日常物品(如飞机、汽车和鸟类)的小型彩色照片集合。
- LAMOST:包含恒星和星系图像的真实世界科学数据集。
在每一次测试中,他们都将他们的 DIP-EDL 侦探与旧的、损坏的方法,甚至与一些需要巨大计算能力的昂贵且复杂的算法进行了对比。
结果令人印象深刻。在手写数字(MNIST)方面,DIP-EDL 的分类正确率达到了 99.53%。更重要的是,当他们展示“分布外”(out-of-distribution)图像(如字母而非数字)时,它能以近乎完美的准确度将其识别为未知物体。它在识别“烤面包机”方面比旧方法要好得多。
在更困难的 CIFAR-10 照片测试中,DIP-EDL 是表现最好的单模型方法,准确率达到了 95.03%。它也是唯一一种既能在对未知物进行排序方面表现出色(知道哪些是奇怪的),又能在校准信心方面表现准确(在不该自信时不会过度自信)的方法。
甚至在复杂的观星数据集(LAMOST)中,许多其他方法完全失效的情况下,DIP-EDL 也并列排名第一(89.29%),并且在识别“恒星”图像作为离群值方面做得很好。
为什么这很重要
论文指出,通过将“它是什么?”的问题与“这个地方有多拥挤?”的问题分开,我们可以构建出对自身局限性更加诚实的 AI。作者从数学上证明了,随着数据量的增加,他们的方法会变得越来越有效,这意味着机器人随着学习的深入会变得越来越可靠。
他们还展示了这种新方法具有灵活性。它不需要机器人具备特定的神经网络类型;它可以与你提供的几乎任何分类器配合工作。而且,与其他需要将图片通过 AI 运行十次才能得到良好答案的方法不同,DIP-EDL 只需要看一次,因此既快速又高效。
简而言之,作者不仅仅是微调了旧系统,他们意识到旧系统对于“不确定性”的定义存在根本性的混乱。通过赋予 AI 一张关于自身知识的地图,他们教会了它在面对未知时保持谦逊,从而使其在现实世界中使用时更加安全和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。