Benchmarking non-conformity score functions in conformal prediction
本文概述了共形预测中非一致性评分函数的修改,并提出了一种新颖的评估方法,以基准测试其在生成预测集方面的有效性,特别是在类别不平衡条件下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对该论文的解读。
宏观视角:从“猜一个答案”到“列出一份安全清单”
想象你在玩“猜动物”的游戏。标准的机器学习模型就像一个自信满满的朋友,指着图片说:“那肯定是一只猫。”有时他们是对的,但有时也会错,而且他们从不承认自己不确定。
共形预测(Conformal Prediction) 则是一种不同的方法。模型不再只猜一个动物,而是给你一份可能性清单。它可能会说:“这很可能是一只猫,但也可能是狗或狐狸。”
这种方法的神奇之处在于它提供了一个安全网。如果你告诉模型:“我希望有 95% 的把握,我的答案在清单里”,模型就会调整清单的大小,以确保从长远来看,真实的动物确实出现在该清单中的概率达到 95%。
问题:清单应该有多大?
这篇论文提出了一个关键问题:我们该如何决定清单里包含什么?
如果清单太小(例如只有“猫”),你可能会错过真实的答案。如果清单太大(例如“猫、狗、狐狸、仓鼠、金鱼”),虽然安全,但清单毫无用处,因为它包含了所有东西。
模型用来决定清单内容的工具被称为非一致性分数(Non-conformity Score)。你可以把这个分数想象成一个**“怪异度计”**。
- 低分:该数据点对于该类别来说非常正常(例如,一张毛茸茸的图片看起来非常像一只猫)。
- 高分:该数据点对于该类别来说看起来很奇怪或“不合规”(例如,如果你试图把一块岩石称为猫,这张岩石图片看起来就非常怪异)。
这篇论文的目标是测试不同类型的“怪异度计”,看看哪一种能生成最有用的清单(即既小又安全的清单)。
测试过的“怪异度计”
作者测试了多种测量“怪异度”的方法,涵盖了不同类型的数据(如动物图片)。以下是他们比较的主要方法,并辅以类比:
标签距离(“靶心射击”计):
- 工作原理:它测量模型的猜测与“完美”答案之间的距离。想象向靶心投掷飞镖。如果飞镖靠近靶心,分数就很低(不怪异)。如果飞镖远离靶心,分数就很高。
- 论文发现:这种方法效果非常好,尤其是当使用一种称为“余弦距离”(Cosine Distance)的特定距离测量方式时(它关注猜测的方向,而不仅仅是原始距离)。
边界距离(“边境巡逻”计):
- 工作原理:它不测量到完美答案的距离,而是测量猜测值与两个答案之间的边界有多近。如果你正好站在“猫”和“狗”的分界线上,你就非常困惑(高怪异度)。如果你深陷“猫”的领地,你就很自信(低怪异度)。
- 论文发现:这是一个超级明星表现者,通常能生成最小、最高效的清单,特别是在查看转换为百分比之前的原始数值时。
平均距离(“群体拥抱”计):
- 工作原理:它将新图片与该类别下它之前见过的所有图片的“平均值”进行比较。如果一张新的猫图片看起来像平均猫,那就是很好的匹配。如果它看起来像狗,那就很怪异。
- 论文发现:这是处理具有许多类别的复杂数据集(如 CIFAR100)的最佳方法。
APS/RAPS/SAPS(“排名”计):
- 工作原理:这些是更复杂的方法,它们查看答案的排名。它们会说:“让我们先加上排名第一的猜测,然后是第二,然后是第三……"直到我们感到足够安全为止。它们加入了一些数学技巧(正则化)以防止清单变得过大。
- 论文发现:这些方法效果不错,但通常生成的清单比“距离”计稍大。有趣的是,论文发现,通常为了公平性而添加到这些方法中的随机“噪声”实际上对于安全保证并非必要;一个简单的固定数字同样有效。
梯度/特征距离(“深度挖掘”计):
- 工作原理:这些方法试图在计算机的“大脑”深处(特征层)测量怪异度,而不仅仅是在最终输出端。
- 论文发现:这些方法计算量很大(速度慢),而且并不总是比更简单的方法表现更好。
“不公平”的测试:类别不平衡
作者还测试了当数据不公平时会发生什么。想象一个数据集,其中 90% 的图片是猫,只有 1% 是老虎。
- 挑战:模型非常擅长识别猫,但非常不擅长识别老虎。
- 结果:当模型被迫要有 95% 的把握时,它通常会在几乎每一张图片的清单中都包含“老虎”,即使图片明显是一只猫。
- 为什么? 模型对老虎如此不确定,以至于它采取了保守策略。这就像一名保安因为太害怕漏掉老虎,而拦住了所有进入大楼的人。论文指出,虽然这让预测变得“诚实”(它承认自己不知道),但这使得清单变得巨大,对于常见物品来说实用性降低。
主要结论
- 没有唯一的赢家:没有一种“最佳”的怪异度计适用于所有情况。
- 对于简单任务,标签距离或边界距离效果最好。
- 对于具有许多类别的复杂任务,平均距离是冠军。
- 方向很重要:使用余弦距离(测量数据的角度/方向)通常比标准距离更好,特别是在高维空间(如深度学习模型)中。
- 简单即胜利:最复杂的方法(如深度特征梯度)并不一定给出更好的结果,而且速度慢得多。
- 架构很重要:所使用的计算机模型类型(例如 ResNet 与 EfficientNet)会改变哪种“怪异度计”效果最好,这表明怪异度计的选择取决于你正在使用的具体模型。
简而言之,这篇论文提供了一份构建更安全 AI 清单的“菜单”。它表明,通过为你的特定问题选择合适的“怪异度计”,你可以在不牺牲安全性的情况下,保持预测清单的小巧和实用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。