← 最新论文
🤖 machine learning

Never mind the metrics -- what about the uncertainty? Visualising confusion matrix metric distributions

本文认为,经验分类器性能指标中固有的实质性不确定性往往掩盖了观察到的模型准确度差异,并主张通过在 ROC 空间中对混淆矩阵分布和后验预测概率进行创新的可视化处理,来寻求一种平衡的视角。

原作者: David Lovell, Dimity Miller, Jaiden Capra, Andrew Bradley

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: David Lovell, Dimity Miller, Jaiden Capra, Andrew Bradley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:不要只看分数,要看样本量

想象你正在评判一场烹饪比赛。两位厨师提交了他们的菜肴。

  • 厨师 A 做出了一个完美的汉堡。
  • 厨师 B 做了 1,000 个汉堡,其中 900 个是完美的,但有 100 个烤焦了。

如果你只看“成功率”(指标),厨师 A 看起来是个天才(100% 成功率),而厨师 B 看起来是个失败者(90% 成功率)。但如果你知道样本量,你会意识到厨师 A 的完美汉堡可能只是运气好,而厨师 B 则证明了他们能够持续做出美味的食物。

这篇论文认为,在机器学习领域,我们过度痴迷于“分数”(指标),却常常忘记去询问:“这个分数是基于多少数据得出的?”

作者 David Lovell 及其团队希望我们停止争论哪一个单一数字(如准确率 Accuracy 或 MCC)是衡量计算机程序的“最佳”方式。相反,他们希望我们去可视化这些数字背后的不确定性(Uncertainty)。他们表明,当你只有少量数据时,无论多么高级的指标,其“分数”都是摇摆不定且不可靠的。

混淆矩阵:计分卡

为了理解一个分类器(即猜测“是”或“否”的程序),我们会使用混淆矩阵(Confusion Matrix)。你可以把它看作一个带有四个方框的简单计分卡:

  1. 真阳性 (True Positives): 你猜是,结果确实是。 (正确!)
  2. 假阳性 (False Positives): 你猜是,但结果其实不是。 (虚假警报)
  3. 假阴性 (False Negatives): 你猜不是,但结果其实是。 (漏报)
  4. 真阴性 (True Negatives): 你猜不是,结果确实不是。 (正确!)

通常,人们会将这四个数字压缩成一个单一的数字(一个指标),以此来说明“这个模型的性能是 85%”。论文指出,这样做是危险的,因为你会丢失信息。这就像是用一个词来概括一整部电影。

3D “混淆四面体”:一种新的观察方式

作者意识到,计分卡上的这四个数字实际上是相互关联的。如果你知道了样本总数,改变其中一个数字就会迫使其他数字发生变化。

他们提议不要将这些计分卡视为一张平面的表,而是将其可视化为一个 3D 金字塔(或称四面体)

  • 想象一个金字塔,其中的每一个点都代表一个唯一的可能计分卡。
  • 金字塔的各个顶点代表极端情况(例如,全对或全错)。
  • 通过观察这个 3D 形状,你可以看到不同的性能指标(如“准确率”或“MCC”)是如何表现的。它们不是平坦的线,而是环绕在这个金字塔周围的曲面(等高线)。

类比: 把这个 3D 金字塔想象成一片地形。那些“性能指标”就像徒步地图上的等高线。如果你沿着特定的等高线行走,即使你的正确与错误答案的实际组合发生了变化,你的“分数”也会保持不变。

“小数据”与不确定性的问题

这是论文中最重要的部分。

当一个计算机模型接受测试时,它通常只观察有限数量的样本(例如 100 张照片)。

  • 现实情况: 模型答对了 90 个。
  • 不确定性: 如果我们用另外 100 张照片测试它,它还会答对 90 个吗?也许是 85 个?也许是 95 个?

论文使用了名为 Beta-Binomial 分布(一种高级说法,意指“我们知道自己并非无所不知”)的数学工具,来绘制出如果再次进行测试,该模型可能产生的各种计分卡。

视觉呈现:
他们没有只展示图表上的一个点(即我们得到的单一分数),而是展示了一个点云(Cloud of dots)

  • 如果测试的数据量很大,点云就会很紧凑、很小。我们对分数的信心很高。
  • 如果测试的数据量很少,点云就会非常巨大且分散。分数几乎可以是任何值。

为什么这很重要:“遮蔽”效应

作者展示了这种“不确定性云”可以大到**遮蔽(Eclipse)**两个模型之间的差异。

隐喻:
想象两名跑步者。

  • 跑者 A 的成绩是 10.0 秒。
  • 跑者 B 的成绩是 10.1 秒。

如果你只看秒表,跑者 A 更快。但如果你的秒表不稳定,且误差范围为 ±0.5 秒,那么你实际上无法判断谁更快。这种“不确定性”比两者之间的“差异”还要大。

论文指出,在许多机器学习基准测试中,数据量太小了。由于得分的不确定性太大,声称“模型 A 比模型 B 更好”往往只是一种猜测。

类别不平衡:稀有事件问题

论文还探讨了“类别不平衡”的问题。这发生在某种结果非常罕见时(例如检测一种罕见疾病)。

  • 如果你有 1,000 个健康人和仅 1 个病人,而你的模型对所有人预测为“健康”,那么它的准确率高达 99.9%。但它在执行任务方面完全失败了。

作者展示了当某个类别非常罕见时,“不确定性云”会变得极其庞大。即使你使用了旨在解决此问题的“平衡”指标,除非你拥有关于该罕见事件的更多数据,否则你仍然无法确定结果。没有任何神奇的数学公式可以弥补数据的缺失;你只需要更多的样本。

总结

这篇论文并不是在告诉你应该使用哪个指标(比如“使用 MCC 而不是准确率”)。相反,它是在告诉你停止争论指标,转而开始关注数据

  1. 指标只是总结: 它们隐藏了数据的复杂现实。
  2. 不确定性是真实存在的: 每个分数周围都围绕着一个可能的数值“云”。
  3. 数据是唯一的解药: 如果你想确定一个模型是否优秀,你需要更多的数据。如果你只有很少的数据,那么你的“完美分数”可能只是一个偶然现象。

作者提供了交互式的 3D 可视化工具(类似于数字沙盒),以便人们可以玩转这些概念,移动“数据点”,并亲眼观察不确定性云是如何扩大和缩小的。他们的目标是让科学家和工程师意识到:在小数据集上的高分并不代表一个好的模型得到了保证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →