← 最新论文
📊 statistics

Agreement Between Fitzpatrick-17k Skin-Type Labels Is Metric- and Stratum-Dependent: A Chance-Corrected Reanalysis

本文通过使用机会校正统计学对 Fitzpatrick-17k 数据集进行重新分析,旨在证明标注来源之间的标签一致性高度依赖于所选指标和肤色分层,揭示了显著的差异——尤其是在较深肤色方面——这使得在皮肤科人工智能研究中透明地报告方法论和各分层置信区间变得至关重要。

原作者: Niya Pennie

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Niya Pennie

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人识别不同的人类肤色,就像一名学习绘制肖像画的数字艺术系学生一样。为此,机器人需要一位“老师”来看照片并说:“这是非常苍白的,”或者“这是深棕色的。”在皮肤病学和人工智能的世界里,这位老师通常是根据**菲茨帕特里克量表(Fitzpatrick scale)**为皮肤类型进行标注的人类注释员。该量表将皮肤分为六个类别,从 I 型(非常白皙,总是晒伤)到 VI 型(色素沉着深,极少晒伤)。但棘手的地方在于,人类并不完美。一个人可能认为一张照片是“中等棕色”,而另一个人却说是“深棕色”。如果机器人从这些混乱的指令中学习,它可能会感到困惑,尤其是在试图帮助那些在医疗护理中本就代表性不足的深色皮肤人群时。核心问题在于:这些人类老师之间的意见究竟有多一致?如果他们只差了一个等级,这真的重要吗?

这篇论文就像是一个侦探故事,研究人员 Niya Pennie 回到了一个著名的数据库——Fitzpatrick-17k,去检查这份“作业”。这个数据集是通过要求两个不同的众包团队(一个来自 Scale AI,一个来自 Centaur Labs)对数千张皮肤照片进行标注而创建的。该数据集的原作者曾说:“嘿,85% 的时间里,我们的两个小组都非常接近,通常误差在一步之内!”这听起来很棒。但 Pennie 决定运行一个更严格、更具数学性的测试,以看看究竟发生了什么。她不仅问:“他们是否接近了?”她还问:“他们是否选择了完全相同的标签?如果他们只差了一个等级,这算作成功还是失败?”

以下是调查结果。首先,“接近但不完全一致”的故事是真的:如果你将偏差仅一个皮肤类型视为“一致”,那么是的,两个小组有 91% 的时间达成了一致。但如果你要求他们选择完全相同的数字,一致性就会降至不到一半(47.9%)。这就像两个朋友看着日落,一个说“橙色”,另一个说“橙红”。他们很接近,但他们说的并不是一回事。

论文还发现,这种分歧并不是均匀分布的。这就像一场规则随分数变化的比赛。对于最浅的肤色类型(I 型),两个小组有近 88% 的时间达成了一致。但对于较深的肤色类型(II 型至 VI 型),一致性大幅下降,徘徊在 34% 到 55% 之间。换句话说,人类老师对深色皮肤的理解比对浅色皮肤的理解要困惑得多。此外,两组人并不只是随机产生分歧;他们有一个模式。Centaur Labs 组倾向于将照片标注得比 Scale AI 组更“浅”,尤其是在深色皮肤类型方面。

最后,论文指出了一项严重的“计数问题”。对于最深的皮肤类别(VI 型),该数据集中用于严重皮肤病变(恶性图像)的照片非常少。在一种标注系统下,有 61 张此类图像;而在另一种系统下,只有 45 张。由于这些数字如此之小,论文建议,任何试图衡量 AI 在这一特定群体上表现如何的研究,都将像是试图通过测量仅仅三个人来猜测一个房间的平均高度。结果会过于摇摆不定且不精确,从而无法令人信服。

因此,主要的启示并不是说这个数据集没用了,而是我们需要更加谨慎地去解读它。论文认为,研究人员不能仅仅说“AI 是公平的”,而不明确说明他们使用了哪种标注系统、如何定义“一致性”,以及他们是否拥有足够的数据来做出可靠的陈述。如果你改变了游戏的规则(标注来源)或团队的规模(图像数量),得分就会改变。论文总结道,为了真正理解 AI 是否对每个人都公平,我们需要停止将这些标签视为完美的真理,并开始如实报告它们究竟在多大程度上具有不确定性和变异性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →