← 最新论文
💻 computer science

When AI and Experts Agree on Error: Intrinsic Ambiguity in Dermatoscopic Images

该研究通过对比人工智能模型与皮肤科专家在特定皮肤病理图像上的表现,揭示了当两者均出现系统性误判时,图像本身存在导致诊断准确率与专家共识度显著下降的内在模糊性,并指出图像质量是造成这一双重失败的主要原因。

原作者: Loris Cino, Pier Luigi Mazzeo, Alessandro Martella, Giulia Radi, Renato Rossi, Cosimo Distante

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Loris Cino, Pier Luigi Mazzeo, Alessandro Martella, Giulia Radi, Renato Rossi, Cosimo Distante

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于人工智能(AI)和人类专家在皮肤癌诊断中“共同犯错”的有趣故事

想象一下,你有一群超级聪明的 AI 医生(基于深度学习算法)和一群经验丰富的老医生(人类专家)。通常,我们觉得 AI 要么比人强,要么比人弱。但这篇研究发现了一个更深层的秘密:当 AI 搞砸的时候,人类专家往往也搞砸了;而且他们搞砸的是同一批图片。

这就好比一群侦探(AI)和一群老刑警(人类专家)一起看一堆模糊的监控录像。如果录像太清楚,大家都认得出罪犯;但如果录像本身太模糊、光线太暗,或者画面里有奇怪的干扰,不管是 AI 还是老刑警,都会看走眼,而且大家看走眼的方向还差不多。

以下是这篇论文的核心内容,用通俗易懂的方式拆解:

1. 核心发现:不是 AI 笨,是题目太难

研究人员拿来了很多皮肤镜下的照片(用来检查皮肤痣或肿瘤的),让 5 种不同的 AI 模型和 6 位资深皮肤科医生分别进行诊断。

  • 现象: 他们发现有一小部分图片,所有的 AI 模型都认错了。
  • 测试: 他们把这部分“难搞”的图片拿给人类专家看。结果令人惊讶:人类专家在这些图片上的诊断准确率也暴跌了。
  • 结论: 这说明这些图片本身就天生具有迷惑性(Intrinsic Ambiguity)。并不是 AI 算法不够聪明,也不是人类医生水平不行,而是这些图片本身就像“罗夏墨迹测试”一样,充满了歧义,连最聪明的大脑和最强的算法都难以看清真相。

2. 数据说话:当 AI 犯错时,人类也“懵”了

为了证明这不是巧合,研究人员做了详细的统计:

  • 平时表现(容易的图片): 在那些 AI 能轻松认对的图片上,人类专家的表现也很好,大家意见很统一(就像大家都能认出“这是一只猫”)。
  • 困难模式(AI 也错的图片): 在那些 AI 集体“翻车”的图片上,人类专家的表现一落千丈。
    • 一致性崩塌: 以前大家意见很统一,现在 6 个专家对同一张图可能给出 6 种不同的答案。
    • 准确率骤降: 专家们的诊断准确率从正常的 66% 左右,跌到了不到 30%。
    • 比喻: 这就像在光线充足的房间里,大家都能认出桌上的苹果;但把苹果放在一个全是雾的盒子里,不仅机器人看不清,连人类专家也会互相争论:“这到底是苹果还是土豆?”

3. 罪魁祸首:图片太“糊”了

为什么这些图片这么难?研究人员发现了一个关键原因:图片质量太差

  • 模糊的陷阱: 很多让 AI 和人类都犯错的图片,其实是模糊的对焦不准的,或者被头发遮挡了。
  • 自动“排雷”: 研究人员开发了一套自动检测工具(就像给图片做“清晰度体检”),利用数学方法(比如傅里叶变换、拉普拉斯滤波)来找出那些模糊的图片。
  • 发现: 他们发现,那些被标记为“最难诊断”的图片里,有很大一部分其实是低质量图片。如果把这些模糊的“坏数据”剔除掉,诊断的准确率可能会提高。

4. 一个意外的尝试:加上“病人信息”有用吗?

在医学上,医生看病不仅看片子,还会问:“你多大岁数?这疙瘩长在哪?你是男是女?”
研究人员尝试把这些病人信息(年龄、性别、部位)也喂给 AI,想看看能不能提高准确率。

  • 结果: surprisingly(令人惊讶地),并没有明显提升
  • 原因推测: 可能是因为图片本身的质量问题(太模糊)掩盖了这些信息的价值。如果图片本身看不清,知道病人是 70 岁还是 20 岁,也帮不上忙。

5. 这篇论文告诉我们什么?(给普通人的启示)

  1. AI 不是万能的,但也不是背锅侠: 当 AI 诊断出错时,不要急着怪 AI 算法不行。有时候,是因为数据(图片)本身质量太差,或者病情本身太复杂,连人类专家也拿不准。
  2. 图片质量至关重要: 在医疗 AI 领域,“清晰的图片”比“复杂的算法”更重要。如果给 AI 看的是模糊的照片,再聪明的 AI 也是瞎子。我们需要建立更严格的标准,确保拍出来的皮肤照片是清晰的。
  3. 未来的方向: 未来的医疗 AI 不应该只是和人类“比谁更准”,而应该学会识别哪些图片是“模糊不清、难以判断”的。当 AI 发现图片太糊时,它应该直接告诉医生:“这张图太模糊了,建议重新拍摄或进行活检”,而不是强行给出一个错误的诊断。

总结一句话:
这篇论文就像是在说,如果考试题目印得太模糊,不管是天才学生(AI)还是学霸老师(人类专家),都会考不及格。所以,与其怪学生笨,不如先把试卷印清楚点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →