External Validation and Interpretability Analysis of a Deep Learning Model for Forensic Age Estimation Across Brazilian and Romanian Populations
本研究表明,尽管深度学习模型能够捕捉用于法医年龄估计的生物学衰老模式,但其可靠性会因人群和硬件的变化而显著受损,这强调了在法医应用之前进行外部验证和可解释性分析,以检测非解剖学捷径的紧迫性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何仅仅通过观察一个人的牙齿照片来猜测其年龄。这不仅仅是一个派对上的小把戏;在法医学领域,准确完成这项工作可以帮助识别失踪人员、破解犯罪案件,或者确定一名青少年是否已达到受审的法定年龄。几十年来,专家们一直通过手动测量骨骼和观察牙齿生长情况来进行这项工作,但这既缓慢又高度依赖于进行测量的人员。最近,科学家们开始使用“深度学习”(一种人工智能,即 AI),它就像一个功能强大的超级大脑。这些 AI 模型通过观察成千上万张牙科 X 光片(特别是显示整个颌骨的全景图像)来学习衰老的模式。然而,一个大问题是:一个针对某一特定人群进行训练的机器人,是否仍能准确猜测另一组完全不同的人群的年龄,还是说它只是死记硬背了第一组 X 光机的特定外观?
这项名为《针对巴西与罗马尼亚人群法医年龄评估深度学习模型的外部验证与可解释性分析》的研究,深入探讨了正是这样一个问题。研究人员想要知道,一个利用来自巴西的大规模牙科 X 光片集进行训练的 AI 模型,在面对罗马尼亚的 X 光片时是否仍能正常工作。他们还想窥探 AI 的“大脑”内部,看看它究竟是在观察牙齿和骨骼,还是在依赖非解剖学特征,比如图片的边缘或用于标记左右的小字母。
团队测试了三种不同的 AI“架构”(可以将其理解为三种不同的脑部设计):VGG-16、InceptionV4 和 ResNet-18。他们将表现最好的模型——ResNet-18,输入了 10,036 张巴西 X 光片进行学习。当他们在同样的巴西数据上进行测试时,AI 的表现相当出色,预测年龄的平均误差仅为 3.61 岁。但紧接着,真正的考验来了:他们向 AI 展示了 150 张来自罗马尼亚患者的新 X 光片,这些照片是由不同的机器拍摄并由不同的医生完成的。结果是一个现实的警示。AI 的准确度下降了,其平均误差跳升至 5.8 岁。
为什么 AI 变得更差了?研究人员使用了一种名为 Grad-CAM 的特殊工具来可视化 AI 在做出判断时究竟在“看”什么。他们发现,虽然 AI 注意到了牙根和颌骨等重要事物,但它也依赖于一些“捷径”。它开始关注非解剖学的东西,比如方向标记(如表示“右”的字母“R”)和图像的边界。看起来 AI 学会了某些机器总是将这些标记放在特定位置,因此它利用这些位置来猜测年龄,而不是仅仅观察牙齿。这有点像一个学生,他并没有学习数学题,而是记住了答案总是“C”,因为老师总是把“C”放在页面的角落里。当老师改变布局时,这个学生就会感到困惑。
该研究还观察了“潜在空间”(latent space),这是描述 AI 在脑海中构建的内部地图的一种高级方式。通过使用 PHATE 和 PCA 等可视化技术,研究人员看到 AI 成功地将患者按从年轻到年老的顺序排列成一条平滑的直线,这表明它确实学习了衰老的普遍概念。然而,由于它依赖于那些“捷径”,且罗马尼亚的机器具有不同的亮度和对比度设置,AI 无法将这些知识完美地转化到新的群体中。
简而言之,这篇论文表明,尽管 AI 可以学习识别衰老模式,但目前它非常脆弱。如果你用一种类型的 X 光机和一种人群进行训练,当你切换到另一种机器或另一个国家时,它可能会遇到困难。作者得出结论,在我们将这些 AI 系统应用于任何实际的法律或法医案件之前,我们必须在完全不同的群体和机器上对其进行严格测试,以确保它们不仅仅是在依赖相框而不是牙齿。AI 并没有坏掉,但它还没准备好成为一名独立的侦探。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。