← 最新论文
💻 computer science

Disentangling Model and Human Data Uncertainty in Apparent Facial Age Estimation

本文表明,在 APPA-REAL 数据集上训练的贝叶斯神经网络能够有效地解耦并量化人脸年龄估计中的偶然不确定性和认知不确定性,揭示了偶然不确定性在不同数据集规模下保持稳定,而认知不确定性则随着训练数据的减少而增加。

原作者: Andrei Foitos, Ivo Pascal de Jong, Matias Valdenegro-Toro

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrei Foitos, Ivo Pascal de Jong, Matias Valdenegro-Toro

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过一张照片来猜测一个陌生人的年龄。你可能会说:“他们看起来大约30岁,”但你的朋友可能会说:“没门,他们看起来像40岁!”在人工智能的世界里,这不仅仅是一个无伤大雅的分歧;这是一个巨大的谜题。AI系统在观察人脸并猜测年龄方面变得越来越出色,但它们往往表现得像个过度自信的“万事通”。它们给你一个单一的数字,并表现得好像那是绝对真理,即使答案本身是模糊的。这是很危险的,因为如果一台计算机对错误答案过于笃定,它可能会做出错误的决策,比如让青少年购买酒精饮料,或者阻止一位老年人访问网站。为了解决这个问题,科学家们正在教AI学会承认自己在“瞎猜”。他们希望计算机能说:“我觉得他们30岁,但我只有50%的把握,”或者“我觉得他们30岁,但我非常确定。”为了做到这一点,研究人员将“不确定性”分成了两种类型:偶然不确定性(aleatoric uncertainty),即数据的自然混乱程度(比如人类在判断年龄时无法达成一致);以及认知不确定性(epistemic uncertainty),即AI自身的无知(比如一个没怎么学习的学生)。

这篇论文就像是一个侦探故事,调查人员试图教会计算机区分“数据很混乱”和“我很困惑”。研究人员使用了一个名为 APPA-REAL 的特殊数据集,其中成千上万的真实人类观察了相同的面孔,并对他们的视觉年龄进行了投票。因为有这么多人参与投票,研究人员可以精确地测量人类的分歧程度(即“混乱度”),并利用这一点来训练AI。他们构建了三种不同类型的“贝叶斯(Bayesian)”AI模型——你可以把它们想象成三支不同的侦探团队,每支团队都使用略微不同的策略来进行猜测并衡量自身的信心。他们通过向模型输入不同量的数据(从极少数的照片到整个资料库)来测试这些团队。

这项重大发现是,这两种类型的不确定性表现得截然不同,且AI可以学会将它们区分开来。数据的“混乱度”(偶然不确定性)无论AI看到了多少照片,都保持不变。这就像一个嘈ibly的房间:无论有一千个人还是一个人在听,背景噪音的水平都不会改变。研究发现,这种噪声水平稳定在约 18岁平方(相当于约 4.2岁 的标准差)。这证实了某种程度的困惑本身就存在于人类感知的本质之中。

另一方面,AI自身的无知(认知不确定性)则完全符合预期:随着AI看到更多数据,这种不确定性急剧下降。当AI只看到 1% 的训练数据(约 40张图像)时,它表现得极其不确定。但随着他们喂入更多数据,直到达到 100% 的全集,AI变得更加自信。例如,“DropConnect”方法看到的认知不确定性从在 5% 数据时的约 12.9岁平方,下降到了使用完整数据集时的 6.0岁平方。“深度集成(Deep Ensembles)”方法整体上最准确,最终的平均绝对误差(MAE)为 8.0岁,而“Flipout”的学习速度稍慢,最终的 MAE 为 8.9岁

论文还测试了这些聪明的AI侦探是否能处理一组新的、不同的面孔(UTKFace 数据集)。结果显示,当数据发生变化时,AI的置信度水平会进行相应的调整,证明了这些模型能够泛化其对不确定性的理解。然而,作者指出,“Flipout”方法有些摇摆不定且不稳定,尤其是在数据匮乏的情况下,这表明它可能不是那种在数据有限时需要高度可靠性的场景下的最佳选择。

最终,这项研究表明,在年龄估计(一种回归任务)中区分这两种不确定性,不仅是可能的,而且比简单的“是/否”分类任务效果更好。研究结论认为,虽然“深度集成”法最为准确,但 “DropConnect” 方法能最清晰地展示出AI的信心是如何随数据增加而增长的。这意味着,我们距离实现那种不仅能猜出你的年龄,还能知道自己何时只是在“瞎猜”的AI,又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →