想象一下,你正试图仅通过一张照片来猜测一个陌生人的年龄。你可能会说:“他们看起来大约30岁,”但你的朋友可能会说:“没门,他们看起来像40岁!”在人工智能的世界里,这不仅仅是一个无伤大雅的分歧;这是一个巨大的谜题。AI系统在观察人脸并猜测年龄方面变得越来越出色,但它们往往表现得像个过度自信的“万事通”。它们给你一个单一的数字,并表现得好像那是绝对真理,即使答案本身是模糊的。这是很危险的,因为如果一台计算机对错误答案过于笃定,它可能会做出错误的决策,比如让青少年购买酒精饮料,或者阻止一位老年人访问网站。为了解决这个问题,科学家们正在教AI学会承认自己在“瞎猜”。他们希望计算机能说:“我觉得他们30岁,但我只有50%的把握,”或者“我觉得他们30岁,但我非常确定。”为了做到这一点,研究人员将“不确定性”分成了两种类型:偶然不确定性(aleatoric uncertainty),即数据的自然混乱程度(比如人类在判断年龄时无法达成一致);以及认知不确定性(epistemic uncertainty),即AI自身的无知(比如一个没怎么学习的学生)。
这篇论文就像是一个侦探故事,调查人员试图教会计算机区分“数据很混乱”和“我很困惑”。研究人员使用了一个名为 APPA-REAL 的特殊数据集,其中成千上万的真实人类观察了相同的面孔,并对他们的视觉年龄进行了投票。因为有这么多人参与投票,研究人员可以精确地测量人类的分歧程度(即“混乱度”),并利用这一点来训练AI。他们构建了三种不同类型的“贝叶斯(Bayesian)”AI模型——你可以把它们想象成三支不同的侦探团队,每支团队都使用略微不同的策略来进行猜测并衡量自身的信心。他们通过向模型输入不同量的数据(从极少数的照片到整个资料库)来测试这些团队。
这项重大发现是,这两种类型的不确定性表现得截然不同,且AI可以学会将它们区分开来。数据的“混乱度”(偶然不确定性)无论AI看到了多少照片,都保持不变。这就像一个嘈ibly的房间:无论有一千个人还是一个人在听,背景噪音的水平都不会改变。研究发现,这种噪声水平稳定在约 18岁平方(相当于约 4.2岁 的标准差)。这证实了某种程度的困惑本身就存在于人类感知的本质之中。
另一方面,AI自身的无知(认知不确定性)则完全符合预期:随着AI看到更多数据,这种不确定性急剧下降。当AI只看到 1% 的训练数据(约 40张图像)时,它表现得极其不确定。但随着他们喂入更多数据,直到达到 100% 的全集,AI变得更加自信。例如,“DropConnect”方法看到的认知不确定性从在 5% 数据时的约 12.9岁平方,下降到了使用完整数据集时的 6.0岁平方。“深度集成(Deep Ensembles)”方法整体上最准确,最终的平均绝对误差(MAE)为 8.0岁,而“Flipout”的学习速度稍慢,最终的 MAE 为 8.9岁。
论文还测试了这些聪明的AI侦探是否能处理一组新的、不同的面孔(UTKFace 数据集)。结果显示,当数据发生变化时,AI的置信度水平会进行相应的调整,证明了这些模型能够泛化其对不确定性的理解。然而,作者指出,“Flipout”方法有些摇摆不定且不稳定,尤其是在数据匮乏的情况下,这表明它可能不是那种在数据有限时需要高度可靠性的场景下的最佳选择。
最终,这项研究表明,在年龄估计(一种回归任务)中区分这两种不确定性,不仅是可能的,而且比简单的“是/否”分类任务效果更好。研究结论认为,虽然“深度集成”法最为准确,但 “DropConnect” 方法能最清晰地展示出AI的信心是如何随数据增加而增长的。这意味着,我们距离实现那种不仅能猜出你的年龄,还能知道自己何时只是在“瞎猜”的AI,又近了一步。
技术摘要:解耦表观面部年龄估计中的模型与人类数据不确定性
问题陈述
由于“表观年龄”依赖于视觉老化特征而非生理真实年龄,面部年龄估计是一个具有挑战性的回归任务。与存在单一真值的标准回归不同,表观年龄估计涉及内在的人类分歧;不同的标注者可能会基于个人偏见或文化感知,对同一图像给出不同的年龄。因此,一个鲁棒的模型不仅需要预测最可能的年龄,还需要量化该预测的可靠性。目前的机器学习模型通常仅输出单点估计,未能区分两种截然不同的不确定性来源:
- 偶然不确定性(Aleatoric Uncertainty): 数据固有的噪声(例如,标注者之间的分歧)。
- 认知不确定性(Epistemic Uncertainty): 源于模型知识匮乏的不确定性(例如,训练数据有限、泛化能力差)。
虽然存在解耦这些不确定性的方法,但近期的文献表明,这些方法在分类任务中往往无法有效地将它们分离。目前尚不清楚这种解耦在像年龄估计这样的回归任务中是否成功。
方法论
作者利用了 APPA-REAL 数据集,该数据集包含 7,591 张图像,由多名人类评分者进行标注,并提供了平均表观年龄和这些评分的标准差。该数据集允许对人类偶然不确定性进行直接监督。
- 模型架构: 提出的系统是一个基于 DenseNet-121 主干网络(预训练于 ImageNet)的多输出回归架构。该网络分支出两个头:
- 均值分支(Mean Branch): 预测表观年龄。
- 方差分支(Variance Branch): 预测标准差(偶然不确定性),使用 Softplus 激活函数以确保数值为正。
- 训练策略: 模型采用三阶段流水线进行训练:初始单任务训练(仅均值)、多任务训练(均值与方差)以及微调。方差分支受到来自数据集的人类投票标准差的显式监督,将人类的分歧视为偶然不确定性的地面真值(Ground Truth)。
- 不确定性解耦: 为了分离偶然不确定性和认知不确定性,作者采用了三种贝叶斯神经网络(BNN)近似方法:
- MC-DropConnect
- Flipout
- 深度集成(Deep Ensembles)
认知不确定性通过计算相同输入在多次前向传播(或集成成员)中的预测方差来得出,而偶然不确定性则是输出分布的学习方差。
- 实验设计: 模型在七种不同规模的数据子集(1%, 5%, 10%, 25%, 50%, 75%, 100%)上进行训练,以观察不确定性指标如何随数据可用性的变化而缩放。
核心贡献
- 人类不确定性的显式监督: 本研究将人类标注者的分歧直接纳入训练过程,使模型能够学习偶然不确定性作为一个特定的目标,而非间接推导。
- 回归任务中的解耦: 本文研究了在回归设置下是否可以成功分离偶然不确定性和认知不确定性,并与以往在分类任务中的发现进行了对比。
- 数据缩放的实证分析: 作者系统地评估了不同不确定性估计方法如何随训练数据量的变化而表现,特别测试了“随着数据增加,认知不确定性下降而偶然不确定性保持稳定”这一假设。
结果
- 不确定性趋势:
- 偶然不确定性: 在所有数据集规模下基本保持稳定(稳定在约 18 年²,即标准差约为 4.2 岁)。这证实了人类的分歧是数据的固有属性,独立于模型的训练规模。
- 认知不确定性: 与数据集大小呈现反比关系。随着训练数据的增加,认知不确定性降低。DropConnect 表现出最显著的降幅(从 5% 数据时的约 12.9 年² 降至 100% 数据时的约 6.0 年²),而 深度集成 则在不同数据规模下始终保持较低的认知不确定性。Flipout 则表现出较不稳定且非单调的行为。
- 预测性能:
- 深度集成 取得了最佳的整体预测精度(在 100% 数据时平均绝对误差 MAE 为 8.0 年,R2 为 0.61)。
- DropConnect 紧随其后(MAE 为 8.3 年,R2 为 0.58)。
- Flipout 收敛较慢(MAE 为 8.9 年,R2 为 0.53)。
- 泛化能力: 在 UTKFace 数据集上测试时,模型显示出误差率上升。然而,不确定性指标通常反映了这种性能退化,即 DropConnect 和集成模型中的认知不确定性有所增加,这表明模型能够检测到分布偏移。
意义与主张
本文声称,不确定性解耦不仅在回归任务中是可行的,而且可能比在分类任务中更稳定且更具可解释性。结果验证了这两种不确定性类型的理论区别:
- 偶然不确定性 被证实是数据固有的,无论模型容量或数据量如何,它都保持不变。
- 认知不确定性 被证实是模型相关的,随着模型接触更多数据,该不确定性会降低。
作者得出结论,深度集成 提供了最强的原始预测性能和鲁棒性,而 DropConnect 提供了最具响应性和可解释性的认知趋势,使其适用于需要精确置信度估计的应用场景。本研究强调了能够量化“为何不确定”(是数据噪声还是知识匮乏)的模型价值,这对于年龄限制内容审查等高风险应用至关重要。
局限性
作者指出了以下约束:
- 小规模子集: 在极小规模子集(1% 数据)上训练的模型存在欠拟合问题,导致其不确定性估计不可靠。
- 数据集偏差: APPA-REAL 数据集向 20-40 岁年龄段倾斜,可能限制了对儿童和老年人的泛化能力。
- 架构同质性: 研究仅依赖于 DenseNet-121;不确定性行为可能会随 ResNet 或 Vision Transformer 等其他架构而改变。
- 方法稳定性: Flipout 在其变分推理近似中表现出不稳定性,尤其是在中间规模的数据集大小下。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。