技术摘要:AlignFace:具有可解释概念关系的类人脸部相似度度量指标
问题陈述
当前的计算机视觉模型用于生成的面部内容(例如,面部编辑、隐私保护)依赖于相似度度量指标,但这些指标往往无法作为人类感知的忠实代理。虽然感知评估已从基于信号的启发式方法(如 PSNR、SSIM)演变为基于表示的方法(如 LPIPS、DreamSim),但现有方法仍局限于行为建模,缺乏认知对齐。这些“黑盒”模型依赖于隐式且伪造的关系,假设存在一个通用观察者,并且未能考虑到不同人群之间固有的差异。因此,它们为利益相关者提供了不准确的评估模型,并为生成模型的调试提供了误导性的指导,例如低估了隐私风险或身份转变,而人类在实际感知中仍会认为两张脸是相似的。
作者认为,感知模型必须遵循科学的认知效应才能实现真正的“人类对齐”。具体而言,人类的面部感知具有以下特征:
- 双重处理: 依赖于特征属性(离散组件,如眼睛颜色)和构型属性(空间布局,如瞳距)。
- 非线性缩放: 人类对属性差异的感知并非线性缩放,而是遵循非线性的心理物理学定律。
- 人口统计学差异: 存在内群体偏差(own-group bias),即个体对自己所属人口统计群体(种族、性别)的面部识别准确度高于其他群体。
方法论
1. FACETS 数据集
为了使模型植根于人类认知,作者引入了 FACETS,一个大规模的人类标注数据集。
- 刺激物: 由 CMU Multi-PIE 和 CelebA 数据集构建,包含 120 个身份(在白人和亚洲人口统计特征上保持平衡)。通过基于扩散模型的修复(inpainting)、基于关键点的变形(warping)以及基于 GAN 的迁移来编辑图像,从而产生 20 个具有认知基础的属性(14 个特征属性,6 个构型属性)的变化。
- 数据收集: 利用二选一强迫选择(2AFC)协议,参与者将编辑后的面部与参考面部进行比较。
- 整体相似度: 来自 78 名参与者的 9.36k 个三元组评分。
- 属性相似度: 来自 611 名参与者的针对 20 个属性的 73.32k 个三元录评分。
- 分析: 对该数据进行的初步广义加性模型(GAM)分析证实了属性影响的非线性和内群体与外群体感知之间显著的敏感度差异。
2. AlignFace 架构
AlignFace 是一个事前(ante-hoc)可解释的模型,旨在编码这些认知原则。它由四个主要模块组成:
视觉-语言模型(VLM)编码:
- 使用共享的视觉编码器提取面部对(z^A,z^B)的表示,并计算关系差异(Z^Δ)。
- 文本编码器处理属性提示词(例如,“瞳距”)以创建锚点(Z^attr),引导沿特定维度进行比较。
属性门控交叉注意力(AGCA):
- 执行多模态融合,其中图像差异特征作为查询(Q),文本属性特征作为键(K)和值(V)。
- 一个可学习的门控因子(tanh(α))控制属性调节信号的注入,从而有效地从差异表示中检索与属性相关的视觉特征。
概念瓶颈模型(CBM):
- AGCA 的输出被约束为可解释的多标签二元概念(Δc^attr∈[−1,+1])。
- 这强制模型的推理显式地基于这些解耦的面部属性,而非潜在的、不可解释的特征。
属性影响神经广义加性模型(Neural GAM):
- 使用神经 GAM 将属性差异映射到整体相似度得分:F(Δc^)=σ(β+∑fi(Δc^i))。
- 每个 fi 是通过小型神经网络实现的样条函数(spline function),用以捕捉非线性的部分影响。
- 模型施加了单调性约束(∂Δc^i∂fi≥0),以确保更高的属性差异永远不会降低整体面部距离,从而符合感知一致性。
3. 训练目标
模型被训练为 AlignFace2AFC,一种多任务三元组度量指标。它预测两组比较(⟨A,Ref⟩ 和 ⟨B,Ref⟩)的成对距离,并最小化预测的相对距离差异与人类二元标签(指示哪张脸更相似)之间的平方合页损失(squared hinge loss)。训练分为两个阶段:首先训练并冻结属性级预测;然后在整体距离损失上训练神经 GAM。
核心贡献
- 认知特征化: 确定了人类面部相似度感知的特定认知特征,包括特征/构型的依赖性、非线性心理物理缩放以及人口统计学内群体效应。
- AlignFace 模型: 一个具有认知基础、可解释的事前(ante-hoc)模型,集成了 VLM、门控交叉注意力、概念瓶颈和神经 GAM,以强制实现人类对齐。
- AlignFace2AFC 度量指标: 一个可解释的度量指标,通过非线性的 grounded 属性量化感知。
- FACETS 数据集: 一个新的面部三元组数据集,包含在整体水平和 20 个属性层面的相似度判断,并附带人口统计学元数据。
结果
- 行为一致性: AlignFace 在与人类 2AFC 判断的对齐方面显著优于基准模型(包括启发式指标如 SSIM,学习型指标如 LPIPS/DreamSim,以及特定于面部的模型如 ArcFace)。它在整体面部感知方面达到了最高的协议得分。
- 属性对齐: 模型在属性级预测方面表现出高度的一致性(与 FLIP 主干的平均一致性为 0.79),特别是在头发长度和眉形等属性上。
- 可解释性与非线性: 部分依赖图(PDP)显示,AlignFace 捕捉到了属性差异与整体相似度之间的高度非线性关系,与人类 GAM 的皮尔逊相关系数极高(ρ≈0.94–0.98)。这证实了属性影响是非线性的这一假设。
- 人口统计学敏感性: 模型成功捕捉了“内群体”效应,显示出白人和亚洲参与者在评估自身人口统计群体与其他群体面部时,具有不同的敏感度趋势。
意义
论文声称,通过将学习到的表示与人类认知过程相结合,AlignFace 能够实现更透明且对齐的感知评估指标。与以往存在伪相关风险的数据驱动方法不同,AlignFace 通过认知心理学进行了理论证明。它提供了一个评估生成模型的框架,该框架不仅能更准确地预测人类感知,而且具有可解释性,允许开发者了解模型为何认为两张脸相似或不同(基于特定的特征和构型属性)。这对于涉及以人为中心的任务(如数字化妆、面部修复和隐私保护)的应用至关重要,因为在这些应用中,必须准确估计“对人的真实影响”。