技术摘要:通过自动提取的概念激活向量解释图像相似性
问题陈述
图像相似性是众多计算机视觉应用的基础组成部分,包括图像检索、人脸识别和时尚兼容性分析。虽然相似性通常在预训练深度网络的潜在嵌入空间(latent embedding spaces)中进行度量,但特定相似性得分背后的原理仍然是不透明的。现有的可解释性(xAI)方法主要针对单输入分类任务设计,难以为本质上需要两个输入的相似性函数提供全局洞察。目前的方法通常依赖于基于梯度的归因图或人工定义的属性(例如“条纹”或“颜色”)来生成显著性图(saliency maps)。这些方法面临两个主要局限性:
- 缺乏全局洞察: 它们往往无法解释是什么具体驱动了整个嵌入空间区域(例如纹理 vs 形状)的相似性。
- 依赖人工定义: 它们通常需要预定义的概念数据库或专门标记的数据集,这限制了它们在面对新领域或新模型时的适用性。
- 分布忠实度: 在原始像素空间中的扰动(例如掩码/masking)往往会将输入推离数据流形(data manifold),导致解释结果不可靠。
方法论
作者提出了一种模型和度量无关的框架,该框架利用通过稀疏自编码器(Sparse Autoencoders, SAEs)自动提取的概念激活向量(Concept Activation Vectors, CAVs)来解释图像相似性。该方法由三个主要步骤组成:
1. 稀疏字典学习(概念提取)
给定数据集 X 和嵌入函数 g:X→Rd,作者将激活矩阵 A 分解为权重矩阵 U 和概念字典 V。这是通过最小化 Frobenius 范数来实现的:
(U,V)=argU,Vmin∥A−UV⊤∥F2
此过程利用各种 SAE 形式(Top-K、JumpReLU 和 Vanilla SAE)来学习一个无需人工标注的概念字典。每个激活都可以近似为这些学习到的概念的线性组合。
2. 用于成对解释的潜在空间扰动
为了解释两个图像(其嵌入分别为 ai 和 aj)之间的相似性,该方法沿学习到的概念方向扰动嵌入。通过测量移除概念贡献时相似性函数 f 的变化,来确定特定概念 ck 的重要性:
elk(ai,aj)=(f(ai,aj)−f(ai/ck,aj))+(f(ai,aj)−f(ai,aj/ck))
其中 ai/ck=ai−ui,kvk⊤。这种对称方法确保了解释考虑了来自两个输入的贡献。结果是一个表征共享和不同属性的局部解释向量。
3. 群组级解释与样本检索
该框架通过对群组 G 中的局部解释求平均,扩展到了群组设置:
eG=(2∣G∣)1i,j∈G,i<j∑el(ai,aj)
这使得分析嵌入空间中的聚类成为可能。此外,作者引入了**样本检索(Exemplar Retrieval)**任务:给定一个查询-参考对,系统会检索出具有相同底层“原因”(即相似的解释向量)而非仅仅是相似整体外观得分的其他图像对。
核心贡献
- 新颖框架: 一种基于自动提取 CAVs 的模型和度量无关的图像相似性可解释性框架,实现了无需预定义概念数据库的成对及群组级分析。
- 基于相似性的归因: 一种直接从相似性函数导出概念重要性得分的方法,能够提供定位(通过热力图)和概念影响的量化。
- 忠实的扰动: 实验证据表明,潜在空间扰动比输入空间掩码策略(如模糊、随机掩码)更忠实于底层数据分布,产生的离群值(OOD)嵌入更少。
- 可操作的洞察: 引入了样本检索和群组分析,允许用户基于语义概念理解并操纵相似性判断。
实验结果
作者在 VITON-HD(时尚)数据集和合成的 Multi-CIFAR-10 Collage 数据集上评估了其方法,使用了六种视觉骨干网络(DINOv2, DINOv3, ResNet50, ConvNeXt, ViT, SigLIP)。
- 概念验证: 在合成数据集上,该方法成功保持了相似性函数的对称性。训练好的字典在进行概念交换后,实现了约 90% 的原始相似性得分恢复率,其中 Top-K SAEs 的偏差最低。
- 分布忠实度: 在所有测试模型中,潜在空间扰动实现的 Wasserstein (W1) 和 OOD 得分始终低于输入空间掩码策略(如模糊、随机掩码)。这证实了潜在空间扰动能更好地保持在数据流形附近。
- 线性可恢复性: 在解释向量上训练的线性回归模型能够高精度地预测原始相似性得分(对于余弦和欧氏距离,R2>0.87),优于 CSIM、基于模糊的向量以及基于梯度的归因等基准方法。
- 定性效用: 在案例研究中,该方法成功识别了相似性的语义驱动因素(例如“条纹”、“领口”),并实现了基于共同概念(例如为条纹衬衫查询检索条纹衬衫)的样本检索。
意义与主张
论文声称,与其现有方法相比,其方法为图像相似性提供了更忠实且更具可解释性的理解。通过在潜在空间中运行,该方法避免了输入空间扰动经常产生不真实图像的缺陷。作者强调,该框架是自动化的(无需手动定义概念),并且是灵活的(适用于任何预训练模型和相似性度量)。
其意义在于能够超越“模型关注哪里”(显著性)而转向“哪些语义特征驱动了相似性”。作者将这项工作定位为迈向可操作洞察的一步,允许模型设计者识别并可能减轻不希望出现的相似性驱动因素(例如背景伪影),并实现基于特定语义原因的进阶检索任务。然而,作者也谦虚地指出,其方法假设通过 CAVs 对嵌入空间进行线性重建,这是一种一阶近似,且 SAE 的稳定性仍是一个需要考虑的问题。