Resumo Técnico: Explicando a Similaridade de Imagens com Vetores de Ativação de Conceitos Extraídos Automaticamente
Declaração do Problema
A similaridade de imagens é um componente fundamental de inúmeras aplicações de visão computacional, incluindo recuperação de imagens, reconhecimento facial e compatibilidade de moda. Embora a similaridade seja tipicamente medida nos espaços de incorporação (embedding) latentes de redes profundas pré-treinadas, a razão por trás de escores de similaridade específicos permanece opaca. Métodos de explicabilidade (xAI) existentes, projetados primariamente para tarefas de classificação de entrada única, têm dificuldade em fornecer insights globais sobre funções de similaridade, que inerentemente requerem duas entradas. As abordagens atuais frequentemente dependem de mapas de atribuição baseados em gradiente ou atributos definidos manualmente (ex: "listras" ou "cor") para gerar mapas de saliência. Esses métodos enfrentam duas limitações principais:
- Falta de Insight Global: Eles frequentemente falham em explicar o que especificamente impulsiona a similaridade através de regiões de um espaço de incorporação (ex: textura vs. forma).
- Dependência de Definições Manuais: Eles frequentemente requerem bancos de dados de conceitos predefinidos ou conjuntos de dados propositalmente rotulados, limitando sua aplicabilidade a novos domínios ou modelos.
- Fidelidade Distribucional: Perturbações no espaço de pixels brutos (ex: mascaramento) frequentemente empurram os inputs para fora do manifold de dados, levando a explicações não confiáveis.
Metodologia
Os autores propõem um framework agnóstico a modelos e métricas que explica a similaridade de imagens usando Vetores de Ativação de Conceitos (CAVs) extraídos automaticamente via Autoencoders Esparsos (SAEs). A metodologia consiste em três etapas primárias:
1. Aprendizado de Dicionário Esparso (Extração de Conceitos)
Dado um conjunto de dados X e uma função de incorporação g:X→Rd, os autores decompõem a matriz de ativações A em uma matriz de pesos U e um dicionário de conceitos V. Isso é alcançado minimizando a norma de Frobenius:
(U,V)=argU,Vmin∥A−UV⊤∥F2
Este processo utiliza várias formulações de SAE (Top-K, JumpReLU e Vanilla SAE) para aprender um dicionário de conceitos sem rotulagem humana. Cada ativação é aproximada como uma combinação linear desses conceitos aprendidos.
2. Perturbação do Espaço Latente para Explicação Pareada
Para explicar a similaridade entre duas imagens com embeddings ai e aj, o método perturba os embeddings ao longo das direções dos conceitos aprendidos. A importância de um conceito específico ck é determinada medindo a mudança na função de similaridade f quando a contribuição do conceito é removida:
elk(ai,aj)=(f(ai,aj)−f(ai/ck,aj))+(f(ai,aj)−f(ai,aj/ck))
onde ai/ck=ai−ui,kvk⊤. Esta abordagem simétrica garante que a explicação considere as contribuições de ambos os inputs. O resultado é um vetor de explicação local que caracteriza atributos compartilhados e distintos.
3. Explicação de Nível de Grupo e Recuperação de Exemplares
O framework se estende a configurações de grupo através da média das explicações locais sobre um grupo G:
eG=(2∣G∣)1i,j∈G,i<j∑el(ai,aj)
Isso permite a análise de clusters no espaço de embedding. Além disso, os autores introduzem a Recuperação de Exemplares, uma tarefa onde, dado um par consulta-referência, o sistema recupera outros pares de imagens que compartilham as mesmas razões subjacentes para a similaridade (ou seja, vetores de explicação similares) em vez de apenas escores de aparência geral similares.
Principais Contribuições
- Framework Inovador: Um framework de explicabilidade agnóstico a modelo e métrica para similaridade de imagem baseado em CAVs extraídos automaticamente, permitendo análise pareada e de nível de grupo sem bancos de dados de conceitos predefinidos.
- Atribuição Baseada em Similaridade: Um método para derivar escores de importância de conceitos diretamente da função de similaridade, fornecendo tanto localização (via heatmaps) quanto quantificação do impacto do conceito.
- Perturbações Fiéis: Evidência experimental demonstrando que perturbações no espaço latente são mais fiéis à distribuição de dados subjacente do que estratégias de mascaramento no espaço de pixels (ex: desfoque), resultando em menos embeddings Fora da Distribuição (OOD).
- Insights Acionáveis: A introdução da Recuperação de Exemplares e análise de grupo, permitindo que usuários entendam e manipulem julgamentos de similaridade baseados em conceitos semânticos.
Resultados Experimentais
Os autores avaliaram sua abordagem no dataset VITON-HD (moda) e em um dataset sintético Multi-CIFAR-10 Collage usando seis backbones de visão (DINOv2, DINOv3, ResNet50, ConvNeXt, ViT, SigLIP).
- Verificação de Conceito: No dataset sintético, o método preservou com sucesso a simetria da função de similaridade. Os dicionários treinados alcançaram aproximadamente 90% de recuperação dos escores de similaridade originais após trocas de conceitos, com os SAEs Top-K mostrando a menor desviação.
- Fidelidade Distribucional: Perturbações latentes alcançaram consistentemente menores escores de Wasserstein (W1) e OOD em comparação com estratégias de mascaramento no espaço de entrada (ex: desfoque, mascaramento aleatório) em todos os modelos testados. Isso confirma que as perturbações latentes permanecem mais próximas do manifold de dados.
- Recuperabilidade Linear: Um modelo de regressão linear treinado nos vetores de explicação pôde prever os escores de similaridade originais com alta precisão (R2>0.87 para ambas as métricas Cosseno e Euclidiana), superando baselines como CSIM, vetores baseados em desfoque e atribuição baseada em gradiente.
- Utilidade Qualitativa: Em estudos de caso, o método identificou com sucesso os drivers semânticos da similaridade (ex: "listras", "decote") e permitiu a Recuperação de Exemplares que recuperou imagens baseadas em conceitos compartilhados (ex: recuperar camisas listradas para uma consulta de camisa listrada) em vez de apenas similaridade visual.
Significância e Alegações
O artigo afirma que sua abordagem fornece uma compreensão mais fiel e interpretável da similaridade de imagens do que os métodos existentes. Ao operar no espaço latente, o método evita as armadil-dhas das perturbações no espaço de pixels que frequentemente geram imagens irreais. Os autores enfatizam que seu framework é automatizado, não exigindo definição manual de conceitos, e é flexível, aplicável a qualquer modelo e métrica de similaridade pré-treinados.
A significância reside na capacidade de ir além de "onde" um modelo foca (saliência) para "o que" características semânticas impulsionam a similaridade. Os autores posicionam seu trabalho como um passo em direção a insights acionáveis, permitindo que designers de modelos identifiquem e potencialmente mitiguem drivers de similaridade indesejados (ex: artefatos de fundo) e permitindo tarefas de recuperação avançadas condicionadas a razões semânticas específicas. No entanto, os autores notam modestamente que sua abordagem assume uma reconstrução linear do espaço de embedding via CAVs, que é uma aproximação de primeira ordem, e que a estabilidade do SAE permanece uma consideração.