Resumen Técnico: Explicación de la Similitud de Imágenes mediante Vectores de Activación de Conceptos Extraídos Automáticamente
Declaración del Problema
La similitud de imágenes es un componente fundamental de numerosas aplicaciones de visión por computadora, incluyendo la recuperación de imágenes, el reconocimiento facial y la compatibilidad de moda. Si bien la similitud se mide típicamente en los espacios de incrustación (embeddings) latentes de redes profundas preentrenadas, la razón detrás de puntuaciones de similitud específicas permanece opaca. Los métodos de explicabilidad (xAI) existentes, diseñados principalmente para tareas de clasificación de una sola entrada, tienen dificultades para proporcionar información global sobre las funciones de similitud, que inherentemente requieren dos entradas. Los enfoques actuales suelen depender de mapas de atribución basados en gradientes o atributos definidos manualmente (por ejemplo, "rayas" o "color") para generar mapas de prominencia (saliency maps). Estos métodos enfrentan dos limitaciones primarias:
- Falta de Información Global: A menudo no logran explicar qué impulsa específicamente la similitud a través de regiones de un espacio de incrustación (por ejemplo, textura frente a forma).
- Dependencia de Definiciones Manuales: Frecuentemente requieren bases de datos de conceptos predefinidos o conjuntos de datos etiquetados deliberadamente, lo que limita su aplicabilidad a nuevos dominios o modelos.
- Fidelidad Distribucional: Las perturbaciones en el espacio de píxeles brutos (por ejemplo, el enmascaramiento) a menudo sacan a las entradas de la variedad de datos (data manifold), lo que conduce a explicaciones poco fiables.
Metodología
Los autores proponen un marco agnóstico al modelo y a la métrica que explica la similitud de imágenes utilizando Vectores de Activación de Conceptos (CAVs) extraídos automáticamente mediante Autoencoders Dispersos (SAEs). La metodología consta de tres pasos principales:
1. Aprendizaje de Diccionario Disperso (Extracción de Conceptos)
Dado un conjunto de datos X y una función de incrustación g:X→Rd, los autores descomponen la matriz de activaciones A en una matriz de pesos U y un diccionario de conceptos V. Esto se logra minimizando la norma de Frobenius:
(U,V)=argU,Vmin∥A−UV⊤∥F2
Este proceso utiliza varias formulaciones de SAE (Top-K, JumpReLU y SAE Vanilla) para aprender un diccionario de conceptos sin etiquetado humano. Cada activación se aproxima como una combinación lineal de estos conceptos aprendidos.
2. Perturbación del Espacio Latente para la Explicación por Pares
Para explicar la similitud entre dos imágenes con incrustaciones ai y aj, el método perturba las incrustaciones a lo largo de las direcciones de los conceptos aprendidos. La importancia de un concepto específico ck se determina midiendo el cambio en la función de similitud f cuando se elimina la contribución del concepto:
elk(ai,aj)=(f(ai,aj)−f(ai/ck,aj))+(f(ai,aj)−f(ai,aj/ck))
donde ai/ck=ai−ui,kvk⊤. Este enfoque simétrico asegura que la explicación tenga en cuenta las contribuciones de ambas entradas. El resultado es un vector de explicación local que caracteriza atributos compartidos y distintos.
3. Explicación a Nivel de Grupo y Recuperación de Ejemplares
El marco se extiende a entornos de grupo promediando las explicaciones locales sobre un grupo G:
eG=(2∣G∣)1i,j∈G,i<j∑el(ai,aj)
Esto permite el análisis de clústeres en el espacio de incrustación. Además, los autores introducen la Recuperación de Ejemplares, una tarea donde, dado un par de consulta-referencia, el sistema recupera otros pares de imágenes que comparten las mismas razones subyacentes para la similitud (es decir, vectores de explicación similares) en lugar de solo puntuaciones de apariencia general similares.
Contribuciones Clave
- Marco Novedoso: Un marco de explicabilidad agnóstico al modelo y a la métrica para la similitud de imágenes basado en CAVs extraídos automáticamente, que permite el análisis por pares y por grupos sin bases de datos de conceptos predefinidos.
- Atribución Basada en Similitud: Un método para derivar puntuaciones de importancia de conceptos directamente de la función de similitud, proporcionando tanto localización (vía mapas de calor) como cuantificación del impacto del concepto.
- Perturbaciones Fieles: Evidencia experimental que demuestra que las perturbaciones en el espacio latente son más fieles a la distribución de datos subyacente que las estrategias de enmascaramiento en el espacio de píxeles (por ejemplo, desenfoque), lo que resulta en menos incrustaciones Fuera de la Distribución (OOD).
- Información Accionable: La introducción de la Recuperación de Ejemplares y el análisis de grupo, permitiendo a los usuarios comprender y manipular los juicios de similitud basados en conceptos semánticos.
Resultados Experimentales
Los autores evaluaron su enfoque en el conjunto de datos VITON-HD (moda) y un conjunto de datos sintético Multi-CIFAR-10 Collage utilizando seis backbones de visión (DINOv2, DINOv3, ResNet50, ConvNeXt, ViT, SigLIP).
- Verificación de Conceptos: En el conjunto de datos sintético, el método preservó con éxito la simetría de la función de similitud. Los diccionarios entrenados lograron aproximadamente un 90% de recuperación de las puntuaciones de similitud originales tras los intercambios de conceptos, mostrando los SAE Top-K la menor desviación.
- Fidelidad Distribucional: Las perturbaciones en el espacio latente consistieron consistentemente en puntuaciones de Wasserstein (W1) y OOD más bajas en comparación con las estrategias de enmascaramiento en el espacio de entrada (por ejemplo, desenfoque, enmascaramiento aleatorio) en todos los modelos probados. Esto confirma que las perturbaciones latentes permanecen más cerca de la variedad de datos.
- Recuperabilidad Lineal: Un modelo de regresión lineal entrenado en los vectores de explicación pudo predecir las puntuaciones de similitud originales con alta precisión (R2>0.87 para las métricas de Coseno y Euclídea), superando a los baselines como CSIM, vectores basados en desenfoque y atribución basada en gradientes.
- Utilidad Cualitativa: En estudios de caso, el método identificó con éxito los impulsores semánticos de la similitud (por ejemplo, "rayas", "escote") y permitió la Recuperación de Ejemplares que recuperó imágenes basadas en conceptos compartidos (por ejemplo, recuperando camisas de rayas para una consulta de camisa de rayas) en lugar de solo similitud visual.
Significado y Reivindicaciones
El artículo afirma que su enfoque proporciona una comprensión más fiel e interpretable de la similitud de imágenes que los métodos existentes. Al operar en el espacio latente, el método evita los problemas de las perturbaciones en el espacio de píxeles que a menudo generan imágenes poco realistas. Los autores enfatizan que su marco es automatizado, ya que no requiere la definición manual de conceptos, y es flexible, aplicable a cualquier modelo preentrenado y métrica de similitud.
La importancia radica en la capacidad de ir más allá de "dónde" se enfoca un modelo (saliencia) hacia "qué" características semánticas impulsan la similitud. Los autores posicionan su trabajo como un paso hacia la obtención de información accionable, permitiendo a los diseñadores de modelos identificar y potencialmente mitigar los impulsores de similitud no deseados (por ejemplo, artefactos de fondo) y habilitar tareas de recuperación avanzadas condicionadas a razones semánticas específicas. Sin embargo, los autores señalan modestamente que su enfoque asume una reconstrucción lineal del espacio de incrustación mediante CAVs, lo cual es una aproximación de primer orden, y que la estabilidad de los SAE sigue siendo una consideración.