Resumen Técnico: AlignFace: Métrica de Similitud Facial Alineada con el Humano con Relaciones de Conceptos Interpretables
Declaración del Problema
Los modelos actuales de visión computacional para contenido facial generado (por ejemplo, edición de rostros, protección de la privacidad) dependen de métricas de similitud que a menudo no logran servir como representaciones fieles de la percepción humana. Si bien la evaluación perceptual ha evolucionado de heurísticas basadas en señales (p. ej., PSNR, SSIM) a métricas basadas en representaciones (p. ej., LPIPS, DreamSim), los enfoques existentes siguen limitados al modelado conductual sin alineación cognitiva. Estos modelos de "caja negra" dependen de relaciones implícitas y espurias, asumen un observador universal y no logran dar cuenta de las variaciones inherentes entre diversas poblaciones humanas. En consecuencia, proporcionan modelos evaluativos inexactos para las partes interesadas y una guía engañosa para la depuración de modelos generativos, como subestimar los riesgos de privacidad o los cambios de identidad cuando un humano aún percibiría los rostros como similares.
Los autores argumentan que los modelos de percepción deben adherirse a efectos cognitivos científicos para lograr una verdadera alineación humana. Específicamente, la percepción humana de los rostros se caracteriza por:
- Procesamiento Dual: Dependencia tanto de atributos featurales (componentes discretos como el color de ojos) como de atributos configuracionales (disposición espacial como la distancia pupilar).
- Escalamiento No Lineal: La percepción humana de las diferencias de atributos no escala linealmente; sigue leyes psicofísicas no lineales.
- Varianza Demográfica: La presencia de un sesgo de propio grupo, donde los individuos reconocen los rostros de sus propios grupos demográficos (etnia, género) con mayor precisión que los de otros grupos.
Metodología
1. El Conjunto de Datos FACETS
Para fundamentar el modelo en la cognición humana, los autores introdujeron FACETS, un conjunto de datos a gran escala anotado por humanos.
- Estímulos: Construidos a partir de los conjuntos de datos CMU Multi-PIE y CelebA, con 120 identidades (equilibradas para las demografías Blanca y Asiática). Las imágenes fueron editadas mediante inpainting basado en difusión, deformación basada en puntos de referencia (landmarks) y transferencia basada en GAN para crear variaciones en 20 atributos con base cognitiva (14 featurales, 6 configuracionales).
- Recolección de Datos: Utilizando un protocolo de Elección Forzada de Dos Alternativas (2AFC), los participantes compararon rostos editados contra un referente.
- Similitud General: 9.36k calificaciones de tripletos de 78 participantes.
- Similitud de Atributos: 73.32k calificaciones de tripletos para 20 atributos de 611 participantes.
- Análisis: El análisis preliminar del Modelo Aditivo Generalizado (GAM) en estos datos confirmó la influencia no lineal de los atributos y las diferencias significativas en la sensibilidad entre la percepción de propio grupo y de otros grupos.
2. Arquitectura de AlignFace
AlignFace es un modelo interpretable ante-hoc diseñado para codificar estos principios cognitivos. Consta de cuatro módulos principales:
Codificación de Modelo de Visión-Lenguaje (VLM):
- Utiliza un codificador de visión compartido para extraer representaciones para un par de rostos (z^A,z^B) y computar diferencias relacionales (Z^Δ).
- Un codificador de texto procesa prompts de atributos (p. ej., "Distancia pupilar") para crear un ancla (Z^attr) que guíe la comparación a lo largo de dimensiones específicas.
Atención Cruzada con Compuerta de Atributos (AGCA):
- Realiza una fusión multimodal donde las características de diferencia de imagen actúan como consultas (Q) y las características de atributos textuales actúan como claves (K) y valores (V).
- Un factor de compuerta aprendible (tanh(α)) controla la inyección de señales condicionadas por atributos, recuperando efectivamente características visuales relevantes del atributo desde la representación de la diferencia.
Modelo de Cuello de Botella de Conceptos (CBM):
- La salida de la AGCA se restringe en conceptos binarios multietiqueta interpretables (Δc^attr∈[−1,+1]).
- Esto obliga al razonamiento del modelo a basarse explícitamente en estos atributos faciales desentrelazados en lugar de en características latentes e ininterpretables.
Modelo de Funciones Aditivas Generales Neuronales de Atributos (Neural GAM):
- Mapea las diferencias de atributos a la puntuación de similitud general utilizando un Neural GAM: F(Δc^)=σ(β+∑fi(Δc^i)).
- Cada fi es una función spline implementada mediante una pequeña red neuronal, capturando influencias parciales no lineales.
- Se impone una restricción de monotonicidad (∂Δc^i∂fi≥0) para asegurar que mayores diferencias de atributos nunca disminuyan la distancia facial total, alineándose con la consistencia perceptual.
3. Objetivo de Entrenamiento
El modelo se entrena como AlignFace2AFC, una métrica de tripletos multitarea. Predice distancias pareadas para dos comparaciones (⟨A,Ref⟩ y ⟨B,Ref⟩) y minimiza la pérdida de bisel cuadrático (squared hinge loss) entre las diferencias de distancia predichas y las etiquetas binarias humanas (que indican qué rostro es más similar). El entrenamiento se realiza por etapas: primero, se entrenan y congelan las predicciones a nivel de atributo; luego, el Neural GAM se entrena sobre la pérdida de distancia total.
Contribuciones Clave
- Caracterización Cognitiva: Identificación de características cognitivas específicas para la percepción de similitud facial humana, incluyendo la dependencia featural/configuracional, el escalamiento psicofísico no lineal y el sesgo de propio grupo demográfico.
- Modelo AlignFace: Un modelo ante-hoc interpretable y basado en la cognición que integra VLMs, Atención Cruzada con Compuerta, Cuellos de Botella de Conceptos y Neural GAMs para forzar la alineación humana.
- Métrica AlignFace2AFC: Una métrica explicable que cuantifica la percepción a través de las contribuciones no lineales de atributos fundamentados.
- Conjunto de Datos FACETS: Un nuevo conjunto de datos de tripletos faciales con juicios de similitud tanto a nivel general como de atributos para 20 atributos, incluyendo metadatos demográficos.
Resultados
- Acuerdo Conductual: AlignFace supera significativamente a los modelos de base (incluyendo métricas heurísticas como SSIM, métricas aprendidas como LPIPS/DreamSim, y modelos específicos de rostros como ArcFace) en la alineación con los juicios humanos 2AFC. Logra los puntajes de acuerdo más altos para la percepción facial general.
- Alineación de Atributos: El modelo demuestra un alto acuerdo en las predicciones a nivel de atributo (acuerdo medio de 0.79 con el backbone FLIP), particularmente para atributos como el largo del cabello y la forma de las cejas.
- Interpretabilidad y No Linealidad: Los Gráficos de Dependencia Parcial (PDPs) revelan que AlignFace captura relaciones altamente no lineales entre las diferencias de atributos y la similitud general, logrando altas correlaciones de Pearson (ρ≈0.94–0.98) con los GAMs humanos. Esto confirma la hipótesis de que la influencia de los atributos es no lineal.
- Sensibilidad Demográfica: El modelo captura con éxito los efectos de "propio grupo", mostrando tendencias de sensibilidad diferentes para participantes Blancos y Asiáticos al evaluar rostros de su propio grupo demográfico frente a otros.
Significado
El artículo afirma que, al cerrar la brecha entre las representaciones aprendidas y los procesos cognitivos humanos, AlignFace permite métricas de evaluación perceptual más transparentes y alineadas para imágenes faciales. A diferencia de los enfoques previos basados en datos que corren el riesgo de generar correlaciones espurias, AlignFace está justificado teóricamente a través de la psicología cognitiva. Proporciona un marco para evaluar modelos generativos que no solo es más preciso para predecir la percepción humana, sino también explicable, permitiendo a los desarrolladores entender por qué un modelo percibe dos rostros como similares o diferentes basándose en atributos featurales y configuracionales específicos. Esto es crítico para aplicaciones que involucran tareas centradas en el humano, como el maquillaje digital, la restauración y la protección de la privacidad, donde el "efecto real en las personas" debe ser estimado con precisión.