Resumo Técnico: AlignFace: Métrica de Similaridade Facial Alinhada ao Humano com Relações de Conceitos Interpretáveis
Declaração do Problema
Os modelos atuais de visão computacional para conteúdo facial gerado (ex: edição de rosto, proteção de privacidade) dependem de métricas de similaridade que frequentemente falham em servir como proxies fiéis para a percepção humana. Embora a avaliação perceptual tenha evoluído de heurísticas baseadas em sinais (ex: PSNR, SSIM) para métricas baseadas em representações (ex: LPIPS, DreamSim), as abordagens existentes permanecem limitadas à modelagem comportamental sem alinhamento cognitivo. Esses modelos "caixa-preta" dependem de relações implícitas e espúrias, assumem um observador universal e falham em considerar variações inerentes entre diversas populações humanas. Consequentemente, eles fornecem modelos avaliativos imprecisos para as partes interessadas e orientações enganosas para a depuração de modelos generativos, como subestimar riscos de privacidade ou mudanças de identidade quando um humano ainda perceberia os rostos como semelhantes.
Os autores argumentam que os modelos de percepção devem aderir a efeitos cognitivos científicos para alcançar um verdadeiro alinhamento humano. Especificamente, a percepção facial humana é caracterizada por:
- Processamento Dual: Dependência tanto de atributos de características (componentes discretos como cor dos olhos) quanto de atributos configuracionais (layout espacial como distância pupilar).
- Escalonamento Não Linear: A percepção humana de diferenças de atributos não escala linearmente; ela segue leis psicofísicas não lineares.
- Variância Demográfica: A presença de viés de grupo próprio (own-group bias), onde indivíduos reconhecem rostos de seus próprios grupos demográficos (etnia, gênero) com mais precisão do que outros grupos.
Metodologia
1. O Conjunto de Dados FACETS
Para fundamentar o modelo na cognição humana, os autores introduziram o FACETS, um conjunto de dados de larga escala anotado por humanos.
- Estímulos: Construídos a partir dos conjuntos de dados CMU Multi-PIE e CelebA, apresentando 120 identidades (equilibradas para as demografias Branca e Asiática). As imagens foram editadas usando inpainting baseado em difusão, deformação baseada em landmarks e transferência baseada em GAN para criar variações em 20 atributos fundamentados cognitivamente (14 de características, 6 configurais).
- Coleta de Dados: Utilizando um protocolo de Escolha Forçada de Duas Alternativas (2AFC), os participantes compararam rostos editados contra uma referência.
- Similaridade Geral: 9,36k classificações de tripletos de 78 participantes.
- Similaridade de Atributos: 73,32k classificações de tripletos para 20 atributos de 611 participantes.
- Análise: Uma análise preliminar de Modelo Aditivo Generalizado (GAM) sobre esses dados confirmou a influência não linear de atributos e diferenças significativas na sensibilidade entre a percepção de grupo próprio e de outros grupos.
2. Arquitetura AlignFace
O AlignFace é um modelo interpretável ante-hoc projetado para codificar esses princípios cognitivos. Ele consiste em quatro módulos primários:
Codificação de Modelo de Visão-Linguagem (VLM):
- Utiliza um codificador de visão compartilhado para extrair representações para um par de rostos (z^A,z^B) e computa diferenças relacionais (Z^Δ).
- Um codificador de texto processa prompts de atributos (ex: "Distância pupilar") para criar uma âncora (Z^attr) que guia a comparação ao longo de dimensões específicas.
Atenção Cruzada com Portão de Atributos (AGCA - Attribute-Gated Cross-Attention):
- Realiza a fusão multimodal onde as características de diferença de imagem atuam como consultas (Q) e as características de atributos textuais atuam como chaves (K) e valores (V).
- Um fator de portão aprendível (tanh(α)) controla a injeção de sinais condicionais ao atributo, recuperando efetivamente características visuais relevantes ao atributo a partir da representação de diferença.
Modelo de Gargalo de Conceito (CBM - Concept Bottleneck Model):
- A saída do AGCA é restringida em conceitos binários multirrótulo interpretáveis (Δc^attr∈[−1,+1]).
- Isso força o raciocínio do modelo a ser explicitamente baseado nesses atributos faciais desentrançados, em vez de características latentes e interpretáveis.
Modelo Aditivo Generalizado Neural de Atributos (Neural GAM):
- Mapeia as diferenças de atributos para a pontuação de similaridade geral usando um Neural GAM: F(Δc^)=σ(β+∑fi(Δc^i)).
- Cada fi é uma função spline implementada via uma pequena rede neural, capturando influências parciais não lineares.
- Uma restrição de monotonicidade é imposta (∂Δc^i∂fi≥0) para garantir que maiores diferenças de atributos nunca diminuam a distância facial total, alinhando-se com a consistência perceptual.
3. Objetivo de Treinamento
O modelo é treinado como AlignFace2AFC, uma métrica de tripletos multitarefa. Ele prevê distâncias pareadas para duas comparações (⟨A,Ref⟩ e ⟨B,Ref⟩) e minimiza a perda de hinge ao quadrado entre as diferenças de distância relativa prevista e os rótulos binários humanos (que indicam qual rosto é mais semelhante). O treinamento é em estágios: primeiro, as previsões de nível de atributo são treinadas e congeladas; depois, o Neural GAM é treinado na perda de distância geral.
Principais Contribuições
- Caracterização Cognitiva: Identificação de características cognitivas específicas para a percepção de similaridade facial humana, incluindo dependência de características/configurações, escalonamento psicofísico não linear e viés de grupo próprio demográfico.
- Modelo AlignFace: Um modelo ante-hoc interpretável e fundamentado cognitivamente, integrando VLMs, Atenção Cruzada com Portão, Gargalos de Conceito e Neural GAMs para impor o alinhamento humano.
- Métrica AlignFace2AFC: Uma métrica explicável que quantifica a percepção através das contribuições não lineares de atributos fundamentados.
- Conjunto de Dados FACETS: Um novo conjunto de dados de tripletos de rostos com julgamentos de similaridade tanto em nível geral quanto de atributo através de 20 atributos, incluindo metadados demográficos.
Resultados
- Acordo Comportamental: O AlignFace supera significativamente os baselines (incluindo métricas heurísticas como SSIM, métricas aprendidas como LPIPS/DreamSim, e modelos específicos de face como ArcFace) no alinhamento com os julgamentos 2AFC humanos. Ele atinge as pontuações de acordo mais altas para a percepção facial geral.
- Alinhamento de Atributos: O modelo demonstra alto acordo nas previsões de nível de atributo (acordo médio de 0,79 com o backbone FLIP), particularmente para atributos como comprimento do cabelo e formato das sobrancelhas.
- Interpretabilidade e Não Linearidade: Gráficos de Dependência Parcial (PDPs) revelam que o AlignFace captura relações altamente não lineares entre as diferenças de atributos e a similaridade geral, alcançando altas correlações de Pearson (ρ≈0,94–0,98) com os GAMs humanos. Isso confirma a hipótesia de que a influência do atributo é não linear.
- Sensibilidade Demográfica: O modelo captura com sucesso os efeitos de "grupo próprio", mostrando tendências de sensibilidade diferentes para participantes brancos e asiáticos ao avaliar rostos de seu próprio grupo demográfico versus outros grupos.
Significância
O artigo afirma que, ao unir representações aprendidas com processos cognitivos humanos, o AlignFace possibilita métricas de avaliação perceptual mais transparentes e alinhadas para imagens faciais. Ao contrário das abordagens anteriores baseadas em dados que correm o risco de correlações espúrias, o AlignFace é teoricamente justificado através da psicologia cognitiva. Ele fornece um framework para avaliar modelos generativos que não é apenas mais preciso em prever a percepção humana, mas também explicável, permitindo que desenvolvedores entendam por que um modelo percebe dois rostos como semelhantes ou diferentes com base em atributos específicos de características e configurações. Isso é crítico para aplicações envolvendo tarefas centradas no humano, como maquiagem digital, restauração e proteção de privacidade, onde o "efeito real nas pessoas" deve ser estimado com precisão.