← Últimos artigos
💻 computer science

From Action Units to Emotions: A Two-Stage Fine-Tuning Framework with Decision-Level Fusion for Facial Expression Recognition

Este artigo propõe uma estrutura de ajuste fino de dois estágios que aprimora as capacidades de reconhecimento de unidades de ação facial e classificação de emoções de um modelo grande multimodal por meio de um conjunto de dados de pergunta-resposta e fusão em nível de decisão com um modelo pequeno especializado, melhorando significamente a precisão e a interpretabilidade do reconhecimento de expressões faciais para expressões sutis e de baixa intensidade.

Autores originais: Rui Tu, Liguo Zhou, Alois Knoll

Publicado 2026-08-31
📖 1 min de leitura☕ Leitura rápida

Autores originais: Rui Tu, Liguo Zhou, Alois Knoll

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: Das Unidades de Ação às Emoções

Declaração do Problema

O Reconhecimento de Expressão Facial (FER) permanece limitado por desafios práticos, como variações de iluminação, diferenças de pose e a escassez de dados anotados. Modelos de aprendizado profundo existentes frequentemente sofrem com baixa adaptabilidade cross-domain, overfitting e insuficiência de interpretabilidade. Além disso, embora os Modelos de Linguagem de Grande Escala Multimodais (MLLMs) ofereçam compreensão semântica avançada, eles frequentemente carecem de sensibilidade para perceber deformações geométricas faciais sutis e microexpressões. O ajuste fino (fine-tuning) tradicional de ponta a ponta de MLLMs em sinais "vídeo-rótulo" frequentemente negligencia as representações intermediárias de grão fino (Unidades de Ação - AUs) que fundamentam as expressões emocionais, levando a cadeias de raciocínio subótimas.

Metodologia

O artigo propõe um Framework de Ajuste Fino de Dois Estágios com Fusão ao Nível de Decisão projetado para unir a percepção facial de baixo nível e a semântica emocional de alto nível.

1. Ajuste Fino Progressivo de Dois Estágios

A estratégia central decompõe o FER em dois estágios sequenciais de aprendizado para alcançar a "tripla decomposição": percepção do raciocínio, conhecimento agnóstico de domínio do conhecimento específico de domínio, e observações físicas do rótulo emocional.

  • Estágio 1: Ajuste Fino de Detecção de AU (Percepção)

    • Dados: Utiliza o conjunto de dados CAS(ME)³, que fornece anotações de Unidade de Ação (AU) em nível de quadro.
    • Tarefa: Reformula o reconhecimento de AU como uma tarefa de Visual Question Answering (VQA). O modelo é instruído a identificar AUs ativas com base na entrada visual, aproveitando o conhecimento prévio do Sistema de Codificação de Ação Facial (FACS).
    • Modelo: O modelo multimodal Qwen3-VL-32B-Instruct é ajustado via LoRA (Low-Rank Adaptation) para atualizar apenas um pequeno subconjunto de parâmetros (matrizes Query e Value), preservando o conhecimento semântico-visual pré-treinado enquanto aprende a detecção de AU.
    • Objetivo: Estabelecer capacidades perceptivas robustas e agnósticas de domínio para micro-movimentos faciais sutis.
  • Estágio 2: Ajuste Fino de Reconhecimento de Expressão (Raciocínio)

    • Dados: Transfere para o conjunto de dados FER-2013 (imagens estáticas com rótulos de emoção, mas sem anotações de AU).
    • Tarefa: O modelo, inicializado com pesos do Estágio 1, é posteriormente ajustado para mapear combinações de AUs detectadas para categorias de emoção. O formato de saída exige que o modelo raciocine das AUs para o rótulo de emoção final, mantendo a estrutura de VQA.
    • Estratégia: Apenas novos adaptadores LoRA para reconhecimento de emoção são otimizados; o codificador visual e os adaptadores do Estágio 1 permanecem congelados para preservar a cadeia de raciocínio AU-para-emoção.

2. Fusão ao Nível de Decisão

Para abordar as limitações de modelos puramente grandes na percepção de deformações geométricas finas, o framework integra o Qwen3-VL ajustado com o OpenFace 3.0, um modelo de FER especializado e leve baseado em CNN.

  • Mecanismo: Uma interpolação linear ponderada funde as distribuições de probabilidade (PVLMP_{VLM} e POpenFaceP_{OpenFace}) dos dois modelos:
    Pfinal=αPOpenFace+(1α)PVLMP_{final} = \alpha \cdot P_{OpenFace} + (1 - \alpha) \cdot P_{VLM}
  • Racional: O OpenFace 3.0 fornece sensibilidade a landmarks faciais locais e características geométricas, enquanto o MLLM ajustado oferece compreensão semântica de alto nível e raciocínio contextual.

Principais Contribuições

  1. Validação de Baselines de Grandes Modelos: Avaliou sistematicamente o desempenho zero-shot e few-shot do Qwen3-VL-32B-Instruct em FER, estabelecendo um baseline sólido.
  2. Ajuste Fino de Dois Estágios Guiado por AU: Introduziu um paradigma de aprendizado por currículo onde o modelo primeiro aprende a detecção de AU no CAS(ME)³ antes de mapear para emoções no FER-2013. Isso permite que o modelo adquira capacidades de inferência de AU e raciocine através de uma cadeia interpretável ("inferência de AU primeiro, predição de emoção depois").
  3. Colaboração de Modelos Heterogêneos: Demonstrou a viabilidade da fusão ao nível de decisão entre um grande modelo multimodal e um modelo pequeno especializado (OpenFace 3.0), validando suas forças complementares.
  4. Desempenho Empírico Robusto: Mostrou que o framework proposto supera significativamente os baselines não ajustados e os modelos especializados standalone, particularmente ao melhorar o recall para classes minoritárias e aumentar a interpretabilidade.

Resultados Experimentais

Os experimentos foram conduzidos no conjunto de teste FER-2013 utilizando métricas incluindo Acurácia (ACC), Precisão, Recall e F1-Score.

  • Desempenho vs. Baselines:
    • O Qwen3-VL ajustado alcançou 66,73% de acurácia, um aumento de 8 pontos percentuais sobre o baseline não ajustado (58,73%).
    • O Modelo Fundido (Qwen3-VL + OpenFace 3.0) alcançou 67,37% de acurácia.
    • Comparado às CNNs tradicionais, o modelo fundido supera ligeiramente o GoogLeNet (67,04%), mas fica atrás do ResNet-50 (69,33%), VGG-16 (68,75%) e DenseNet (69,38%).
    • Apesar de não superar os modelos CNN especializados ideais em acurácia geral, o modelo fundido demonstrou uma Precisão Ponderada (Weighted Precision) superior (69,47%), comparável à ResNet50 (69,84%).
  • Vantagens da Fusão:
    • O modelo fundido mostrou uma melhoria significativa no Macro-Recall (62,71%) em comparação ao modelo de grande escala puro (58,64%), indicando melhor captura de classes minoritárias (ex: nojo, medo).
    • Comparado ao OpenFace 3.0 sozinho (48,02% de acurácia), o framework conjunto melhorou a acurácia em 19,35 pontos percentuais (melhoria relativa de 40,3%).
  • Interpretabilidade: O modelo gerou com sucesso explicações em linguagem natural vinculando ativações específicas de AU (ex: AU4, AU7) a julgamentos de emoção, fornecendo uma cadeia de raciocínio rastreável ausente em CNNs de "caixa-preta".

Significância e Alegações

O artigo alega que a estratégia de ajuste fino de dois estágios proposta elicia efetivamente características discriminativas para deformações geométricas faciais sutis e expressões de baixa intensidade de modelos visuais grandes, que tipicamente lutam com tais detalhes de grão fino.

Os autores afirmam que, embora os modelos visuais puramente grandes possuam uma formidável compreensão semântica de alto nível, eles exibem limitações inerentes na percepção de deformações faciais sutis. O método proposto aborda isso:

  1. Aumentando a Interpretabilidade: O uso de AUs como representações intermediárias permite saídas de modelo rastreáveis, aumentando a confiabilidade.
  2. Melhorando a Robustez: A fusão ao nível de decisão compensa a falta de priors espaciais de grão fino nos modelos grandes, aumentando significativamente o desempenho em classes minoritárias e reduzindo o viés para classes majoritárias.
  3. Fornecendo um Novo Caminho: O estudo oferece um paradigma técnico para construir sistemas de FER altamente robustos e interpretáveis, alavancando as forças complementares de MLLMs e modelos geométricos especializados, validados por resultados empíricos que mostram ganhos substanciais sobre a inferência standalone de qualquer um dos modelos.

Os autores concluem que, embora a acurácia atual ainda não supere as melhores CNNs especializadas absolutas, o framework demonstra clara superioridade em confiança de predição, interpretabilidade arquitetural e no potencial para aplicações sinérgicas de grandes modelos em computação afetiva.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →