← Últimos artigos
💻 computer science

An AI-Driven Multimodal Emotion-Aware Application Based on IFS Therapy

Este artigo apresenta o ANA, uma aplicação multimodal impulsionada por IA que integra análise de texto, fala e vídeo com os princípios da terapia de Sistemas Familiares Internos (IFS) para reconhecer com precisão os estados emocionais e as partes psicológicas internas dos usuários, alcançando alto desempenho entre as modalidades para permitir interações de saúde mental mais ricas e incorporadas.

Autores originais: Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

Publicado 2026-07-15
📖 1 min de leitura☕ Leitura rápida

Autores originais: Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: ANA – Uma Aplicação Multimodal Impulsionada por IA e Consciente de Emoções Baseada na Terapia IFS

1. Declaração do Problema e Motivação

Os atuais sistemas de apoio à saúde mental que utilizam Inteligência Artificial são predominantemente limitados a interações unimodais baseadas em texto. Estes sistemas carecem frequentemente da capacidade de discernir emoções humanas complexas que são transmitidas através do tom, expressões faciais e gestos manuais. Além disso, os modelos multimodais existentes sofrem frequentemente de estratégias de integração fracas, como a simples concatenação de características sem considerar as dependências intermodais, e uma falta de alinhamento com teorias psicológicas estabelecidas.

Especificamente, existe uma lacuna nos modelos computacionais que integram dados multimodais (texto, voz, visão, gestos) com a terapia de Sistemas Familiares Internos (IFS). A IFS postula que a mente humana consiste em múltiplas "partes internas" distintas (por exemplo, o Crítico Interno, o Protetor, a Parte Sobrecarregada) com perfis emocionais únicos. O artigo argumenta que modelar eficazmente estes constructos psicológicos requer uma abordagem estruturada que mapeie pistas emocionais heterogéneas para constructos psicológicos específicos, uma tarefa que os sistemas unimodais não conseguem realizar.

2. Solução Proposta: O Modelo ANA

Os autores propõem o ANA (Uma Aplicação Multimodal para Modelagem de Estados Emocionais e Interação Adaptativa), um sistema concebido para mimetizar os conceitos da terapia IFS. O ANA utiliza um paradigma de aprendizagem multimodal para analisar os inputs do utilizador através de quatro modalidades distintas: Texto, Voz, Expressões Faciais e Gestos Manuais.

2.1 Arquitetura do Sistema e Fluxo de Trabalho

O sistema opera através de um fluxo de trabalho de "Sessão de Reenquadramento" (Reframe Session):

  1. Controlo de Acesso: Antes da interação, o sistema valida o estado do utilizador. Se um utilizador tiver três ou mais personagens internas "não curadas", o acesso aos inputs multimodais é restrito para evitar sobrecarregar o utilizador.
  2. Modalidades de Input:
    • Vídeo: Extrai simultaneamente texto, emoção vocal, gestos manuais e expressões faciais.
    • Apenas Texto: Processa o input escrito.
    • Apenas Voz: Processa sinais de fala e tom.
    • Nota: Os inputs em Árabe são automaticamente traduzidos para Inglês antes da análise.
  3. Processamento: Cada modalidade é processada por um encoder específico para extrair características.
  4. Fusão: Um módulo de fusão integra estes sinais para atualizar o perfil de personagem interna do utilizador e fornecer uma avaliação do estado emocional.
  5. Output: O sistema identifica a "personagem interna" dominante e o estado emocional, armazenando os dados para monitorização comportamental.

3. Metodologia

3.1 Pré-processamento de Dados

  • Texto: Envolve normalização, tokenização, remoção de stop-words, codificação de vocabulário e padding/truncamento para criar sequências de comprimento fixo.
  • Voz: Inclui reamostragem (16 kHz), redução de ruído, corte de silêncio, enquadramento e extração de características (MFCCs, Chroma, Mel-spectrogram, ZCR, RMS, Centroide Espectral). As características são padronizadas e reduzidas via PCA.
  • Gestos Manuais: Utiliza o MediaPipe para detetar 21 landmarks de mão. As coordenadas são normalizadas (translação e escala) em relação ao pulso, achatadas num vetor de 42 dimensões e preparadas para classificação.
  • Expressões Faciais: As imagens são convertidas para tons de cinza, redimensionadas para 48x48 pixels, normalizadas e aumentadas (rotação, cisalhamento, zoom) durante o treino.

3.2 Encoders Específicos por Modalidade

O sistema emprega encoders especializados para cada tipo de input:

  • Encoder de Texto: Um modelo híbrido CNN + BiLSTM. As camadas CNN extraem características de N-gramas locais, seguidas de max pooling e camadas BiLSTM para capturar dependências de longo prazo. O output classifica a "personagem interna" (ex: Crítico Interno, Protetor).
  • Encoder de Voz: Utiliza características acústicas manuais (MFCCs, pitch, energia) reduzidas via PCA e classificadas usando um algoritmo K-Nearest Neighbors (KNN) para reconhecer estados emocionais.
  • Encoder de Gestos Manuais: Um classificador de Perceptron Multicamadas (MLP) que processa vetores de landmarks normalizados para reconhecer gestos estáticos e dinâmicos.
  • Encoder de Expressões Faciais: Uma Rede Neuronal Convolucional (CNN) (baseada em Caffe SSD/ResNet-10 para deteção) que classifica emoções a partir de imagens faciais.

3.3 Estratégias de Fusão

O artigo avalia três abordagens de fusão:

  1. Fusão Precoce (Early Fusion): Concatenar características antes da classificação.
  2. Fusão Tardia (Late Fusion): Cada modalidade faz uma previsão independente, que é depois combinada via votação ponderada.
  3. Fusão Híbrida: Uma combinação de fusão ao nível das características e ao nível da decisão.
    Os resultados indicam que a Fusão Tardia é a estratégia mais eficaz, pois permite que cada modalidade tome decisões independentes antes da agregação, tornando o sistema robusto a inputs ausentes ou ruidosos.

4. Resultados Experimentais

4.1 Datasets

O estudo utilizou diversos datasets para treino e avaliação:

  • Texto: Agregado de fontes como Counseling, DailyDialog, GoEmotions e RedditMentalHealth (360.000 amostras).
  • Voz: Datasets de referência incluindo RAVDESS, TESS, CREMA-D, SAVEE e EMO-DB (4.800 amostras).
  • Rosto: FER-2013, AffectNet e CK+ (35.887 amostras).
  • Gestos Manuais: Um dataset personalizado (ANAHandGestures.csv) criado usando MediaPipe (6.153 amostras).

4.2 Métricas de Desempenho

Os modelos unimodais atingiram as seguintes precisões:

  • Reconhecimento de Emoção de Voz (KNN): 98% (Desempenho mais elevado; atribuído à forte separabilidade acústica).
  • Classificação de Personagem Interna de Texto (CNN+BiLSTM): 97%.
  • Reconhecimento de Gestos Manuais (MLP): 93%.
  • Reconhecimento de Emoção Facial (CNN): 88% (Menor devido à sensibilidade à iluminação e sobreposição de expressões).

4.3 Análise

  • Voz e Texto foram identificados como os preditores mais fortes do estado emocional e da personagem interna.
  • Expressões Faciais e Gestos Manuais serviram como sinais complementares, fornecendo feedback não verbal que ajudou a resolver ambiguidades no texto ou na voz (ex: detetar um "Protetor" a esconder a tristeza por trás de um sorriso).
  • As Matrizes de Confusão mostraram dominância diagonal em todas as modalidades, com erros ocorrendo principalmente entre classes emocionais semelhantes (ex: neutro vs. triste).
  • A Análise ROC confirmou altos valores de AUC para todas as modalidades, indicando uma forte separação de classes.

5. Principais Contribuições

O artigo delineia as seguintes contribuições específicas:

  1. Modelo Multimodal Estruturado: Desenvolvimento de um sistema que integra quatro modalidades (texto, voz, rosto, gesto) especificamente dentro do framework da Computação Afetiva e da terapia IFS.
  2. Encoders Especializados:
    • Um encoder de texto CNN-BiLSTM para classificação de personagem interna.
    • Um sistema de reconhecimento de emoção de voz PCA-KNN.
    • Um sistema de reconhecimento de emoção facial baseado em CNN.
    • Um módulo de reconhecimento de gestos manuais leve baseado em MediaPipe.
  3. Fusão Multimodal: Implementação de um sistema de fusão que combina estas modalidades para reconhecer tanto estados emocionais como personagens psicológicas internas.
  4. Implementação: Uma arquitetura de serviço de inferência web funcional (baseada em Flask) com uma interface móvel que lida com análise multimodal em tempo real, incluindo tradução de Árabe para Inglês e controlo de acesso baseado no estado psicológico do utilizador.

6. Significância e Alegações

Os autores alegam que o modelo ANA vai além dos comuns chatbots de apoio à saúde mental ao criar um modelo de interação mais rico e incorporado. Ao tirar partido da aprendizagem multimodal, o sistema alcança uma compreensão mais robusta do utilizador do que os sistemas unimodais.

  • Validação da Multimodalidade: O estudo demonstra que a combinação de modalidades compensa as fraquezas individuais (ex: ambiguidade de texto ou oclusão facial), duplicando efetivamente a capacidade de compreensão do sistema em comparação com os modos de entrada única.
  • Alinhamento Terapêutico: O sistema mapeia com sucesso os outputs técnicos de IA (reconhecimento de emoção) para constructos psicológicos (partes internas da IFS), colmatando a lacuna entre o deep learning e os modelos de terapia clínica.
  • Utilidade Prática: A arquitetura de implementação suporta o processamento em tempo real e lida com desafios do mundo real, tais como ruído, variações de iluminação e modalidades ausentes através de estratégias de fusão adaptativas.

O artigo conclui que, embora as modalidades individuais tenham limitações (ex: a precisão do reconhecimento facial cai em má iluminação), a abordagem multimodal integrada fornece uma avaliação abrangente e contextualizada do estado psicológico interno de um utilizador, validando a eficácia do modelo proposto para o apoio personalizado à saúde mental.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →