← Últimos artículos
💻 computer science

An AI-Driven Multimodal Emotion-Aware Application Based on IFS Therapy

Este artículo presenta ANA, una aplicación multimodal impulsada por IA que integra el análisis de texto, voz y video con los principios de la terapia de Sistemas de Familia Interna (IFS) para reconocer con precisión los estados emocionales y las partes psicológicas internas de los usuarios, logrando un alto rendimiento a través de las modalidades para permitir interacciones de salud mental más ricas y corpóreas.

Autores originales: Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

Publicado 2026-07-15
📖 1 min de lectura☕ Lectura para el café

Autores originales: Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: ANA – Una Aplicación Multimodal Impulsada por IA con Conciencia Emocional Basada en la Terapia IFS

1. Planteamiento del Problema y Motivación

Los sistemas actuales de apoyo a la salud mental que utilizan Inteligencia Artificial se limitan predominantemente a interacciones unimodales basadas en texto. Estos sistemas a menudo carecen de la capacidad para discernir emociones humanas complejas que se transmiten a través del tono, las expresiones faciales y los gestos de las manos. Además, los modelos multimodales existentes suelen sufrir de estrategias de integración débiles, como la simple concatenación de características sin tener en cuenta las dependencias intermodales, y una falta de alineación con teorías psicológicas establecidas.

Específicamente, existe una brecha en los modelos computacionales que integran datos multimodales (texto, voz, visión, gestos) con la terapia de Sistemas de Familia Interna (IFS, por sus siglas en inglés). La IFS postula que la mente humana consta de múltiples "partes internas" distintas (por ejemplo, el Crítico Interno, el Protector, la Parte Abrumada) con perfiles emocionales únicos. El artículo argumenta que modelar eficazmente estos constructos psicológicos requiere un enfoque estructurado que mapee señales emocionales heterogéneas con constructos psicológicos específicos, una tarea que los sistemas unimodales no pueden lograr.

2. Solución Propuesta: El Modelo ANA

Los autores proponen ANA (Una Aplicación Multimodal para el Modelado de Estados Emocionales e Interacción Adaptativa), un sistema diseñado para imitar los conceptos de la terapia IFS. ANA utiliza un paradigma de aprendizaje multimodal para analizar las entradas del usuario a través de cuatro modalidades distintas: Texto, Voz, Expresiones Faciales y Gestos de las Manos.

2.1 Arquitectura del Sistema y Flujo de Trabajo

El sistema opera a través de un flujo de trabajo de "Sesión de Reencuadre" (Reframe Session):

  1. Control de Acceso: Antes de la interacción, el sistema valida el estado del usuario. Si un usuario tiene tres o más personajes internos "no sanados", el acceso a las entradas multimodales se restringe para evitar abrumar al usuario.
  2. Modalidades de Entrada:
    • Video: Extrae texto, emoción vocal, gestos de las manos y expresiones faciales simultáneamente.
    • Solo Texto: Procesa la entrada escrita.
    • Solo Voz: Procesa señales de voz y tono.
    • Nota: Las entradas en árabe se traducen automáticamente al inglés antes del análisis.
  3. Procesamiento: Cada modalidad es procesada por un codificador específico para extraer características.
    4.ales Fusión: Un módulo de fusión integra estas señales para actualizar el perfil del personaje interno del usuario y proporcionar una evaluación del estado emocional.
  4. Salida: El sistema identifica el "personaje interno" dominante y el estado emocional, almacenando los datos para el seguimiento conductual.

3. Metodología

3.1 Preprocesamiento de Datos

  • Texto: Implica normalización, tokenización, eliminación de palabras de parada (stop-words), codificación de vocabulario y relleno/truncamiento para crear secuencias de longitud fija.
  • Voz: Incluye remuestreo (16 kHz), reducción de ruido, recorte de silencios, enmarcado y extracción de características (MFCCs, Chroma, espectrograma de Mel, ZCR, RMS, Centroide Espectral). Las características se estandarizan y reducen mediante PCA.
  • Gestos de las Manos: Utiliza MediaPipe para detectar 21 puntos de referencia (landmarks) de la mano. Las coordenadas se normalizan (traslación y escala) con respecto a la muñeca, se aplanan en un vector de 42 dimensiones y se preparan para la clasificación.
  • Expresiones Faciales: Las imágenes se convierten a escala de grises, se redimensionan a 48x48 píxeles, se normalizan y se aumentan (rotación, cizallamiento, zoom) durante el entrenamiento.

3.2 Codificadores Específicos por Modalidad

El sistema emplea codificadores especializados para cada tipo de entrada:

  • Codificador de Texto: Un modelo híbrido CNN + BiLSTM. Las capas CNN extraen características locales de N-gramas, seguidas de capas de max pooling y BiLSTM para capturar dependencias de largo plazo. La salida clasifica el "personaje interno" (por ejemplo, Crítico Interno, Protector).
  • Codificador de Voz: Utiliza características acústicas artesanales (MFCCs, tono, energía) reducidas mediante PCA y clasificadas utilizando un algoritmo de K-Vecinos Más Cercanos (KNN) para reconocer estados emocionales.
  • Codificador de Gestos de las Manos: Un clasificador de Perceptrón Multicapa (MLP) que procesa vectores de puntos de referencia normalizados para reconocer gestos estáticos y dinámicos.
  • Codificador de Expresiones Faciales: Una Red Neuronal Convolucional (CNN) (basada en Caffe SSD/ResNet-10 para detección) que clasifica emociones a partir de imágenes faciales.

3.3 Estrategias de Fusión

El artículo evalúa tres enfoques de fusión:

  1. Fusión Temprana (Early Fusion): Concatenación de características antes de la clasificación.
  2. Fusión Tardía (Late Fusion): Cada modalidad realiza una predicción independiente, las cuales son combinadas mediante votación ponderada.
  3. Fusión Híbrida: Una combinación de fusión a nivel de características y a nivel de decisión.
    Los resultados indican que la Fusión Tardía es la estrategia más efectiva, ya que permite que cada modalidad tome decisiones independientes antes de agregarlas, haciendo que el sistema sea robusto ante entradas faltantes o ruidosas.

4. Resultados Experimentales

4.1 Conjuntos de Datos

El estudio utilizó diversos conjuntos de datos para el entrenamiento y la evaluación:

  • Texto: Agregado de fuentes como Counseling, DailyDialog, GoEmotions y RedditMentalHealth (360,000 muestras).
  • Voz: Conjuntos de datos de referencia incluyendo RAVDESS, TESS, CREMA-D, SAVEE y EMO-DB (4,800 muestras).
  • Rostro: FER-2013, AffectNet y CK+ (35,887 muestras).
  • Gestos de las Manos: Un conjunto de datos personalizado (ANAHandGestures.csv) creado usando MediaPipe (6,153 muestras).

4.2 Métricas de Desempeño

Los modelos unimodales lograron las siguientes precisiones:

  • Reconocimiento de Emoción de Voz (KNN): 98% (El desempeño más alto; atribuido a la fuerte separabilidad acústica).
  • Clasificación de Personaje Interno de Texto (CNN+BiLSTM): 97%.
  • Reconocimiento de Gestos de las Manos (MLP): 93%.
  • Reconocimiento de Expresión Facial (CNN): 88% (Menor debido a la sensibilidad a la iluminación y la superposición de expresiones).

4.3 Análisis

  • La Voz y el Texto fueron identificados como los predictores más fuertes del estado emocional y el personaje interno.
  • Las Expresiones Faciales y los Gestos de las Manos sirvieron como señales complementarias, proporcionando retroalimentación no verbal que ayudó a resolver ambigüedidades en el texto o la voz (por ejemplo, detectar a un "Protector" ocultando la tristeza tras una sonrisa).
  • Las Matrices de Confusión mostraron dominancia diagonal en todas las modalidades, ocurriendo errores principalmente entre clases emocionales similares (por ejemplo, neutral vs. triste).
  • El Análisis ROC confirmó altos valores de AUC para todas las modalidades, indicando una fuerte separación de clases.

5. Contribuciones Clave

El artículo describe las siguientes contribuciones específicas:

  1. Modelo Multimodal Estructurado: Desarrollo de un sistema que integra cuatro modalidades (texto, voz, rostro, gesto) específicamente dentro del marco de la Computación Afectiva y la terapia IFS.
  2. Codificadores Especializados:
    • Un codificador de texto CNN-BiLSTM para la clasificación de personajes internos.
    • Un sistema de reconocimiento de emoción de voz PCA-KNN.
    • Un sistema de reconocimiento de expresión facial basado en CNN.
    • Un módulo de reconocimiento de gestos de las manos ligero basado en MediaPipe.
  3. Fusión Multimodal: Implementación de un sistema de fusión que combina estas modalidades para reconocer tanto estados emocionales como personajes psicológicos internos.
  4. Despliegue: Un servicio de inferencia web funcional (basado en Flask) con una interfaz móvil que gestiona el análisis multimodal en tiempo real, incluyendo la traducción de árabe a inglés y el control de acceso basado en el estado psicológico del usuario.

6. Significado y Reivindicaciones

Los autores afirman que el modelo ANA va más allá de los sistemas comunes de chatbot de salud mental al crear un modelo de interacción más rico y encarnado. Al aprovechar el aprendizaje multimodal, el sistema logra una comprensión más robusta del usuario que los sistemas unimodales.

  • Validación de la Multimodalidad: El estudio demuestra que la combinación de modalidades compensa las debilidades individuales (por ejemplo, la ambigüedad del texto o la oclusión facial), duplicando efectivamente la capacidad de comprensión del sistema en comparación con los modos de entrada única.
  • Alineación Terapéutica: El sistema logra mapear con éxito los resultados técnicos de la IA (reconocimiento de emociones) a constructos psicológicos (partes internas de la IFS), cerrando la brecha entre el aprendizaje profundo y los modelos de terapia clínica.
  • Utilidad Práctica: La arquitectura de despliegue soporta el procesamiento en tiempo real y maneja desafíos del mundo real, como el ruido, las variaciones de iluminación y las modalidades faltantes a través de estrategias de fusión adaptativas.

El artículo concluye que, si bien las modalidades individuales tienen limitaciones (por ejemplo, la precisión del reconocimiento facial cae en condiciones de mala iluminación), el enfoque multimodal integrado proporciona una evaluación integral y consciente del contexto del estado psicológico interno de un usuario, validando la efectividad del modelo propuesto para el apoyo de salud mental personalizado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →