← 最新论文
💻 computer science

An AI-Driven Multimodal Emotion-Aware Application Based on IFS Therapy

本文介绍了 ANA,这是一款由人工智能驱动的多模态应用,它将文本、语音和视频分析与内感家庭系统(IFS)疗法原理相结合,以准确识别用户的情绪状态和内在心理部分,通过在多种模态上实现高性能,从而实现更丰富、具身化的心理健康交互。

原作者: Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:ANA —— 基于 IFS 疗法的 AI 驱动多模态情绪感知应用

1. 问题陈述与动机

目前利用人工智能的心理健康支持系统主要局限于单模态、基于文本的交互。这些系统往往缺乏辨别通过语调、面部表情和手势传达的复杂人类情绪的能力。此外,现有的多模态模型经常受到弱集成策略的影响,例如简单的特征拼接,而未考虑到模态间的依赖关系,且缺乏与既定心理学理论的对齐。

具体而言,在计算模型整合多模态数据(文本、语音、视觉、手势)与内在家庭系统 (Internal Family Systems, IFS) 疗法方面存在空白。IFS 认为人类的心智由多个不同的“内在部分”组成(例如:内在批判者、保护者、被压倒的部分),这些部分具有独特的的情绪特征。本文认为,有效地对这些心理构念进行建模需要一种结构化的方法,将异构的情绪线索映射到特定的心理构念上,而单模态系统无法完成这一任务。

2. 提议的解决方案:ANA 模型

作者提出了 ANA(用于建模情绪状态与自适应交互的多模态应用),该系统旨在模拟 IFS 疗法的概念。ANA 利用多模态学习范式来分析用户在四个不同模态上的输入:文本、声音、面部表情和手势

2.1 系统架构与工作流

系统通过“重构会话 (Reframe Session)”工作流运行:

  1. 访问控制: 在交互之前,系统会验证用户的状态。如果用户拥有三个或更多“未愈合”的内在角色,则限制其访问多模态输入,以防止用户感到不知所措。
  2. 输入模态:
    • 视频: 同时提取文本、语音情绪、手势和面部表情。
    • 仅文本: 处理书面输入。
    • 仅语音: 处理语音信号和语调。
    • 注: 阿拉伯语输入会在分析前自动翻译为英语。
  3. 处理: 每种模态都由特定的编码器进行处理以提取特征。
  4. 融合: 融合模块整合这些信号,以更新用户的内在角色剖面并提供情绪状态评估。
  5. 输出: 系统识别主导的“内在角色”和情绪状态,并存储数据用于行为追踪。

3. 方法论

3.1 数据预处理

  • 文本: 包括归一化、分词、停用词去除、词汇编码以及填充/截断,以创建固定长度的序列。
  • 语音: 包括重采样(16 kHz)、降噪、静音修剪、分帧,以及特征提取(MFCCs、Chroma、Mel谱图、ZCR、RMS、谱质心)。特征经过标准化并通过 PCA 进行降维。
  • 手势: 使用 MediaPipe 检测 21 个手部关键点。坐标相对于手腕进行归一化(平移和缩放),展平为 42 维向量,并为分类做准备。
  • 面部表情: 图像转换为灰度图,调整大小为 48x48 像素,并在训练期间进行增强(旋转、剪切、缩放)。

3.2 特定模态编码器

系统为每种输入类型采用了专门的编码器:

  • 文本编码器: 采用混合 CNN + BiLSTM 模型。CNN 层提取局部 N-gram 特征,随后通过最大池化和 BiLSTM 层捕捉长期依赖关系。输出用于分类“内在角色”(例如:内在批判者、保护者)。
  • 语音编码器: 利用手工设计的声学特征(MFCCs、音高、能量),通过 PCA 降维,并使用 K-最近邻 (KNN) 算法进行分类,以识别情绪状态。
  • 手势编码器: 一个 多层感知器 (MLP) 分类器,处理归一化的关键点向量以识别静态和动态手势。
  • 面部表情编码器: 一个 卷积神经网络 (CNN)(基于 Caffe SSD/ResNet-10 进行检测)用于从面部图像中进行情绪分类。

3.3 融合策略

论文评估了三种融合方法:

  1. 早期融合 (Early Fusion): 在分类前进行特征拼接。
  2. 后期融合 (Late Fusion): 每种模态进行独立预测,然后通过加权投票进行组合。
  3. 混合融合 (Hybrid Fusion): 特征级融合与决策级融合的结合。
    结果表明,后期融合是最有效的策略,因为它允许每种模态在聚合之前做出独立决策,使系统对缺失或有噪声的输入具有鲁棒性。

4. 实验结果

4.1 数据集

研究使用了多样化的数据集进行训练和评估:

  • 文本: 汇总自咨询 (Counseling)、DailyDialog、GoEmotions 和 RedditMentalHealth 等来源(360,000 个样本)。
  • 语音: 基准数据集包括 RAVDESS、TESS、CREMA-D、SAVEE 和 EMO-DB(4,800 个样本)。
  • 面部: FER-2013、AffectNet 和 CK+(35,887 个样本)。
  • 手势: 使用 MediaPipe 创建的自定义数据集 (ANAHandGestures.csv)(6,153 个样本)。

4.2 性能指标

单模态模型实现了以下准确率:

  • 语音情绪识别 (KNN): 98%(性能最高;归因于强大的声学可分性)。
  • 文本内在角色分类 (CNN+BiLSTM): 97%
  • 手势识别 (MLP): 93%
  • 面部情绪识别 (CNN): 88%(较低,由于对光照和表情重叠的敏感性)。

4.3 分析

  • 语音和文本被确定为情绪状态和内在角色的最强预测因子。
  • 面部和手势作为补充信号,提供了非语言反馈,有助于解决文本或语音中的歧义(例如:检测到隐藏在微笑背后的“保护者”所表现出的悲伤)。
  • 混淆矩阵显示出各模态的对角线占优地位,错误主要发生在相似的情绪类别之间(例如:中性与悲伤)。
  • ROC 分析确认了所有模态的高 AUC 值,表明具有很强的类别分离度。

5. 核心贡献

论文概述了以下具体贡献:

  1. 结构化多模态模型: 开发了一个专门在情感计算和 IFS 疗法框架内整合四种模态(文本、语音、面部、手势)的系统。
  2. 专门的编码器:
    • 用于内在角色分类的 CNN-BiLSTM 文本编码器。
    • 用于语音情绪识别的 PCA-KNN 系统。
    • 用于面部情绪识别的 CNN 系统。
    • 基于 MediaPipe 的轻量级手势识别模块。
  3. 多模态融合: 实现了一个结合这些模态以识别情绪状态和内在心理角色的融合系统。
  4. 部署: 一个功能性的 Web 推理服务(基于 Flask)及移动界面,处理实时多模态分析,包括阿拉伯语到英语的翻译以及基于用户心理状态的访问控制。

6. 重要性与主张

作者声称,ANA 模型超越了常见的基于聊天机器人的心理健康系统,创建了一个更丰富的、具身化的交互模型。通过利用多模态学习,该系统实现了比单模态系统更鲁棒的用户理解。

  • 多模态性的验证: 研究表明,结合多种模态可以补偿单个模态的弱点(如文本歧义或面部遮挡),有效地将系统的理解能力比单输入模式提高了一倍。
  • 治疗对齐: 系统成功地将技术 AI 输出(情绪识别)映射到心理构念(IFS 内在部分),弥合了深度学习与临床疗法模型之间的鸿沟。
  • 实际效用: 部署架构支持实时处理,并通过自适应融合策略应对现实世界的挑战,如噪声、光照变化或缺失模态。

论文总结道,虽然单个模态存在局限性(例如,面部识别准确率在光照较差时会下降),但集成的多模态方法提供了一个全面且具备上下文意识的用户内在心理状态评估,验证了所提模型在个性化心理健康支持方面的有效性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →