← أحدث الأبحاث
💻 computer science

Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model

تقدم هذه الورقة نظاماً للتعرف على الانفعالات في الكلام يجمع بين استخراج ميزات معاملات السيبسترال لتردد ميل (MFCC) ونموذج التعلم العميق للذاكرة الطويلة قصيرة المدى (LSTM)، محققاً دقة بنسبة 99% على مجموعة بيانات TESS ومتفوقاً على خط الأساس الكلاسيكي لآلات ناقلات الدعم (SVM).

المؤلفون الأصليون: Adelekun Oluwademilade, Ademola Adedamola, Abiola Abdulhakeem, Akinpelu Azeezat, Eraiyetan Israel, Omotosho Oluwadunsin, Ibenye Ikechukwu, Ayuba Muhammad, Olusanya Olamide, Kamorudeen Amuda

نُشر 2026-04-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Adelekun Oluwademilade, Ademola Adedamola, Abiola Abdulhakeem, Akinpelu Azeezat, Eraiyetan Israel, Omotosho Oluwadunsin, Ibenye Ikechukwu, Ayuba Muhammad, Olusanya Olamide, Kamorudeen Amuda

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تخمين شعور صديق لك بمجرد الاستماع إلى صوته. لست بحاجة لسماع الكلمات التي يقولها؛ بل تحتاج فقط لسماع النبرة، والإيقاع، والطاقة. إذا بدا صوته مهتزاً، فقد يكون خائفاً. وإذا بدا حاداً وعالياً، فقد يكون غاضباً.

هذه الورقة البحثية تدور حول تعليم الكمبيوتر القيام بذلك بالضبط. فقد بنى الباحثون نظاماً يمكنه الاستماع إلى صوت الشخص ومعرفة ما إذا كان سعيداً، أو حزيناً، أو غاضباً، أو محايداً، دون الحاجة لفهم اللغة نفسها.

إليك كيف فعلوا ذلك، مشروحاً ببساطة:

1. المكونات: "بصمة الصوت" (MFCC)

أولاً، يحتاج الكمبيوتر لتحويل الموجات الصوتية إلى شيء يمكنه قراءته. استخدم الباحثون أداة تسمى MFCC (معاملات ملامح التردد الميل - Mel-Frequency Cepstral Coefficients).

فكر في الـ MFCC كأنها بصمة صوت. تماماً كما أن لبصمة إصبعك نتوءات وأنماط فريدة تحدد هويتك، تقوم الـ MFCCs بتفكيك الصوت إلى مجموعة محددة من الأرقام التي تصف طبقة الصوت، ونبرته، وملمسه. ينظر الكمبيوتر إلى هذه الأرقام ليفهم "شكل" الصوت.

2. المعلم: "الطالب الذي يسافر عبر الزمن" (LSTM)

السحر الحقيقي يحدث مع نوع "العقل الكمبيوتري" الذي استخدموه، وهو ما يسمى LSTM (الذاكرة الطويلة قصيرة المدى - Long Short-Term Memory).

تخيل طالباً يؤدي اختباراً.

  • الكمبيوترات القديمة تشبه الطلاب الذين ينظرون فقط إلى الجملة الأخيرة من القصة لتخمين نهايتها. إنهم يفتقدون للسياق.
  • الـ LSTM يشبه الطالب الذي يتذكر القصة بأكملها. هو يعلم أنه إذا بدأ الصوت هادئاً ثم أصبح فجأة عالياً وسريعاً، فإن هذا التغير بمرور الوقت هو علامة على الغضب. وإذا بدأ الصوت مرتفعاً ثم انخفض، فقد يكون ذلك دليلاً على الحزن.

الـ LSTM مميز لأنه يستطيع تذكر ما حدث قبل بضع ثوانٍ أثناء الاستماع لما يحدث الآن. وهذا أمر بالغ الأهمية لأن المشاعر ليست مجرد لقطة ثابتة؛ بل هي رحلة تتكشف بمرور الوقت.

3. ساحة التدريب: "فصل التمثيل" (مجموعة بيانات TESS)

لتعليم هذا الكمبيوتر، استخدم الباحثون مجموعة بيانات تسمى TESS (مجموعة تورنتو للكلام العاطفي).

  • الممثلون: استخدموا تسجيلات لممثلتين محترفتين.
  • النص: قرأت الممثلتان نفس قائمة الكلمات (مثل "take up") ولكن بصيغ سبع "أزياء" عاطفية مختلفة: الغضب، والاشمئزاز، والخوف، والسعادة، والمفاجأة السارة، والحزن، والحياد.
  • الهدف: كان على الكمبيوتر الاستماع إلى هذه التسجيلات وتعلم كيفية تمييز "الزي" الذي يرتديه الصوت.

4. التدريب: تعلم الأنماط

قام الباحثون بتغذية الكمبيوتر بآلاف من هذه المقاطع الصوتية.

  1. التحضير: قاموا بتقطيع الصوت إلى قطع مرتبة مدة كل منها 3 ثوانٍ وتحويلها إلى "بصمات الصوت" تلك (MFCCs).
  2. الدرس: نظر الكمبيوتر إلى تسلسل بصمات الأصابع. وتعلم: "أوه، عندما ترتفع الأرقام وتنخفض بسرعة بهذا النمط، فهذا يعني عادةً 'سعادة'".
  3. الاختبار: اختبروا الكمبيوتر على مقاطع صوتية لم يسبق له رؤيتها من قبل.

5. النتائج: درجة تقترب من المثالية

كانت النتائج مبهرة:

  • الطريقة القديمة: جربوا أولاً طريقة أبسط وأقدم (تسمى SVM) تعتمد فقط على متوسط بصمات الأصابع، متجاهلة التوقيت. حققت نسبة 98% صحيحة! وهذا جيد جداً بالفعل.
  • الطريقة الجديدة: نظام الـ LSTM الجديد، الذي تذكر التوقيت والتدفق في الصوت، حقق نسبة 99% صحيحة.

تظهر الورقة البحثية أنه من خلال الانتباه إلى كيفية تغير الصوت بمرور الوقت (مثل اللحن)، استطاع الكمبيوتر تخمين العاطفة بدقة أفضل قليلاً من مجرد النظر إلى لقطة ثابتة للصوت.

6. ماذا يعني هذا (وما لا يعنيه)

تخلص الورقة البحثية إلى أن هذا الإعداد المحدد يعمل بشكل جيد جداً مع بيانات "فصل التمثيل" التي استخدموها.

  • أين يمكن استخدامه (وفقاً للورقة): يقترح المؤلفون أن هذا يمكن أن يساعد في بناء مساعدين افتراضيين أفضل (مثل سيري أو أليكسا اللذين يعرفان متى تشعر بالإحباط) وأدوات مراقبة الصحة النفسية (لاكتشاف الضيق في الصوت).
  • العائق: تعترف الورقة بأن هذا تم في بيئة محكومة بتسجيلات نظيفة وممثلين محترفين. في العالم الحقيقي، مع وجود ضوضاء خلفية، أو لهجات مختلفة، أو أشخاص يتحدثون بعفوية، قد لا يكون النظام مثاليًا تمامًا بعد.

باخت مختصر: علم الباحثون الكمبيوتر الاستماع إلى "موسيقى" الصوت، وليس فقط الكلمات. ومن خلال استخدام نظام ذاكرة ذكي يتتبع التغييرات بمرور الوقت، بنوا أداة يمكنها تخمين المشاعر البشرية بدقة تصل إلى 99% على بيانات الاختبار الخاصة بهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →