← أحدث الأبحاث
⚡ electrical engineering

A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations

تقترح الورقة البحثية إطار عمل MiSTER-E، وهو إطار عمل معياري يعتمد على "خليط من الخبراء" (Mixture-of-Experts) يعمل على فصل نمذجة السياق الخاصة بكل نمط عن دمج الأنماط المتعددة باستخدام نماذج لغوية كبيرة (LLMs) مضبوطة بدقة لكل من الكلام والنص، محققاً أداءً هو الأفضل في فئته على ثلاثة مجموعات بيانات مرجعية للتعرف على العواطف دون الاعتماد على هوية المتحدث.

المؤلفون الأصليون: Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

نُشر 2026-02-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول فهم الحالة المزاجية لمجموعة من الأصدقاء يخوضون محادثة عاطفية حادة. لديك طريقتان رئيسيتان لجمع المعلومات: ما يقولونه (النص) وكيف يقولونه (نبرة صوتهم).

أحياناً، تكون الكلمات ساخرة، لكن النبرة غاضبة. وأحياناً أخرى، تكون الكلمات سعيدة، لكن الصوت يبدو حزيناً. على الكمبيوتر الذي يحاول تخمين العاطفة أن يوازن بين كلا القرينتين في وقت واحد، مع تذكر ما قيل قبل خمس دقائق من المحادثة.

تقدم هذه الورقة نظام ذكاء اصطناعي جديد يسمى MiSTER-E (مزيج من خبراء الكلام والنص للتعرف على العواطف) والذي يحل هذه المشكلة من خلال العمل كـ فريق إدارة عالي التنظيم بدلاً من مجرد محقق واحد مثقل بالأعباء.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: "السكين السويسري" مقابل "الفريق المتخصص"

معظم نماذج الذكاء الاصطناعي القديمة للتعرف على العواطف تشبه السكين السويسري. فهي تحاول فعل كل شيء بشفرة واحدة: تنظر إلى الكلمات، وتستمع إلى الصوت، وتتذكر الماضي، وتخمن العاطفة، كل ذلك في آن واحد. المشكلة هي أنه عندما تكون البيانات فوضوية أو شحيحة، فإن هذا النهج "الذي يناسب الجميع" يصاب بالارتباك؛ فهو يحاول تعلم أشياء كثة جداً في وقت واحد وغالباً ما ينتهي به الأمر بتعلم الأنماط الخاطئة.

يغير MiSTER-E الاستراتيجية. فبدلاً من سكين واحدة، فإنه يوظف فريقاً من ثلاثة خبراء متخصصين:

  • خبير الصوت: يستمع فقط إلى نبرة الصوت، ويتجاهل الكلمات تماماً.
  • خبير النص: يقرأ الكلمات فقط، ويتجاهل النبرة تماماً.
  • خبير الدمج: يستمع إلى كليهما ويحاول رؤية كيف يعملان معاً.

2. "المدير" (آلية البوابة)

وجود ثلاثة خبراء أمر رائع، ولكن من يقرر أي خبير يجب الاستماع إليه؟ هنا يأتي دور المدير (المسمى آلية البوابة).

تخيل محادثة يقول فيها شخص ما: "هذا رائع"، لكنه يصرخ بها بغضب.

  • خبير النص يرى كلمة "رائع" ويعتقد: "هذا شعور سعيد!"
  • خبير الصوت يسمع الصراخ ويعتقد: "هذا غضب!"
  • خبير الدمج يرى هذا التضارب ويحاول فهم الأمر.

ينظر المدير إلى الموقف. ويدرك أن الصوت يصرخ، فيقول: "حسناً، سأثق في خبير الصوت بنسبة 80% وفي خبير الدمج بنسبة 20%، وسأتجاهل خبير النص في هذه اللحظة تحديداً".

هذا هو سحر مزيج الخبراء (Mixture-of-Experts). النظام لا يكتفي بمتوسط الإجابات فحسب؛ بل يقرر ديناميكياً، جملة بجملة، أي خبير هو الأكثر موثوقية. إذا كان الميكروفون معطلاً والصوت مشوشاً، يعتمد المدير تلقائياً وبقوة على خبير النص. وإذا كان النص غامضاً، فإنه يعتمد على خبير الصوت.

3. "السياق" (تذكر القصة)

العواطف لا تحدث في فراغ. إذا قال شخص ما "أنا بخير" بعد جدال طويل، فإن ذلك يعني شيئاً مختلفاً عما إذا قالها بعد تلقي إطراء.

يمنح MiSTER-E خبرائه بنك ذاكرة. قبل أن يقدموا تخميناً، يقومون بتمرير المحادثة عبر "شبكة إضافة السياق". فكر في هذا كـ غرفة بروفات حيث يراجع الخباء الحوارات السابقة لفهم تدفق القصة. هذا يضمن عدم خداعهم بجملة واحدة خارج سياقها.

4. "معسكر التدريب" (كيف يتعلمون الاتفاق)

للتأكد من أن هؤلاء الخبراء لن يتمردوا أو يقدموا إجابات مختلفة تماماً، يستخدم النظام تقنية تدريب خاصة تسمى الخسارة التباينية (Contrastive Loss).

تخيل أن الخبراء الثلاثة هم طلاب في فصل دراسي. يظهر لهم المعلم (مدرب الذكاء الاصطناعي) صورة لوجه حزين.

  • طالب الصوت يرسم وجهاً حزيناً.
  • طالب النص يرسم وجهاً حزيناً.
  • طالب الدمج يرسم وجهاً حزيناً.

يستخدم المعلم قاعدة خاصة: "إذا رسمتم جميعاً نفس الشيء، فستحصلون على مكافأة. وإذا رسمتم أشياء مختلفة، فعليكم الدراسة بجد أكبر". هذا يجبر الخبراء على مواءمة فهمهم للعواطف، رغم أنهم ينظرون إلى أدلة مختلفة.

5. النتائج: لماذا هذا أفضل؟

اختبر المؤلفون MiSTER-E على ثلاث مجموعات بيانات شهيرة (مجموعات من المحادثات المسجلة من الأفلام والمسلسلات).

  • IEMOCAP: دقة 70.9%.
  • MELD: دقة 69.5%.
  • CMU-MOSI: دقة 87.9%.

لقد تفوق على كل الأنظمة التي تم اختبارها سابقاً تقريباً. والأهم من ذلك، أنه فعل ذلك دون معرفة هوية المتحدثين. لم يغش عبر حفظ معلومة مثل "جون دائماً غاضب"، بل تعلم فهم العاطفة نفسها، مما جعله أكثر ذكاءً وقدرة على التعميم.

التشبيه الشامل

فكر في الذكاء الاصطناعي التقليدي كـ عازف منفرد يحاول عزف سيمفونية معقدة بمفرده؛ قد يخطئ في نوتة أو يشعر بالإرهاق.

أما MiSTER-E فهو ثلاثي جاز مع قائد أوركسترا.

  • البيانو (خبير النص) يعرف اللحن.
  • الطبول (خبير الصوت) تعرف الإيقاع والشدة.
  • الباص (خبير الدمج) يعرف كيف يتناسبان معاً.
  • القائد (المدير) يستمع إلى الغرفة ويقرر: "الآن، دع الطبول تقود لأن الإيقاع هو ما يقود العاطفة".

من خلال السماح للخبير المناسب بالتألق في الوقت المناسب، يفهم MiSTER-E العاطفة البشرية بشكل طبيعي وأكثر دقة من أي وقت مضى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →