← أحدث الأبحاث
🤖 AI

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

تقترح هذه الورقة إطار عمل لنموذج لغوي كبير متعدد الوسائط يعتمد على المقاطع، يستفيد من نموذج Qwen3-Omni-30B-A3B الذي تم ضبطه بدقة للتعرف بفعالية على حالات التردد والازدواجية الدقيقة في مقاطع الفيديو من خلال تحليل التناقضات عبر الوسائط، محققاً دقة تبلغ 85.1% وهي الأفضل في فئتها على مجموعة بيانات BAH.

المؤلفون الأصليون: Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

نُشر 2026-03-17
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول معرفة ما إذا كان صديقك متحمس حقًا لعرض عمل جديد، أم أنه في الحقيقة مشتت (يعاني من صراع داخلي) أو غير متأكد (متردد).

إذا نظرت إلى وجهه فقط، فقد تراه يبتسم. وإذا استمعت إلى صوته فقط، فقد يبدو واثقًا. ولكن إذا نظرت إلى كليهما معًا، فقد تلاحظ فجوة صغيرة: ابتسامة لا تصل إلى العينين، أو صوت يبدو مثاليًا للغاية، كأنه مجرد نص محفوظ. هذا التناقض الصغير هو "التردد أو عدم اليقين" (A/H) الذي يحاول هذا البحث رصده.

إليك كيف حل الباحثون في "لينوفو" (Lenovo) هذه المشكلة المعقدة، مشروحة ببساطة:

١. المشكلة: ضجيج كثير ووقت قليل جداً

إن اكتشاف هذه المشاعر الدقيقة في الفيديو أمر صعب على أجهزة الكمبيوتر.

  • مشكلة "الفيديو الطويل": تخيل أنك تحاول قراءة رواية كاملة لتجد جملة واحدة محددة؛ سيكون الأمر مرهقًا وبطيئًا. وبالمثل، فإن تغذية ذكاء اصطناعي فائق الذكاء بفيديو مدته ١٠ دقائق هو قدر هائل من البيانات؛ سيصاب الذكاء الاصطناعي بالارتباك، وتنفد "ذاكرته" (الرموز/Tokens)، وسيفقد التفاصيل الصغيرة.
  • مشكلة "الإشارة الخفية": هذه المشاعر المتمثلة في كون الشخص مترددًا عادة ما تحدث في نوبات قصيرة جدًا—حوالي ٤ أو ٥ ثاتٍ. أما بقية الفيديو فقد يكون مجرد شخص يجلس هناك أو يتحدث عن حالة الطقس.

٢. الحل: استراتيجية "قاطع المقاطع" (Clip Cutter)

بدلاً من عرض الفيلم بأكمله على الذكاء الاصطناعي، ابتكر الباحثون "قاطع مقاطع".

  • الاستعارة: تخيل الفيديو كرغيف خبز طويل؛ بدلاً من محاولة تذوق الرغيف بأكمله دفعة واحدة، قاموا بتقطيعه إلى قطع صغيرة مدة كل منها ٥ ثوانٍ.
  • الفلتر الذكي: لم يقطعوا المقاطع بشكل عشوائي، بل نظروا إلى "النص" (التوضيحات) للعثور على اللحظات الدقيقة التي أظهر فيها الشخص تردده. لقد استقطعوا تلك الشرائح المحددة ذات الـ ٥ ثوانٍ واستبعدوا الأجزاء المملة. هذا جعل الذكاء الاصطమైన يركز فقط على اللحظات "المثيرة" حيث يحدث الشعور.

٣. العقل المدبر: Qwen3-Omni (المحقق الخارق)

لتحليل هذه الشرائح، استخدموا ذكاءً اصطناعيًا قويًا جدًا يسمى Qwen3-Omni.

  • ماذا يفعل: هذا الذكاء الاصطناعي يشبه المحقق الخارق الذي يمكنه مشاهدة الفيديو والاستماع إلى الصوت في نفس الوقت. فهو لا يكتفي بالنظر إلى الابتسامة فحسب، بل يتحقق مما إذا كانت الابتسامة تتوافق مع نبرة الصوت.
  • التدريب: قاموا بتدريب هذا المحقق باستخدام تقنية خاصة تسمى LoRA (وهي تشبه إعطاء المحقق مجموعة محددة من الكتيبات التدريبية دون إعادة كتابة دماغه بالكامل) والضبط الدقيق الكامل (Full Fine-Tuning) (أي إعادة كتابة الدماغ بالكامل). لقد علموه الإجابة على سؤال بسيط: "هل هذا الشخص مشتت أو غير متأكد؟" بـ "نعم" أو "لا".

٤. العمل الجماعي: "مجلس القضاة"

قد يرتكب محقق واحد خطأً، لذا لم يكتفِ الباحثون باستخدام ذكاء اصطناعي واحد.

  • الاستعارة: تخيل قاعة محكمة بها ثلاثة قضاة مختلفين؛ كل قاضٍ ينظر إلى نفس الأدلة (مقاطع الفيديو) ولكن تم تدريبه بشكل مختلف قليلاً.
  • الحكم: إذا قال أي من القضاة: "أرى ترددًا هنا"، يتم تحديد الفيديو بالكامل على أنه "متردد". بعد ذلك، يأخذون التصويت النهائي؛ فإذا وافقت أغلبية القضاة، يكون ذلك هو الجواب النهائي. هذا يجعل النظام صعب الاختراق أو الخداع.

النتيجة

من خلال تقطيع الفيديوهات إلى قطع صغيرة ومركزة، واستخدام فريق من خبراء الذكاء الاصطناعي الخارقين للبحث عن التناقضات بين ما يقوله الناس وكيف يتصرفون، حقق النظام دقة بلغت ٨٥.١٪.

باخت-صار: لقد توقفوا عن محاولة قراءة الكتاب بأكمله وركزوا بدلاً من ذلك على أكثر المشاهد درامية لمدة ٥ ثوانٍ، مستخدمين فريقًا من خبراء الذكاء الاصطناعي لرصد الشقوق الصغيرة في ثقة الشخص. يساعد هذا أنظمة الصحة الرقمية على فهم متى يعاني الأشخاص حقًا لاتخاذ قرار ما، لتقديم المساعدة المناسبة في الوقت المناسب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →