Lightweight Prompt-Based Enhancement for Missing-Modality Multimodal Sentiment Analysis
تقترح هذه الورقة إطار عمل خفيف الوزن يعتمد على التلقين، يتكون من ثلاث وحدات تآزرية — تعزيز الميزات الأصيلة، والدمج المدرك للموثوقية، ومهايئ التوزيع الموجه بالمحتوى — لمعالجة فقدان الأنماط في تحليل المشاعر متعدد الوسائط بفعالية من خلال استعادة الميزات دقيقة التفاصيل، وتعديل أوزان الدمج ديناميكيًا، وتصحيح انزياحات التوزيع.
المؤلفون الأصليون:Juan Liu, Jinping Liu, Hang Zhong, Shikang He
إن العاطفة البشرية نادراً ما تكون نوتة واحدة؛ بل هي وتر معقد تعزفه الكلمات، ونبرة الصوت، وحركة الوجه. وعلى الحواسيب التي تحاول فهم هذه المشاعر أن تستمع إلى هذه الآلات الثلاث في آن واحد. هذا المجال، المعروف باسم تحليل المشاعر متعدد الوسائط، حقق خطوات كبيرة في تعليم الآلات كيفية قراءة أمزجتنا من خلال الجمع بين النص والصوت والفيديو. ومع ذلك، في الواقع الفوضوي للعالم الحقيقي، غالباً ما يصمت أحد هذه الآلات؛ فقد تتعطل الكاميرا، أو ينقطع الميكروفون، أو تمنع إعدادات الخصوصية بث الفيديو. وعندما تُجبر الحواسيب على تخمين مزاج الشخص باستخدام جزء فقط من البيانات، فإن فهمها غالباً ما ينهار، وتفقد الإشارات الدقيقة التي تحدد كيف نشعر حقاً.
لسنوات، حاول الباحثون إصلاح ذلك عبر تعليم الحواسيب كيفية تخيل القطعة المفقودة. إنهم يستخدمون تقنية تسمى "تعلم التلقين" (prompt learning)، حيث يتم إعطاء الآلة تلميحاً أو "تلقيناً" لإعادة بناء الصوت أو الفيديو المفقود بناءً على ما لا يزال متاحاً. وبينما يعد هذا النهج فعالاً، إلا أنه يحمل عيباً خفياً؛ فعملية تخمين المعلومات المفقودة تميل إلى تنعيم الحواف الحادة للتعبير البشري. تماماً كما تفقد النسخة الضوئية منخفضة الجودة الحبيبات الدقيقة للصورة الفوتوغرافية، فإن هذه الإشارات المعاد بناؤها تفقد التفاصيل الدقيقة عالية التردد — مثل الومضة السريعة لتعبيرات الوجه الدقيقة أو الشرخ المفاجئ في الصوت — والتي غالباً ما تكون أهم الأدلة لتحديد العاطفة. علاوة على ذلك، تتعامل الأساليب الحالية مع هذه الإشارات المخمنة بنفس القدر من الثقة التي تعامل بها الإشارات الحقيقية، فتعجز عن إدراك أن إعادة البناء هي بطبيعتها أقل موثوقية من التسجيل المباشر. وأخيراً، ولأن هذه الأنظمة تعتمد على "دماغ" مدرب مسبقاً ومجمد لا يمكنه تعلم أشياء جديدة أثناء العمل، فإن البيانات المعاد بناؤها غالسب ما تبدو "خارج النغمة" بالنسبة لبقية النظام، مما يجعل الآلة تتعثر عندما تحاول دمجها.
اقترح فريق من الباحثين من كلية تشانغشا للعمل الاجتماعي وجامعة هونان حلاً جديداً وخفيف الوزن لهذه المشكلات الثلاث. لم يحاولوا إعادة بناء الآلة بأكملها من الصفر، بل أضافوا ثلاث أدوات صغيرة متخصصة إلى النظام الحالي، صُممت لتعمل معاً مثل محرر ماهر يقوم بتنقيح مسودة أولية. تركز الأداة الأولى على البيانات الحقيقية التي لا تزال متاحة؛ فهي تأخذ السمات الناعمة والباهتة قليلاً للصوت أو الفيديو الأصلي وتقوم بحقن التفاصيل المفقودة عالية التردد فيها مجدداً، مما يؤدي فعلياً إلى شحذ الصورة وتوضيح الصوت. أما الأداة الثانية، فتعمل كحارس بوابة لعملية الدمج؛ فهي تتحقق باستمرار من الإشارات الحقيقية وتلك المخمنة، وترفع مستوى صوت البيانات الموثوقة تلقائياً بينما تخفض ضجيج الأجزاء المعاد بناؤها. أما الأداة الثالثة، فهي مترجم يضمن ملاءمة البيانات المخمنة للبيانات الحقيقية؛ إذ تستخدم محتوى الإشارات المتاحة لتدفع الميزات المعاد بناؤها برفق نحو الشكل الصحيح، بحيث تندمج بسلاسة مع بقية المعلومات قبل أن يتخذ الكمبيوتر قراره النهائي.
اختبر الباحثون هذا النظام المكون من ثلاثة أجزاء على مجموعة بيانات قياسية من مقاطع الفيديو التي تحتوي على آلاف التفاعلات البشرية. لقد قاموا بمحاكاة سيناريو يفقد فيه الكمبيوتر 70 بالمائة من البيانات، مما يجبره على الاعتماد بشكل كبير على قدرته على ملء الفراغات. وأظهرت النتائج أن الأدوات الثلاث تعمل بشكل أفضل عند استخدامها معاً، بطريقة تتجاوز مجرد كونها مجموع أجزائها. فعندما كانت الأدوات الثلاث نشطة، تحسنت قدرة النظام على تحديد المشاعر الإيجابية أو السلبية بشكل ملحوظ، لتصل دقتها إلى حوالي 70.6 بالمائة، وهي قفزة ملحوظة عن الخط المرجعي. ومن المثير للاهتمام أن الباحثين وجدوا أن استخدام أول أداتين معاً أدى في الواقع إلى أداء أسوأ من استخدام الأداة الأولى وحدها؛ مما يشير إلى أنه بدون الأداة الثالثة لإصلاح عدم التطابق بين البيانات الحقيقية والمخمنة، يصبح النظام مشوشاً بسبب الإشارات المتضاربة. وفقط عند إضافة مهايئ التوزيع لتوحيد البيانات، انطلق الإمكان الكامل للنظام.
كما استكشفت الدراسة كيف يتصرف النظام عند فقدان أنواع معينة من البيانات، مثل توفر النص فقط أو فقدان الفيديو فقط. وفي هذه السيناريوهات الثابتة، أثبت النظام الكامل مرة أخرى أنه الأكثر قوة بشكل عام، رغم أن الباحثين أشاروا إلى أن الفوائد المحددة لكل أداة تعتمد على نوع البيانات المفقودة بالضبط. فعلى سبيل المثال، كانت إحدى الأدوات جيدة بشكل خاص في تحسين قدرة النظام على الارتباط بالتقييمات البشرية عندما يكون الفيديو مفقوداً، بينما تفوق المزيج الكامل في الدقة العامة. ولم تضف التحسينات بأكملها سوى جزء ضئيل جداً من المعلمات الجديدة إلى النظام — حوالي 1 بالمائة من حجم النموذج الرئيسي — مما يثبت أن التحسينات الكبيرة في فهم العاطفة البشرية لا تتطلب عمليات تغيير ضخمة ومستهلكة للطاقة.
يشير هذا العمل إلى أن المسار نحو ذكاء عاطفي أكثر قوة في الآلات لا يكمن في توليد نسخ مثالية من البيانات المفقودة، بل في إدارة العلاقة بعناية بين ما هو معلوم وما هو مخمن. فمن خلال شحذ الإشارات الحقيقية، والثقة بها أكثر من التخمينات، وضمان ملاءمة التخمينات للسياق، خلق الباحثون نظاماً يتعامل مع المعلومات المفقودة بمستوى جديد من الرزانة. ورغم أن الدراسة كانت محدودة بمجموعات بيانات باللغة الإنجليزية وأنماط فقدان محددة، إلا أن النتائج تقدم مخططاً واضحاً لبناء آلات يمكنها فهمنا حتى عندما يكون الاتصال غير مكتمل. قد يعتمد مستقبل هذه التكنولوجيا على مثل هذه التعديلات الذكية والخفيفة التي تسمح للحواسيب بالتنقل عبر الفجوات في حياتنا الرقمية دون أن تفقد جوهر إنسانيتنا.
إليك ملخص تقني مفصل للورقة البحثية بعنوان "التعزيز القائم على التلقين خفيف الوزن لتحسين تحليل المشاعر متعدد الوسائط عند فقدان الأنماط".
بيان المشكلة
يعمل تحليل المشاعر متعدد الوسائط (MSA) على دمج الإشارات النصية، والصوتية، والبصرية، ولكنه غالبًا ما يعاني من تدهور الأداء في سيناريوهات العالم الحقيقي بسبب فشل المستشعرات، أو قيود الخصوصية، أو حدود عرض النطاق الترددي التي تؤدي إلى فقدان الأنماط (modality missing). وبينما تقدم الطرق الحديثة القائمة على تعلم التلقين (مثل MPLMM) حلولاً فعالة من حيث المعلمات لإعادة بناء الأنماط المفقودة، حدد المؤلفون ثلاث قيود أساسية في النهج الحالية:
تنعيم الميزات بشكل مفرط (Over-smoothing of Features): تعمل آليات الانتباه عبر الوسائط (cross-modal attention) كمرشحات تمرير منخفض (low-pass filters)، مما يؤدي إلى إضعاف الإشارات عالية التردد (مثل النبرة الصوتية، وتعبيرات الوجه الدقيقة) الضرورية لتمييز العواطف. يؤثر هذا على كل من الميزات المولدة والأصيلة التي تمر عبر طبقات الانتباه المجمدة.
الدمج غير المدرك للموثوقية (Reliability-Blind Fusion): غالبًا ما تطبق الاستراتيجيات الحالية دمجًا متساوي الوزن للأنماط الأصيلة والمولدة. يتجاهل هذا الفجوة الجوهرية في الموثوقية، حيث يؤدي دمج الميزات المولدة منخفضة الجودة مع الميزات الأصيلة عالية الدقة إلى تخفيف نسبة الإشارة إلى الضوضاء (SNR).
انزياح التوزيع في الهياكل الأساسية المجمدة (Distribution Shift in Frozen Backbones): لا تستطيع الأساليب التي تبقي هيكل الـ Transformer مجمدًا للحفاظ على المحاذاة المسبقة استيعاب انزياحات التوزيع بين مخرجات التلقين التوليدي والميزات الأصيلة. وقد ثبت أن الضبط الدقيق البسيط للهيكل الأساسي يؤدي إلى تعطيل المحاذاة المسبقة، مما يؤدي إلى انخفاض الأداء.
المنهجية: AFEP-RAF-GDA
يقترح المؤلفون إطار عمل تعزيز خفيف الوزن مبني فوق خط الأساس MPLMM، ويتكون من ثلاثة وحدات تآزرية تعمل على هيكل أساسي مجمد. يبلغ إجمالي الإضافات حوالي 52.6 ألف معلمة قابلة للتدريب (~1.05% من الهيكل الأساسي).
1. مسار تعزيز الميزات الأصيلة (AFEP)
الهدف: استعادة التفاصيل الدقيقة وعالية التردد المفقودة في الميزات الأصيلة بسبب التنعيم المفرط.
الآلية:
تعزيز حقن التفاصيل (DIE): يستخدم شبكة عصبية متعددة الطبقات (MLP) ذات عنق الزجاجة لاستخراج معلومات التفاصيل المتبقية من الميزات المفرطة في التنعيم.
آلية بوابات التفاصيل (DGM): يستخدم بوابة سيجمويد (sigmoid gate) للتحكم التكيفي في كمية حقن التفاصيل المحسنة، مع تهيئة محافظة لضمان استقرار التدريب.
كبح النمط المولد (GMS): يضمن تطبيق التعزيز فقط على الأنماط الأصيلة (حيث مؤشر الموثوقية rm=1)، وترك الميزات الزائفة للأنماط المفقودة دون تغيير.
2. الدمج المدرك للموثوقية (RAF)
الهدف: ضبط أوزان الدمج ديناميكيًا بناءً على موثوقية النمط لتضخيم الإشارات الأصيلة وكبح الضوضاء المولدة.
الآلية:
يستخدم إشارات الموثوقية الثنائية (rm∈{0,1}) للأنماط الأخرى كمدخلات.
يقوم بتعديل الميزات عبر تحويلات تآلفية على مستوى القنوات (hm′′=(1+γm)⊙hm′+βm) قبل الدمج، مما يتجنب الحاجة إلى تطبيع الوزن الصريح.
3. مهايئ التوزيع الموجه بالمحتوى (GDA)
الهدف: تصحيح انزياحات التوزيع في الميزات المولدة قبل دخولها إلى طبقات الانتباه عبر الوسائط المجمدة، دون تعطيل المعرفة المسبقة.
الآلية:
بناء إشارة التوجيه: يبني إشارة عن طريق تجميع متوسط الميزات المسقطة للأنماط المتاحة (الأصيلة) ودمجها مع مؤشرات الموثوقية الخاصة بها.
التصحيح الشرطي باستخدام FiLM: يستخدم شبكة FiLM لتوليد معاملات القياس (λ) والإزاحة (δ) بناءً على المحتوى الدلالي المستمر للأنماط الأصيلة (على عكس إشارات RAF الثنائية). يعمل هذا على تصحيح ضغط التباين وانزياحات المتوسط.
بوابة الوعي بالنمط المفقود: يضمن تطبيق التصحيح فقط على الأنماط المفقودة.
التهيئة: يستخدم التهيئة الصفرية لأوزان الطبقة الأخيرة لضمان رسم الخرائط المتطابقة (identity mapping) في بداية التدريب، مما يحافظ على المحاذاة المسبقة.
المساهمات الرئيسية
التحليل المنهجي للمشكلة: تحدد الورقة وتعالج قضايا التنعيم المفرط، وعدم إدراك الموثوقية، وانزياح التوزيع من منظور معالجة الإشارات، ونظرية المعلومات، وتكيف التوزيع.
وحدات مبتكرة:
AFEP: تستعيد التفاصيل عالية التردد من الميزات الأصيلة عبر التعلم المتبقي.
RAF: يحقق دمجًا مدركًا للموثوقية باستخدام شرط FiLM على موثوقية مصدر النمط.
GDA: يصحح انزياحات التوزيع في الميزات المولدة باستخدام توجيه المحتوى الأصيل، مما يحافظ على المعرفة المسبقة للهيكل الأساسي المجمد.
التفاعل التآزري: يوضح المؤلفون أن الوحدات الثلاث متكاملة وليست مجرد إضافات مستقلة. على سبيل المثال، فإن الجمع بين AFEP و RAF (B0) يسجل أداءً أقل من تكوين AFPF وحده تحت ظروف الفقد العشوائي بسبب التداخل، وهو ما لا يتم حله إلا بإضافة GDA لتصحيح عدم تطابق التوزيع.
بروتوكولات تقييم تكميلية: تدرس الدراسة النموذج تحت بروتوكولين: فقد عشوائي بنسبة 70% وفقد ثابت (بأسلوب TMDC)، مما يكشف أن فعالية الوحدة تعتمد على كل من مقياس التقييم ونمط النمط المفقود.
النتائج التجريبية
أُجريت التجارب على مجموعة بيانات CMU-MOSI باستخدام ثلاث بذور عشوائية (666، 777، 888).
بروتوكول الفقد العشوائي (معدل سقوط 70%):
حقق النموذج الكامل (AFEP-RAF-GDA، ويُرمز له بـ B) أفضل أداء عبر جميع المقاييس الأربعة الرئيسية (MAE, Corr, F1, Acc-2) ضمن تكوينات التهيئة E0.
التحسينات: ارتفع Acc-2 إلى 0.706 (من 0.684 للأساس) و F1 إلى 0.705 (من 0.683).
دراسة الاستئصال (Ablation): سجل الجمع الثنائي AFEP+RAF (B0) أداءً أقل من تكوين AFEP وحده، مما يؤكد ضرورة وجود GDA لحل التداخل غير الإضافي.
بروتوكول الفقد الثابت:
حقق النموذج الكامل B أعلى متوسط Acc-2 (0.668) و F1 بين تكوينات التهيئة E0.
GDA بمفرده (E3): من المثير للاهتمام أن GDA وحده حقق أفضل متوسط MAE (1.218) و Corr (0.411)، مما يشير إلى قوته المحددة في معايرة الانحدار تحت الأنماط الثابتة.
المقارنة: تفوق النموذج الكامل على خط الأساس TMDC المعاد إنتاجه في 5 من أصل 6 سيناريوهات فقد، رغم استخدامه لبروتوكول تدريب أحادي المرحلة مقابل تدريب TMDC ثنائي المرحلة.
الكفاءة: يضيف المنهج حوالي 52.6 ألف معلمة قابلة للتدريب فقط فوق خط أساس يحتوي على حوالي 5.0 مليون معلمة مجمدة، مما يمثل زيادة بنسبة ~1.05% في إجمالي معلمات النموذج.
الأهمية والادعاءات
تدعي الورقة أن الإطار المقترح يقدم بديلًا خفيف الوزن ومركزيًا للضبط الدقيق الكامل للهيكل الأساسي للتعامل مع الأنماط المفقودة. تكمن الأهمية في التصميم التآزري:
تعالج الوحدات أوضاع الفشل المختلفة (جودة الميزات، موثوقية الدمج، ومحاذاة التوزيع)، والتي عند دمجها، تحل مشكلات التداخل الموجودة في التجميعات الجزئية.
فعالية الوحدات تعتمد على المقياس والنمط: بينما يعد النموذج الكامل هو الأمثل لسيناريوهات الفقد العشوائي، فإن تكوينات محددة (مثل GDA وحده) تتفوق في مهام انحدار معينة ذات فقد ثابت.
يحافظ النهج على معرفة المحاذاة المسبقة مع التكيف مع انزياحات التوزيع، متجنبًا انخفاض الأداء المرتبط بالضبط الدقيق البسيط.
القيود التي أقر بها المؤلفون:
إشارة الموثوقية حاليًا ثنائية؛ والوزن المستمر الواعي بالجودة هو اتجاه مستقبلي.
التقييم محدود بمجموعة بيانات CMU-MOSI؛ والتعميم عبر مجموعات البيانات واللغات (مثل CMU-MOSEI) غير مدعوم تجريبيًا.
معدل الفقد 70% ثابت؛ ولم يتم التطرق للقدرة على التكيف مع نسب الفقد الديناميكية.
يتطلب اليقين الإحصائي لحجم المكاسب عددًا أكبر من البذور العشوائية.
يظل النموذج أقل قوة في أنماط معينة تتعلق بالفيديو وفقدان النص (مثل فقدان كل من النص والصوت معًا).