← أحدث الأبحاث
🤖 AI

Deep Multimodal Learning with Missing Modality: A Survey

تقدم هذه الدراسة المراجعة الشاملة الأولى لطرق التعلم العميق للتعلم متعدد الوسائط مع فقدان أحد الأنماط (MLMM)، حيث تفصل دوافعه، واختلافاته عن الإعدادات القياسية، والتقنيات الحالية، والتطبيقات، ومجموعات البيانات، والتحديات المستقبلية.

المؤلفون الأصليون: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

نُشر 2026-02-05
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: مشكلة "الحواس الخمس"

تخيل أنك تحاول فهم فيلم. عادةً، لديك مدخلان رئيسيان: الرؤية (الفيديو) والصوت (الحوار والموسيقى). هذا يشبه النظام "متعدد الوسائط" (multimodal)—فهو يستخدم حواسًا متعددة للحصول على القصة الكاملة.

ومع ذلك، في العالم الحقيقي، تسوء الأمور. رب'ما تتعطل مكبرات الصوت لديك (لا يوجد صوت)، أو تصبح الشاشة سوداء (لا يوجد فيديو). ربما تكون في غابة ضبابية حيث لا يمكنك الرؤية، لكن يمكنك سماع حفيف الأشجار. هذه هي مشكلة "الوسيط المفقود" (Missing Modality).

معظم نماذج الذكاء الاصطناعي تشبه الطلاب الذين لا يعرفون كيف يذاكرون إلا إذا كان لديهم الكتاب المدرسي ومعهم ملاحظات صوتية. إذا سحبت أحدهما، يصابون بالذعر ويفشلون. هذا البحث هو بمثابة دليل ضخم للباحثين حول كيفية تعليم الذكاء الاصطناعي البقاء هادئًا والأداء بشكل جيد حتى عندما يفقد أحد "حواسه".

عن ماذا يتحدث هذا البحث؟

هذا البحث هو دراسة مسحية (Survey). فكر فيه كأنه أمين مكتبة قرأ كل كتاب (354 ورقة بحثية!) كُتبت بين عامي 2012 و2025 حول هذا الموضوع تحديدًا. قام المؤلفون، رينجي وو وفريقه، بتنظيم كل هذه الحلول المختلفة في خريطة واضحة ليعرف الباحثون ما الذي ينجح، وما الذي لا ينجح، وإلى أين يتجهون بعد ذلك.

يطلقون على هذا المجال اسم MLMM (التعلم متعدد الوسائط مع الوسيط المفقود).

الاستراتيجيتان الرئيسيتان: "إصلاح البيانات" مقابل "إصلاح الدماغ"

يقسم المؤلفون جميع الحلول إلى معسكرين كبيرين، مثل إصلاح سيارة مكسورة إما عن طريق إصلاح القطع أو تغيير طريقة قيادة السائق.

1. معالجة البيانات: "إصلاح القطع"

يحاول هذا النهج ملء المعلومات المفقودة قبل أن يبدأ الذكاء الاصطناعي في التفكير.

  • طريقة "الصفحة الفارغة" (تركيب الوسائط): تخيل أنك تقرأ كتابًا، لكن هناك صفحة ممزقة. يمكنك ببساطة ترك مساحة بيضاء فارغة (أصفار) أو كتابة كلام عشوائي غير مفهوم (قيم عشوائية) في تلك الصفحة. يتعلم الذكاء الاصطناعي تجاهل المساحة الفارغة والتركيز على الباقي. إنها طريقة بسيطة، لكنها ليست ذكية جدًا.
  • طريقة "النسخ واللصق" (الاسترجاع): إذا كانت هناك صفحة مفقودة، فابحث عن نسخ أخرى من نفس الكتاب في المكتبة، وجد الصفحة المطابقة، ثم الصقها. هذا يعمل جيدًا إذا كانت الكتب متطابقة، ولكن إذا كانت القصص مختلفة قليلاً، فقد تلصق مشهدًا خاطئًا.
  • طريقة "الخيال" (توليد الوسائط): هذه هي الطريقة الأكثر تقدمًا. يعمل الذكاء الاصطناعي ككاتب مبدع. إذا كان الصوت مفقودًا، ينظر الذكاء الاصطناعي إلى الفيديو ويتخيل كيف يجب أن يكون الصوت، ثم يقوم بإنشائه. الأمر يشبه ساحرًا يخرج أرنبًا من قبعة. يشير البحث إلى أنه رغم روعة هذه الطريقة، إلا أنها قد تؤدي أحيانًا إلى "الهلوسة" (اختلاق أشياء غير حقيقية).

2. تصميم الاستراتيجية: "إصلاح الدماغ"

بدلاً من محاولة إصلاح البيانات المفقودة، يغير هذا النهج بنية الذكاء الاصطناعي بحيث يمكنه التعامل مع البيانات المفقودة بشكل طبيعي.

  • طريقة "تسليط الضوء" (الانتباه): تخيل معلمًا في فصل دراسي. إذا غاب طالب، لا يتوقف المعلم عن الدرس؛ بل يسلط ضوء كشافه فقط على الطلاب الموجودين. تسمح آليات "الانتباه" للذكاء الاصطناعي بالتركيز ديناميكيًا فقط على البيانات المتاحة وتجاهل الأجزاء المفقودة.
  • طريقة "المعلم الخصوصي" (التقطير): تخيل طالبًا ذكيًا (المعلم) لديه كل الكتب. وطالبًا أقل ذكاءً (الطالب) لديه نصف الكتب فقط. يشرح المعلم الفصول المفقودة للطالب. يتعلم الطالب فهم القصة كاملة حتى بدون وجود الكتاب الفعلي.
  • طريقة "العمل الجماعي" (دمج النماذج): بدلاً من وجود ذكاء اصطناعي واحد عملاق، لديك فريق من المتخصصين. إذا كان الفيديو مفقودًا، تسأل "خبير الصوت". إذا كان الصوت مفقودًا، تسأل "خبير الفيديو". ويقومون بالتصويت على الإجابة معًا.
  • "الدماغ الخارق" (النماذج اللغوية الكبيرة): مؤخرًا، أصبحت نماذج الذكاء الاصطناعي الضخمة (مثل تلك التي تشغل برامج الدردشة) ذكية جدًا لدرجة أنها تستطيع فهم النصوص والصور والأصوات في آن واحد. إنها مرنة للغاية لدرجة أنه إذا سحبت منها مدخلًا واحدًا، فإنها تتكيف وتستمر في العمل، تمامًا مثل الإنسان الذي لا يزال قادرًا على سرد قصة حتى لو لم يستطع رؤية الصورة.

أين يُستخدم هذا؟ (أمثلة من الواقع)

يسرد البحث العديد من الأماكن التي يعد فيها هذا الأمر بالغ الأهمية:

  • الفحوصات الطبية: قد يكون لدى الطبيب صورة رنين مغناطيسي (MRI) ولكن ليس لديه فحص مقطعي (CT) للمريض. يحتاج الذكاء الاصطناعي لتشخيص المرض باستخدام الرنين المغناط مغناطيسي فقط دون التخمين العشوائي.
  • السيارات ذاتية القيادة: قد تتعرض كاميرا السيارة للعمى بسبب الثلوج، أو قد يتعطل الرادار الخاص بها. يجب على ذكاء السيارة الاصطناعي الاستمرار في القيادة بأمان باستخدام المستشعرات التي لا تزال تعمل فقط.
  • كشف المشاعر: قد تكون مكالمة الفيديو ذات صوت سيء ولكن صورة واضحة. يجب أن يظل الذكاء الاصطناعي قادرًا على معرفة ما إذا كنت سعيدًا أو حزينًا من خلال النظر إلى وجهك.
  • الروبوتات: قد يفقد الروبوت الذي يستكشف كهفًا إشارة نظام تحديد المواقع (GPS). يحتاج إلى التنقل باستخدام كاميراتاته ومستشعرات اللمس فقط.

المشكلات التي لم نتمكن من حلها بعد

على الرغم من امتلاكنا لهذه الحيل الرائعة، يشير البحث إلى بعض الصعوبات الكبيرة:

  1. فخ "البيانات المزيفة": عندما "يتخيل" الذكاء الاصطناعي البيانات المفقودة، فإنه أحيانًا يختلق تفاصيل خاطئة. إذا تخيلت سيارة ذاتية القيادة طريقًا حيث توجد منحدر خطير، فسيكون ذلك خطرًا.
  2. الذكاء الاصطناعي "الكسول": أحيانًا، حتى لو حاول الذكاء الاصطناعي ملء الجزء المفقود، فإنه ينتهي به الأمر بتجاهل المعلومات الجديدة والاعتماد فقط على المستشعر الوحيد الذي يمتلكه، والذي قد لا يكون كافيًا.
  3. "المكتبة الفوضوية": لا يوجد اختبار معياري واحد. قد يختبر باحث ما الذكاء الاصطناعي الخاص به مع 10% من البيانات المفقودة، بينما يختبر آخره مع 90%. من الصعب المقارنة لمعرفة من هو الأفضل حقًا.
  4. الثقل الزائد: تتطلب العديد من هذه الحلول قوة حاسوبية هائلة (مثل سوبر كمبيوتر). لكن الأجهزة الواقعية (مثل الساعة الذكية أو الطائرة بدون طيار) صغيرة ولديها بطاريات ضعيفة. نحن بحاجة إلى حلول "خفيفة الوزن" تعمل على شرائح صغيرة.

الخلاصة

هذا البحث هو بمثابة خارطة طريق. يخبرنا أنه بينما حققنا تقدمًا كبيرًا في تعليم الذكاء الاصطناعي كيفية التعامل مع المستشعرات المعطلة والبيانات المفقودة، إلا أننا لا نزال بحاجة إلى طرق أفضل للقيام بذلك دون اختلاق أشياء، ودون الحاجة إلى أجهزة سوبر كمبيوتر، ودون الارتباك من المواقف الواقعية الفوضوية. الهدف هو بناء ذكاء اصطناعي قوي مثل البشر: قادر على فهم العالم حتى عندما تكون الرؤية ضبابية أو الميكروفون معطلاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →