← أحدث الأبحاث
🤖 AI

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

تقدم هذه الورقة VLM-RobustBench، وهو معيار شامل لتقييم متانة أربع عائلات من نماذج الرؤية واللغة عبر 133 إعداداً للفساد، كاشفةً أن النماذج الحالية قوية دلالياً ولكنها هشة مكانياً، حيث تسبب التشوهات الهندسية منخفضة الشدة انخفاضات في الأداء أكبر بكثير من الفسادات الضوئية شديدة الوضوح بصرياً.

المؤلفون الأصليون: Rohit Saxena, Alessandro Suglia, Pasquale Minervini

نُشر 2026-03-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rohit Saxena, Alessandro Suglia, Pasquale Minervini

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً جديداً يُدعى نموذج الرؤية واللغة (VLM). هذا الطالب ذكي للغاية في قراءة الكتب والنظر إلى الصور. إذا عرضت عليه صورة عالية الدقة لقطة وسألته: "ما هذا؟"، فسيجيب بشكل صحيح بنسبة 99% من المرات. إنه يتصدر فصله في الاختبارات القياسية.

ولكن، تكمن المشكلة في أن: الحياة الواقعية ليست صورة استوديو مثالية.

في العالم الحقيقي، تصبح الصور ضبابية لأنك تحركت بسرعة كبيرة، أو تصبح مغبشة بسبب المطر، أو تصبح مشوشة (بكسلات) بسبب بطء الإنترنت، أو تصبح مقلوبة لأن شخصاً ما أمسك الكاميرا بشكل خاطئ.

ورقة البحث التي شاركتها، VLM-RobustBench، هي بمثابة "اختبار جهد" لهؤلاء الطلاب الأذكياء جداً. أراد الباحثون معرفة: ماذا يحدث عندما نلقي بالفوضى الواقعية على هذه النماذج؟

إليك تفصيل نتائجهم، باستخدام بعض التشبيهات البسيطة:

1. مفاجأة "ضباب الزجاج" (المفارقة)

قد تعتقد أنه إذا جعلت الصورة تبدو سيئة للغاية (مثل تغطيتها بالطين السميك أو تحويلها إلى الأبيض والأسود)، فإن الطالب سيصاب بالارتباك.

  • الواقع: النماذج قوية جداً ضد الصور "القبيحة". يمكنها التعامل مع الضجيج الشديد أو الإضاءة السيئة بشكل مدهش.
  • الصدمة: النماذج تنهار أمام التغييرات البسيطة والدقيقة.
    • التشبيه: تخيل طباخاً ماهراً يمكنه طهي وجبة مثالية حتى لو كان المطبخ يحترق (شدة عالية). لكن، إذا أعدت ترتيب التوابل على الطاولة قليلاً بحيث تغير ترتيبها (شدة منخفضة)، فسينسى الطباخ كيف يطبخ تماماً.
    • النتيجة: تسبب "ضباب الزجاج" (الذي يبدو كأنك تنظر من خلال نافذة متسخة قليلاً) ذو الشدة المنخفضة في فشل النماذج بشكل أكبر بكثير مما فعله انخفاض السطوع ذو الشدة العالية. النماذج قوية دلالياً (تعرف ماهية الأشياء) ولكنها هشة مكانياً (تصاب بالارتباك إذا تغير شكل أو موقع الأشياء قليلاً).

2. كارثة "القط المقلوب"

حاول الباحثون استخدام بعض الحيل البسيطة جداً، مثل قلب الصورة رأسياً (مقلوبة) أو عكس الألوان (جعل القطة السوداء تبدو بيضاء).

  • التشبيه: الأمر يشبه سؤال إنسان: "هل هذا كوب؟" بينما تمسك الكوب مقلوباً. الإنسان سيقول: "إنه لا يزال كوباً، لكنه مقلوب فقط".
  • النتيجة: أصيبت نماذج (VLMs) بالذعر. تسبب قلب الصورة في انخفاض هائل في الأداء، وأحياناً كان أسوأ مما لو كنت قد كرمشت الصورة في كرة. هذا يشير إلى أن النماذج لديها "عادة" قوية في توقع أن تكون الأشياء قائمة، وكسر هذه العادة يكسر عقلها.

3. فخ "إعادة أخذ العينات" (Resampling)

كان القاتل الأكبر لهذه النماذج هو إعادة أخذ العينات (تغيير حجم الصورة، مثل التكبير أو التصغير، أو التمدد).

  • التشبيه: تخيل لغزاً (بازل). إذا أخذت قطعة من اللغز وقمت بتمديدها قليلاً، فإن الصورة الموجودة عليها ستتشوه. النموذج يشبه روبوتاً حفظ الشكل الدقيق لكل قطعة. إذا مددت القطعة، فلن يتعرف الروبوت عليها على الإطلاق.
  • النتيجة: تسببت عمليات مثل رفع العينات (جعل الصورة الصغيرة كبيرة) أو التحويل المرن (تشويه الصورة مثل الجيلي) في فقدان النماذج لما يصل إلى 34% من دقتها. هذا يعتبر "فشلاً كارثياً".

4. نوعان مختلفان من الاختبارات

اختبر الباحثون النماذج على نوعين مختلفين من الأسئلة:

  • MMBench (اختبار "العيون"): أسئلة تتطلب النظر بدقة إلى الصورة (مثلاً: "ما لون السيارة؟"). هنا، كانت النماذج هشة للغاية.
  • MMMU-Pro (اختبار "الدماغ"): أسئلة تتطلب تفكيراً معقداً (مثلاً: "بناءً على هذا الرسم البياني، ما هو الاتجاه الاقتصادي؟"). هنا، اعتمدت النماذج أكثر على معرفتها النصية وأقل على الصورة. إذا كانت الصورة ضبابية، كانوا ببساطة يخمنون بناءً على النص، لذا لم يفشلوا بنفس القدر.

5. كذبة "الشدة"

عادةً ما نفترض أنه كلما كانت الصورة أكثر تشوهاً، زادت صعوبة فهمها.

  • النتيجة: هذا خاطئ بالنسبة للذكاء الاصطنا Artificial Intelligence.
  • التشبيه: فكر في سيارة. سيارة بإطار مسطح (شدة عالية) قد يكون من الصعب قيادتها. لكن سيارة ببرغي مرتخٍ في عجلة القيادة (شدة منخفضة) قد تتحطم فوراً. "البرغي المرتخي" (ضباب الزجاج ذو الشدة المنخفضة) كان أكثر خطورة على الذكاء الاصطناعي من "الإطار المسطح" (الضجيج ذو الشدة العالية).

ماذا يعني هذا للمستقبل؟

تخلص الورقة البحثية إلى أن نماذج الذكاء الاصطري الحالية تشبه العباقرة الذين يعانون من أيدٍ مرتجفة. هم يعرفون الكثير من الحقائق، لكنهم سيئون جداً في التعامل مع الخصائص الفيزيائية للعالم الحقيقي.

التوصيات:

  1. تدريبهم على بيانات "فوضوية": لا تكتفِ بعرض صور مثالية عليهم. اعرض عليهم صوراً مقلوبة، وصوراً ممددة، وصوراً ضبابية.
  2. اختبارهم على بيانات "فوضوية": لا تعطهم اختباراً نظيفاً فقط. إذا كان النموذج لا يستطيع التعامل مع صورة مقلوبة قلياً، فهو ليس جاهزاً للسيارات ذاتية القيادة أو للروبوتات الطبية.
  3. إصلاح "الأيدي المرتجفة": نحن بحاجة لتعليم هذه النماذج أن القطة تظل قطة، حتى لو كانت الصورة ممددة أو كانت القطة مقلوبة.

باختصار: نماذج الذكاء الاصطنا هذه هي دودة كتب بارعة، لكنها مرعوبة من إطار صورة مائل قليلاً. وإلى أن نصلح ذلك، لا يمكننا الوثوق بها تماماً في العالم الحقيقي الفوضوي وغير المتوقع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →