← أحدث الأبحاث
💻 computer science

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

تقدم الورقة البحثية VLM-UQBench، وهو معيار جديد مصمم لتقييم عدم اليقين الخاص بكل نمط وعدم اليقين عبر الأنماط في نماذج الرؤية واللغة، مما يكشف أن طرق قياس عدم اليقين الحالية تواجه صعوبة في اكتشاف حالات الغموض الدقيقة على مستوى العينة وتوفير إشارات غير متسقة للكشف عن الهلوسة.

المؤلفون الأصليون: Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً شخصياً لمساعدتك في التنقل في هذا العالم. أنت تريده أن يكون ذكياً، ولكن الأهم من ذلك، أن يكون صادقاً. إذا لم يستطع رؤية لافتة شارع بوضوح لأنها ضبابية، أو إذا طرحت عليه سؤالاً مربكاً مثل: "ما لون ذلك الشيء هناك؟" دون أن تشير إليه، فأنت لا تريده أن يخمن فقط ويعطيك إجابة خاطئة، بل تريده أن يقول: "لست متأكداً—هل الصورة ضبابية جداً، أم أن سؤالك كان غامضاً للغاية؟"

في عالم الذكاء الاصطعي، تُسمى هذه "المساعدات" نماذج الرؤية واللغة (VLMs). فهي تنظر إلى الصور وتقرأ النصوص للإجابة على الأسئلة. المشكلة؟ هي مشهورة بـ "الهلوسة"—فهي غالباً ما تخبرك بثقة تامة بوجود قطة على الأريكة بينما هي في الواقع مجرد وسادة.

تقدم هذه الورقة البحثية VLM-UQBench، وهو "اختبار صدق" عالي التقنية مصمم لمعرفة ما إذا كانت نماذج الذكاء الاصطعي هذه تدرك حقاً متى تكون مرتبكة، والأهم من ذلك، لماذا هي مرتبكة.

مشكلة الـ "لماذا": المصادر الثلاثة للارتباك

معظم الاختبارات تسأل فقط: "هل الذكاء الاصطناعي على صواب أم خطأ؟" تقول هذه الورقة إن هذا ليس كافياً. لإصلاح الذكاء الاصطناعي، نحتاج إلى معرفة أين بدأ الخطأ. لقد صنفوا الارتباك في ثلاث فئات:

  1. مشكلة "العيون السيئة" (الارتباك البصري): الصورة مظلمة جداً، أو ضبابية، أو منقطة (pixelated). الذكاء الاصطناعي يعاني لأن "العيون" لا تستطيع الرؤية.
  2. مشكلة "التعليمات السيئة" (الارتبك النصي): الإنسان طرح سؤالاً مربكاً، أو مليئاً بالأخطاء المطبعية، أو ذاتياً بشكل مفرط. الذكاء الاصطناعي يعاني لأن "الأذنين" لم تفهما.
  3. مشكلة "الضياع في الترجمة" (الارتباك عبر الوسائط): الصورة واضحة والنص واضح، لكنهما لا يتطابقان. على سبيل المثال، السؤال عن "ما لون السيارة؟" بينما توجد ثلاث سيارات في الصورة. الذكاء الاصطناعي يعاني لأنه لا يستطيع ربط الكلمات بالشيء الصحيح.

مسار "اختبار الضغط"

لاختبار الذكاء الاصطناعي، أنشأ الباحثون "غرفة تعذيب رقمية" (مسار الاضطراب/perturbation pipeline). يأخذون صورة واضحة تماماً وسؤالاً مثالياً، ثم يفسدونهم بشكل منهجي:

  • يمسحون الصورة (الضبابية - Blur).
  • يضيفون أخطاء مطبعية للنص (الأخطاء المطبعية - Typos).
  • يتعمدون جعل السؤال والصورة متضاربين (الارتباك عبر الوسائط - Cross-modal).

من خلال القيام بذلك، يمكنهم معرفة ما إذا كان "مقياس عدم اليقين" لدى الذكاء الاصطناعي (مقياس "أنا لست متأكداً" الداخلي لديه) يرتفع بالفعل عندما تصبح الأمور فوضوية.

النتائج المفاجئة: "الكاذب الواثق"

اختبر الباحثون عدة نماذج ذكاء اصطناعي شهيرة (مثل GPT-4o-mini و LLaVA)، وكانت النتائج بمثابة جرس إنذار. فقد وجدوا ثلاث مشكلات رئيسية:

  • الارتباك المتخصص: بعض نماذج الذكاء الاصطناعي جيدة في استشعار متى يكون السؤال سيئاً، لكنها عمياء تماماً عن معرفة متى تكون الصورة ضبابية. إنها تشبه طالباً يعرف أنه لم يذاكر الكتاب المدرسي، لكنه لا يدرك أنه لا يستطيع قراءة خط اليد في الامتحان.
  • فجوة الهلوسة: هذا هو الجزء الأكثر خطورة. حتى عندما يبدأ الذكاء الاصطناعي في الهلوسة (اختلاق أشياء)، فإن "مقياس عدم اليقين" لديه غالباً ما يظل منخفضاً. إنه يشبه شخصاً يسير بثقة نحو حافة منحدر لأنه واثق جداً من وجود جسر هناك.
  • الفشل "الخفي": نماذج الذكاء الاصطناي جيدة في اكتشاف "الارتباك الواضح" (مثل صورة سوداء تماماً)، لكنها سيئة جداً في اكتشاف "الارتباك الخفي" (مثل خطأ مطبعي صغير أو مرجع غامض قليلاً).

لماذا هذا مهم؟

إذا أردنا استخدام الذكاء الاصطناعي في المستشفيات (لتحليل الأشعة السينية) أو في السيارات ذاتية القيادة، فإن كون النموذج "صحيحاً في معظم الأحيان" ليس كافياً. نحن بحاجة إلى ذكاء اصطناعي يمكنه قول: "توقف! أنا مرتبك لأن الإضاءة سيئة،" أو "يرجى إعادة صياغة ذلك؛ أنا لا أعرف أي جسم تقصد."

يوفر VLM-UQBench خارطة طريق لبناء هذا النوع من الذكاء الاصطناي الموثوق والواعي بذاته. إنه ينقلنا من مجرد بناء نماذج "ذكية" إلى بناء نماذج موثوقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →