← أحدث الأبحاث
💻 computer science

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

تقدم هذه الورقة البحثية VISTAQA، وهو معيار مرجعي شامل ومقياس تقييم GROVE المصمم لتقييم صحة الإجابة على الأسئلة البصرية ودقة استناد الأدلة على مستوى البكسل بشكل مشترك، مما يكشف عن فجوة أداء كبيرة في النماذج متعددة الوسائط الحالية التي تفشل في مواءمة الإجابات مع الأدلة البصرية.

المؤلفون الأصليون: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف محققاً لحل لغز بناءً على صورة فوتوغرافية واحدة.

في الماضي، إذا أعطاك المحقق الاسم الصحيح للجاني، كنت ستوظفه. لم يكن يهمك كيف عرف ذلك. ربما خمن بناءً على حدس، أو صورة نمطية، أو مجرد تخمين محظوظ. إذا قال: "كان الخادم"، وكان محقاً، كنت ستعطيه نجمة ذهبية. وحتى لو أشار إلى الشخص الخطأ في الصورة وقال: "انظر؟ هذا هو الخادم!"، كنت ستعطيه النجمة الذهبية لأن الاسم كان صحيحاً.

هذه الورقة البحثية تجادل بأن هذه الطريقة القديمة لاختبار الذكاء الاصطناعي معطلة. إنها تشبه توظيف محقق يعطي الإجابة الصحيحة لكنه لا يستطيع إطلاعك على الأدلة.

المشكلة: ذكاء اصطناعي "يخمن بالحظ"

يقول المؤلفون إن نماذج الذكاء الاصطناعي الحالية (التي تسمى نماذج اللغات الكبيرة متعددة الوسائط) بارعة في تخمين الكلمات الصحيحة. لكنها سيئة جداً في إثبات لماذا هي على حق.

  • فخ "النص فقط": إذا قال الذكاء الاصطناعي: "هناك ثلاث أرجل لهذا الكلب"، بينما الكلب في الصورة يمتلك بوضوح أربع أرجل، فقد يقول الذكاء الاصطناعي "ثلاث" لأنه تعلم من النصوص أن الكلاب عادة لها أربع أرجل، أو أنه خمن فقط. إذا أصاب الرقم بالصدفة، فنحن نكافئه.
  • فخ "التحديد فقط": على العكس من ذلك، بعض نماذج الذكاء الاصطناعي جيدة في الإشارة إلى الأشياء في صورة (مثل رسم دائرة حول كلب) لكنها سيئة في الإجابة على الأسئلة. قد تشير بدقة إلى الكلب ولكنها تقول: "هذا قط".

يسمي المؤلفون هذا "فجوة الوسائط" (modality gap). فعقل الذكاء الاصطناعي (النص) وعيناه (الرؤية) لا يتحدثان مع بعضهما البعض بشكل صحيح.

الحل: VISTAQA (اختبار "أرني عملك")

لإصلاح ذلك، ابتكر المؤلفون اختباراً جديداً يسمى VISTAQA.

اعتبر VISTAQA بمثابة معلم صارم لا يكتفي بتصحيح إجابتك النهائية فحسب، بل يصحح عملك أيضاً.

  • القواعد: لكي يحصل الذكاء الاصطناعي على درجة ناجحة، يجب أن يقوم بشيئين في نفس الوقت تماماً:
    1. الإجابة على السؤال بشكل صحيح (مثلاً: "السيارة حمراء").
    2. رسم قناع (مثل قلم التحديد) على البكسلات الدقيقة للسيارة الحمراء في الصورة لإثبات أنه رآها.

إذا حصل الذكاء الاصطناعي على الإجابة الصحيحة ولكنه ظلل السيارة الخطأ، فإنه يفشل. وإذا ظلل السيارة الصحيحة ولكن قال إنها زرقاء، فإنه يفشل أيضاً. يجب أن يفعل الأمرين معاً بإتقان ليحصل على درجة عالية.

مجموعة البيانات: مزيج من التحديات

الاختبار ليس مجرد نوع واحد من الأسئلة. لقد بنى المؤلفون مكتبة من 1,157 لغزاً منسقاً من قبل خبراء تغطي:

  • ستة أنواع من التفكير: من "ما لون هذا؟" البسيط (الإدراك) إلى "أي جسم هو الأقرب لذراع الروبوت؟" المعقد (الاستنتاج).
  • ستة عوالم مختلفة: غرف داخلية، شوارع خارجية، رسوم بيانية رياضية، مخططات علمية، مختبرات روبوتات، ومشاهد سيارات ذاتية القيادة.
  • "الأسئلة الخادعة": حوالي 27% من الأسئلة هي أفخاخ. تسأل عن أشياء ليست موجودة في الصورة (مثلاً: "كم عدد الفيلة الحمراء الموجودة في هذا المطبخ؟"). الذكاء الاصطناعي الذكي يجب أن يقول: "لا يوجد أحد"، ويترك الصورة فارغة. أما الذكاء الاصطناعي الذي يعاني من "الهلوسة" فسيحاول رسم فيل أحمر غير موجود.

بطاقة الدرجات: GROVE

كيف تصحح اختباراً يتطلب أن تكون صحيحاً بطريقتين مختلفتين؟ لا يمكنك مجرد جمع الدرجات. إذا حصلت على 100% في النص و0% في الصورة، فلا ينبغي أن تحصل على متوسط مرتفع.

ابتكر المؤلفون نظام تسجيل جديداً يسمى GROVE.

  • التشبيه: تخيل كرسياً ذا قوائم (مقعداً) مكوناً من رجلين. إذا انكسرت إحدى القوائم، سيسقط الكرسي. لا يمكنك القول: "حسناً، الرجل الأخرى مثالية، لذا الكرسي بخير".
  • كيف يعمل: يقوم GROVE بضرب "درجة النص" في "درجة الصورة". إذا كان أي منهما صفراً (أو منخفضاً جداً)، فإن الدرجة النهائية تنهار. هذا يجبر الذكاء الاصطناعي على أن يكون جيداً في كليهما أو يحصل على درجة سيئة.

النتائج: الذكاء الاصطناعي لا يزال يتعلم

اختبر المؤلفون أذكى نماذج الذكاء الاصطناعي المتاحة اليوم (بما في ذلك نماذج من Google وOpenAI وغيرهما) في هذا الاختبار الجديد والأكثر صرامة.

الحكم؟ حتى أفضل النماذج واجهت صعوبة.

  • كانوا بارعين في تخمين الكلمات الصحيحة.
  • كانوا جيدين نوعاً ما في الإشارة إلى الأشياء.
  • لكن عندما طُلب منهم القيام بـ الأمرين في آن واحد، انخفضت درجاتهم بشكل كبير.

تخلص الورقة البحثية من أن الذكاء الاصطناعي، بينما يصبح أكثر ذكاءً في الكلام، إلا أنه لم يتعلم تماماً كيف "يرى" و"يثبت" إجاباته في وقت واحد. هناك فجوة كبيرة بين ما "يقوله" الذكاء الاصطناعي وما "يراه" بالفعل.

الملخص

  • الطريقة القديمة: هل حصلت على الإجابة الصحيحة؟ نعم؟ عمل جيد. (تتجاهل ما إذا كنت قد غششت أو خمنت).
  • الطريقة الجديدة (VISTAQA): هل حصلت على الإجابة الصحيحة و هل يمكنك الإشارة إلى الدليل في الصورة؟
  • الدرجة (GROVE): إذا فاتك أي جزء، فأنت تفشل.
  • النتيجة: الذكاء الاصطناعي الحالي لا يزال مثل طالب يمكنه حفظ نموذج الإجابات لكنه لا يفهم الدرس. إنهم بحاجة لتعلم كيفية إظهار خطوات عملهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →