← أحدث الأبحاث
💻 computer science

WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata

تقدم الورقة البحثية WikiVQABench، وهو معيار تم تنسيقه بشرياً يجمع بين صور ويكيبيديا وتوضيحاتها وبيانات ويكيداتا لتقييم قدرات الاستدلال القائمة على المعرفة لنماذج الرؤية واللغة من خلال أسئلة متعددة الخيارات تتطلب معلومات خارجية تتجاوز الإدراك البصري.

المؤلفون الأصليون: Basel Shbita, Pengyuan Li, Anna Lisa Gentile

نُشر 2026-05-21
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Basel Shbita, Pengyuan Li, Anna Lisa Gentile

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تلعب لعبة "خمن الصورة" مع صديق لك. عادةً ما تكون اللعبة بسيطة: تعرض صورة لتفاحة حمراء، فيقول صديقك: "هذه تفاحة!" أو "إنها مستديرة!". هكذا تعمل معظم اختبارات الرؤية للذكاء الاصطناعي الحالية؛ فهي تتحقق مما إذا كان بإمكان الذكاء الاصطناعي "رؤية" ما هو موجود في الصورة.

لكن في العالم الحقيقي، لا يكفي النظر دائماً. تخيل أنك عرضت على صديقك صورة لعنكبوت نادر جداً ومحدد. إذا سألته: "إلى أي فصيلة من العناكب ينتمي هذا؟"، فلن يستطيع الإجابة بمجرد النظر إلى الشبكة أو الأرجل. بل يحتاج إلى معرفة حقائق بيولوجية ليست مرئية في الصورة. يحتاج إلى استدعاء المعلومات من "مكتبة" المعرفة الموجودة في دماغه.

WikiVQABench هو اختبار جديد صُمم ليرى ما إذا كان بإمكان الذكاء الاصطناعي فعل ذلك بالضبط: الجمع بين ما "يراه" وما "يعرفه" من حقائق مكتبية.

إليك كيف يشرح البحث هذا الأمر، مقسماً إلى أجزاء بسيطة:

1. المشكلة: الذكاء الاصطناعي "سطحي للغاية"

نماذج الذكاء الاصطناعي الحالية بارعة في وصف ما هو أمامها مباشرة (مثل "رجل يمسك مضرباً"). لكنها تعاني عندما يتطلب السؤال معرفة خارجية.

  • الطريقة القديمة: عرض صورة لمعلم ما والسؤال: "ما هذا؟" (الإجابة: "برج حجري طويل").
  • التحدي الجديد: عرض نفس الصورة والسؤال: "أي حضارة قديمة بنت هذا؟" (الإجابة: "الفينيقيون"). لا يمكنك رؤية "الفينيقيين" في الحجر؛ بل يجب أن تعرف التاريخ.

2. الحل: اختبار "مرتبط بالمكتبة"

قام الباحثون ببناء اختبار جديد يسمى WikiVQABench. فكر في الأمر كأنه مسابقة مرتبطة بكل صفحة في موسوعة ضخمة (ويكيبيديا) وقاعدة بيانات منظمة للحقائق (Wikidata).

  • المكونات: أخذوا صوراً حقيقية من ويكيبيديا، وقرأوا المقالات المجاورة لها، واستخرجوا حقائق منظمة من ويكيداتا (مثل خزانة ملفات رقمية للحقائق).
  • الوصفة: استخدموا برنامجاً حاسوبياً ذكياً (نموذج لغوي كبير - LLM) لخلط هذه المكونات معاً لإنشاء أسئلة متعددة الخيارات.
  • اللمسة البشرية: هذا هو الجزء الأهم. قام الكمبيوتر بإنشاء آلاف الأسئلة، لكنه ارتكب أخطاءً. لذا، قام بشر حقيقيون بدور "المحررين". لقد تحققوا من كل سؤال للتأكد من:
    1. أن الإجابة صحيحة بالفعل.
    2. أن السؤال يتطابق مع الصورة.
    3. الأهم من ذلك: أنه لا يمكنك الإجابة على السؤال بمجرد النظر إلى الصورة. يجب عليك استخدام المعرفة الخارجية.

3. الاختبار: "فجوة المعرفة"

اختبر الباحثون 15 نموذجاً مختلفاً من نماذج الذكاء الاصطناي على هذا الاختبار الجديد. تراوحت هذه النماذج بين نماذج صغيرة جداً (مثل الآلة الحاسبة الجيبية) ونماذج ضخمة (مثل الحاسوب الخارق).

النتائج:

  • الفجوة الكبيرة: حصل أفضل ذكاء اصطناعي على حوالي 76% بشكل صحيح. بينما حصل أصغر ذكاء اصطناعي على 25% فقط (وهو ما يعادل التخمين العشوائي تقريباً).
  • اختبار الواقع: حتى أكبر وأذكى نماذج الذكاء الاصطناعي لم يحصل على 100%. وهذا يثبت أن الاختبار صعب وأن الذكاء الاصطناعي الحالي لا يزال يعاني من أجل الدمج المثالي بين "الرؤية" و"المعرفة".
  • الحجم مهم (ولكن ليس كل شيء): النماذج الأكبر أدت بشكل أفضل عموماً، لكن مجرد جعل النموذج أكبر لم يجعله تلقائياً عبقرياً في هذا النوع المحدد من الاستنتاج.

4. لماذا يهم هذا؟

فكر في هذا المعيار (Benchmark) كأنه "اختبار رخصة قيادة" للذكاء الاصطناعي.

  • الاختبارات القديمة: كانت تتحقق مما إذا كان بإمكان الذكاء الاصطناعي رؤية عجلة القيادة والطريق.
  • WikiVQABench: يتحقق مما إذا كان الذكاء الاصطناعي يعرف قوانين المرور، وتاريخ الطريق، وقواعد المدينة، وليس فقط شكل الطريق.

يخلص البحث إلى أننا بحاجة إلى اختبارات كهذه للعثور على "النقاط العمياء" في الذكاء الاصطناعي. وهو يوضح أنه بينما يتحسن الذكاء الاصطناعي في الرؤية، إلا أنه لا يزال بحاجة إلى أن يصبح أفضل بكثير في فهم العالم الكامن وراء الصورة. لقد جعل الباحثون هذا الاختبار والبيانات متاحة للجميع لاستخدامها، آملين أن يساعد ذلك في بناء ذكاء اصطناعي أكثر ذكاءً ومعرفة في المستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →