VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning
تقدم هذه الورقة البحثية VOILA، وهو معيار ديناميكي يقيم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على إجراء الاستدلال العلائقي التجريدي من خلال القياسات البصرية، مما يكشف أن النماذج الحالية تعاني بشكل كبير في العلاقات بين الصور مقارنة بالأداء البشري رغم التحسينات الناتجة عن استراتيجيات التلقين متعدد الخطوات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيف يفكر كالبشر. تعرض عليه صورة لـ قط يطارد فأرًا، ثم صورة لـ كلب يطارد كرة. ثم تسأل الروبوت: "إذا عرضتُ عليك صورة طائر يطارد دودة، فماذا سيحدث بعد ذلك؟"
الطفل البشري سيقول فورًا: "الطائر سيمسك بالدودة!" لأنه يفهم النمط: "الحيوان (أ) يصطاد الحيوان (ب)."
ولكن ماذا لو رأى الروبوت الصور فقط وقال: "لا أعرف، ربما يطير الطائر بعيدًا"؟ هذا هو المشكلة التي يحاول الباحثون حلها باستخدام اختبار جديد يسمى VOILA.
إليك شرح مبسط للورقة البحثية، باستخدام تشبيهات من الحياة اليومية.
1. المشكلة: الروبوتات يمكنها "الرؤية" ولكن لا يمكنها "ربط النقاط"
نماذج الذكاء الاصطناعي الحالية (مثل تلك التي تشغل برامج الدردشة ومولدات الصور) مذهلة في وصف ما تراه. إذا عرضت عليها صورة كلب، يمكنها أن تقول لك: "هذا كلب بني يجري."
ومع ذلك، فهي تعاني في الاستدلال التناظري. وهو القدرة على النظر إلى شيئين، وفهم العلاقة بينهما، وتطبيق نفس العلاقة على موقف جديد.
- التشبيه: تخيل أنك تلعب لعبة "أوجد الفروق". لديك زوجان من الصور. الزوج (أ) يظهر تغييرًا (مثلاً: كوب صغير يصبح كوبًا كبيرًا). الزوج (ب) يظهر كرة صغيرة. يحتاج الروبوت إلى اكتشاف أن الكرة يجب أن تصبح كرة كبيرة.
- الواقع: معظم نماذج الذكاء الاصطناعي تتعثر. يمكنها وصف الكوب الصغير والكوب الكبير، لكنها تفشل في إدراك أن القاعدة هي "اجعل الشيء أكبر" وتطبيقها على الكرة.
2. الحل: تقديم "VOILA"
ابتكر الباحثون اختبارًا جديدًا ضخمًا يسمى VOILA (تقييم الذكاء والتعلم التناظري البصري المفتوح). فكر في VOILA كأنه "مصنع ألغاز" ديناميكي وضخم للذكاء الاصطناعي.
بدلاً من إعطاء الذكاء الاصطناعي اختبارًا من نوع الاختيار من متعدد (حيث يختار فقط أ، ب، ج، أو د)، يطلب VOILA من الذكاء الاصطناعي ابتكار الإجابة.
- الإعداد: يرى الذكاء الاصطناعي ثلاث صور:
- الصورة (أ) (مثلاً: دبّان يقودان سيارة).
- الصورة (ب) (مثلاً: دبّان يقرآن كتابًا).
- الصورة (ج) (مثلاً: 4 أرانب تلعب كرة القدم).
- المهمة: يجب على الذكاء الاصطناعي اكتشاف القاعدة بين (أ) و(ب) (الدبّان تغيرا من القيادة إلى القراءة) وتطبيقها على (ج). لذا، يجب على الذكاء الاصطناউ إنشاء صورة لـ 4 أرانب تقرأ كتابًا.
3. فخ "التشتيت"
لجعل الاختبار أكثر صعوبة، أضاف الباحثون وضع "التشتيت" (VOILA-WD).
- الاستعارة: تخيل أن معلمًا يسأل: "إذا تحول تفاحتان إلى 4 تفاحات، فماذا سيحدث لبرتقالتين؟"
- التشتيت: ولكن على الطاولة، يوجد أيضًا موزة عشوائية وقبعة حمراء. الإنسان الذكي يتجاهل الموزة والقبعة ويركز فقط على التفاح والبرتقال.
- معاناة الذكاء الاصطناعي: غالبًا ما يرتبك الذكاء الاصطناعي بسبب "الضجيج" الإضافي. فهو يحاول تضمين الموزة أو القبعة في إجابته لأنه لا يستطيع تصفية ما هو مهم وما هو مجرد فوضى خلفية.
4. النتائج: البشر يفوزون، والذكاء الاصطناعي يعاني
اختبر الباحثون أذكى نماذج الذكاء الاصطناعي (مثل GPT-4o و LLaMa) مقابل البشر.
- لوحة النتائج:
- البشر: أجابوا بشكل صحيح بنسبة 70% تقريبًا.
- أفضل ذكاء اصطناعي: أجاب بشكل صحيح بنسبة تتراوح بين 13% إلى 29% فقط.
- الخلاصة: الذكاء الاصطناعي يشبه الطالب الذي حفظ القاموس لكنه لا يفهم القصة. يمكنه وصف الصور بدقة، ولكن عندما يُطلب منه استخدام المنطق لحل لغز، فإنه يضيع.
5. كيف نساعد الذكاء الاصطناعي على التفكير بشكل أفضل
وجدت الورقة البحثية بعض الحيل التي تساعد الذكاء الاصطناعي على الأداء بشكل أفضل، رغم أنه لا يزال بعيدًا عن مستوى البشر:
- "السلم خطوة بخطوة" (من الأقل إلى الأكثر): بدلاً من طلب "حل اللغز" من الذكاء الاصطناعي، قام الباحثون بتفكيك العملية:
- "صف الصورة الأولى."
- "ما الذي تغير بين الصورة 1 و2؟"
- "طبق هذا التغيير على الصورة 3."
- "ارسم النتيجة."
- النتيجة: ساعد هذا الذكاء الاصطناعي كثيرًا، تمامًا مثل إعطاء ورقة ملاحظات مساعدة لطالب.
- مشكلة "الكولاج" مقابل "الصور المنفصلة": عندما تم دمج الصور الثلاث معًا في كولاج واحد كبير، ارتبك الذكاء الاصطناعي. وعندما عُرضت كصور ثلاث منفصلة متتالية، كان أداؤه أفضل بكثير. الأمر يشبه محاولة قراءة كتاب حيث الصفحات ملتصقة ببعضها البعض مقابل تقليب الصفحات واحدة تلو الأخرى.
ملخص
VOILA هو اختبار جديد وصعب يوضح أن الذكاء الاصطناعي الحالي لا يزال "ببغاءً" وليس "مفكرًا". يمكنه تكرار ما يراه، لكنه يكافح لفهم القواعد الخفية التي تربط الصور المختلفة ببعضها. وبينما يساعد إعطاء الذكاء الاصطناعي تعليمات خطوة بخطوة، إلا أنه لا تزال هناك فجوة كبيرة بين كيفية حل البشر لهذه الألغاز وكيفية حل الآلات لها.
يأمل الباحثون أنه من خلال استخدام هذا الاختبار، يمكننا بناء ذكاء اصطناعي لا يكتفي فقط بـ "رؤية" العالم، بل يفهم حقًا المنطق الكامن وراءه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.