VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
يكشف معيار VRIQ أن نماذج الرؤية واللغة الحالية تؤدي أداءً ضعيفًا في مهام الاستدلال البصري، ويرجع ذلك أساسًا إلى قيود الإدراك لا إلى عجز في الاستدلال، حيث تتراوح الدقة بين 28% في الألغاز التجريدية و45% في الصور الطبيعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فريقًا من الروبوتات الذكية للغاية التي يمكنها قراءة الكتب والنظر إلى الصور. أنت تريد أن تعرف ما إذا كانت "ذكية" حقًا أم أنها مجرد جيدة جدًا في التخمين. لمعرفة ذلك، قام مؤلفو هذه الورقة البحثية ببناء اختبار خاص يسمى VRIQ (اختبار ذكاء الاستدلال البصري).
فكر في VRIQ كأنه "صندوق ألغاز" رقمي ضخم مصمم لخداع هذه الروبوتات. يحتوي الصندوق على نوعين من الألغاز:
- الألغاز المجردة: وهي تشبه بطاقات اختبارات الذكاء الكلاسيكية التي تحتوي على أشكال وخطوط وأنماط غريبة. لا توجد هنا أشياء من العالم الحقيقي، بل مجرد رموز.
- الألغاز الطبيعية: وهي تستخدم صورًا حقيقية لأشياء من الحياة اليومية، مثل التفاح أو السيارات أو الأشخاص، ولكنها تطرح نفس الأسئلة المنطقية الصعبة.
المفاجأة الكبرى: الروبوتات "عمياء"
عندما اختبر الباحثون أذكى نماذج الذكاء الاصططناعي المتاحة (بما في ذلك النماذج الشهيرة من OpenAI وGoogle)، وجدوا شيئًا صادمًا.
- في الألغاز المجردة: كان أداء الروبوتات سيئًا للغاية، لدرجة أنها بدت وكأنها تخمن عشوائيًا فقط. بلغ متوسط درجاتهم حوالي 28% (حيث تمثل نسبة 25% مجرد حظ محض). الأمر يشبه طالبًا حفظ القاموس بالكامل لكنه لا يستطيع قراءة جملة واحدة.
- في الألغاز الطبيعية: كان أداؤهم أفضل قليلاً (حوالي 45%)، لكنهم كانوا لا يزالون بعيدين عن المثالية.
تكشف الورقة أن المشكلة ليست في أن الروبوتات سيئة في "التفكير" (الاستدلال)، بل المشكلة هي أنها سيئة في "الرؤية" (الإدراك).
العمل التحري: لماذا فشلوا؟
لمعرفة أين تكمن نقطة فشل الروبوتات بالضبط، تصرف الباحثون كالمحققين. لم يكتفوا بسؤال: "ما هي الإجابة؟"، بل قاموا بتفكيك كل لغز إلى خطوات صغيرة باستخدام "أسئلة الاستقصاء".
تخيل روبوتًا يفشل في لغز يتطلب منه إيجاد الشكل الغريب من بين مجموعة أشكال. سأل الباحثون:
- استقصاء الإدراك: "كم عدد الدوائر الحمراء التي تراها؟"
- استقصاء الاستدلال: "إذا كان هناك 3 دوائر حمراء والقاعدة هي 'احذف واحدًا'، فما المتبقي؟"
نتائج التحقيق:
- في 56% من الحالات: فشل الروبوت لأنه لم يستطع رؤية الأساسيات (على سبيل المثال، لم يستطع عد الدوائر أو معرفة الاتجاه الذي يشير إليه الشكل).
- في 43% من الحالات: فشل الروبوت في رؤية الأساسيات وفي القدرة على فهم المنطق معًا.
- في 1% فقط من الحالات: رأى الروبوت كل شيء بوضوح تام، لكنه أخطأ في المنطق فقط.
الاستعارة: الأمر يشبه إعطاء وصفة كعكة لطاهٍ. الطاهي (الذكاء الاصطناعي) يعرف منطق الخبز تمامًا، ولكن إذا كان الطاهي معصوب العينين ولا يستطيع رؤية أن هناك بيضتين فقط بدلًا من أربع، فإن الكعكة ستفشل. الفشل لم يكن في منطق الطبخ، بل في عدم القدرة على رؤية المكونات.
تحول "الأداة"
حاول الباحثون شيئًا واحدًا أخيرًا. فقد أعطوا نموذجًا محددًا من الذكاء الاصطناعي (o3 من OpenAI) مجموعة من الأدوات الرقمية، مثل عدسة مكبرة، ومقص (لقص الصور)، وآلة حاسبة. سُمح لهذا النموذج بأن "يفكر بالصور" من خلال التلاعب بالصورة بنشاط قبل الإجابة.
النتيجة: انطلق هذا الروبوت مستخدمًا للأدوات بشكل مذهل. فقد قفز من درجة 28% إلى أكثر من 50% في الألغاز المجردة، وحتى 80-100% في الألغاز الطبيعية. وهذا يثبت أنه إذا منحت الروبوت "عيونًا" أفضل (أدوات للرؤية بوضوح)، فإن "عقله" (الاستدلال) سيعمل بشكل أفضل بكثير.
الخلاصة
تخلص الورقة البحثية إلى أن نماذج الذكاء الاصطناعي الحالية لا تفشل بسبب نقص الذكاء أو المنطق، بل تفشل لأنها تواجه صعوبة في إدراك العالم البصري بدقة. فهي لا تستطيع عد الأشياء بشكل موثوق، أو فهم العمق ثلاثي الأبعاد، أو تحديد اتجاه دوران الأشياء.
لجعل الذكاء الاصطناعي ذكيًا حقًا في الاستدلال البصري، لا نحتاج فقط إلى عقول أكبر؛ بل نحتاج إلى منحهم عيونًا أفضل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.