GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra
تقدم هذه الورقة GIQ، وهو معيار شامل يستخدم مجسمات متعددة الوجوه متنوعة، اصطناعية وحقيقية، لتقييم نماذج الرؤية والنماذج اللغوية البصرية التأسيسية، مما يكشف عن أوجه قصور كبيرة في قدراتها على الاستدلال الهندسي عبر مهام مثل إعادة البناء ثلاثي الأبعاد، وكشف التماثل، وتصنيف الأشكال.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مجموعة من الروبوتات الذكية للغاية التي عُرضت عليها ملايين الصور للعالم. إنها بارعة في التعرف على القطط، والسيارات، وحتى كتابة القصائد. لكن مؤلفي هذه الورقة البحثية أرادوا طرح سؤال بسيط: هل تفهم هذه الروبوتات حقاً العالم ثلاثي الأبعاد، أم أنها مجرد تحفظ الأنماط؟
لمعرفة ذلك، ابتكروا اختباراً يسمى GIQ (اختبار الذكاء الهندسي). فكر في GIQ كأنه "اختبار رخصة قيادة" للروبوتات، ولكن بدلاً من قيادة سيارة، يتعين عليهم فهم الأشكال مثل المكعبات، والأهرامات، والأجسام المعقدة التي تشبه النجوم.
إليك كيف قسمت الورقة البحثية الموضوع، باستخدام بعض التشبيهات من الحياة اليومية:
1. موضوعات الاختبار: "المتعدد الوجوه" (The Polyhedra)
لم يستخدم الباحثون أشياء عشوائية مثل التفاح أو الكراسي، بل استخدموا المتعددات الوجوه—وهي أشكال هندسية مكونة من أوجه مسطحة، مثل أحجار النرد، أو كرات القدم، أو البلورات النجمية المعقدة.
- النطاق: بدأوا بأشكال بسيطة (مثل مكعب مثالي) وانتقلوا إلى أشكال معقدة للغاية (مثل "وحش ميلر"، وهو شكل بـ 124 وجهاً يبدو ككتلة متشابكة من النجوم).
- الإعداد: اختبروا الروبوتات بطريقتين:
- عالم ألعاب الفيديو: صور مثالية مولدة بالحاسوب لهذه الأشكال.
- العالم الحقيقي: قاموا ببناء نماذج ورقية فعلية لهذه الأشكال، وأخذوها إلى الخارج وصوروها في الثلج، وتحت ضوء الشمس، وفي غرف معيشة فوضوية. هذا يشبه اختبار ما إذا كان بإمكان الروبوت التعرف على لعبة في لعبة فيديو وكذلك التعرف على لعبة حقيقية على طاولة مطبخ مغبرة.
2. التحديات الأربعة
أخضع الباحثون الروبوتات لأربعة اختبارات محددة لمعرفة مدى "ذكائهم الهندسي" حقاً.
أ. إعادة البناء بلقطة واحدة (هل يمكنهم البناء من صورة؟)
المهمة: عرض صورة واحدة لشكل ثلاثي الأبعاد على الروبوت وطلب بناء النموذج ثلاثي الأبعاد الكامل منه.
النتيجة: فشل ذريع. حتى أفضل الروبوتات، التي تدربت على ملايين الأجسام ثلاثية الأبعاد، لم تستطع القيام بذلك بشكل صحيح.
- التشبيه: تخيل أنك تري شخصاً صورة لمكعب مثالي وتطلب منه بناءه. بدلاً من صنع مكعب بحواف مستقيمة وزوايا حادة، يقوم الروبوت ببناء كتلة متعرجة وغير متوازنة. لم يستطع حتى الحصول على "الزوايا القائمة" الأساسية للمكعب بشكل صحيح. وعندما أصبحت الأشكال أكثر تعقيداً، انهارت "بناءات" الروبوتات تماماً.
ب. رصد التماثل (هل يمكنهم رؤية النمط؟)
المهمة: عرض شكل على الروبوت وسؤاله: "هل يحتوي هذا الشكل على نقطة مركزية يبدو فيها متماثلاً إذا قمت بقلبه؟" أو "هل لديه دوران رباعي (مثل علامة الزائد/الكروس)؟"
النتيجة: جيدة بشكل مفاجئ.
- التشبيه: بينما كانت الروبوتات سيئة جداً في بناء الأشكال، إلا أنها كانت جيدة جداً في رصد التماثل. الأمر يشبه شخصاً لا يستطيع رسم دائرة مثالية ولكنه يستطيع فوراً إخبارك ما إذا كان الرسم متماثلاً أم لا. وجد الباحثون أن "عيون" الروبوتات (طبقات عقولهم الداخلية) تلتقط هذه الأنماط ثلاثية الأبعاد بشكل طبيعي، حتى دون تعليمها صراحةً للقيام بذلك.
ج. اختبار الدوران الذهني (هل يمكنهم تخيل تدويره؟)
المهمة: عرض صورتين لنفس الشكل على الروبوت، ولكن أحدهما مدور. السؤال هو: "هل هذان نفس الجسم؟"
النتيجة: معاناة.
- التشبيه: هذا يشبه الإمساك بمكعب روبيك في يدك، وتدويره في عقلك، ومعرفة ما إذا كان يطابق مكعباً آخر. ارتبكت الروبوتات بسهولة. عندما كانت الأشكال بسيطة، كان أداؤها جيداً. ولكن عندما أصبحت الأشكال صعبة أو التقطت الصورة في العالم الحقيقي (مع وجود ظلال وزوايا غريبة)، بدأت الروبوتات تخمن عشوائياً.
- المقارنة بالبشر: طلب الباحثون من بشر حقيقيين خوض الاختبار. وبينما طابق أفضل روبوت متوسط درجات البشر، فإن 68% من البشر الفعليين تفوقوا على أفضل روبوت. لم تستطع الروبوتات التعامل مع الاختلافات الدقيقة.
د. لعبة الأسماء (التصنيف بدون معرفة مسبقة)
المهمة: عرض صورة لشكل معقد على الروبوت وسؤاله: "ما هو اسم هذا الشكل؟" (على سبيل المثال: "هل هذا جسم جونسون أم جسم كاتالان؟").
النتيجة: ارتباك وهلوسة.
- التشبيه: تخيل أنك تري روبوتاً لعبة نجمية معقدة وتسأله: "ما هذا؟" قد يقول الروبوت: "إنه نجم!" ولكنه قد يخترع تفاصيل أخرى.
- قد يخلط بين شكل مقعر (الذي ينحني للداخل) وشكل محدب (الذي يبرز للخارج).
- قد يخلط بين شكلين مختلفين ملتصقين معاً (مركب) وبين شكل واحد معقد (تفرع نجمي).
- حتى مساعدي الذكاء الاصطناعي الأكثر ذكاءً (مثل تلك التي تشغل ChatGPT أو Gemini) حصلوا على أقل من 20% من الأشكال المعقدة بشكل صحيح. لقد "هلوسوا" غالباً بخصائص ليست موجودة، مثل اختراع وجه سداسي على شكل يتكون من مثلثات فقط.
3. الخلاصة الكبرى
تخلص الورقة البحثية إلى أنه بينما هذه النماذج مذهلة في التعرف على الأنسجة (مثل "هذا يشبه القطة") أو الأنماط، إلا أنها تفتقر إلى الفهم الهندسي الحقيقي.
- "الغش" مقابل "المهارة": يبدو أن الروبوتات "تغش" عبر حفظ ما تبدو عليه الأشياء من بيانات تدريبها، بدلاً من فهم الرياضيات التي تُبنى بها الأشكال.
- الفجوة: هناك فجوة كبيرة بين مدى جودة أداء هذه النماذج في الاختبارات القياسية وكيفية تعاملها مع الاستنتاج الهندسي الحقيقي. إنهم يشبهون طالباً حفظ الإجابات لاختبار رياضيات، لكنه لا يعرف في الواقع كيفية إجراء العمليات الحسابية.
باختصار: إذا طلبت من هذه الروبوتات بناء منزل بناءً على مخطط، فقد يبنون شيئاً متعرجاً وفاشلاً. ولكن إذا طلبت منهم الإشارة إلى نافذة متماثلة، فقد ينجحون في ذلك. تجادل الورقة بأنه ما لم نقم بإصلاح هذا "العمى الهندسي"، فإن هذه الروبوتات ليست مستعدة حقاً للتنقل في عالمنا ثلاثي الأبعاد المعقد أو فهمه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.