Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?
تقدم هذه الورقة VLATIM، وهو معيار مرجعي قائم على لعبة *The Incredible Machine 2* يكشف عن فجوة كبيرة بين قدرات التخطيط رفيعة المستوى والربط البصري الدقيق للنماذج اللغوية الرؤية الحالية، مما يثبت أنها لم تحقق بعد قدرات حل المشكلات المنطقية الشبيهة بالبشر في بيئات الألغاز التفاعلية القائمة على النقر والتشير.