Multimodal Language Models Cannot Spot Spatial Inconsistencies
यह शोध पत्र स्थानिक रूप से असंगत (spatially inconsistent) छवि युग्मों को उत्पन्न करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में 3D मोशन निरंतरता का मूल्यांकन करने के लिए एक नवीन बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल मनुष्यों की तुलना में काफी खराब प्रदर्शन करते हैं और उनमें 3D भौतिक संरचना की मजबूत समझ का अभाव है।