Time Blindness: Why Video-Language Models Can't See What Humans Can?
यह शोधपत्र स्पूकीबेंच (SpookyBench) प्रस्तुत करता है, जो यह प्रदर्शित करता है कि अत्याधुनिक वीडियो-भाषा मॉडल उन पैटर्नों को पहचानने में विफल रहते हैं जो केवल शोर जैसे फ्रेमों के टेम्पोरल अनुक्रमों (temporal sequences) में एनकोड किए गए होते हैं जहाँ मनुष्य उत्कृष्ट प्रदर्शन करते हैं, जो स्थानिक विशेषताओं (spatial features) पर अत्यधिक निर्भरता और शुद्ध टेम्पोरल सूचना को संसाधित करने की मौलिक अक्षमता को प्रकट करता है।