Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video
यह शोध पत्र यह प्रकट करता है कि वर्तमान Video-LLMs लंबे वीडियो में विशिष्ट पात्रों को वास्तविक रूप से ट्रैक करने में काफी हद तक विफल रहते हैं, इसके बजाय वे सतही लैंगिक संकेतों पर निर्भर रहते हैं और समान लिंग वाले व्यक्तियों के बीच अंतर करने में विफल रहते हैं, जिसके कारण बेंचमार्क स्कोर उनकी वास्तविक टेम्पोरल रीजनिंग और पहचान-ट्रैकिंग क्षमताओं को बढ़ा-चढ़ाकर दिखाते हैं।