NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models
यह शोधपत्र NextMotionQA प्रस्तुत करता है, जो विजन-लैंग्वेज मॉडल्स में मानव गति की समझ का कठोरता से आकलन करने के लिए विभिन्न जटिलता स्तरों में मल्टी-टास्क मूल्यांकन वाला एक व्यापक बेंचमार्क है, जो महत्वपूर्ण क्षमता अंतराल को प्रकट करता है और सूक्ष्म गति विश्लेषण के लिए जज के रूप में VLMs के उपयोग की सीमाओं को परिभाषित करता है।