FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
यह शोधपत्र FineBench प्रस्तुत करता है, जो लंबे वीडियो पर सघन एनोटेशन के साथ एक बड़े पैमाने का सूक्ष्म-स्तरीय (fine-grained) मानव गतिविधि बेंचमार्क है, और FineAgent का प्रस्ताव करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो ओपन-सोर्स विजन-लैंग्वेज मॉडल्स की स्थानिक तर्क (spatial reasoning) और क्रिया समझ (action understanding) क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।