Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
यह शोध पत्र VG-GUIBench प्रस्तुत करता है, जो वीडियो ट्यूटोरियल का पालन करने की MLLM-आधारित GUI एजेंटों की क्षमता का मूल्यांकन करने के लिए एक नया बेंचमार्क है, और TASKER का प्रस्ताव करता है, जो एक टास्क-ड्रिवन और सीन-अवेयर कीफ्रेम एक्सट्रैक्शन एल्गोरिदम है जो VideoQA और वीडियो-गाइडेड एजेंटिक कार्यों दोनों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।