From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models
यह शोध पत्र एगोसेंट्रिक एक्शन रिकग्निशन (egocentric action recognition) के लिए एक नवीन ढांचे का प्रस्ताव करता है जो वीडियो को टेम्पोरल एक्शन ग्राफ्स (Temporal Action Graphs) में परिवर्तित करके विजुअल परसेप्शन को सिम्बोलिक रीजनिंग से अलग करता है, और यह प्रदर्शित करता है कि स्ट्रक्चर्ड ग्राफ रिप्रेजेंटेशन पर इन-कॉन्टेक्स्ट लर्निंग के माध्यम से विजन-लैंग्वेज मॉडल्स को सिम्बोलिक रीज़नर के रूप में उपयोग करना विविध मॉडल परिवारों में प्रत्यक्ष पिक्सेल-आधारित अनुमान की तुलना में काफी बेहतर प्रदर्शन करता है।