VideoSEMA: a scalable and efficient Mamba-like attention for video understanding
यह शोध पत्र VideoSEMA को प्रस्तुत करता है, जो एक स्केलेबल और कुशल वीडियो वर्गीकरण मॉडल है जो सॉफ्टमैक्स टेम्पोरल अटेंशन के साथ एक मांबा-जैसे (Mamba-like) स्प्लिट स्पेस-टाइम अटेंशन मैकेनिज्म को जोड़ता है, जो K400 और SSv2 बेंचमार्क पर मौजूदा विजन ट्रांसफॉर्मर और मांबा मॉडलों की तुलना में बेहतर सटीकता और रिज़ॉल्यूशन मजबूती प्रदर्शित करता है।