← नवीनतम पेपर
💻 computer science

Label-Efficient Transfer Learning for Human Action Recognition Using Pretrained VideoMAE

यह अध्ययन प्रदर्शित करता है कि एक फ्रोजन प्रीट्रेंड VideoMAE एनकोडर को एक लाइटवेट लीनियर क्लासिफायर के साथ संयोजित करने से अत्यधिक लेबल-कुशल मानव क्रिया पहचान सक्षम होती है, जो न्यूनतम एनोटेशन के साथ UCF101 और HMDB51 बेंचमार्क पर मजबूत प्रदर्शन प्राप्त करते हुए स्थिर अनुकूलन और निरंतर कम्प्यूटेशनल संसाधन उपयोग बनाए रखती है।

मूल लेखक: Nousheen Taj

प्रकाशित 2026-09-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nousheen Taj

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कंप्यूटर विज़न की दुनिया में, मशीनों को मानव गति को समझने के लिए सिखाना लंबे समय से एक अत्यंत जटिल पहेली रहा है। दशकों से, शोधकर्ता ऐसे सिस्टम बनाने की कोशिश कर रहे हैं कि वे एक वीडियो देख सकें और पहचान सकें कि व्यक्ति क्या कर रहा है, चाहे वह टेनिस सर्व हो, हाथ मिलाना हो या गिरना। शुरुआती प्रयास हस्त-निर्मित नियमों (hand-crafted rules) पर निर्भर थे, जहाँ इंजीनियरों ने मैन्युअल रूप से परिभाषित किया था कि गति कैसी दिखती है, लेकिन ये सिस्टम अक्सर विफल हो जाते थे जब कैमरा एंगल बदल जाता था या बैकग्राउंड में भीड़भाड़ हो जाती थी। क्षेत्र तब बदल गया जब डीप लर्निंग का आगमन हुआ, जिससे कंप्यूटर को कच्चे वीडियो डेटा से सीधे इन पैटर्न को सीखने की अनुमति मिली। हालाँकि, इस नए दृष्टिकोण के साथ एक भारी कीमत भी आई: इसके लिए लेबल किए गए वीडियो की विशाल मात्रा की आवश्यकता थी, जहाँ मनुष्यों ने घंटों के फुटेज को बड़ी मेहनत से देखा और हर क्रिया को टैग किया। यह प्रक्रिया धीमी, महंगी और अक्सर उन विशेष कार्यों के लिए असंभव होती है जहाँ विशेषज्ञ दुर्लभ होते हैं। इसे हल करने के लिए, वैज्ञानिक सेल्फ-सुपरवाइज्ड लर्निंग (self-supervised learning) की ओर मुड़े, जो एक ऐसी विधि है जहाँ कंप्यूटर बिना मानवीय सहायता के, चित्र के छूटे हुए हिस्सों की भविष्यवाणी करने की कोशिश करके, अनलेबल वीडियो के विशाल महासागरों से सीखता है, जिससे वह प्रभावी रूप से गति की संरचना को स्वयं ही सीख लेता है। प्रश्न जो बना हुआ है वह यह है कि क्या ये स्व-शिक्षित सिस्टम वास्तव में वास्तविक दुनिया के लिए तैयार हैं, जहाँ लेबल किया गया डेटा अक्सर सीमित होता है, या क्या उन्हें सही ढंग से काम करने के लिए अभी भी मानवीय पर्यवेक्षण के भारी हाथ की आवश्यकता है।

भारत के सिद्धगंगा संस्थान ऑफ टेक्नोलॉजी के एक शोधकर्ता ने इस प्रश्न का उत्तर देने के लिए एक विशिष्ट प्रकार के सेल्फ-सुपरवाइज्ड मॉडल, जिसे 'वीडियोएमएई' (VideoMAE) कहा जाता है, का परीक्षण करके एक लक्ष्य निर्धारित किया। कल्पना कीजिए कि एक छात्र जिसने लाइब्रेरी की हर किताब पढ़ ली है लेकिन उसने कभी कोई परीक्षा नहीं दी है; शोधकर्ता यह देखना चाहते थे कि यदि उस छात्र को अध्ययन के लिए केवल कुछ नमूना उत्तर दिए जाएं, तो वह परीक्षा के प्रश्नों का उत्तर कितनी अच्छी तरह दे सकता है। अपने अध्ययन में, उन्होंने एक प्री-ट्रेंड वीडियोएमएई मॉडल का उपयोग किया, जिसने पहले से ही हजारों अनलेबल क्लिप्स के मास्क किए गए (masked-out) हिस्सों को पुनर्गठित करके वीडियो को समझना सीख लिया था। उन्होंने इस मॉडल के 'मस्तिष्क' को फ्रीज कर दिया ताकि यह कुछ भी नया न सीख सके, और इसके ऊपर एक सरल, हल्का क्लासिफायर लगा दिया। इस सेटअप ने उन्हें विभिन्न मात्रा में लेबल किए गए प्रशिक्षण डेटा को फीड करके मानव क्रिया की कच्ची समझ का परीक्षण करने की अनुमति दी, जो बहुत छोटे अंश से लेकर पूरे डेटासेट तक फैला हुआ था। उन्होंने मानव क्रिया पहचान के दो प्रसिद्ध बेंचमार्क पर इस दृष्टिकोण का परीक्षण किया: UCF101, जिसमें खेलों और दैनिक गतिविधियों का एक विविध सेट है, और HMDB51, जो फिल्मों और सार्वजनिक डेटाबेस का एक अधिक कठिन संग्रह है जिसमें जटिल कैमरा मूवमेंट और विविध बैकग्राउंड शामिल हैं।

परिणामों ने इन उन्नत मॉडलों का उपयोग करने के लिए एक स्पष्ट और व्यावहारिक मार्ग प्रकट किया। जब शोधकर्ता ने सिस्टम को उपलब्ध लेबल किए गए डेटा का केवल दस प्रतिशत दिया, तो इसने उल्लेखनीय सटीकता के साथ क्रियाओं की पहचान की। UCF101 डेटासेट पर, मॉडल ने लेबल किए गए उदाहरणों के उस छोटे से हिस्से के साथ लगभग अस्सी-आठ प्रतिशत की पहचान दर हासिल की। जैसे-जैसे उन्होंने लेबल किए गए डेटा की मात्रा को पच्चीस प्रतिशत और फिर पचास प्रतिशत तक बढ़ाया, सटीकता लगातार बढ़ती गई, और पूर्ण डेटासेट का उपयोग करने पर नब्बे प्रतिशत से अधिक पहुँच गई। सबसे महत्वपूर्ण निष्कर्ष, हालांकि, यह नहीं था कि मॉडल कम डेटा के साथ काम करता है, बल्कि यह था कि अधिक डेटा जोड़ने के लाभ तेजी से कम होने लगे। एक बार जब सिस्टम के पास आधे लेबल किए गए प्रशिक्षण नमूने उपलब्ध हो गए, तो शेष आधे हिस्से को जोड़ने से प्रदर्शन में बहुत मामूली सुधार हुआ। यह सुझाव देता है कि सेल्फ-सुपरवाइज्ड प्री-ट्रेनिंग ने पहले ही मानव गति को समझने के लिए आवश्यक अधिकांश दृश्य और टेम्पोरल (temporal) जानकारी को कैप्चर कर लिया था, जिससे साधारण क्लासिफायर को विशिष्ट कार्य के अनुकूल होने के लिए बहुत कम काम करना पड़ा।

जब शोधकर्ता ने अधिक कठिन HMDB51 डेटासेट का परीक्षण किया, तो कहानी थोड़ी अलग, लेकिन समान रूप से प्रकट करने वाली थी। क्योंकि ये वीडियो अधिक अव्यवस्थित थे, जिनमें हिलते हुए कैमरे और जटिल बैकग्राउंड थे, मॉडल केवल दस प्रतिशत लेबल का उपयोग करके लगभग बावन प्रतिशत की निम्न सटीकता के साथ शुरू हुआ। हालाँकि, जैसे-जैसे उन्होंने अधिक लेबल किया गया डेटा जोड़ा, सिस्टम में आसान डेटासेट की तुलना में बहुत अधिक नाटकीय सुधार हुआ, और अंततः पूर्ण पर्यवेक्षण के साथ साठ प्रतिशत से अधिक की सटीकता तक पहुँच गया। इससे संकेत मिला कि हालांकि सेल्फ-सुपरवाइज्ड आधार मजबूत था, लेकिन वास्तविक दुनिया का वातावरण जितना अधिक अराजक और जटिल होगा, कुछ अतिरिक्त लेबल किए गए उदाहरण उतने ही मूल्यवान होते जाएंगे। फिर भी, सिस्टम ने केवल आधे डेटा के साथ उच्च स्तर का प्रदर्शन किया, जिससे सिद्ध हुआ कि स्व-शिक्षित मॉडल ने क्रिया का एक मजबूत प्रतिनिधित्व सीखा था जो बिना किसी पूर्ण मैनुअल गाइड के, काफी दृश्य विविधता को संभाल सकता था।

अंतिम स्कोर के अलावा, शोधकर्ता ने इस बात पर भी बारीकी से नज़र डाली कि सिस्टम कैसे सीखता है और वह किन संसाधनों का उपभोग करता है। उन्होंने पाया कि प्रशिक्षण प्रक्रिया सभी स्तरों के पर्यवेक्षण में स्थिर और अनुमानित थी, और मॉडल बिना किसी अनियमित व्यवहार के सुचारू रूप से कन्वर्ज (converge) हुआ। कंप्यूटिंग शक्ति के मामले में, यह दृष्टिकोण अत्यधिक कुशल था। चूंकि मॉडल का मुख्य भाग फ्रीज था और केवल ऊपरी छोटी परत को प्रशिक्षित किया जा रहा था, इसलिए आवश्यक कंप्यूटर मेमोरी की मात्रा लगभग स्थिर रही, चाहे कितना भी लेबल किया गया डेटा उपयोग किया गया हो। प्रशिक्षण में लगने वाला समय अधिक डेटा के साथ बढ़ता गया, क्योंकि कंप्यूटर को अधिक उदाहरणों को प्रोसेस करना पड़ता था, लेकिन मेमोरी फुटप्रिंट नहीं बढ़ा। इसका अर्थ है कि यह विधि स्केलेबल है और इसे बड़े डेटासेट को संभालने के लिए महंगे हार्डवेयर अपग्रेड की मांग नहीं करती है। अध्ययन में यह भी जांचा गया कि मॉडल किन क्रियाओं को गलत पहचानता है, जिसमें पाया गया कि त्रुटियां मुख्य रूप से दृष्टिगत रूप से समान गतिविधियों में केंद्रित थीं, जो मानव गति के सूक्ष्म अंतरों के बीच अंतर करने की एक स्वाभाविक सीमा है।

अंततः, यह कार्य प्रदर्शित करता है कि प्रत्येक नए अनुप्रयोग के लिए विशाल, पूरी तरह से लेबल किए गए वीडियो डेटासेट की आवश्यकता का युग समाप्त होने की कगार पर है। शोधकर्ता ने दिखाया कि अनलेबल वीडियो पर प्रशिक्षित मॉडल मानव क्रियाओं को पहचानने के लिए एक शक्तिशाली आधार के रूप में कार्य कर सकता है, जिसे उच्च प्रदर्शन प्राप्त करने के लिए केवल लेबलिंग के एक छोटे से अंश की आवश्यकता होती है। निष्कर्ष बताते हैं कि कई व्यावहारिक अनुप्रयोगों के लिए, जैसे कि कारखानों में सुरक्षा की निगरानी करना या खेल तकनीकों का विश्लेषण करना, संगठन इन प्री-ट्रेन्ड सिस्टम पर भरोसा कर सकते हैं ताकि वे हर एक वीडियो फ्रेम को एनोटेट करने की अत्यधिक लागत के बिना सटीक परिणाम दे सकें। भले ही सबसे कठिन डेटासेट को अतिरिक्त लेबल किए गए उदाहरणों से लाभ होता है, लेकिन मूल क्षमता पहले से ही सेल्फ-सुपरवाइज्ड मॉडल में मौजूद है, जो वास्तविक दुनिया में बुद्धिमान वीडियो समझ लाने के लिए एक व्यावहारिक और संसाधन-कुशल समाधान प्रदान करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →