← नवीनतम पेपर
🤖 machine learning

VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

विज़न-लैंग्वेज मॉडल्स के लिए एक्शन रिकग्निशन मूल्यांकन में गिरावट को संबोधित करने हेतु, यह शोध पत्र 'वीडियोनेट' (VideoNet) पेश करता है, जो 1,000 डोमेन-विशिष्ट क्रियाओं और एक संगत 500k वीडियो QA प्रशिक्षण डेटासेट वाला एक बड़े पैमाने का बेंचमार्क है, जो यह प्रदर्शित करता है कि इस डेटा पर फाइन-ट्यूनिंग करने से छोटे मॉडल्स जटिल, डोमेन-विशिष्ट क्रियाओं को पहचानने में बड़े ओपन-वेट समकक्षों से आगे निकल सकते हैं।

मूल लेखक: Tanush Yadav, Mohammadreza Salehi, Jae Sung Park, Vivek Ramanujan, Hannaneh Hajishirzi, Yejin Choi, Ali Farhadi, Rohun Tripathi, Ranjay Krishna

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanush Yadav, Mohammadreza Salehi, Jae Sung Park, Vivek Ramanujan, Hannaneh Hajishirzi, Yejin Choi, Ali Farhadi, Rohun Tripathi, Ranjay Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो किताबें पढ़ सकता है, कविता लिख सकता है और लगभग किसी भी विषय पर बातचीत कर सकता है। आप सोच सकते हैं, "शानदार! यह शायद एक वीडियो देख सकता है और मुझे ठीक-ठीक बता सकता है कि उसमें क्या हो रहा है, है ना?"

VideoNet नामक शोध पत्र कहता है: "इतना जल्दी नहीं।"

जबकि ये रोबोट (जिन्हें विजन-लैंग्वेज मॉडल्स कहा जाता है) सामान्य कार्यों में अद्भुत हैं, वे विशिष्ट, वास्तविक दुनिया के कार्यों को पहचानने में आश्चर्यजनक रूप से खराब हैं जिनमें विशेषज्ञ ज्ञान की आवश्यकता होती है। इसे साबित करने और ठीक करने के लिए, शोधकर्ताओं ने रोबोटों के लिए एक नया "जिम" बनाया जिसे VideoNet कहा गया।

यहाँ उनकी कहानी दी गई है, जिसे सरल भाषा में समझाया गया है:

1. समस्या: रोबोट एक जनरललिस्ट है, स्पेशलिस्ट नहीं

वर्तमान AI मॉडल्स को एक बहुत ही पढ़े-लिखे हाई स्कूल के छात्र की तरह समझें। वे हर चीज़ के बारे में थोड़ा-बहुत जानते हैं। यदि आप उन्हें बास्केटबॉल खेलते हुए किसी का वीडियो दिखाते हैं, तो वे बता सकते हैं, "यह बास्केटबॉल है।"

लेकिन यदि आप उनसे "टोमाहॉक डंक" (Tomahawk Dunk) और "एली-ऊप डंक" (Alley-Oop Dunk) के बीच अंतर करने के लिए कहें, या फिगर स्केटिंग में "ट्रिपल एक्सल" (Triple Axel) और "ट्रिपल लुट्ज़" (Triple Lutz) के बीच अंतर बताने के लिए कहें, तो वे भ्रमित हो जाते हैं। वे अनुमान लगा सकते हैं, लेकिन अक्सर गलत होते हैं।

शोधकर्ताओं ने पाया कि क्योंकि इन विशिष्ट, कठिन मूव्स को दिखाने वाले बड़े, विविध वीडियो संग्रह की कमी थी, इसलिए रोबोटों ने वास्तव में इनका अभ्यास नहीं किया था। वे एक ऐसे शेफ की तरह थे जो बुनियादी ऑमलेट बनाना तो जानता है लेकिन उसने कभी सूफ़ले (soufflé) नहीं देखा है।

2. समाधान: "VideoNet" बनाना (अल्टीमेट ट्रिविया क्विज़)

रोबोटों को टेस्ट करने के लिए, टीम ने VideoNet बनाया।

  • पैमाना (Scale): यह एक विशाल लाइब्रेरी है जिसमें 37 अलग-अलग दुनियाओं (डोमेन) में 1,000 अलग-अलग क्रियाएं शामिल हैं।
  • दुनिया: ये परिचित (खाना बनाना, खेल, नृत्य) से लेकर बहुत विशिष्ट (पेन स्पिनिंग, न्यूरोलॉजिकल परीक्षण, क्रोशिया और यहाँ तक कि सिलाई/Suturing) तक फैली हुई हैं।
  • कठिनाई: उन्होंने केवल रैंडम वीडियो नहीं उठाए। उन्होंने "हार्ड नेगेटिव्स" (Hard Negatives) बनाए।
    • उपमा: कल्पना करें कि एक क्विज़ है जहाँ सवाल है "यह क्या है?" और विकल्प हैं "एक गोल्डन रिट्रीवर" और "एक छोटा सा टोपी पहने हुए गोल्डन रिट्रीवर।" यह कठिन है। VideoNet वैसा ही है। उन्होंने ऐसे वीडियो खोजे जहाँ क्रियाएं अनट्रेंड आँखों के लिए लगभग एक जैसी दिखती हैं, जिससे AI को सूक्ष्म विवरणों पर ध्यान देने के लिए मजबूर होना पड़ता है।

3. टेस्ट: रोबोट बनाम इंसान

शोधकर्ताओं ने सबसे अच्छे AI रोबोट्स (जैसे Gemini और GPT) को VideoNet का उपयोग करके एक टेस्ट में डाला।

  • परिणाम: रोबोटों को संघर्ष करना पड़ा। सबसे स्मार्ट वाले भी एक मल्टीपल-चॉइस टेस्ट में केवल लगभग 70% सही थे। यह ठीक लग सकता है, लेकिन एक सुपर-इंटेलिजेंट रोबोट के लिए, यह एक फेल ग्रेड है।
  • "फ्यू-शॉट" (Few-Shot) टेस्ट: उन्होंने रोबोटों को कुछ उदाहरण दिखाकर मदद करने की कोशिश की (जैसे किसी छात्र को वास्तविक टेस्ट से पहले एक प्रैक्टिस प्रॉब्लम दिखाना)।
    • ट्विस्ट: इंसानों ने उदाहरण दिखाए जाने पर कार्य में बहुत बेहतर प्रदर्शन किया। रोबोट? वे शायद ही सुधरे, और कुछ तो वास्तव में और भी खराब हो गए। ऐसा लग रहा था जैसे रोबोट उदाहरणों से सीखने के बजाय भ्रमित हो गए थे। वे उस तरह से "डॉट्स कनेक्ट" नहीं कर सके जैसे इंसान करते हैं।

4. समाधान: शून्य से रोबोट को सिखाना

शोधकर्ताओं को एहसास हुआ कि रोबोट इसलिए विफल नहीं हो रहे थे क्योंकि वे "मूर्ख" थे; वे इसलिए विफल हो रहे थे क्योंकि वे इन विशिष्ट क्षेत्रों में अनट्रेंड थे।

  • ट्रेनिंग डेटा: उन्होंने लगभग 5,00,000 वीडियो क्लिप्स का एक बड़ा ट्रेनिंग डेटासेट बनाया। उन्होंने एक चालाक ट्रिक का उपयोग किया: हर वीडियो को लेबल करने के लिए हजारों विशेषज्ञों को काम पर रखने के बजाय (जो बहुत महंगा है), उन्होंने AI का उपयोग किया ताकि उन वीडियो को खोजा जा सके जहाँ क्रिया का उल्लेख शीर्षक में या बोले गए शब्दों (ट्रांसक्रिप्ट) में किया गया था।
  • परिणाम: उन्होंने एक छोटे रोबोट (एक 4-बिलियन पैरामीटर मॉडल) को लिया और उसे इस नए डेटा का उपयोग करके सिखाया।
    • जादू: इस ट्रेनिंग के बाद, यह छोटा रोबोट इन विशिष्ट क्रियाओं को पहचानने में बड़े, अनट्रेंड रोबोट्स (8-बिलियन पैरामीटर मॉडल्स) से बेहतर बन गया। यह एक समर्पित प्रशिक्षु (apprentice) की तरह है जिसने वर्षों तक एक विशिष्ट शिल्प का अभ्यास किया है और उस जनरललिस्ट जीनियस को हरा देता है जिसने कभी औजारों को छुआ तक नहीं।

5. मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि AI को वास्तव में वास्तविक दुनिया को समझने के लिए, हम केवल इस बात पर निर्भर नहीं रह सकते कि वे सवाल पूछने पर इसे "खुद समझ लेंगे"। हमें उन्हें उन विशिष्ट कार्यों के लिए विशिष्ट, उच्च-गुणवत्ता वाला ट्रेनिंग डेटा देना होगा।

  • वर्तमान स्थिति: AI एक ऐसे पर्यटक की तरह है जो प्रसिद्ध लैंडमार्क को पहचान सकता है लेकिन उसे नहीं पता कि नल कैसे ठीक किया जाए या कोई विशिष्ट डांस मूव कैसे किया जाए।
  • VideoNet का योगदान: यह उस पर्यटक को एक कुशल स्थानीय विशेषज्ञ में बदलने के लिए मैप और अभ्यास ड्रिल प्रदान करता है।

संक्षेप में: इस पेपर ने यह दिखाने के लिए एक विशाल, कठिन टेस्ट बनाया कि AI विशिष्ट वास्तविक दुनिया के कौशल में बुरा है, और फिर एक ट्रेनिंग मैनुअल बनाया जिसने एक छोटे AI को बड़े वाले को हराने के लिए सिखाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →