All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding
यह शोध पत्र एक एकीकृत सिंथेटिक डेटा जनरेशन पाइपलाइन का प्रस्ताव करता है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को प्रशिक्षित करने के लिए विविध, मल्टी-टास्क वीडियो एनोटेशन स्वचालित रूप से बनाता है, और यह प्रदर्शित करता है कि मुख्य रूप से इस सिंथेटिक डेटा पर प्रशिक्षित मॉडल ऑब्जेक्ट काउंटिंग, विजुअल क्वेश्चन अनस्विरिंग और सेगमेंटेशन जैसे कार्यों में वास्तविक दुनिया के डेटा पर प्रशिक्षित समकक्षों के प्रति प्रभावी ढंग से सामान्यीकरण कर सकते हैं और अक्सर उनसे बेहतर प्रदर्शन करते हैं।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वीडियो समझना सिखाना चाहते हैं। आप चाहते हैं कि वह किसी दृश्य में लोगों की संख्या गिन सके, "कुत्ता किसका पीछा कर रहा है?" जैसे सवालों के जवाब दे सके, या यहाँ तक कि हर एक फ्रेम में एक चलती हुई कार का सटीक स्थान बता सके।
इसे करने के लिए, आपको आमतौर पर वास्तविक दुनिया के वीडियो के एक विशाल पुस्तकालय की आवश्यकता होती है जिसे मनुष्यों द्वारा सावधानीपूर्वक लेबल किया गया हो। लेकिन समस्या यह है: मानवीय लेबलिंग धीमी, महंगी और उबाऊ है। यह ऐसा है जैसे हजारों घंटों की घरेलू फिल्मों को देखने और हर विवरण को लिखने के लिए लोगों की एक सेना को काम पर रखने की कोशिश करना। इसके अलावा, वास्तविक जीवन अव्यवस्थित है; आपको पार्कों में कुत्तों के बहुत सारे वीडियो मिल सकते हैं लेकिन अंतरिक्ष में कुत्तों के बहुत कम, जिससे रोबोट "अंतरिक्ष" वाले हिस्से को समझने में कमजोर रह सकता है।
यह पेपर एक समाधान पेश करता है जिसे "ऑल इन वन" (All in One) कहा जाता है, जो एक स्मार्ट फैक्ट्री है जो अपना स्वयं का प्रशिक्षण डेटा बनाती है।
मुख्य विचार: "इमेजिनेशन फैक्ट्री" (कल्पना की फैक्ट्री)
वास्तविक वीडियो खोजने और उन्हें लेबल करने के लिए मनुष्यों का इंतजार करने के बजाय, लेखकों ने एक ऐसा पाइपलाइन बनाया है जो एक अकेली फोटो से वीडियो को सपनों की तरह रचता (dream up) है। इसे एक रचनात्मक लेखन कार्यशाला की तरह समझें जिसके पास विचारों की कभी कमी नहीं होती।
यहाँ उनका "फैक्ट्री" चरण-दर-चरण कैसे काम करता है:
- बीज (फोटो): आप केवल एक स्थिर चित्र से शुरुआत करते हैं। शायद यह पिकनिक मनाते हुए एक परिवार की फोटो है।
- कथावाचक (टेक्स्ट): एक सुपर-स्मार्ट AI (जैसे कि एक बहुत ही उन्नत ChatGPT) उस फोटो को देखता है और एक कहानी लिखता है कि आगे क्या हो सकता है। यह सिर्फ यह नहीं कहता कि "वहाँ एक कुत्ता है।" यह कहता है, "कुत्ता एक गेंद का पीछा करता है, बच्चे हंसते हैं, और एक बादल ऊपर से गुजरता है।" यह वीडियो को एक कथानक (प्लॉट) देता है।
- निर्देशक (वीडियो): एक अन्य AI उस फोटो और कहानी को लेता है और उसे एनिमेट करता है। वह स्थिर चित्र को एक चलते हुए वीडियो में बदल देता है जो कहानी से मेल खाता है।
- ध्वनि इंजीनियर (वैकल्पिक ऑडियो): यदि वे चाहें, तो वे वीडियो से मेल खाने वाले साउंड इफेक्ट्स (भोंकना, हंसी, हवा) जोड़ सकते हैं।
- लेबलर (जादू): यह सबसे अच्छा हिस्सा है। क्योंकि AI ने वह वीडियो बनाया है, इसलिए वह जानता है कि उसमें वास्तव में क्या है। यह स्वचालित रूप से लिख देता है:
- "वहाँ 3 लोग हैं।"
- "कुत्ते ने लाल रंग का पट्टा पहना है।"
- "गेंद बाईं से दाईं ओर चली गई।"
- यह हर फ्रेम में हर वस्तु के चारों ओर अदृश्य रूपरेखा (outlines) भी खींच देता है।
यह "ऑल इन वन" क्यों है?
आमतौर पर, यदि आप किसी रोबोट को गिनना सिखाना चाहते हैं, तो आपको एक डेटासेट चाहिए। यदि आप चाहते हैं कि वह सवालों के जवाब दे, तो आपको दूसरा चाहिए। यदि आप चाहते हैं कि वह वस्तुओं को ट्रैक करे, तो आपको तीसरा चाहिए।
यह पाइपलाइन एक स्विस आर्मी नाइफ (Swiss Army Knife) की तरह है। यह एक फोटो लेता है और एक पूरा पैकेज निकाल कर देता: एक वीडियो, एक कहानी, वस्तुओं की गिनती, और सवाल-जवाब का एक सेट—जो सब कुछ पूरी तरह से सिंक्रोनाइज़्ड है। यह प्रशिक्षण डेटा के लिए एक "वन-स्टॉप शॉप" है।
गुप्त मंत्र: केवल पढ़ना नहीं, बल्कि पूछना
लेखकों ने गौर किया कि अधिकांश रोबोट केवल कैप्शन (जैसे, "कुत्ता दौड़ता है") पढ़कर प्रशिक्षित होते हैं। यह रोबोट को आलसी बनाता है; वह बिना वास्तव में देखे केवल शब्दों को रट लेता है।
इसके बजाय, उन्होंने अपने रोबोट्स को विजुअल क्वेश्चन अनसरिंग (VQA) का उपयोग करके प्रशिक्षित किया।
- पुराना तरीका: "यहाँ एक कुत्ते का वीडियो है। कैप्शन है 'कुत्ता दौड़ता है'।"
- नया तरीका: "यहाँ एक वीडियो है। प्रश्न: कुत्ते के कितने पैर हैं? उत्तर: चार। प्रश्न: क्या कुत्ता पेड़ की ओर दौड़ रहा है या उससे दूर? उत्तर: उसकी ओर।"
यह रोबोट को केवल अनुमान लगाने के बजाय वास्तव में वीडियो को देखने और सोचने के लिए मजबूर करता है। यह एक मानचित्र को रटने और वास्तव में उस इलाके में नेविगेट करने के बीच का अंतर है।
परिणाम: क्या नकली डेटा काम करता है?
आप सोच सकते हैं, "यदि वीडियो नकली है, तो क्या रोबोट वास्तविक जीवन देखते समय भ्रमित नहीं हो जाएगा?"
लेखकों ने इसका परीक्षण किया। उन्होंने अपने रोबोट को लगभग पूरी तरह से इन "सपनों में रचे गए" वीडियो पर प्रशिक्षित किया। फिर, उन्होंने उसे वास्तविक दुनिया के परीक्षणों में डाला (जैसे व्यस्त सड़क में लोगों को गिनना या वास्तविक वीडियो के बारे में सवालों के जवाब देना)।
रोबोट ने केवल पास ही नहीं किया; उसने परीक्षा में उत्कृष्ट प्रदर्शन किया।
उसने उन रोबोटों से बेहतर प्रदर्शन किया जिन्हें महंगे, वास्तविक दुनिया के डेटा पर प्रशिक्षित किया गया था। क्यों? क्योंकि "नकली" डेटा पूरी तरह से विविध (diverse) था। फैक्ट्री 10,000 अंतरिक्ष में बिल्लियों के वीडियो, 10,000 बारिश में चलती कारों के वीडियो, और 10,000 नाचते हुए लोगों के वीडियो बना सकती थी, और उन सबके पास सटीक लेबल थे। रोबोट ने दुनिया के काम करने के नियमों को सीखा, न कि केवल उन विशिष्ट उदाहरणों को जो उसने देखे थे।
बड़ी तस्वीर
यह पेपर यह साबित करता है कि हमें AI को सिखाने के लिए पूरी तरह से महंगे मानवीय श्रम पर निर्भर रहने की आवश्यकता नहीं है। एक ऐसी "फैक्ट्री" बनाकर जो अपने स्वयं के उच्च-गुणवत्ता वाले, लेबल किए गए और विविध सिंथेटिक वीडियो उत्पन्न करती है, हम अधिक स्मार्ट, अधिक सक्षम वीडियो-समझने वाले रोबोटों को तेजी से और सस्ते में प्रशिक्षित कर सकते हैं।
यह एक बच्चे को गाड़ी चलाना सिखाने जैसा है। केवल एक विशिष्ट सड़क (वास्तविक डेटा) पर उन्हें चलाने देने के बजाय, आप उन्हें एक आदर्श ड्राइविंग सिम्युलेटर (सिंथेटिक डेटा) में रखते हैं जहाँ वे बर्फ, बारिश और ट्रैफिक जाम में लाखों बार अभ्यास कर सकते हैं। जब वे अंततः वास्तविक सड़क पर आते हैं, तो वे किसी भी चीज़ के लिए तैयार होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।