BRIDLE: Generalized Self-supervised Learning with Quantization
BRIDLE एक सामान्यीकृत स्व-पर्यवेक्षित शिक्षण (self-supervised learning) ढांचा है जो ऑडियो, इमेज और वीडियो मोडैलिटीज में पदानुक्रमित अवशिष्ट परिमाणीकरण (hierarchical residual quantization) को एक द्विदिशीय प्रशिक्षण प्रक्रिया में एकीकृत करके प्रतिनिधित्व की गुणवत्ता को बढ़ाता है, जिससे एकल-कोडबुक वेक्टर परिमाणीकरण की सीमाओं को दूर किया जा सकता है और विभिन्न डाउनस्ट्रीम कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक आर्टिफिशियल इंटेलिजेंस की दुनिया में, मशीनें पैटर्न पहचानने में असाधारण रूप से कुशल होती जा रही हैं, लेकिन उन्हें सीखने के लिए अक्सर बड़ी मात्रा में मानव-लेबल वाले उदाहरणों की आवश्यकता होती है। कल्पना कीजिए कि आप एक बच्चे को जानवरों की पहचान करना सिखाने की कोशिश कर रहे हैं और उसे हजारों तस्वीरें दिखा रहे हैं, जिनमें से प्रत्येक को एक धैर्यवान शिक्षक द्वारा जानवर के नाम के साथ सावधानीपूर्वक टैग किया गया है। हालांकि यह काम करता है, लेकिन यह धीमा, महंगा है और यह उस चीज़ को सीमित करता है जो मशीन सीख सकती है क्योंकि वह मानवीय मदद का इंतजार करने में फंसी रहती है। एक अधिक शक्तिशाली दृष्टिकोण, जिसे 'सेल्फ-सुपरवाइज्ड लर्निंग' (स्व-पर्यवेक्षित शिक्षण) के रूप में जाना जाता है, मशीनों को दिए गए कच्चे डेटा का अध्ययन करके खुद को सिखाने की अनुमति देता है, बिना किसी के उत्तर लिखे जाने की प्रतीक्षा किए, छिपी हुई संरचनाओं और कनेक्शनों की तलाश करता है। इस पद्धति ने पहले ही यह बदल दिया है कि कंप्यूटर भाषा को कैसे समझते हैं, जिससे उन्हें अरबों किताबें पढ़कर और गायब शब्दों का अनुमान लगाकर वाक्यों के गहरे अर्थ को समझने की अनुमति मिली है। अब, शोधकर्ता इसी तरह की स्व-शिक्षण शक्ति को ध्वनि, चित्र और वीडियो की दुनिया में लाने की कोशिश कर रहे हैं, इस उम्मीद में कि वे ऐसे सिस्टम बना सकें जो शब्दों को समझने की तरह स्वाभाविक रूप से दृश्य और श्रव्य दुनिया को समझ सकें।
ध्वनि और वीडियो पर इन स्व-शिक्षण विधियों को लागू करने की चुनौती यह है कि ये संकेत निरंतर और जटिल होते हैं, जो एक वाक्य के अलग-अलग शब्दों के विपरीत हैं। इन्हें कंप्यूटर के लिए संसाधित करना आसान बनाने के लिए, शोधकर्ता अक्सर इन्हें छोटे, विशिष्ट टुकड़ों में तोड़ देते हैं, ठीक वैसे ही जैसे पानी की एक चिकनी धारा को बूंदों की एक श्रृंखला में बदलना। इसके लिए एक लोकप्रिय तरीका एक "टोकनाइज़र" (tokenizer) का उपयोग करना है, जो एक अनुवादक के रूप में कार्य करता है, और कच्चे संकेत को इन डिस्क्रीट टोकन की एक श्रृंखला में परिवर्तित करता है। कुछ समय के लिए, सबसे सफल सिस्टम ने एक सरल अनुवादक का उपयोग किया जिसने सिग्नल के एक हिस्से का प्रतिनिधित्व करने के लिए विकल्पों की एक निश्चित सूची से एक एकल टोकन चुना। हालांकि, इस दृष्टिकोण की एक सीमा है: यह कंप्यूटर को एक सपाट सूची से केवल एक विकल्प चुनने के लिए मजबूर करता है, जो उन सूक्ष्म, स्तरित विवरणों को छोड़ सकता है जो एक जटिल ध्वनि या चलते हुए चित्र को बनाते हैं। यह एक जटिल पेंटिंग का वर्णन करने के लिए केवल एक रंग चुनने जैसा है, बजाय इसके कि गहराई और बनावट को पकड़ने के लिए कई रंगों को मिलाया जाए।
फ्लोरिडा स्टेट यूनिवर्सिटी और मेटा प्लेटफॉर्म्स इंक. के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए BRIDLE नामक एक नया सिस्टम विकसित किया है। उनका काम इन स्व-शिक्षण प्रणालियों में उपयोग किए जाने वाले अनुवादक, या टोकनाइज़र, को बेहतर बनाने पर केंद्रित है। एक एकल, सपाट टोकन सूची पर निर्भर रहने के बजाय, उन्होंने एक पदानुक्रमित (hierarchical) प्रणाली पेश की है जो चरणों में काम करती है। कल्पना कीजिए कि आप किसी स्थान का वर्णन केवल फोन बुक से एक पता चुनकर नहीं, बल्कि पहले देश, फिर राज्य, फिर शहर और अंत में सड़क की पहचान करके कर रहे हैं। प्रत्येक चरण विवरण की एक परत जोड़ता है। BRIDLE सिस्टम में, कंप्यूटर ध्वनि या चित्र को अवशेषों (residuals), या शेष विवरणों की एक श्रृंखला में तोड़ता है और प्रत्येक परत का वर्णन करने के लिए कोडबुक की एक श्रृंखला का उपयोग करता है। पहला चरण व्यापक, सामान्य विशेषताओं को पकड़ता है, जबकि बाद के चरण सूक्ष्म, अधिक विशिष्ट विवरणों को भरते हैं। इन परतों को जोड़कर, सिस्टम डेटा का एक बहुत अधिक समृद्ध और सटीक प्रतिनिधित्व बना सकता है, जैसा कि एक एकल-चरण विधि कभी नहीं कर सकती।
शोधकर्ताओं ने इस नए दृष्टिकोण का परीक्षण तीन अलग-अलग प्रकार के डेटा पर किया: ऑडियो, चित्र और वीडियो। उन्होंने अपने मॉडल को विशाल डेटासेट पर प्रशिक्षित किया, जिसमें यूट्यूब से लाखों साउंड क्लिप, मानक इमेजनेट संग्रह से दस लाख से अधिक चित्र और मानवीय क्रियाओं को दिखाने वाले सैकड़ों हजार वीडियो क्लिप शामिल थे। हर मामले में, उन्होंने अपने नए पदानुक्रमित तरीके की तुलना पुराने, एकल-सूची वाले तरीके से की, यह सुनिश्चित करते हुए कि टोकन की कुल संख्या समान रहे ताकि एकमात्र अंतर यह हो कि वे टोकन कैसे व्यवस्थित हैं। परिणाम स्पष्ट और सुसंगत थे। नया सिस्टम, जो इस बहु-चरणीय, स्तरित दृष्टिकोण का उपयोग करता है, लगातार पुराने तरीके से बेहतर प्रदर्शन करता है। सुधार विशेष रूप से तब देखा गया जब शोधकर्ताओं ने यह परीक्षण किया कि कंप्यूटर नई चीजों को कितनी अच्छी तरह पहचान सकता है जिसे उसने पहले कभी नहीं देखा है, जिसे 'लीनियर प्रोबिंग' (linear probing) कहा जाता है। यह सुझाव देता है कि नए सिस्टम ने दुनिया की अधिक लचीली और मजबूत समझ सीखी है, जिससे ऐसे प्रतिनिधित्व बने हैं जिन्हें अन्य कार्यों के लिए उपयोग करना आसान है।
केवल प्रदर्शन के आंकड़ों से परे, शोधकर्ताओं ने यह भी जांचा कि सिस्टम को अधिक प्रभावी ढंग से कैसे सीखा जाए। उन्होंने पाया कि सिस्टम के सीखने की प्रक्रिया कैसे शुरू होती है, यह महत्वपूर्ण है। सिस्टम को एक विशिष्ट गणितीय तकनीक के साथ आरंभ (initialize) करके, जो शुरुआती बिंदुओं को समान रूप से फैलाती है, बजाय इसके कि उन्हें यादृच्छिक (random) छोड़ा जाए, सिस्टम तेजी से और अधिक विश्वसनीय रूप से सीखता है। उन्होंने एक ऐसी विधि भी विकसित की जिससे यह सुनिश्चित हो सके कि सिस्टम का प्रत्येक भाग उपयोग में आए, जिससे कंप्यूटर अपने स्वयं के शब्दावली के बड़े हिस्सों को अनदेखा न कर सके। इन तकनीकी सुधारों ने, नई स्तरित संरचना के साथ मिलकर, सिस्टम को ऑडियो वर्गीकरण में अत्याधुनिक परिणाम प्राप्त करने में सक्षम बनाया, जो मानक बेंचमार्क पर मौजूदा सर्वोत्तम मॉडलों के बराबर या उनसे बेहतर है। यह कार्य यह प्रदर्शित करता है कि मशीन जानकारी को कैसे तोड़ती है और उसका प्रतिनिधित्व करती है, यह लर्निंग एल्गोरिदम जितना ही महत्वपूर्ण है। एक सपाट, एकल-विकल्प प्रणाली से एक गहरे, स्तरित सिस्टम की ओर बढ़कर, शोधकर्ताओं ने दिखाया है कि मशीनें दुनिया को अधिक बारीकी और स्पष्टता के साथ देखना और सुनना सीख सकती हैं, जो अधिक सक्षम और बहुमुखी आर्टिफिशियल इंटेलिजेंस का मार्ग प्रशस्त करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।