MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
यह शोध पत्र मल्टीमॉडल कोड-स्विचिंग (MMCS) को प्रस्तुत करता है, जो एक नया प्रीट्रेनिंग प्रतिमान (paradigm) है जो स्पष्ट ऑब्जेक्ट-लेवल सुपरविजन प्रदान करने के लिए टेक्स्ट में विजुअल ऑब्जेक्ट्स को इंटरलीव करता है, जिससे पारंपरिक इमेज-टेक्स्ट अलाइनमेंट विधियों की तुलना में डेटा दक्षता और विजुअल ग्राउंडिंग क्षमताओं में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखा रहे हैं। आप उसे एक बिखरी हुई मेज की तस्वीर दिखाते हैं और उससे कहते हैं, "वहाँ एक कॉफी मग, एक लैपटॉप और एक बिल्ली है।" आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन रोबोट्स को मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) कहा जाता है। वे सुपर-स्मार्ट छात्रों की तरह हैं जो एक ही समय में टेक्स्ट पढ़ सकते हैं और तस्वीरों को देख सकते हैं। सीखने के लिए, वे आमतौर पर जोड़ों में अध्ययन करते हैं: एक तरफ एक फोटो दिखाई जाती है, और दूसरी तरफ उसका विस्तृत विवरण (पैराग्राफ) दिखाया जाता है। रोबोट पूरी तस्वीर के आधार पर शब्दों का अनुमान लगाने की कोशिश करता है।
लेकिन यहाँ एक पेचीदा हिस्सा है: एक अकेली तस्वीर कई चीजों का मिश्रण होती है। यदि रोबोट एक ऐसी फोटो देखता है जिसमें एक बिल्ली, एक कुत्ता और एक गेंद है, और टेक्स्ट कहता है "बिल्ली कुत्ते का पीछा कर रही है," तो रोबोट को यह समझना होगा कि तस्वीर का कौन सा हिस्सा "बिल्ली" का है और कौन सा हिस्सा "कुत्ते" का है। यह एक पहेली सुलझाने जैसा है जहाँ सभी टुकड़े एक बड़े ढेर में आपस में चिपके हुए हैं। रोबोट को कनेक्शनों का अनुमान लगाना पड़ता है, जो धीमा, अक्षम और अक्सर भ्रमित करने वाला होता है। यह अपने दोस्तों के नाम जानने की कोशिश करने जैसा है जहाँ एक ग्रुप फोटो में हर कोई एक ढेर में खड़ा है; आप अनुमान लगा सकते हैं कि कौन कौन है, लेकिन आप अक्सर गलत हो सकते हैं।
यही वह समस्या है जिसे नानजिंग यूनिवर्सिटी के शोधकर्ताओं ने अपने नए पेपर में हल किया है। उन्होंने महसूस किया कि इन रोबोट्स को सिखाने का पुराना तरीका—पूरी तस्वीर को पूरे वाक्य से जोड़ना—बहुत अव्यवस्थित है। इसलिए, उन्होंने एक नया, चतुर तरीका निकाला जिसे मल्टीमॉडल कोड-स्विचिंग (MMCS) कहा जाता है।
MMCS को "रिक्त स्थान भरें" (fill in the blank) के खेल की तरह समझें जहाँ रिक्त स्थान कोई शब्द नहीं, बल्कि एक छोटा, ज़ूम-इन किया हुआ चित्र है। "The cat is on the mat" लिखने के बजाय, रोबोट को एक वाक्य दिखाया जाता है जो ऐसा दिखता है: "The [बिल्ली की तस्वीर] is on the [चटाई की तस्वीर] own."
वास्तविक दुनिया में, "कोड-स्विचिंग" तब होती है जब एक व्यक्ति जो दो भाषाएँ बोलता है (जैसे अंग्रेजी और स्पेनिश) एक ही वाक्य में उन्हें मिला देता है, जैसे कि कहना, "I went to the tienda to buy milk।" शोधकर्ताओं ने इस विचार को अपनाया। वे विजुअल ऑब्जेक्ट (बिल्ली की तस्वीर) को टेक्स्ट की तुलना में एक अलग "भाषा" या "कोड" के रूप में देखते हैं। "बिल्ली" शब्द को एक वास्तविक छवि (बिल्ली की छोटी तस्वीर) से बदलकर, वे रोबोट को उस विशिष्ट छोटी तस्वीर को देखने और यह समझने के लिए मजबूर करते हैं कि यही उस शब्द का अर्थ है। अब कोई अनुमान नहीं लगा रहा है। कनेक्शन स्पष्ट और सीधा है।
टीम ने इन विशेष प्रशिक्षण उदाहरणों को बनाने के लिए एक विशाल मशीन बनाई। उन्होंने हजारों चित्र लिए, उनके विस्तृत विवरण लिखे, उन तस्वीरों में विशिष्ट वस्तुओं (जैसे बिल्ली, किताब, या लैंप) को खोजा, और फिर विवरण में उन शब्दों को उन छोटे इमेज स्निपेट्स (छवि के टुकड़ों) से बदल दिया। उन्होंने 773,000 ऐसे "मिश्रित-भाषा" वाले नमूने तैयार किए।
परिणाम आश्चर्यजनक रूप से कुशल थे। आमतौर पर, एक रोबोट को अच्छी तरह सिखाने के लिए, आपको लाखों मानक चित्र-और-टेक्स्ट जोड़ों की आवश्यकता होती है। लेकिन इस नए "कोड-स्विचिंग" तरीके के साथ, रोबोट ने केवल 50,000 नमूनों के साथ उतना ही अच्छा सीखा। वास्तव में, केवल 50,000 विशेष नमूनों पर प्रशिक्षित एक मॉडल ने 600,000 मानक नमूनों पर प्रशिक्षित मॉडलों के समान या उनसे बेहतर प्रदर्शन किया। यह ऐसा है जैसे रोबोट को एक पूरी लाइब्रेरी की किताबों की ज़रूरत नहीं पड़ी, बल्कि उसने कुछ फ्लैशकार्ड्स से उतनी ही जानकारी सीख ली क्योंकि वे फ्लैशकार्ड्स बहुत अधिक स्पष्ट थे।
पेपर ने यह भी दिखाया कि इस पद्धति ने न केवल रोबोट को वस्तुओं को पहचानने में मदद की; इसने रोबोट को यह समझने में भी बेहतर बनाया कि चित्र में चीजें वास्तव में कहाँ हैं और उनका सटीक वर्णन कैसे किया जाए। जब शोधकर्ताओं ने देखा कि रोबोट का "दिमाग" कैसे काम कर रहा था, तो उन्होंने देखा कि उसका ध्यान (attention) बहुत अधिक सटीक हो गया था। पूरी तस्वीर को अस्पष्ट रूप से देखने के बजाय, वह "बिल्ली" शब्द पढ़ते समय ठीक उसी सही स्थान पर केंद्रित हो गया।
संक्षेप में, शोधकर्ताओं ने पाया कि वाक्यों में चित्रों और शब्दों को मिलाकर—शब्दों को उनके विजुअल समकक्षों से बदलकर—वे AI मॉडल्स को बहुत तेज़ी से और अधिक सटीकता से दुनिया को समझना सिखा सकते हैं। उन्होंने साबित किया कि यदि आप उन्हें सटीक डेटा देते हैं, तो आपको रोबोट को डेटा में डुबोने की आवश्यकता नहीं है। रोबोट को यह अनुमान लगाने की ज़रूरत नहीं है कि फोटो का कौन सा हिस्सा बिल्ली है; बिल्ली वहीं वाक्य में है, उसकी ओर देख रही है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।