SAM3-I: Segment Anything with Instructions
यह शोध पत्र SAM3-I को प्रस्तुत करता है, जो सेगमेंट एनीथिंग मॉडल 3 का एक निर्देश-अनुसरण करने वाला विस्तार है, जो एक कैस्केड अनुकूलन तंत्र और एक नए बड़े पैमाने के डेटासेट (HMPL-Instruct) के माध्यम से अवधारणा-स्तरीय ग्राउंडिंग और निर्देश-स्तरीय तर्क को एकीकृत करता है, जिससे मॉडल की मूल अवधारणा रिकॉल क्षमताओं से समझौता किए बिना जटिल प्राकृतिक-भाषा निर्देशों की सीधी व्याख्या संभव हो पाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास SAM (सेगमेंट एनीथिंग मॉडल) नाम का एक सुपर-स्मार्ट रोबोट सहायक है। लंबे समय तक, SAM एक बहुत ही आज्ञाकारी लेकिन शाब्दिक अर्थ समझने वाले लाइब्रेरियन की तरह था।
- SAM 1 और 2: यदि आप किसी विशिष्ट पुस्तक की ओर इशारा करते और कहते, "इसे ढूंढो," तो वह उसे ढूंढ लेता। लेकिन यदि आप "एक पुस्तक" मांगते, तो उसे समझ नहीं आता कि कौन सी चुननी है।
- SAM 3: यह संस्करण अधिक स्मार्ट हो गया। यदि आप कहते, "सभी फुटबॉल खिलाड़ियों को ढूंढो," तो यह एक फोटो में हर एक फुटबॉल खिलाड़ी को तुरंत ढूंढ सकता था, भले ही वे दस क्यों न हों। यह अवधारणाओं (श्रेणियों) के आधार पर चीजों को खोजने में माहिर था।
समस्या:
वास्तविक जीवन केवल श्रेणियों के बारे में नहीं है। कल्पना कीजिए कि आप एक बिखरे हुए कमरे में हैं और आप अपने रोबोट से कहते हैं: "कृपया वह नीली फुटबॉल उठाएं जो दरवाजे की ओर लुढ़क रही है और बिल्ली से टकरा रही है।"
पुराना SAM 3 इसे नहीं संभाल पाता था। वह केवल "फुटबॉल" को समझता था। इसे काम करने योग्य बनाने के लिए, डेवलपर्स को एक जटिल "मिडलमैन" सिस्टम (एक AI एजेंट) बनाना पड़ा जो आपके जटिल वाक्य को "नीली गेंद" जैसे सरल कीवर्ड में अनुवाद कर सके, और फिर अनुमान लगा सके कि आपका मतलब किससे है। यह धीमा, बोझिल था और अक्सर विवरणों को गलत कर देता था (जैसे लाल गेंद को उठा लेना)।
समाधान: SAM3-I
लेखकों ने SAM3-I (इंस्ट्रक्शन-फॉलोइंग) बनाया है। इसे एक लाइब्रेरियन को मानव बातचीत में पीएचडी देने के रूप में समझें, जबकि उनकी अद्भुत याददाश्त को बरकरार रखा गया है।
यह कैसे काम करता है, यहाँ कुछ मजेदार उपमाओं का उपयोग किया गया है:
1. "कैस्केडेड एडेप्टर" (परतदार जासूस)
सब कुछ एक साथ सीखने के बजाय, SAM3-I इसके मस्तिष्क के भीतर दो-चरणीय जासूसी टीम का उपयोग करता है:
- "सरल" जासूस (S-Adapter): यह जासूस स्पष्ट सुराग पहचानने में माहिर है। यदि आप कहते हैं, "लाल कार," तो यह जासूस तुरंत रंग और वस्तु को पकड़ लेता है।
- "जटिल" जासूस (C-Adapter): यह जासूस छिपे हुए अर्थों को पढ़ने में जीनियस है। यदि आप कहते, "वह कार जो टकराने ही वाली है," तो पहला जासूस भ्रमित हो सकता है। लेकिन दूसरा जासूस क्रिया और संदर्भ को समझता है।
वे एक कैस्केड (श्रृंखला) में काम करते हैं। सरल सुरागों को जटिल जासूस को भेजा जाता है, जो इसमें गहरा तर्क जोड़ता है। इस प्रकार, रोबोट "लाल कार" और "वह कार जो टकराने ही वाली है" दोनों को समान रूप से समझता है।
2. "अलाइनमेंट लॉसेस" (गुणवत्ता नियंत्रण टीम)
जब आप एक रोबोट को सोचने के दो अलग-अलग तरीके सिखाते हैं (सरल बनाम जटिल), तो वे एक-दूसरे को समझे बिना बात कर सकते हैं। इसे ठीक करने के लिए, शोधकर्ताओं ने एक "गुणवत्ता नियंत्रण टीम" (गणितीय नियम जिन्हें Losses कहा जाता है) जोड़ी:
- "समान लक्ष्य" का नियम: यदि आप एक ही वस्तु को दो अलग-अलग तरीकों से वर्णित करते हैं (जैसे, "बड़ा कुत्ता" और "भोंकने वाला जानवर"), तो रोबत को एहसास होना चाहिए कि वे वही कुत्ता है।
- "कॉन्सेप्ट गार्डरेल": यदि आप "कुत्ता" कहते हैं, तो रोबोट गलती से बिल्ली को नहीं चुनना चाहिए, भले ही बिल्ली भोंक रही हो। यह रोबोट को सही श्रेणी में बनाए रखता है।
- "हार्ड मोड" ट्रेनर: रोबोट को छवि के कठिन हिस्सों (जैसे कुर्सी के पीछे छिपी गेंद) पर विशेष ध्यान देने के लिए मजबूर किया जाता है ताकि वह आलसी न हो जाए।
3. "HMPL-Instruct" डेटासेट (प्रशिक्षण स्कूल)
आप एक रोबोट को जटिल निर्देशों को समझने के लिए अच्छे पाठ्यपुस्तकों के बिना नहीं सिखा सकते। लेखकों ने एक विशाल नया पुस्तकालय बनाया जिसे HMPL-Instruct कहा जाता है।
- कल्पित करें कि एक स्कूल है जहाँ छात्र निर्देश देने का अभ्यास करते हैं।
- स्तर 1: "सेब ढूंढो।" (अवधारणा)
- स्तर 2: "बाईं ओर स्थित चमकदार सेब ढूंढो।" (सरल निर्देश)
- स्तर 3: "वह फल ढूंढो जिसे किसी ने गिरा दिया और जो कुत्ते के पास लुढ़क रहा है।" (जटिल तर्क)
- स्तर 4: "उन सेबों में से तीन ढूंढो जो सड़ रहे हैं।" (एक-से-अनेक तर्क)
उन्होंने सैकड़ों हजारों उदाहरण बनाने के लिए मनुष्यों और AI दोनों का उपयोग किया, यह सुनिश्चित करते हुए कि रोबोट हर प्रकार के अनुरोध को संभालने के लिए सीख सके।
यह एक बड़ी बात क्यों है?
इससे पहले, यदि आप चाहते थे कि एक रोबोट जटिल निर्देशों का पालन करे, तो आपको विभिन्न AI मॉडलों की एक धीमी, महंगी श्रृंखला की आवश्यकता होती थी जो आपस में बात कर रहे हों। यह एक अनुवादक, फिर एक प्रबंधक, फिर एक कार्यकर्ता को काम पर रखने जैसा था।
SAM3-I एक सुपर-कर्मचारी को काम पर रखने जैसा है जो आपके जटिल अनुरोध को सुन सकता है, ठीक से समझ सकता है कि आपका क्या मतलब है, और एक ही सहज गति में काम कर सकता है। यह पुराने संस्करण की गति और सटीकता को बनाए रखता है लेकिन इसमें मानवीय बारीकियों, हास्य और संदर्भ को समझने की क्षमता भी जोड़ता है।
संक्षेप में: SAM3-I एक ऐसे रोबोट को जो केवल "कीवर्ड्स" समझता था, एक ऐसे रोबोट में बदल देता है जो "कहानियां" समझता है, जिससे यह घर में मदद करने, कार चलाने या कारखाने में काम करने जैसे वास्तविक दुनिया के कार्यों के लिए तैयार हो जाता है जहाँ निर्देश कभी भी केवल सरल शब्द नहीं होते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।