← नवीनतम पेपर
💻 computer science

SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM

यह शोध पत्र SAM-MI का प्रस्ताव करता है, जो एक नवीन मास्क-इंजेक्टेड फ्रेमवर्क है जो टेक्स्ट-गाइडेड स्पार्स प्रॉम्प्टिंग, शैलो मास्क एग्रीगेशन और डिकपल्ड मास्क इंजेक्शन को नियोजित करके ओपन-वोकैबुलरी सिमेंटिक सेगमेंटेशन को बढ़ाता है, जिससे SAM की ओवर-सेगमेंटेशन और लेबल इंटीग्रेशन चुनौतियों को प्रभावी ढंग से संबोधित किया जाता है और सटीकता एवं इन्फरेंस स्पीड में महत्वपूर्ण सुधार किया जाता है।

मूल लेखक: Lin Chen, Yingjian Zhu, Qi Yang, Xin Niu, Kun Ding, Shiming Xiang

प्रकाशित 2026-07-29
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lin Chen, Yingjian Zhu, Qi Yang, Xin Niu, Kun Ding, Shiming Xiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को केवल चित्रों को देखकर और शब्दों की एक सूची पढ़कर दुनिया को समझने के लिए सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह हर उस "कुत्ते", "पेड़" या "पिज्जा" को पहचान ले जिसे वह देखता है, भले ही उसने पहले कभी उस विशिष्ट प्रकार के कुत्ते को न देखा हो। यह ओपन-वोकैबुलरी सिमेंटिक सेगमेंटेशन (Open-Vocabulary Semantic Segmentation) की चुनौती है। यह एक रोबोट को शब्दकोश और कैमरा देने और उससे जो कुछ भी वह देख रहा है उसे सही ढंग से लेबल करते हुए एक नक्शा बनाने के लिए कहने जैसा है। इसे करने के लिए, वैज्ञानिकों ने दो शक्तिशाली उपकरणों का उपयोग किया है। पहला उपकरण एक विज़न-लैंग्वेज मॉडल (VLM) है, जो एक सुपर-स्मार्ट लाइब्रेरियन की तरह है जो जानता है कि शब्द छवियों से कैसे जुड़ते हैं लेकिन सटीक रूपरेखा (outlines) बनाने में बहुत अच्छा नहीं है। दूसरा SAM (सेगमेंट एनीथिंग मॉडल) है, जो एक अरब अलग-अलग छवियों पर प्रशिक्षित एक रोबोट कलाकार है जो आपके द्वारा इशारा किए गए लगभग किसी भी चीज़ के चारों ओर सटीक रूपरेखा बना सकता है, लेकिन उसे यह नहीं पता कि उन चीजों को क्या कहा जाता है जब तक कि आप उसे बताएं नहीं।

समस्या यह है कि जब आप इन दोनों को एक साथ काम करने की कोशिश करते हैं, तो वे अक्सर एक-दूसरे से टकरा जाते हैं। कलाकार (SAM) बहुत उत्साहित हो जाता है और हर पत्ते और छाया के चारों ओर अनावश्यक रूपरेखाएं खींच देता है, जिससे वे सभी अलग-अलग वस्तुएं बन जाती हैं। यह एक अव्यवस्थित ढेर जैसा दिखता है। दूसरी ओर, लाइब्रेरियन (VLM) एक बिखरी हुई ड्राइंग पर लेबल थोपने की कोशिश करता है, भले ही वह ड्राइंग गलत हो। यह एक पहेली (puzzle) को जोड़ने जैसा है जहाँ टुकड़े लगातार अपना आकार बदल रहे हैं और डिब्बे पर बनी तस्वीर और आपके पास मौजूद टुकड़ों में मेल नहीं बैठ रहा है। यह शोध पत्र, SAM-MI, इन दोनों को बिना किसी अराजकता के एक टीम के रूप में काम करने का एक नया तरीका पेश करता है।

समस्या: अति-उत्साही कलाकार और कठोर लाइब्रेरियन

शोधकर्ताओं ने देखा कि SAM और लाइब्रेरियन को मिलाने के पिछले प्रयासों में दो बड़ी खामियां थीं। पहली, SAM ओवर-सेगमेंटेशन (over-segment) करता है। यदि आप उससे एक "बिल्ली" खोजने के लिए कहते हैं, तो वह बिल्ली की मूंछों, उसकी पूंछ और उसकी छाया के लिए भी अलग-अलग रूपरेखाएं बना सकता है, और उन सभी को अलग-अलग वस्तुओं के रूप में मान सकता है। इससे छोटे, भ्रमित करने वाले टुकड़ों का एक ढेर बन जाता है। दूसरी, पुराने तरीकों में एक "हार्ड कॉम्बिनेशन" (hard combination) का उपयोग किया जाता था। वे SAM से एक निश्चित रूपरेखा लेते थे और उस पर एक लेबल चिपका देते थे, चाहे वह रूपरेखा कितनी भी खराब क्यों न हो। यदि SAM ने एक बादल के चारोंвद एक घेरा बनाया और लाइब्रेरियन ने कहा "बिल्ली", तो सिस्टम बस उसे स्वीकार कर लेता था। यह एक कठोर, "जैसा है वैसा ही स्वीकार करो" वाला दृष्टिकोण था जिसने गलतियों को नजरअंदाज कर दिया।

समाधान: एक नए वर्कफ़्लो के साथ एक स्मार्ट टीम

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे SAM-MI (मास्क-इंजेक्टेड) कहा जाता है। कलाकार और लाइब्रेरियन को एक सीधी रेखा में काम करने के लिए मजबूर करने के बजाय, वे एक लचीला वर्कफ़्लो बनाते हैं जहाँ कलाकार की ड्राइंग का उपयोग अंतिम कमांड के बजाय सहायक संकेतों के रूप में किया जाता है। वे इसे तीन चतुर तरीकों का उपयोग करके करते हैं:

1. स्मार्ट स्काउट (टेक्स्ट-गाइडेड स्पार्स पॉइंट प्रॉम्प्टर - Text-guided Sparse Point Prompter)
पुराने समय में, SAM को चित्र में सब कुछ बनाने के लिए, आपको चित्र के चारों ओर हजारों बिंदुओं का ग्रिड टैप करना पड़ता था, जैसे हर जगह नमक छिड़कना। यह धीमा और गणनात्मक रूप से भारी था। SAM-MI एक "स्मार्ट स्काउट" पेश करता है जिसे TSPP कहा जाता है। हर जगह टैप करने के बजाय, यह स्काउट चित्र और उस शब्द को देखता है जिसे आप चाहते हैं (जैसे "कुत्ता") और यह तय करता है कि वास्तव में कहाँ टैप करना है। यह केवल वहीं डॉट्स रखने के लिए सीखता है जहाँ वस्तु मिलने की सबसे अधिक संभावना होती है।

  • परिणाम: 1,024 डॉट्स (एक सघन ग्रिड) के बजाय, स्काउट औसतन केवल 41 डॉट्स ही लगाता है। यह इस प्रक्रिया को 1.6 गुना तेज़ बनाता है और टैप की संख्या को 96% कम कर देता है, फिर भी वस्तुओं को उतनी ही अच्छी तरह से पाता है।

2. फिल्टर (शैलो मास्क एग्रीगेशन - Shallow Mask Aggregation)
कम टैप के बावजूद, SAM अभी भी बहुत सारे छोटे, खंडित टुकड़े बना सकता है। शैलो मास्क एग्रीगेशन (SMAgg) एक फिल्टर या छलनी की तरह कार्य करता है। यह SAM द्वारा बनाए गए छोटे आउटलाइन्स के ढेर को देखता है और पूछता है, "क्या ये टुकड़े एक साथ हैं?" यदि कुछ छोटे पैच सभी एक ही "कुत्ते" का हिस्सा दिखते हैं, तो SMAgg उन्हें एक साफ आकार में वापस जोड़ देता है। यह शोर और "रुचि के बाहर" के पैच (जैसे रैंडम छाया) को लाइब्रेरियन के देखने से पहले ही हटा देता है।

3. सौम्य मार्गदर्शक (डिकपल्ड मास्क इंजेक्शन - Decoupled Mask Injection)
यह सबसे महत्वपूर्ण बदलाव है। "हार्ड कॉम्बिनेशन" के बजाय जहाँ एक खराब रूपरेखा एक खराब लेबल को मजबूर करती है, SAM-MI डिकपल्ड मास्क इंजेक्शन (DMI) का उपयोग करता है। लाइब्रेरियन के नक्शे को एक धुंधले स्केच के रूप में सोचें। कलाकार की रूपरेखा का उपयोग उस स्केच को तेज करने के लिए एक "गाइड" के रूप में किया जाता है, लेकिन लाइब्रेरियन को गाइड को अनदेखा करने की अनुमति है यदि वह गलत दिखता है।

  • लो-फ्रीक्वेंसी इंजेक्शन (Low-Frequency Injection): यह भाग लाइब्रेरियन को बड़ी तस्वीर और चीजों के सामान्य आकार (ग्लोबल कॉन्टेक्स्ट) को समझने में मदद करने के लिए रूपरेखा का उपयोग करता है।
  • हाई-फ्रीक्वेंसी इंजेक्शन (High-Frequency Injection): यह भाग किनारों और विवरणों को तेज करने के लिए रूपरेखा का उपयोग करता है (लोकल डिटेल्स)।
    इन दोनों को अलग करके, सिस्टम लाइब्रेरियन के धुंधले नक्शे को ठीक कर सकता है बिना किसी खराब रूपरेखा को स्वीकार करने के लिए मजबूर हुए। यदि कलाकार ने एक बादल के चारों ओर घेरा बनाया है लेकिन लाइब्रेरियन जानता है कि यह एक "कुर्सी" है, तो सिस्टम केवल गलती को स्वीकार करने के बजाय नक्शे को सुधार सकता है।

उन्होंने क्या पाया

टीम ने MESS (जो शहर की सड़कों से लेकर मेडिकल स्कैन और खेती तक सब कुछ कवर करता है) जैसे विभिन्न डेटासेट्स पर SAM-MI का परीक्षण किया।

  • प्रदर्शन: MESS बेंचमार्क पर, SAM-MI ने पिछले सर्वश्रेष्ठ तरीके, Grounded-SAM की तुलना में सटीकता (mIoU में मापी गई) में 16.7% का सुधार किया।
  • गति: यह Grounded-SAM की तुलना में 1.6 गुना तेज़ भी था।
  • बहुमुखी प्रतिभा: इसने ADE20K और PASCAL-Context जैसे मानक डेटासेट्स पर भी अच्छा प्रदर्शन किया, जो अन्य शीर्ष तरीकों की तुलना में क्रमशः 4.2% और 3.5% का सुधार दिखाते हैं।

सीमाएं और भविष्य

लेखक सावधानीपूर्वक यह बताते हैं कि उनका सिस्टम पूर्ण नहीं है। उन्होंने दो मुख्य क्षेत्र पाए जहाँ वे अभी भी संघर्ष कर रहे हैं:

  1. छोटे या संकीले ऑब्जेक्ट्स: यदि कोई वस्तु अत्यंत छोटी है (जैसे कुर्सी का पैर) या बहुत पतली है (जैसे पंखे का ब्लेड), तो "स्मार्ट स्काउट" उसे मिस कर सकता है क्योंकि वह केवल कुछ ही डॉट्स रखता है। सिस्टम यह भी स्वीकार करता है कि लाइब्रेरियन (CLIP) बहुत छोटे ऑब्जेक्ट्स को पहचानने में भी उतना अच्छा नहीं है, भले ही वे मिल गए हों।
  2. अव्यवस्थित बैकग्राउंड: ऐसे दृश्यों में जो अत्यधिक भीड़भाड़ वाले हैं, जैसे कि फर्नीचर से भरा कमरा या उलझे हुए पेड़ों वाला जंगल, सिस्टम कभी-कभी भ्रमित हो जाता है और वस्तुओं को आपस में मिला देता है।

शोधकर्ताओं ने यह भी नोट किया कि वर्तमान परीक्षणों में कुछ खामियां हैं, जैसे डेटासेट्स में लेबल का गायब होना या गलत श्रेणियां, जो इस तकनीक की वास्तविक सीमाओं को जानना कठिन बनाता है। वे सुझाव देते हैं कि भविष्य के कार्य को इन बेंचमार्क को ठीक करने और शायद इस "मास्क-इंजेक्टेड" विचार को अन्य कार्यों, जैसे कि विशिष्ट वस्तुओं के उदाहरणों को खोजने या पूर्ण पैनोरमिक मानचित्र बनाने में लागू करने पर ध्यान केंद्रित करना चाहिए।

संक्षेप में, SAM-MI दिखाता है कि शक्तिशाली "सेगमेंट एनीथिंग" मॉडल को एक कठोर बॉस के बजाय एक सहायक गाइड के रूप में मानकर, हम रोबोट को दृश्य दुनिया को बहुत बेहतर, तेज़ और कम गलतियों के साथ समझने और मैप करने में सक्षम बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →