← नवीनतम पेपर
💻 computer science

CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation

यह शोध पत्र CLIP-Guided SAM प्रस्तुत करता है, जो एक पैरामीटर-कुशल ढांचा है जो हल्के एडेप्टर के माध्यम से इसके इमेज एनकोडर में सीधे CLIP-व्युत्पन्न विशेषताओं को इंजेक्ट करके 'सेगमेंट एनीथिंग मॉडल' (SAM) की सिमेंटिक रूप से दृष्टिहीन प्रकृति को उन्नत करता है, जिससे मॉडल के मूल प्रॉम्प्टेबल इंटरफेस को बनाए रखते हुए इंटरैक्टिव और केवल टेक्स्ट-आधारित दोनों मोड में मजबूत कॉन्सेप्ट-विशिष्ट सेगमेंटेशन सक्षम होता है।

मूल लेखक: Shayan Jalilian, Abdul Bais

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shayan Jalilian, Abdul Bais

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट आर्टिस्ट है जिसका नाम SAM (सेगमेंट एनीथिंग मॉडल) है। SAM एक चीज़ में अविश्वसनीय है: किसी तस्वीर को देखना और उस चीज़ के चारों ओर सटीक रूपरेखा (outlines) बनाना जिसकी ओर आप इशारा करते हैं। यदि आप एक कुत्ते पर टैप करते हैं, तो यह एक कुत्ते की रूपरेखा बनाता है। यदि आप एक कार पर टैप करते हैं, तो यह एक कार की रूपरेखा बनाता है।

लेकिन इसमें एक पेच है: SAM अर्थ (meaning) के प्रति अंधा है। इसे यह नहीं पता कि कुत्ता या कार क्या होता है। यह केवल इतना जानता है "आपने यहाँ इशारा किया, इसलिए मैं यहाँ एक आकार बनाऊँगा।" यदि आप चाहते हैं कि यह बिना हर एक कुत्ते पर टैप किए, फोटो में सभी कुत्तों को ढूँढे, तो SAM खोया हुआ महसूस करेगा। इसे एक इंसान की ज़रूरत है जो हर एक कुत्ते पर टैप करे।

अब, कल्पना कीजिए कि आपके पास एक दूसरा रोबोट है, CLIP, जो एक भाषा विशेषज्ञ (language expert) है। CLIP एक तस्वीर और एक शब्द (जैसे "कुत्ता") को देख सकता है और समझ सकता है कि वे आपस में कैसे जुड़े हैं। लेकिन CLIP सटीक रूपरेखा बनाने में बुरा है; यह कुछ हद तक "कुत्तेपन" (dog-ness) के एक धुंधले बादल जैसा है।

पुराना तरीका: बिचौलिया (The Middleman)

पहले, यदि आप इन दोनों रोबोटों का उपयोग करना चाहते थे, तो आपको उन्हें एक लाइन में काम करना पड़ता था। आप CLIP से पूछते, "कुत्तों को ढूँढो," और CLIP अनुमान लगाने की कोशिश करता कि वे कहाँ हैं और SAM को एक मोटा-मोटा नोट भेजता, "हे, यहाँ टैप करो।" फिर SAM रूपरेखा बनाता।

समस्या यह थी कि यह "टेलीफोन" के खेल (एक संदेश को आगे बढ़ाने वाला खेल) की तरह था जहाँ संदेश धुंधला हो जाता था। CLIP का मोटा अनुमान एकदम सटीक नहीं था, और SAM रेखा खींचते समय "कुत्ते" की अवधारणा को नहीं समझता था; वह बस एक खराब निर्देश का पालन करता था।

नया तरीका: CLIP-Guided SAM

लेखकों ने एक नया सिस्टम बनाया जहाँ वे इन दोनों रोबोटों के दिमाग को सीधे एक साथ जोड़ देते हैं।

केवल CLIP द्वारा एक नोट भेजने के बजाय, वे CLIP की "समझ" को SAM के काम करने के दौरान सीधे उसके दिमाग में इंजेक्ट कर देते हैं। इसे ऐसे समझें जैसे SAM को स्मार्ट चश्मे पहना दिए गए हों जो उसे न केवल आकारों को, बल्कि उनके पीछे के अर्थ को भी दिखाते हैं।

उन्होंने इसे इस प्रकार किया:

  1. सेमेंटिक एडेप्टर्स (The Semantic Adapters): उन्होंने SAM के दिमाग के अंदर छोटे, हल्के पुल (एडेप्टर) बनाए।
  2. इंजेक्शन (The Injection): वे CLIP के "टेक्स्ट" (शब्द "कुत्ता"), "विज़न" (एक कुत्ता कैसा दिखता है), और "सिमिलैरिटी" (इस चित्र का हिस्सा कितना कुत्ते जैसा दिखता है) को सीधे इन पुलों में फीड करते हैं।
  3. परिणाम: अब, जब SAM एक तस्वीर देखता है, तो वह केवल आकार नहीं देखता; वह अर्थ से रंगे हुए आकार देखता है। वह जानता है, "यह आकार एक कुत्ता है क्योंकि मेरा दिमाग वर्तमान में 'कुत्ते' के लिए ट्यून किया गया है।"

उपयोग के दो तरीके

पेपर इस सिस्टम के दो मोड दिखाता है:

  • इंटरैक्टिव मोड (मैनुअल): आप बॉस हैं। आप एक कुत्ते पर क्लिक करते हैं, और आप "कुत्ता" भी टाइप करते हैं। सिस्टम आपकी सटीकता के लिए आपके क्लिक का उपयोग करता है और आपके टेक्स्ट का उपयोग यह सुनिश्चित करने के लिए करता है कि वह केवल उस एक को ही नहीं, बल्कि सभी कुत्तों को ढूँढे जिसे आपने क्लिक किया था।
  • सेमी-ऑटोमैटिक मोड (केवल टेक्स्ट): आप बस "कुत्ता" टाइप करते हैं। सिस्टम अपने नए "स्मार्ट चश्मों" का उपयोग करके कुत्तों को ढूँढता है और बिना किसी क्लिक के अपने आप उनकी रूपरेखा बनाता है।

यह क्यों महत्वपूर्ण है (पेपर के दावे)

लेखकों ने कुछ बहुत ही कठिन कार्यों पर इसका परीक्षण किया, जैसे छलावरण वाले ऑब्जेक्ट्स (वे जानवर जो पृष्ठभूमि में पूरी तरह से छिप जाते हैं) को ढूँढना और बहुत कम लेबल वाले उदाहरणों (जैसे कि पूरे पुस्तकालय के बजाय केवल कुछ फ्लैशकार्ड के साथ एक छात्र को सिखाना) के साथ वस्तुओं को ढूँढना।

उन्होंने पाया कि:

  • यह स्मार्ट है: क्योंकि यह सिस्टम दोनों मॉडलों को एक साथ सीखने (सह-अनुकूलन/co-adaptation) की अनुमति देता है, यह चीजों को खोजने में बहुत बेहतर हो जाता है यदि उन्हें अलग-अलग प्रशिक्षित किया जाता।
  • यह कुशल है: उन्हें SAM के विशाल मस्तिष्क को फिर से प्रशिक्षित करने की आवश्यकता नहीं थी। उन्होंने केवल छोटे "स्मार्ट चश्मों" (एडेप्टर) को थोड़ा बदला और CLIP को भी थोड़ा सीखने दिया। इसका मतलब है कि यह तेज़ चलता है और इसे सुपरकंप्यूटर की आवश्यकता नहीं है।
  • यह प्रतियोगिता को पछाड़ता है: अपने परीक्षणों में, इस पद्धति ने अन्य तरीकों की तुलना में वस्तुओं को अधिक सटीकता से पाया जो इन रोबोटों को मिलाने की कोशिश करते थे, और यह बहुत बड़े, महंगे मॉडलों (जैसे SAM 3) के करीब भी पहुँच गया जबकि इसने बहुत कम संसाधनों का उपयोग किया।

सबसे बड़ा सबक

इस पेपर की सबसे महत्वपूर्ण खोज यह है कि आप केवल एक रोबोट को फ्रीज (स्थिर) करके यह उम्मीद नहीं कर सकते कि यह काम करेगा। यदि आप CLIP को तब तक सीखने देते हैं जब तक SAM सीख रहा होता है, तो वे एक-दूसरे को समझने में बेहतर होते हैं। यदि आप CLIP को पहले ही फ्रीज कर देते हैं, तो टीम वास्तव में बदतर प्रदर्शन करती है। यह एक डांस की तरह है: पार्टनर्स को स्टेप्स को एक साथ सीखना चाहिए, न कि एक दूसरे के शामिल होने से पहले अकेले अभ्यास करना चाहिए।

संक्षेप में, उन्होंने यह पता लगाया है कि कैसे एक आकार खोजने वाले रोबोट को शब्दों को समझने के लिए एक "दिमाग" दिया जाए, जिससे यह चित्रों में विशिष्ट चीजों को खोजने के लिए एक बहुत अधिक शक्तिशाली उपकरण बन जाता है, खासकर तब जब आपके पास उसे सिखाने के लिए बहुत अधिक डेटा न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →