← नवीनतम पेपर
💻 computer science

Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models

यह शोध पत्र ओपन-वोकैबुलरी कैमौफ्लाज्ड ऑब्जेक्ट सेगमेंटेशन के लिए एक नवीन VLM-गाइडेड कैस्केडेड फ्रेमवर्क प्रस्तावित करता है जो सटीक स्थानीयकरण के लिए सेगमेंट एनीथिंग मॉडल को स्पष्ट रूप से प्रॉम्प्ट करने हेतु विजन लैंग्वेज मॉडल फीचर्स का लाभ उठाता है और पूर्ण-छवि संदर्भ को बनाए रखने के लिए सॉफ्ट स्पेशियल प्रायर्स का उपयोग करता है, जिससे डोमेन अंतराल को दूर किया जा सके और किसी भी श्रेणी के कैमौफ्लाज्ड ऑब्जेक्ट्स के सेगमेंटेशन और वर्गीकरण दोनों में सुधार किया जा सके।

मूल लेखक: Kai Zhao, Wubang Yuan, Zheng Wang, Guanyi Li, Xiaoqiang Zhu, Deng-ping Fan, Dan Zeng

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Zhao, Wubang Yuan, Zheng Wang, Guanyi Li, Xiaoqiang Zhu, Deng-ping Fan, Dan Zeng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घने, कोहरे से भरे जंगल में "I Spy" (मैं देख रहा हूँ) खेल खेल रहे हैं। आपका दोस्त कहता है, "मैं एक लोमड़ी (fox) देख रहा हूँ।" लेकिन यहाँ एक पेंच है: लोमड़ी ने एक बेहतरीन छलावरण (camouflage) सूट पहना हुआ है जो उसे बिल्कुल पत्तों, टहनियों और परछाइयों जैसा दिखाता है। वह लगभग अदृश्य है।

यही Open-Vocabulary Camouflaged Object Segmentation (OVCOS) की चुनौती है। कंप्यूटर इन "छिपे हुए" ऑब्जेक्ट्स को खोजने में संघर्ष करते हैं, खासकर तब जब कंप्यूटर ने पहले कभी उस विशिष्ट प्रकार के जानवर को नहीं देखा हो (जैसे कि "कुत्ते" पर प्रशिक्षित होने के बाद "लोमड़ी" को पहचानना)।

यह पेपर एक नया सिस्टम पेश करता है जिसे COCUS (Cascaded Open-vocabulary Camouflaged UnderStanding) कहा जाता है ताकि इस पहेली को सुलझाया जा सके। COCUS को एक दो-सदस्यीय जासूसी टीम के रूप में समझें जो मिलकर काम करती है: एक है स्पॉटर (Spotter - खोजने वाला), और दूसरा है आइडेंटिफायर (Identifier - पहचानने वाला)

यहाँ बताया गया है कि वे कैसे काम करते हैं, सरल उपमाओं का उपयोग करते हुए:

1. पुराने तरीकों के साथ समस्या

पहले, कंप्यूटर एक साथ दो काम करने की कोशिश करते थे या एक अनाड़ी दो-चरणीय प्रक्रिया का उपयोग करते थे:

  • "क्रॉप एंड आस्क" (काटो और पूछो) की गलती: पुराने तरीके फोटो के उस छोटे से हिस्से को काटने की कोशिश करते थे जिसमें छिपा हुआ ऑब्जेक्ट होता था और फिर एक स्मार्ट AI से पूछते थे, "यह क्या है?"
    • दोष: AI (जैसे CLIP) को पूरी तस्वीरों (जैसे कि पूरा जंगल का दृश्य) को देखकर प्रशिक्षित किया गया था। जब आप उसे एक छोटे से, कटे हुए टुकड़े को देखने के लिए मजबूर करते हैं, तो वह भ्रमित हो जाता है। यह एक ऐसे शेफ से पूछने जैसा है जिसे केवल पूर्ण भोजन पकाने के लिए प्रशिक्षित किया गया है, कि वह चावल के एक अकेले दाने का न्याय करे। वे संदर्भ (context) खो देते हैं।
  • "जेनेरिक सर्च" (सामान्य खोज) की गलती: अन्य तरीकों ने जेनेरिक सर्च टूल्स का उपयोग किया जो चमकीली, स्पष्ट चीजों (जैसे मेज पर रखा लाल सेब) को खोजने में बहुत अच्छे हैं लेकिन ऐसी चीजों को खोजने में खराब हैं जो घुल-मिल जाती हैं (जैसे पत्ते पर बैठा हरा मेंढक)।

2. COCUS समाधान: एक दो-चरणीय जासूसी टीम

लेखकों ने एक स्मार्ट वर्कफ़्लो बनाया है जहाँ दो चरण एक-दूसरे की मदद करते हैं बिना संदर्भ खोए।

चरण 1: "सुपर स्पॉटर" (छिपे हुए ऑब्जेक्ट को खोजना)

  • टूल: वे एक शक्तिशाली AI का उपयोग करते हैं जिसे SAM (Segment Anything Model) कहा जाता है, जो एक मास्टर पेंटर की तरह है जो किसी भी चीज़ की रूपरेखा बना सकता है यदि आप उन्हें एक संकेत दें।
  • ट्रिक: आमतौर पर, SAM को किसी ऑब्जेक्ट पर क्लिक करने के लिए इंसान की जरूरत होती है। लेकिन यहाँ, वे SAM को एक Vision-Language Model (VLM) से एक "हिंट" (संकेत) देते हैं।
    • उपमा: कल्पना कीजिए कि आप एक लोमड़ी की तलाश कर रहे हैं। सिर्फ जंगल की ओर इशारा करने के बजाय, आप पेंटर के कान में फुसफुसाते हैं, "किसी ऐसी चीज़ को देखो जो लोमड़ी जैसी दिखती हो।" VLM शब्द "लोमड़ी" को एक विजुअल मैप में बदल देता है कि एक लोमड़ी कैसा महसूस होती है (उसका आकार, बनावट, रंग)।
    • परिणाम: SAM इस "फुसफुसाहट" का उपयोग करके अपना ध्यान ठीक वहीं केंद्रित करता है जहाँ लोमड़ी छिपी है, भले ही लोमड़ी पूरी तरह से छलावरण में क्यों न हो। यह छिपे हुए ऑब्जेक्ट के चारों ओर एक सटीक रूपरेखा खींचता है।

चरण 2: "स्मार्ट आइडेंटिफायर" (ऑब्जेक्ट को नाम देना)

  • समस्या: एक बार जब ऑब्जेक्ट मिल जाता है, तो हमें उसे नाम देना होता है। लेकिन याद रखें "क्रॉप एंड आस्क" की गलती? हम ऑब्जेक्ट को काटकर अलग नहीं करना चाहते।
  • समाधान: वे एक "सॉफ्ट स्पेशियल गाइड" (Soft Spatial Guide) का उपयोग करते हैं।
    • उपमा: कल्पना कीजिए कि स्पॉटर द्वारा खींची गई रूपरेखा मूल फोटो के ऊपर रखी गई एक पारदर्शी शीट (जैसे कांच का टुकड़ा) है। यह कांच हर जगह साफ है सिवाय उस जगह के जहाँ लोमड़ी है; वहाँ, यह थोड़ा रंगीन (tinted) है।
    • जब आइडेंटिफायर AI फोटो को देखता है, तो वह पूरे जंगल को देखता है (ताकि वह अपना संदर्भ बनाए रखे) लेकिन वह रंगीन कांच को भी देखता है जो लोमड़ी को हाईलाइट कर रहा है। वह जानता है, "आह, दिलचस्प हिस्सा ठीक इसी रंगीन हिस्से के नीचे है।"
    • यह AI को यह कहने की अनुमति देता है कि, "वह एक लोमड़ी है," बिना लोमड़ी को तस्वीर से काटे।

3. यह एक बड़ी बात क्यों है

  • "ब्लाइंड स्पॉट" का अंत: "फोटो काटने" के बजाय "रंगीन कांच" के तरीके का उपयोग करके, सिस्टम संदर्भ को समझता है। वह जानता है कि लोमड़ी जंगल में है, किचन में नहीं।
  • बेहतर देखना सीखना: सिस्टम को छलावरण के सूक्ष्म संकेतों को समझने के लिए "फाइन-ट्यून" (विशेष रूप से प्रशिक्षित) किया गया है। यह एक जासूस को यह नोटिस करने के लिए प्रशिक्षित करने जैसा है कि एक पत्ता थोड़ा गलत आकार का है, जो उसके नीचे छिपे कीड़े को प्रकट करता है।
  • एज अवेयरनेस (किनारों की जागरूकता): सिस्टम ऑब्जेक्ट के किनारों (edges) पर भी अतिरिक्त ध्यान देता है। छलावरण वाले ऑब्जेक्ट्स के किनारे अक्सर धुंधले होते हैं। यह नया तरीका उन किनारों को तेज करता है, जिससे रूपरेखा स्पष्ट और सटीक बनती है।

सारांश

संक्षेप में, यह पेपर एक नए तरीके को प्रस्तुत करता है जिससे कंप्यूटर छलावरण वाली दुनिया में "I Spy" खेल सकते हैं। अंधेरे में अनुमान लगाने या तस्वीर को काटने के बजाय, वे एक दो-चरणीय टीम का उपयोग करते हैं:

  1. एक स्पॉटर जो छिपे हुए ऑब्जेक्ट को खोजने के लिए भाषा के संकेतों का उपयोग करता है।
  2. एक आइडेंटिफायर जो पूरी तस्वीर को देखता है लेकिन मिले हुए ऑब्जेक्ट पर ध्यान केंद्रित करने के लिए एक "हाईलाइटर" का उपयोग करता है।

यह दृष्टिकोण इतना अच्छा है कि यह छिपे हुए ऑब्जेक्ट्स को खोजने और उन्हें नाम देने में सभी पिछले तरीकों को मात देता है, भले ही कंप्यूटर ने उस विशिष्ट जानवर को पहले कभी न देखा हो। यह मेडिकल इमेजिंग (छिपे हुए ट्यूमर को ढूंढना) या वन्यजीव निगरानी (छलावरण वाले जानवरों की गिनती करना) जैसी चीजों के लिए एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →