← नवीनतम पेपर
💻 computer science

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg एक कुशल, सिंगल-स्टेज फ्रेमवर्क है जो ओपन-वोकैबुलरी सिमेंटिक सेगमेंटेशन के लिए ऑब्जेक्ट अस्तित्व प्रायर्स (object existence priors), रीजन-अवेयर अलाइनमेंट और ड्यूल-स्ट्रीम फ्यूजन को एकीकृत करता है ताकि बाहरी प्रपोजल्स या अतिरिक्त डेटासेट्स की आवश्यकता के बिना मौजूदा विजन-लैंग्वेज मॉडल-आधारित विधियों की स्थानिक मिसअलाइनमेंट (spatial misalignment) और ऑब्जेक्ट हैलुसिनेशन (object hallucination) की समस्याओं को दूर किया जा सके।

मूल लेखक: Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक खिड़की से एक व्यस्त, अराजक शहर की सड़क को देख रहे हैं। आप वहां दिखने वाली हर एक चीज़ की ओर इशारा करना चाहते हैं: लाल बस, एक आवारा बिल्ली, कॉफी शॉप का साइन, और यहाँ तक कि दीवार पर लगा एक छोटा, धुंधला पोस्टर भी जिस पर "Open" लिखा है।

समस्या: "धुंधले चश्मे" का प्रभाव (The "Blurry Glasses" Effect)
पारंपरिक कंप्यूटर विज़न प्रोग्राम उन छात्रों की तरह हैं जिन्होंने केवल 20 विशिष्ट चीजों (कारें, लोग, पेड़) की एक सूची रट ली है। यदि वे "जेब्रा" देखते हैं, तो वे भ्रमित हो जाते हैं क्योंकि वह उनकी सूची में नहीं था।

इसे ठीक करने के लिए, शोधकर्ताओं ने "विज़न-लैंग्वेज मॉडल्स" (जैसे CLIP) का उपयोग करना शुरू किया, जो उन सुपर-स्मार्ट छात्रों की तरह हैं जिन्होंने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। वे शब्द पढ़कर ही समझ जाते हैं कि "जेब्रा" क्या होता है।

हालाँकि, इन सुपर-स्मार्ट छात्रों के साथ एक समस्या है: वे सटीक रूप से इशारा करने में खराब हैं।
क्योंकि उन्हें पूरी तस्वीरों और पूरे विवरणों (जैसे, "एक मैदान में जेब्रा") को देखकर प्रशिक्षित किया गया था, इसलिए उन्हें यह ठीक से पता नहीं होता कि जेब्रा वास्तव में कहाँ है। यदि आप उनसे जेब्रा के चारों ओर एक घेरा बनाने के लिए कहते हैं, तो वे पूरे मैदान के चारों ओर घेरा बना सकते हैं, या वे कल्पना (hallucinate) कर सकते हैं और एक झाड़ी के पास जेब्रा बना सकते हैं जहाँ वास्तव में जेब्रा नहीं है। उनमें "स्थानिक सटीकता" (spatial precision) की कमी है।

समाधान: LoGoSeg (Local + Global)
यह पेपर LoGoSeg पेश करता है, जो इस कार्य के लिए एक नया सिस्टम है जिसे एक आदर्श मार्गदर्शक के रूप में डिज़ाइन किया गया है। LoSeg को तीन विशेषज्ञों की एक टीम के रूप में समझें जो शहर की सड़क को पूरी तरह से लेबल करने के लिए मिलकर काम करते हैं।

1. "रियलिटी चेक" विशेषज्ञ (Object Existence Prior)

  • रूपक (Metaphor): कल्पना कीजिए कि आप एक अंधेरे कमरे में देख रहे हैं और कोई आपसे पूछता है, "क्या यहाँ कोई ड्रैगन है?" एक सामान्य AI कह सकता है, "शायद!" और एक ड्रैगन बना सकता है क्योंकि वह इसकी कल्पना कर सकता है।
  • LoGoSeg कैसे काम करता है: चित्र बनाने की कोशिश करने से पहले ही, LoSeg एक सरल प्रश्न पूछता है: "क्या इस चित्र में वास्तव में ड्रैगन की अवधारणा (concept) मौजूद है?" यह पहले पूरी तस्वीर को देखता है। यदि चित्र स्पष्ट रूप से एक रसोई का है, तो यह ड्रैगन पर "कम संभावना" (low probability) लगा देता है।
  • परिणाम: यह AI को "भ्रम" (hallucinations) पैदा करने से रोकता है। यह शुरू करने से पहले ही निरर्थक चीजों को फ़िल्टर कर देता है, यह सुनिश्चित करता है कि वह केवल उन्हीं चीजों की तलाश करे जिनके वहां होने की संभावना अधिक है।

2. "स्पॉटलाइट" विशेषज्ञ (Region-Aware Alignment)

  • रूपक: कल्पना कीजिए कि आप एक धुंधली फोटो को एक विवरण ("एक लाल कार") से मिलाने की कोशिश कर रहे हैं। पूरी फोटो को एक साथ देखने के बजाय, LoSeg फोटो को छोटे-छोटे वर्गों के ग्रिड में काट देता है (जैसे एक मोज़ेक)।
  • LoGoSeg कैसे काम करता है: यह प्रत्येक वर्ग पर एक "स्पॉटलाइट" डालता है। यह पूछता है, "क्या यह विशिष्ट वर्ग एक लाल कार जैसा दिखता है?" यह टेक्स्ट विवरण को सीधे पिक्सेल के उस विशिष्ट हिस्से से जोड़ता है।
  • परिणाम: यह शब्द और छवि के बीच एक गहरा और सटीक संबंध बनाता है। यह AI को यह कहने से रोकता है कि "पूरी सड़क एक लाल कार है," और इसके बजाय यह कहता है कि "केवल यह विशिष्ट वर्ग ही लाल कार है।"

3. "बड़ी तस्वीर और सूक्ष्म विवरण" विशेषज्ञ (Dual-Stream Fusion)

  • रूपक: कल्पना कीजिए कि आप एक पेंटिंग का वर्णन करने की कोशिश कर रहे हैं। आपको संदर्भ समझने के लिए बड़ी तस्वीर (यह एक परिदृश्य है) देखने की आवश्यकता है, लेकिन किनारों को सही करने के लिए आपको सूक्ष्म विवरणों (एक पत्ते पर ब्रश के निशान) को भी देखने की आवश्यकता है।
  • LoGoSeg कैसे काम करता है: अधिकांश पिछले सिस्टमों ने इसे एक ही मस्तिष्क के साथ करने की कोशिश की, जिससे वे अक्सर भ्रमित हो जाते थे। LoGoSeg एक ही समय में प्रोसेसिंग के दो "स्ट्रीम" का उपयोग करता है:
    • स्ट्रीम A (Local): तीखे किनारों और छोटी आकृतियों (जैसे एक कप की रूपरेखा) पर ध्यान केंद्रित करता है।
    • स्ट्रीम B (Global): समग्र दृश्य और संबंधों (जैसे यह जानना कि कप आमतौर पर मेज पर होता है) पर ध्यान केंद्रित करता है।
  • परिणाम: यह इन दोनों दृश्यों को जोड़ता है। यह जानता है कि वस्तु क्या है (global) और उसके किनारे बिल्हीं कहाँ हैं (local)।

यह एक बड़ी बात क्यों है?

अन्य अधिकांश विधियाँ एक दो-चरणीय प्रक्रिया की तरह हैं:

  1. पहले, अनुमान लगाएं कि वस्तुएं कहाँ हो सकती हैं (एक अलग टूल का उपयोग करके)।
  2. फिर, उन्हें नाम देने का प्रयास करें।
    यह धीमा है और अक्सर गलतियों की ओर ले जाता है क्योंकि पहला चरण वस्तु को पूरी तरह से मिस कर सकता है।

LoGoSeg एक "वन-स्टेज" (One-Stage) सिस्टम है। यह अनुमान लगाने, नाम देने और रूपरेखा बनाने का काम एक ही बार में, एक ही कुशल प्रक्रिया में करता है। इसे अतिरिक्त टूल्स, अतिरिक्त डेटा या दूसरी राय की आवश्यकता नहीं है।

निष्कर्ष (The Bottom Line)

LoGoSeg एक ऐसे कंप्यूटर की तरह है जिसे चश्मा पहना दिया गया है जो:

  1. भ्रम (hallucinations) को फ़िल्टर करता है (यह उन चीजों को नहीं देखेगा जो वहां मौजूद नहीं हैं)।
  2. ज़ूम इन करता है ताकि शब्दों को विशिष्ट पिक्सेल के साथ पूरी तरह से मिलाया जा सके।
  3. बड़े दृश्य और सूक्ष्म विवरणों के बीच संतुलन बनाता है।

परिणाम? एक ऐसा कंप्यूटर जो एक अव्यवस्थित, जटिल छवि को देख सकता है और आपके द्वारा पूछी गई किसी भी चीज़ को सटीक रूप से लेबल कर सकता है, भले ही उसने पहले कभी उस विशिष्ट वस्तु को न देखा हो, बिना भ्रमित हुए या मनगढ़ंत बातें किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →