← नवीनतम पेपर
💻 computer science

Open-Vocabulary Domain Generalization in Urban-Scene Segmentation

यह शोध पत्र ओपन-वोकैबुलरी डोमेन जनरलाइजेशन इन सिमेंटिक सेगमेंटेशन (OVDG-SS) को पेश करता है, जो स्वायत्त ड्राइविंग के लिए एक नया सेटिंग और बेंचमार्क है जो अनदेखे डोमेन और श्रेणियों दोनों को संबोधित करता है, और विविध शहरी वातावरणों में सुदृढ़ प्रदर्शन प्राप्त करने के लिए विजन-लैंग्वेज मॉडल्स में टेक्स्ट-इमेज सहसंबंधों को परिष्कृत करने हेतु एक स्टेट-स्पेस-ड्रिवन तंत्र, S2-Corr का प्रस्ताव करता है।

मूल लेखक: Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट ड्राइवर को शहर में नेविगेट करना सिखा रहे हैं।

पुराना तरीका: "कठोर छात्र" (The Strict Student)
पारंपरिक रूप से, हम रोबोट को धूप वाले दिनों, साफ सड़कों, कारों और लोगों की हजारों तस्वीरें दिखाकर सिखाते थे। रोबate ने इन विशिष्ट चीजों को पहचानना सीखा।

  • समस्या: यदि अचानक इस रोबोट को भारी बारिश, एक अंधेरी सुरंग, या निर्माण क्षेत्र (construction zone) में रख दिया जाए जहाँ अजीब नई चीजें हों (जैसे एक विशाल छाता या पुलिस बैरियर), तो रोबोट घबरा जाता है। वह कहता है, "मुझे नहीं पता कि यह क्या है!" या "क्या यह एक कार है? नहीं, रुको, बारिश हो रही है!" वह विफल हो जाता है क्योंकि उसे केवल नियमों की एक निश्चित सूची और निश्चित चीजों के लिए सिखाया गया था।

नया विचार: "खुले दिमाग वाला खोजकर्ता" (The Open-Minded Explorer)
यह पेपर एक नए तरीके के बारे में बताता है जिसे OVDG-SS (ओपन-वोकैबुलरी डोमेन जनरलाइजेशन) कहा जाता है। इसे एक छात्र के बजाय एक खोजकर्ता बनने के लिए प्रशिक्षित करने के रूप में सोचें।

  • ओपन वोकैबुलरी (Open Vocabulary): 10 चीजों की सूची याद करने के बजाय, रोबोट अवधारणाओं (concepts) को समझना सीखता है। यदि आप उसे कहते हैं, "एक 'ट्रैफिक कोन' को ढूंढो," तो वह जानता है कि कोन क्या होता है, भले ही उसने पहले कभी उसे न देखा हो। वह दुनिया को समझने के लिए एक "शब्दकोश" (टेक्स्ट विवरणों) का उपयोग करता है।
  • डोमेन जनरलाइजेशन (Domain Generalization): रोबोट इन अवधारणाओं को तब भी पहचानना सीखता है जब "मौसम" बदल जाता है। इससे कोई फर्क नहीं पड़ना चाहिए कि धूप खिली है, बर्फ गिर रही है, या कैमरा धुंधला है; रोबोट को अभी भी पता होना चाहिए कि "सड़क" या "व्यक्ति" क्या है।

बड़ी चुनौती: "शोर वाला रेडियो" (The Noisy Radio)
शोधकर्ताओं ने वर्तमान "स्मार्ट" रोबोटों में एक बड़ी समस्या पाई। वे एक शक्तिशाली उपकरण (जैसे कि एक सुपर-इंटेलिजेंट लाइब्रेरी जिसे विजन-लैंग्वेज मॉडल कहा जाता है) का उपयोग चित्रों को शब्दों से जोड़ने के लिए करते हैं।

  • उपमा: कल्पना करें कि आप एक सुरंग (एक नया वातावरण) के माध्यम से गाड़ी चलाते समय एक रेडियो स्टेशन (शब्द "Road") को सुनने की कोशिश कर रहे हैं। सुरंग के कारण स्टैटिक और शोर पैदा होता है। सिग्नल विकृत हो जाता है। रोबोट "Road" सुनता है लेकिन स्टैटिक उसे सोचने पर मजबूर कर देता है कि यह शायद "Grass" या "Sky" है।
  • तकनीकी शब्दों में, जब वातावरण बदलता है (प्रकाश, मौसम, स्थान), तो चित्र और टेक्स्ट के बीच का संबंध "शोर भरा" (noisy) और भ्रमित करने वाला हो जाता है। रोबोट उन चीजों को देखने लगता है जो वहां नहीं हैं या उन्हें पहचानने में चूक जाता है जो वहां मौजूद हैं।

समाधान: S2-Corr (द "सिग्नल क्लीनर")
इसे ठीक करने के लिए, लेखकों ने एक नया मॉड्यूल बनाया जिसे S2-Corr कहा जाता है। इसे रोबोट के दिमाग के लिए एक हाई-टेक नॉइज़-कैंसलिंग हेडफ़ोन के रूप में समझें।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. साँप की तरह स्कैन करना (The Snake Scan - द पाथ):
    कल्पना करें कि रोबोट टेक्स्ट की एक लंबी पंक्ति को पढ़ रहा है (छवि)। पुराने तरीके इसे एक रोबोट की तरह पढ़ते हैं: बाएँ-से-दाएँ, ऊपर-से-नीचे, बहुत सख्ती से। यदि शुरुआत में कोई टाइपो (शोर) है, तो रोबोट पूरे वाक्य के लिए भ्रमित हो जाता है।
  • S2-Corr टेक्स्ट को एक साँप की तरह पढ़ता है। यह आगे-पीछे (ज़िग-ज़ैग) रेंगता है। यह इसे "पड़ोस" (स्थानिक संरचना) के संदर्भ को बरकरार रखने में मदद करता है। यदि यह एक जगह अजीब शोर देखता है, तो यह उस शोर को पूरे वाक्य को खराब करने नहीं देता क्योंकि यह अपने परिवेश की जाँच करता रहता है।
  1. डिके गेट (The Decay Gate - द फ़िल्टर):
    कल्पना करें कि रोबोट एक कहानी याद कर रहा है। कभी-कभी, पुरानी यादें (प्रशिक्षण डेटा से) वर्तमान स्थिति के लिए गलत होती हैं।
  • S2-Corr के पास एक विशेष "भूलने वाला गेट" (forgetting gate) है। यदि जानकारी बहुत पुरानी या बहुत शोर भरी है (जैसे कि धूप वाले दिन की एक स्टैटिक-भरी याद जबकि वर्तमान में बारिश हो रही है), तो गेट कहता है, "इसे जाने दो।" यह खराब डेटा को फ़िल्टर कर देता है ताकि केवल स्पष्ट, प्रासंगिक जानकारी ही आगे बढ़ सके।
  1. संदर्भित संकेत (The Contextual Hint - द ट्रांसलेटर):
    छवि को समझने की कोशिश करने से पहले, S2-Corr वर्तमान मौसम के आधार पर इसे एक छोटा सा संकेत देता है।
  • उपमा: यदि बारिश हो रही है, तो रोबोट को एक नोट मिलता है: "हे, याद रखो, आज चीजें अधिक गहरी और गीली दिख रही हैं।" यह रोबोट को अपनी अपेक्षाओं को समायोजित करने में मदद करता है ताकि वह बारिश के कारण भ्रमित न हो।

परिणाम
इस "सिग्नल क्लीनर" का उपयोग करके, रोबोट अब यह कर सकता है:

  • बारिश, बर्फबारी या रात में गाड़ी चलाना।
  • उन नई चीजों को पहचानना जिन्हें उसने पहले कभी नहीं देखा है (जैसे निर्माण बैरियर या आवारा कुत्ता) केवल उनका नाम पढ़कर।
  • यह सब पिछले तरीकों की तुलना में कम कंप्यूटर पावर और तेज़ी से कर सकता है।

सारांश में
यह पेपर सेल्फ-ड्राइविंग कारों को अनुकूलनशील (adaptable) बनाने के बारे में है। केवल एक धूप वाले शहर के मानचित्र को याद करने के बजाय, वे एक शहर की अवधारणा को समझना सीख रहे हैं, चाहे मौसम कैसा भी हो या वे किन अजीब नई वस्तुओं का सामना करें। उन्होंने यह एक स्मार्ट "नॉइज़ फ़िल्टर" बनाकर किया है जो दुनिया के अस्त-व्यस्त होने पर भी रोबोट के विज़न को स्पष्ट रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →