← नवीनतम पेपर
💻 computer science

OVSegDT: Segmenting Transformer for Open-Vocabulary Object Goal Navigation

यह शोध पत्र OVSegDT को प्रस्तुत करता है, जो एक हल्का, केवल RGB-आधारित ट्रांसफार्मर पॉलिसी है जो सटीक स्थानिक ग्राउंडिंग के लिए एक सिमेंटिक शाखा को एंट्रॉपी-एडेप्टिव लॉस मॉड्यूलेशन के साथ जोड़कर स्टेट-ऑफ-द-आर्ट ओपन-वोकैबुलरी ऑब्जेक्ट गोल नेविगेशन प्राप्त करता है, जिससे सामान्यीकरण और सुरक्षा में सुधार होता है साथ ही प्रशिक्षण नमूना जटिलता कम होती है।

मूल लेखक: Tatiana Zemskova, Aleksei Staroverov, Dmitry Yudin, Aleksandr Panov

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tatiana Zemskova, Aleksei Staroverov, Dmitry Yudin, Aleksandr Panov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट बटलर को एक ऐसे घर में चीजें ढूंढना सिखा रहे हैं जहाँ वह पहले कभी नहीं गया है। आप उसे कहते हैं, "जाओ और एक तौलिया (towel) ढूंढो।"

समस्या यह है कि रोबोट ने कभी तौलिया देखा ही नहीं है। वह केवल कुर्सियों, मेजों और लैंपों को पहचानना जानता है। अधिकांश रोबट भ्रमित हो जाएंगे, बिना सोचे-समझे इधर-उधर भटकने लगेंगे या दीवारों से टकरा जाएंगे क्योंकि वे किसी विशिष्ट कमरे को याद करने की कोशिश कर रहे हैं, न कि तौलिये की अवधारणा (concept) को समझने की।

यह शोध पत्र OVSegDT पेश करता है, जो रोबोट के लिए एक नया "दिमाग" है जो इस समस्या को हल करता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है।

1. समस्या: भूलने की बीमारी वाला रोबोट

वर्तमान रोबोट उन छात्रों की तरह हैं जो केवल एक विशिष्ट परीक्षा के लिए पढ़ाई करते हैं। यदि परीक्षा में "कुर्सियों" के बारे में पूछा जाता है, तो वे उत्कृष्ट प्रदर्शन करते हैं। लेकिन यदि आप उनसे "तौलिया" (ऐसी चीज़ जिसे उन्होंने कभी नहीं पढ़ा) खोजने के लिए कहते हैं, तो वे सुन्न पड़ जाते हैं। वे अक्सर फर्नीचर से टकराते भी हैं क्योंकि वे केवल अनुमान लगा रहे होते हैं, समझ नहीं रहे होते।

2. समाधान: "हाइलाइटर" रणनीति

लेखकों ने एक हल्का रोबोट मस्तिष्क (एक ट्रांसफार्मर मॉडल) बनाया है जो एक चतुर ट्रिक का उपयोग करता है: बाइनरी मास्क (Binary Mask)।

  • उपमा: कल्पना कीजिए कि आप एक अव्यवस्थित लाइब्रेरी में एक विशिष्ट पुस्तक खोज रहे हैं। केवल शीर्षक पढ़ने के बजाय, कोई आपको एक कागज का टुकड़ा देता है जिस पर उस पुस्तक का एक ब्लैक-एंड-व्हाइट सिलुएट (काली आकृति) बना हुआ है।
  • यह कैसे काम करता है: रोबोट केवल कमरे को नहीं देखता; वह कमरे को एक "हाइलाइटर" के माध्यम से देखता है जो उस वस्तु की आकृति को रेखांकित करता है जिसे वह खोज रहा है। भले ही रोबोट ने पहले कभी "तौलिया" न देखा हो, मास्क उसे बताता है, "उस चीज़ को खोजो जो इस आकार जैसी दिखती है।" यह रोबोट को उन नई वस्तुओं को खोजने की क्षमता देता है जिनका उसने पहले कभी सामना नहीं किया है।

3. प्रशिक्षण: "कॉन्फिडेंस कोच" (EALM)

रोबोट को प्रशिक्षित करना आमतौर पर दो चरणों वाला नृत्य है:

  1. अनुकरण (Imitation): रोबोट एक विशेषज्ञ को देखता है और उसकी हूबहू नकल करता है (जैसे एक छात्र शिक्षक के होमवर्क की नकल करता है)।
  2. सुदृढीकरण (Reinforcement): रोबोट अपने आप प्रयास करता है, सफलता के लिए इनाम पाता है और टकराने पर दंड (जैसे गिरकर साइकिल चलाना सीखना)।

आमतौर पर, आपको चरण 1 से चरण 2 में मैन्युअल रूप से स्विच करना पड़ता है। यदि आप बहुत जल्दी स्विच करते हैं, तो रोबोट चलना भूल जाता है। यदि आप बहुत देर से स्विच करते हैं, तो वह खुद से सोचना कभी नहीं सीख पाता।

नवाचार: लेखकों ने एक प्रणाली बनाई है जिसे EALM (एंट्रॉपी-एडेप्टिव लॉस मॉड्यूलेशन) कहा जाता है।

  • उपमा: EALM को एक स्मार्ट कोच के रूप में सोचें जो रोबोट के बगल में खड़ा है। कोच रोबोट के "आत्मविश्वास" (एंट्रॉपी) को देखता है।
    • यदि रोबोट भ्रमित है (उच्च एंट्रॉपी), तो कोच कहता है, "अनुमान मत लगाओ! बस विशेषज्ञ की नकल करो!"
    • यदि रोबोट आत्मविश्वासी हो रहा है (कम एंट्रॉपी), तो कोच कहता है, "ठीक है, तुम बुनियादी बातें जानते हो। अब जाओ, खुद खोजो और सीखो!"
  • परिणाम: रोबोट तेजी से सीखता है, कम टकराता है, और उसे मैन्युअल रूप से यह बताने की आवश्यकता नहीं होती कि कब मोड बदलना है।

4. "वास्तविक दुनिया" की गड़बड़ी का समाधान

वास्तविक दुनिया में, रोबोट कंप्यूटर से सटीक "हाइलाइटर मास्क" प्राप्त नहीं कर सकते। उन्हें आकार का अनुमान लगाने के लिए एक AI का उपयोग करना पड़ता है, जो पूर्ण नहीं होता। कभी-कभी AI तौलिये को मिस कर सकता है या एक धुंधली रूपरेखा बना सकता है।

लेखकों ने इस स्थिति को संभालने के लिए एक विशेष प्रशिक्षण ट्रिक जोड़ी है:

  • उपमा: कल्पना कीजिए कि आप एक सिम्युलेटर पर ड्राइविंग टेस्ट का अभ्यास कर रहे हैं जहाँ सड़क की रेखाएं कभी-कभार डगमगाती या टेढ़ी-मेढ़ी होती हैं। हार मानने के बजाय, रोबोट उन डगमगाती रेखाओं के बावजूद गाड़ी चलाना सीखता है।
  • यह कैसे काम करता है: उन्होंने रोबोट को एक बाहरी AI (YOLOE) के "शोर वाले" (noisy) अनुमानों का उपयोग करके प्रशिक्षित किया और उसे गलतियों को अनदेखा करना सिखाया। उन्होंने उसे वस्तु के करीब पहुँचने के लिए भी इनाम दिया, भले ही रूपरेखा थोड़ी धुंधली हो। यह रोबोट को बिना महंगे डेप्थ कैमरा सेंसर के वास्तविक दुनिया में काम करने के लिए मजबूत बनाता है।

बड़ी जीत

परिणामस्वरूप एक ऐसा रोबोट मिलता है जो:

  1. हल्का है (Lightweight): यह एक मानक रोबोट कंप्यूटर पर चलने के लिए पर्याप्त छोटा है (उन विशाल AI मॉडलों के विपरीत जिन्हें सुपरकंप्यूटर की आवश्यकता होती है)।
  2. सुरक्षित है: यह पिछले तरीकों की तुलना में 10% कम टकराता है।
  3. स्मार्ट है: यह केवल आकार और टेक्स्ट निर्देश को देखकर उन वस्तुओं को खोज सकता है जिन्हें उसने पहले कभी नहीं देखा (जैसे "तौलिया" या "तकिया")।

संक्षेप में: OVSegDT एक ऐसे चश्मे की तरह है जो रोबोट को उस चीज़ की आकृति को हाइलाइट करने की शक्ति देता है जिसे वह खोज रहा है, साथ ही इसमें एक स्मार्ट कोच भी है जो जानता है कि रोबोट को कब खुद अभ्यास करने देना है। यह रोबोट को अपरिचित घरों में सुरक्षित रूप से नेविगेट करने और किसी भी चीज़ को खोजने की अनुमति देता है, भले ही उसने उस विशिष्ट वस्तु को पहले कभी न देखा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →