← नवीनतम पेपर
💻 computer science

A Scene Language Model for Open-Vocabulary Scene Mapping

यह शोध पत्र SceneLM को प्रस्तुत करता है, जो एक विजन-लैंग्वेज मॉडल है जो एक संक्षिप्त संरचित टेक्स्ट सूची के रूप में एक निरंतर, ओपन-वोकैबुलरी 3D सीन मैप बनाए रखता है, और पारंपरिक मैपिंग सिस्टम की तुलना में काफी कम मेमोरी उपयोग के साथ प्रतिस्पर्धी लोकलाइजेशन और रिट्रीवल प्रदर्शन प्राप्त करता है।

मूल लेखक: Adam Lilja, Fabio Hübel, Siming He, Junsheng Fu, Claire Tomlin, Lars Hammarstrand, Jitendra Malik, Jonas Frey, Marco Pavone

प्रकाशित 2026-09-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adam Lilja, Fabio Hübel, Siming He, Junsheng Fu, Claire Tomlin, Lars Hammarstrand, Jitendra Malik, Jonas Frey, Marco Pavone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

दुनिया में घूमने वाले रोबोटों को यह याद रखने के लिए एक तरीके की आवश्यकता होती है कि उन्होंने क्या देखा है। एक कमरे में नेविगेट करने, दरवाजा खोलने या किसी व्यक्ति को कप थमाने के लिए, एक मशीन को अपने परिवेश का एक मानसिक मानचित्र (मेंटल मैप) बनाना चाहिए जो उसके मुड़ने के बाद भी बना रहे। वर्षों से, इंजीनियर इन मानचित्रों को जटिल, बहु-चरणीय प्रणालियों का उपयोग करके बनाते रहे हैं। ये प्रणालियाँ वस्तुओं का पता लगाती हैं, त्रि-आयामी स्थान में उनकी स्थिति की गणना करती हैं, और फिर विशाल मात्रा में दृश्य डेटा—जैसे कि हर सतह के विस्तृत स्नैपशॉट या गणितीय फिंगरप्रिंट—को संग्रहीत करती हैं ताकि मानचित्र समय के साथ सुसंगत बना रहे। प्रभावी होने के बावजूद, ये विधियाँ मेमोरी पर भारी पड़ती हैं और विभिन्न दृश्यों को जोड़ने के लिए विशेष सॉफ़्टवेयर की आवश्यकता होती है। शोधकर्ता यह सवाल पूछ रहे हैं कि क्या एक एकल, बुद्धिमान प्रणाली इस पूरे काम को सूचना को संग्रहीत करने के एक बहुत सरल तरीके का उपयोग करके स्वयं करने के लिए सीख सकती है।

शोधकर्ताओं की एक टीम ने 'सीनएलएम' (SceneLM) नामक एक नया दृष्टिकोण विकसित किया है, जो इन भारी, बहु-भाग वाली प्रणालियों को एक एकल मॉडल से बदलने का प्रयास करता है जो केवल टेक्स्ट (पाठ) का उपयोग करके एक दृश्य मानचित्र बनाए रखता है। जटिल दृश्य डेटा या फीचर मैप्स को संग्रहीत करने के बजाय, यह प्रणाली वस्तुओं की एक स्थायी सूची, उनके स्थान और संक्षिप्त लिखित विवरण रखती है। जब रोबोट एक नया चित्र देखता है, तो मॉडल अपनी वर्तमान टेक्स्ट-आधारित सूची को पढ़ता है और निर्णय लेता है कि उसे क्या करना है: वह अभी-अभी देखी गई नई वस्तुओं को जोड़ता है, पहले से ज्ञात वस्तुओं के विवरण को संपादित करता है, या उन वस्तुओं को हटा देता है जिन्हें गलती से जोड़ दिया गया था या जो अब वहां नहीं हैं। सिस्टम इन अपडेट्स को करने के लिए लाखों छवियों का अध्ययन करके सीखता है जिन्हें अन्य एआई (AI) टूल्स द्वारा स्वचालित रूप से लेबल किया गया था, जिससे एक ऐसा प्रशिक्षण पाइपलाइन तैयार होता है जिसमें मनुष्यों को मैन्युअल रूप से 3D मानचित्र बनाने की आवश्यकता नहीं होती है।

शोधकर्ताओं ने पाया कि यह टेक्स्ट-ओनली (केवल पाठ आधारित) विधि आश्चर्यजनक रूप से अच्छा काम करती है। भाषा-आधारित खोज और नेविगेशन कार्यों में शामिल परीक्षणों में, मॉडल ने मौजूदा प्रणालियों के समान या उनसे बेहतर प्रदर्शन किया जो समर्पित धारणा (परसेप्शन) और ज्यामिति मॉड्यूल पर निर्भर करते हैं। अधिक महत्वपूर्ण बात यह है कि दृश्य को संग्रहीत करने के लिए आवश्यक मेमोरी पारंपरिक प्रणालियों की तुलना में छह से बारह गुना कम थी। चूंकि इसका प्रतिनिधित्व इतना संक्षिप्त है, इसलिए टीम ने मॉडल को एक चार पैरों वाले रोबोट से जुड़े एक छोटे कंप्यूटर पर चलाने में सक्षम बनाया, जिससे यह वास्तविक समय में वास्तविक वातावरण का मानचित्रण कर सका। रोबोट ने केतली, कूड़ेदान और लाइट स्विच जैसी वस्तुओं की सफलतापूर्वक पहचान की और उन्हें रिकॉर्ड किया, और कमरे में घूमते हुए अपनी गलतियों को सुधारा।

यह सफलता बताती है कि 3D मानचित्र बनाए रखने के लिए आमतौर पर आवश्यक जटिल, इंजीनियर किए गए चरणों को सीधे एक विजन-लैंग्वेज मॉडल द्वारा सीखा जा सकता है। यह प्रणाली केवल वस्तुओं को पहचानती ही नहीं; यह मानचित्र रखरखाव के तर्क को भी सीखती है, यह समझती है कि कब एक प्रविष्टि को रखना है, कब उसे परिष्कृत करना है, और कब उसे हटा देना है। प्रशिक्षण प्रक्रिया एक स्वचालित पाइपलाइन पर टिकी थी जिसने छवियों से उच्च-गुणवत्ता वाले लेबल उत्पन्न किए, खराब विवरणों को फ़िल्टर किया और एक ऐसा डेटासेट बनाया जो मानवीय हस्तक्षेप के बिना मॉडल को ये व्यवहार सिखाने के लिए पर्याप्त बड़ा था। हालांकि प्रत्येक फ्रेम को प्रोसेस करने में यह प्रणाली पुराने तरीकों की तुलना में धीमी है, लेकिन इसका लाभ एक बहुत ही कम मेमोरी फुटप्रिंट और एक एकीकृत दृष्टिकोण है जो धारणा और मेमोरी अपडेट को एक ही चरण में संभालता है।

प्रयोगों ने दिखाया कि मॉडल एक चलते हुए रोबोट की अव्यवस्थित वास्तविकता को संभाल सकता है। एक कैमरा और एक छोटे ऑनबोर्ड कंप्यूटर से लैस एक क्वाड्रुपेड (चार पैरों वाले) रोबोट पर वास्तविक दुनिया के परीक्षण में, इसने इनडोर कमरों और एक बाहरी क्षेत्र सहित तीन अलग-अलग वातावरणों का मानचित्रण किया। इसने छवियों को केवल तभी प्रोसेस किया जब रोबोट एक निश्चित दूरी तक चला, जिससे यह सुनिश्चित हुआ कि वह हार्डवेयर के साथ तालमेल बनाए रख सके। अंतिम मानचित्रों में सही वस्तुएं और सटीक स्थान थे, जो प्रदर्शित करता है कि नेविगेशन और वस्तु प्राप्ति के लिए टेक्स्ट-आधारित प्रतिनिधित्व पर्याप्त था। शोधकर्ताओं ने नोट किया कि हालांकि वर्तमान संस्करण को चलाने के लिए महत्वपूर्ण कंप्यूटिंग शक्ति की आवश्यकता होती है, लेकिन 3D दृश्य को शब्दों की एक सरल सूची में संकुचित करने की क्षमता भविष्य में अधिक कुशल और सक्षम रोबोटों के लिए द्वार खोलती है।

यह सिद्ध करके कि एक एकल मॉडल सरल टेक्स्ट ऑपरेशन्स के माध्यम से एक निरंतर दृश्य अवस्था (सीन स्टेट) को प्रबंधित कर सकता है, यह कार्य इस विचार को चुनौती देता है कि जटिल मैपिंग के लिए जटिल, अलग घटकों की आवश्यकता होती है। परिणाम संकेत देते हैं कि जैसे-जैसे विजन-लेंग्वेज मॉडल अधिक सक्षम होते जा रहे हैं, वे स्वाभाविक रूप से उन कार्यों को आत्मसात कर सकते हैं जो वर्तमान में विशिष्ट सॉफ़्टवेयर द्वारा संभाले जाते हैं। अध्ययन यह दावा नहीं करता है कि इसने रोबोटिक्स की हर समस्या को हल कर लिया है, लेकिन यह इस बात का पुख्ता प्रमाण प्रदान करता है कि एक हल्का, टेक्स्ट-आधारित मेमोरी, अतीत के भारी, फीचर-रिच मानचित्रों का एक व्यवहार्य और शक्तिशाली विकल्प है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →