← नवीनतम पेपर
🤖 AI

Bridging Learned Visual Perception and Symbolic Belief-Space Planning

यह शोध पत्र एक नवीन "VLM-as-probabilistic-grounder" प्रतिमान प्रस्तुत करता है जो दृश्य धारणा की अनिश्चितता को प्रतीकात्मक अवस्थाओं (symbolic states) पर प्रायिकता वितरणों के रूप में कैप्चर करता है, जिससे आंशिक रूप से अवलोकन योग्य वातावरणों में मौजूदा नियतात्मक (deterministic) दृष्टिकोणों से बेहतर, सुदृढ़ विश्वास-स्थान नियोजन (belief-space planning) सक्षम होता है।

मूल लेखक: Guy Azran, Michael Navat, Sarah Keren

प्रकाशित 2026-09-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guy Azran, Michael Navat, Sarah Keren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक बिखरे हुए लिविंग रूम को व्यवस्थित करने की कोशिश कर रहा है। वह मेज पर एक किताब देखता है और कमरे के दूसरी ओर एक शेल्फ है। लेकिन उसका कैमरा हिल रहा है, और रोशनी कम है। वास्तविक दुनिया में, रोबोटों की दृष्टि शायद ही कभी एकदम सटीक होती है। वे एक साथ सब कुछ नहीं देख सकते; वस्तुएं फर्नीचर के पीछे छिप जाती हैं, और सेंसर अक्सर इस बात का गलत अर्थ निकाल लेते हैं कि वे क्या देख रहे हैं। एक रोबोट को सुरक्षित और प्रभावी ढंग से कार्य करने के लिए, उसे यह स्वीकार करना चाहिए कि वह क्या नहीं जानता। यदि वह इस बारे में गलत अनुमान लगाता है कि कोई वस्तु कहाँ है, तो वह उस चीज़ को पकड़ने की कोशिश कर सकता है जो वहाँ है ही नहीं, या इससे भी बुरा, वह उस वस्तु को रखने की कोशिश कर सकता है जिसे वह पकड़े हुए नहीं है। यह अनिश्चितता मशीनों को हमारे जटिल, अप्रत्याशित घरों में नेविगेट करना सिखाने में सबसे बड़ी बाधा है।

वर्षों से, शोधकर्ताओं ने रोबोट को एक ऐसा "मस्तिष्क" देकर इसे हल करने की कोशिश की है जो किसी तस्वीर को देख सके और तुरंत तय कर सके कि क्या सत्य है। वे शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करते हैं जो छवियों और भाषा दोनों को समझते हैं। विचार सरल था: रोबट को एक फोटो दिखाएं, उससे पूछें "क्या कैबिनेट खुला है?", और यदि मॉडल कहता है "हाँ," तो रोबोट इसे एक परम सत्य मान लेता है और अपनी अगली चाल की योजना बनाता है। लेकिन व्यवहार में, यह दृष्टिकोण बहुत नाजुक (brittle) है। जब मॉडल गलती करता है—जो अक्सर तब होता है जब वस्तुएं छिपी होती हैं या दृश्य स्पष्ट नहीं होता—तो रोबोट एक झूठ के आधार पर योजना का पालन करता है। वह एक ऐसे दरवाजे को खोलने की कोशिश में मिनटों बिता सकता है जो पहले से ही खुला है, या इससे भी बुरा, वह पूरी तरह से हार मान सकता है क्योंकि उसे लगता है कि कार्य असंभव है। मुख्य समस्या यह है कि ये सिस्टम अनिश्चित अनुमानों को निश्चित तथ्यों के रूप में मानते हैं, जिससे त्रुटि की कोई गुंजाइश नहीं बचती।

टेक्नियन (Technion), इज़राइल के शोधकर्ताओं की एक टीम ने इस समस्या के बारे में सोचने का एक अलग तरीका प्रस्तावित किया है। रोबोट को दुनिया के बारे में एक एकल, कठोर अनुमान लगाने के लिए मजबूर करने के बजाय, उन्होंने इसे एक साथ कई संभावनाओं को अपने मन में रखने के लिए प्रशिक्षित किया। वे अपने नए सिस्टम को RoVLaP कहते हैं। एआई मॉडल से यह पूछने के बजाय कि "किताब मेज पर है" या "किताब मेज पर नहीं है," यह सिस्टम मॉडल से यह पूछता है कि प्रत्येक परिदृश्य की कितनी संभावना है। यह कह सकता है कि किताब के मेज पर होने की 60% संभावना है और दराज के अंदर छिपे होने की 40% संभावना है। इन संभावनाओं को जीवित रखकर, रोबोट दुनिया के बारे में एक "विश्वास" (belief) बना सकता है जो अनिश्चितता को स्वीकार करता है। यह केवल सबसे संभावित परिदृश्य के लिए योजना नहीं बनाता; यह एक साथ संभावित परिदृश्यों की एक श्रृंखला के लिए योजना बनाता है।

शोधकर्ताओं ने एक सिम्युलेटेड होम एनवायरनमेंट (एक डिजिटल दुनिया जो आभासी फर्नीचर, दराजों और वस्तुओं से भरी है) में इस विचार का परीक्षण किया। उन्होंने रोबोट को घरेलू कार्यों के सामान्य कार्य दिए, जैसे किताबों को शेल्फ पर छाँटना, दराजों की सफाई करना, या दरवाजे लॉक करना। इन परीक्षणों में, रोबोट को पूरी तरह से केवल वही देखना था जो उसका कैमरा देख सकता था, बिना इस विशेष ज्ञान के कि छिपी हुई वस्तुएं कहाँ हो सकती हैं। उन्होंने अपने नए तरीके की तुलना दो अन्य सामान्य दृष्टिकोणों से की: एक जहाँ एआई मॉडल सीधे रोबोट को चरण-दर-चरण निर्देश देता है, और दूसरा जहाँ मॉडल कमरे का एक एकल, निश्चित विवरण देता है जिसका उपयोग एक मानक प्लानर द्वारा किया जाता है।

परिणामों ने नए दृष्टिकोण के लिए एक स्पष्ट लाभ दिखाया। सिम्युलेटेड परीक्षणों में, मानक तरीके अक्सर विफल हो गए जब रोबोट का दृश्य बाधित या भ्रामक था। उदाहरण के लिए, एक कार्य में जहाँ एक कटोरा बंद कैबिनेट के अंदर छिपा हुआ था, मानक रोबोट यह मान लेगा कि कटोरा दिखाई दे रहा है और उसे तुरंत पकड़ने की कोशिश करेगा, जिससे वह हर बार विफल होगा। हालाँकि, नया सिस्टम पहचान गया कि कटोरा छिपा हो सकता है। इसने एक ऐसी क्रियाओं की श्रृंखला की योजना बनाई जिसमें पहले कैबिनेट खोलना शामिल था। इस एक बदलाव ने रोबोट को उन स्थितियों में सफल बनाया जहाँ अन्य तरीके विफल रहे। कठिन कार्यों पर, नए सिस्टम ने 66.7% समस्याओं को हल किया, जबकि मानक "ग्राउंडर" पद्धति ने एक भी नहीं सुलझाया। मध्यम-कठिनाई वाले कार्यों पर, इसने मानक पद्धति की तुलना में सफलता दर में 160% से अधिक सुधार किया।

केवल अधिक कार्य हल करने के अलावा, नया सिस्टम अधिक कुशल भी था। क्योंकि इसने शुरुआत से ही अनिश्चितता के लिए योजना बनाई, इसलिए इसने कम गलतियाँ कीं और इसे अपनी योजनाओं को कम बार फिर से शुरू करना पड़ा। मानक तरीकों को अक्सर रुकना पड़ता था, यह महसूस करना पड़ता था कि वे गलत थे, और फिर से प्रयास करना पड़ता था, जिससे समय और ऊर्जा बर्बाद होती थी। इसके विपरीत, नया सिस्टम ऐसी योजनाएँ बनाता था जो प्रारंभिक भ्रम को संभालने के लिए पर्याप्त मजबूत थीं और जिन्हें फिर से सोचने के लिए रुकने की आवश्यकता नहीं थी। यह एक प्रकार के सतर्क आत्मविश्वास के साथ चला, इस संभावना के लिए तैयार होकर कि उसका पहला अनुमान गलत हो सकता है, और ज़रूरत पड़ने पर एक बैकअप योजना भी तैयार रखी।

शोधकर्ताओं ने यह भी सिद्ध किया कि यह तरीका गणितीय रूप से सुदृढ़ है। उन्होंने दिखाया कि यदि आर्टिफिशियल इंटेलिजेंस मॉडल रैंडम अनुमान लगाने से थोड़ा भी बेहतर है, तो रोबोट अंततः दुनिया की वास्तविक स्थिति को समझ लेगा यदि वह अपने विश्वासों को देखता और अपडेट करता रहता है। इस सिस्टम को मॉडल के पूर्ण होने की आवश्यकता नहीं है; इसे केवल एक सिक्के के उछाल (coin flip) से लगातार बेहतर होने की आवश्यकता है। समय के साथ, जैसे-जैसे रोबक दृश्य साक्ष्य एकत्र करता है, उसकी अनिश्चितता कम होती जाती है, और उसकी योजनाएं अधिक सटीक होती जाती हैं। यह एक सुरक्षा जाल प्रदान करता है: भले ही रोबोट के पास गलत विचार से शुरुआत हो, सिस्टम को खुद को सुधारने के लिए डिज़ाइन किया गया है ताकि वह क्रैश न हो या अटक न जाए।

यह कार्य स्वायत्त एजेंटों (autonomous agents) को बनाने के तरीके में एक बदलाव का प्रतिनिधित्व करता है। यह इस विचार से दूर जाता है कि एक रोबोट को कार्य करने के लिए सत्य को जानने की आवश्यकता है, और इस विचार की ओर बढ़ता है कि एक रोबोट अनिश्चित होने पर भी बुद्धिमानी से कार्य कर सकता है। दुनिया को एक एकल निश्चित वास्तविकता के बजाय संभावनाओं के सेट के रूप में मानकर, रोबोट अधिक अनुकूलन योग्य और विश्वसनीय बन जाता है। सिम्युलेटेड घरों में, इसका अर्थ एक ऐसे रोबोट के बीच का अंतर था जो छिपी हुई वस्तु को न देख पाने पर हार मान लेता है और एक ऐसे रोबोट के बीच जो उसे खोजने के लिए धैर्यपूर्वक कैबिनेट खोलता है। जैसे-जैसे रोबोट नियंत्रित प्रयोगशालाओं से हमारे वास्तविक घरों में आ रहे हैं, जहाँ रोशनी बदलती है, वस्तुएं हिलती हैं, और दृश्य बाधित होते हैं, अज्ञात के लिए योजना बनाने की यह क्षमता उन्हें वास्तव में उपयोगी साथी बनाने की कुंजी हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →