Partially Observable Markov Decision Processes (POMDPs) and Robotics
यह शोधपत्र रोबोटिक्स प्लानिंग के लिए पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस (POMDP) फ्रेमवर्क की समीक्षा करता है, जिसमें इस बात पर प्रकाश डाला गया है कि कैसे सैंपलिंग-आधारित अनुमानित सॉल्वर में हालिया प्रगति ने भौतिक रोबोटों पर व्यावहारिक, सुदृढ़ अनुप्रयोगों को सक्षम करने के लिए इसकी ऐतिहासिक कम्प्यूटेशनल बाधाओं को दूर कर दिया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ हन्ना कुर्नियावाटी के शोध पत्र "पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस (POMDPs) एंड रोबोटिक्स" का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।
बड़ी तस्वीर: रोबोट की दुविधा
कल्पना कीजिए कि आप घने कोहरे में कार चला रहे हैं। आप सड़क को स्पष्ट रूप से नहीं देख पा रहे हैं (आंशिक दृश्यता/पार्शियल ऑब्जर्वैबिलिटी), और आपका स्टीयरिंग व्हील थोड़ा चिपचिपा हो सकता है या आपके ब्रेक उम्मीद से थोड़ा अलग प्रतिक्रिया दे सकते हैं (नॉन-डिटरमिनिस्टिक प्रभाव)। आपको एक गंतव्य तक पहुँचना है, लेकिन आप ठीक से नहीं जानते कि आप कहाँ हैं, और आप यह भी नहीं जानते कि पहिया घुमाने पर आपकी कार वास्तव में क्या करेगी।
यह एक रोबोट का दैनिक जीवन है। यह शोध पत्र बताता है कि कैसे POMDPs (पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेसेज) वह गणितीय "मस्तिष्क" है जिसे इस धुंधली और अनिश्चित दुनिया में रोबोट को सही निर्णय लेने में मदद करने के लिए डिज़ाइन किया गया है।
समस्या: "परफेक्ट" मस्तिष्क बहुत धीमा है
लंबे समय से, गणितज्ञों को पता था कि इस स्थिति के लिए एक परफेक्ट मस्तिष्क कैसे बनाया जाए। यह परफेक्ट मस्तिष्क हर एक संभावित भविष्य, हर एक संभावित गलती और हर एक संभावित परिणाम की गणना करेगा ताकि सबसे अच्छे एकल कदम को खोजा जा सके।
हालाँकि, यह शोध पत्र बताता है कि यह "परफेक्ट मस्तिष्क" एक ऐसे पहेली को हल करने जैसा है जिसके टुकड़े ब्रह्मांड में मौजूद परमाणुओं से भी अधिक हैं। यह इतना गणनात्मक रूप से भारी है कि एक साधारण समस्या के लिए एक कदम तय करने में ही घंटों या दिन लग जाते हैं। एक रोबोट के लिए जिसे वास्तविक समय (रियल-टाइम) में चलना है, यह बेकार है। यह एक रोड ट्रिप के लिए परफेक्ट रूट की गणना करने जैसा है जबकि आप पहले से ही ट्रैफिक में फंसे हुए हैं; जब तक आप अपनी गणना पूरी करेंगे, तब तक आप दुर्घटनाग्रस्त हो चुके होंगे।
समाधान: "काफी अच्छा" अन्वेषक (The "Good Enough" Explorer)
यह शोध पत्र 2000 के दशक की शुरुआत से हुए एक बड़े ब्रेकथ्रू पर प्रकाश डालता है। परफेक्ट होने की कोशिश करने के बजाय, शोधकर्ताओं ने सैंपलिंग-बेस्ड सॉल्वर्स विकसित किए।
इसे एक विशाल, अंधेरी गुफा की खोज करने जैसा समझें।
- पुराना तरीका (परफेक्ट सॉल्वर): आप एक भी कदम उठाने से पहले गुफा के हर इंच, हर पत्थर और हर छाया का मानचित्र बनाने की कोशिश करते हैं। आप प्रवेश द्वार पर ही रह जाते हैं क्योंकि नक्शा बहुत बड़ा है।
- नया तरीका (सैंपलिंग सॉल्वर): आप एक टॉर्च जलाते हैं। आप पूरी गुफा का नक्शा नहीं बनाते। इसके बजाय, आप कुछ कदम चलते हैं, चारों ओर देखते हैं, और पूछते हैं, "अगर मैं बाईं ओर जाता हूँ, तो क्या होने की संभावना है? अगर मैं दाईं ओर जाता हूँ, तो क्या होने की संभावना है?" आप केवल उन्हीं रास्तों की खोज करते हैं जो आशाजनक लगते हैं। आप उन रास्तों को छोड़ देते हैं जिन्हें आप पहले ही देख चुके हैं।
यह दृष्टिकोण पूर्णतः सर्वश्रेष्ठ पथ की गारंटी नहीं देता है, लेकिन यह बहुत जल्दी एक बहुत अच्छा पथ खोज लेता है। यही चीज़ है जो आज रोबोट को व्यावहारिक बनाती है। वे बिना ठप पड़े अनिश्चितता को संभाल सकते हैं।
पाँच बड़ी बाधाएँ (और उन्हें कैसे पार किया गया)
शोध पत्र में उन पाँच विशिष्ट "दानवों" का विवरण दिया गया है जिन्होंने POMDPs को रोबोट के लिए असंभव बना दिया था, और कैसे नए "सैंपलिंग" तरीकों ने उन्हें वश में किया:
डायमेंशनलिटी का अभिशाप (बहुत सारी जगहें):
- समस्या: यदि एक रोबोट के पास होने वाली 100 संभावित जगहें हैं, तो गणित विस्फोटक हो जाता है। यह 100-अंकों वाले लॉक के हर संभावित संयोजन को याद रखने जैसा है।
- समाधान: हर नंबर को याद रखने के बजाय, रोबोट केवल उन नंबरों को याद रखता है जिनका सामना करने की संभावना अधिक है। यह अपनी स्मृति को उन "पड़ोसों" पर केंद्रित करता है जहाँ वह वास्तव में जाता है।
इतिहास का अभिशाप (बहुत सारे कदम):
- समस्या: एक अच्छा निर्णय लेने के लिए, एक रोबोट को भविष्य के बारे में सोचना पड़ता है। लेकिन यदि वह 30 कदम आगे सोचता है, तो संभावित भविष्यों की संख्या तेजी से बढ़ती है (जैसे एक पेड़ की शाखाएं बेतहाशा फैलती हैं)।
- समाधान: रोबोट "मैक्रो-एक्शन" का उपयोग करता है। हर छोटी मांसपेशी की हरकत के बारे में सोचने के बजाय, वह बड़े लक्ष्यों के संदर्भ में सोचता है, जैसे "रसोई में जाओ" या "कप उठाओ।" यह मानसिक समयरेखा को छोटा कर देता है।
डेटा की बाढ़ (बहुत सारे अवलोकन):
- समस्या: रोबोट के पास कैमरे, लेजर और सेंसर होते हैं। वे लाखों पिक्सेल देखते हैं। हर एक पिक्सेल को वर्गीकृत करना असंभव है।
- समाधान: रोबोट समान चीजों को एक साथ समूह बनाना सीख जाता है। उसे इससे फर्क नहीं पड़ता कि दीवार पिक्सेल #405 है या #406; उसे बस यह पता होना चाहिए कि "वहाँ एक दीवार है।" यह दृश्य को सरल बनाता है।
अनंत विकल्प (बहुत सारे कार्य):
- समस्या: यदि एक रोबोट अपने हाथ को निरंतर सुचारू गति में हिला सकता है, तो हिलने के अनंत तरीके हैं। आप उन सभी की जाँच नहीं कर सकते।
- समाधान: रोबोट कुछ यादृच्छिक (रैंडम) गतिविधियों का नमूना लेता है, परीक्षण करता है कि कौन सी आशाजनक दिख रही हैं, और फिर उन पर ध्यान केंद्रित करता है। यह दुनिया के हर फ्लेवर को चखने के बजाय आइसक्रीम के कुछ फ्लेवर चखकर सबसे अच्छा खोजने जैसा है।
जटिल भौतिकी (अनुमान लगाना कठिन है):
- समस्या: कुछ रोबोटों (जैसे रेस कार या स्क्रूड्राइवर) में जटिल भौतिकी होती है जहाँ एक छोटा सा बदलाव बड़े, अप्रत्याशित परिणाम की ओर ले जाता है। एक चरण का सिमुलेशन करने में लंबा समय लगता है।
- समाधान: रोबोट "लेजी" (आलसी) सिमुलेशन का उपयोग करता है। वह पहले एक त्वरित, मोटा अनुमान लगाता है। केवल तभी जब वह अनुमान दिलचस्प दिखता है, वह विस्तृत और महंगा सिमुलेशन चलाता है।
वास्तविक दुनिया का प्रमाण
यह शोध पत्र केवल सिद्धांत नहीं है। इसमें उल्लेख है कि इन तरीकों को वास्तविक सॉफ्टवेयर (जैसे SARSOP, POMCP, और ABT नामक उपकरण) में डाला गया है और वास्तविक रोबोटों पर परीक्षण किया गया है।
- परिणाम: एक वास्तविक रोबोटिक कॉन्फ्रेंस (ICRA 2018) में एक वास्तविक डेमो में, इन "काफी अच्छे" POMDP रणनीतियों का उपयोग करने वाला रोबोट 100% बार सफल रहा।
- तुलना: जब उसी रोबोट ने अनिश्चितता (धुंध को अनदेखा करते हुए) को ध्यान में रखे बिना कार्य करने की कोशिश की, तो वह केवल 35% बार सफल हुआ।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि भले ही हम अभी भी ऐसा "परफेक्ट" रोबोट मस्तिष्क नहीं बना सकते जो सब कुछ जानता हो, लेकिन हमने एक "पर्याप्त स्मार्ट" मस्तिष्क बनाया है जो अज्ञात को संभालना जानता है। स्मार्ट सैंपलिंग तकनीकों का उपयोग करके, रोबोट अब अनिश्चितता से निपटने, जानकारी एकत्र करने और कार्यों को मजबूती से पूरा करने में सक्षम हैं, भले ही वे पूरी तस्वीर न देख पा रहे हों।
संक्षेप में: हमने पूरे ब्रह्मांड की गणना करने की कोशिश करना छोड़ दिया और स्मार्ट, शिक्षित अनुमान लगाना शुरू कर दिया। इसी बदलाव ने आधुनिक, विश्वसनीय रोबोट को संभव बनाया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।