EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees
यह शोध पत्र EvoPlan प्रस्तुत करता है, जो एक न्यूरो-सिम्बोलिक फ्रेमवर्क है जो प्रदर्शनों (demonstrations) से स्थानिक-कालिक बाधाओं (spatio-temporal constraints) को खोजने के लिए इवोल्यूशनरी सर्च को एकीकृत करता है और उन्हें एक इवोल्यूशनरी PDDL प्लानर और कन्सट्रेंड एक्जीक्यूशन लूप के साथ जोड़ता है ताकि LLM-आधारित रोबोट्स को ओपन-वर्ल्ड वातावरण में औपचारिक गारंटी के साथ सुरक्षित, निष्पादन योग्य योजनाएं उत्पन्न करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त दुनिया में नेविगेट करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक फैक्ट्री में डिलीवरी बॉट या शहर में खुद चलने वाली कार। आपके पास इसे मदद करने के लिए दो मुख्य उपकरण हैं, लेकिन दोनों में एक बड़ी खामी है:
- "क्रिएटिव राइटर" (AI/LLM): यह एक स्मार्ट AI है जो आपके निर्देशों को पढ़ सकता है ("कैफेटेरिया जाओ") और एक चतुर योजना बना सकता है। यह संदर्भ समझने और गलतियों को सुधारने में माहिर है। समस्या: यह थोड़ा लापरवाह है। यह ऐसी योजना बना सकता है जो सुनने में तो अच्छी लगती है लेकिन शारीरिक रूप से असंभव है, या यह गलती से रेड लाइट तोड़ सकता है क्योंकि इसने नियमों के बारे में "सोचा" नहीं।
- "स्ट्रिक्ट अकाउंटेंट" (क्लासिकल प्लानर्स): यह एक कठोर, नियम-आधारित प्रणाली है। यह तभी काम करती है जब आप इसे दुनिया का एक सटीक, गणितीय विवरण दें। समस्या: यह प्राकृतिक भाषा समझने या अपनी गलतियों को सुधारने में बहुत खराब है। यदि दुनिया थोड़ी भी बदलती है, तो यह फ्रीज हो जाता है।
EvoPlan एक नया फ्रेमवर्क है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यह सुरक्षित और निष्पादन योग्य (executable) योजना बनाने के लिए "क्रिएटिव राइटर" का उपयोग करता है और यह सुनिश्चित करने के लिए कि यह सुरक्षित है, "स्ट्रिक्ट अकाउंटेंट" का उपयोग करता है। यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:
1. "शैडो कोच" (नियमों को सीखना)
रोबोट के हिलने से पहले, सिस्टम को सड़क या फैक्ट्री फ्लोर के "अलिखित नियमों" को सीखने की आवश्यकता होती है।
- समस्या: शोधकर्ताओं के पास केवल अच्छे व्यवहार (विशेषज्ञों द्वारा सुरक्षित ड्राइविंग या लोगों का शालीनता से चलना) के वीडियो हैं। उनके पास रोबोट को यह दिखाने के लिए वीडियो नहीं हैं कि क्या नहीं करना है।
- समाधान: सिस्टम एक क्रिएटिव राइटिंग कोच की तरह काम करता है। यह एक अच्छी ड्राइव का वीडियो लेता है और AI से पूछता है: "क्या होगा अगर ड्राइवर तेज हो जाता? क्या होगा अगर वे रेड लाइट पार कर देते?" यह इन "बुरे" परिदृश्यों (counterfactuals) को गढ़ता है ताकि एक विरोधाभास पैदा किया जा सके।
- परिणाम: "अच्छे" वीडियो की तुलना इन आविष्कृत "बुरे" वीडियो से करके, सिस्टम एक एकल, सार्वभौमिक नियम पुस्तिका (जिसे STL constraint कहा जाता है) सीखता है। इसे एक "शैडो कोच" के रूप में सोचें जो रोबोट के कान में फुसफुसाता है: "X से अधिक तेज कभी न जाएं," या "लोगों से हमेशा Y मीटर दूर रहें।" यह नियम पुस्तिका रोबोट के हर कदम पर लागू होती है।
2. "इवोल्यूशनरी एडिटर" (योजना बनाना)
अब, रोबोट को बिंदु A से बिंदु B तक जाने के लिए एक योजना की आवश्यकता है।
- प्रक्रिया: "क्रिएटिव राइटर" (AI) एक योजना का प्रस्ताव देता है। लेकिन इसे सीधे स्वीकार करने के बजाय, सिस्टम इसे एक कठोर एडिटिंग प्रक्रिया से गुजारता है।
- लूप:
- AI एक ड्राफ्ट योजना लिखता है।
- एक "वैलिडेटर" (अकाउंटेंट) इसकी जांच करता है। यदि योजना टूटी हुई है (जैसे, "आप वह दरवाजा नहीं खोल सकते जो मौजूद ही नहीं है"), तो वैलिडेटर विशिष्ट त्रुटि को चिह्नित करता है।
- AI उस त्रुटि को पढ़ता है, उस विशिष्ट हिस्से को ठीक करता है, और फिर से प्रयास करता है।
- यह बार-बार होता है, जैसे एक लेखक एक कहानी को तब तक परिष्कृत करता है जब तक वह एकदम सही न हो जाए।
- जादू: सिस्टम योजना के उन "अच्छे हिस्सों" को बरकरार रखता है जिन्हें पहले ही चेक किया जा चुका है और केवल टूटे हुए हिस्सों को ही दोबारा लिखता है। समय के साथ, योजना लंबी और अधिक विश्वसनीय होती जाती है जब तक कि वह पूरी तरह से वैध न हो जाए।
3. "सेफ्टी गेटकीपर" (रियल-टाइम निष्पादन)
अंत में, रोबोट चलना शुरू करता है। यहीं पर "शैडो कोच" और "सेफ्टी गेटकीपर" नियंत्रण लेते हैं।
- चेक: रोबोट केवल योजना को अंधे होकर निष्पादित नहीं करता है। एक भी कदम उठाने (या पहिया घुमाने) से पहले, सिस्टम उस विशिष्ट गतिविधि की जांच नियम पुस्तिका के विरुद्ध करता है।
- सेफ्टी नेट:
- परिदृश्य A: रोबमा बाएं मुड़ने की योजना बनाता है। गेटकीपर जांचता है: "क्या वहां कोई पैदल यात्री है? क्या गति सुरक्षित है?" हाँ। रोबोट चलता है।
- परिदृश्य B: रोबोट बाएं मुड़ने की योजना बनाता है। गेटकीपर जांचता है: "रुको, एक पैदल यात्री बहुत करीब है!" नहीं। रोबोट तुरंत रुक जाता है।
- री-प्लान (पुनः योजना): यदि गेटकीपर "नहीं" कहता है, तो रोबोट क्रैश नहीं होता है। वह अपने द्वारा लिए गए सभी सुरक्षित कदमों को लॉक कर देता है, अपनी वर्तमान स्थिति को अपडेट करता है, और "इवोल्यूशनरी एडिटर" से शेष यात्रा के लिए एक नई योजना लिखने के लिए कहता है।
यह क्यों महत्वपूर्ण है
यह पेपर दिखाता है कि यह सिस्टम केवल AI या केवल नियमों का उपयोग करने की तुलना में बेहतर काम करता है।
- ड्राइविंग में: ड्राइविंग डेटा पर परीक्षण करते समय, इस सिस्टम ने ड्राइवर AI को फिर से प्रशिक्षित किए बिना टक्करों और रेड-लाइट उल्लंघन को काफी कम कर दिया। इसने बस एक "गार्डरेल" जोड़ दी जिसने गलत चालों को रोक दिया।
- नेविगेशन में: जटिल, ओपन-वर्ल्ड पहेलियों (जैसे घर में वस्तुओं को खोजना) में परीक्षण के दौरान, इस सिस्टम ने अन्य AI प्लानर्स की तुलना में अधिक कार्यों को हल किया, भले ही निर्देशों में इस्तेमाल किए गए शब्द रोबोट की शब्दावली से पूरी तरह मेल न खाते हों।
संक्षेप में: EvoPlan एक रोबोट प्लानिंग सिस्टम है जो रचनात्मक और लचीला होने के लिए AI का उपयोग करता है, लेकिन यह सुनिश्चित करने के लिए कि यह कभी भी खतरनाक या असंभव कुछ न करे, यह उसे एक "सेफ्टी हेलमेट" (डेटा से सीखा हुआ) और एक "नियम पुस्तिका" (कोड द्वारा जांचा गया) पहनने के लिए मजबूर करता है। यह एक बेहद बुद्धिमान लेकिन आवेगपूर्ण ड्राइवर की तरह है जिसे लगातार एक बहुत ही सख्त और बहुत ही स्मार्ट को-पायलट द्वारा निर्देशित किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।