← नवीनतम पेपर
💻 computer science

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

यह शोध पत्र EvoPlan प्रस्तुत करता है, जो एक न्यूरो-सिम्बोलिक फ्रेमवर्क है जो प्रदर्शनों (demonstrations) से स्थानिक-कालिक बाधाओं (spatio-temporal constraints) को खोजने के लिए इवोल्यूशनरी सर्च को एकीकृत करता है और उन्हें एक इवोल्यूशनरी PDDL प्लानर और कन्सट्रेंड एक्जीक्यूशन लूप के साथ जोड़ता है ताकि LLM-आधारित रोबोट्स को ओपन-वर्ल्ड वातावरण में औपचारिक गारंटी के साथ सुरक्षित, निष्पादन योग्य योजनाएं उत्पन्न करने में सक्षम बनाया जा सके।

मूल लेखक: Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त दुनिया में नेविगेट करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक फैक्ट्री में डिलीवरी बॉट या शहर में खुद चलने वाली कार। आपके पास इसे मदद करने के लिए दो मुख्य उपकरण हैं, लेकिन दोनों में एक बड़ी खामी है:

  1. "क्रिएटिव राइटर" (AI/LLM): यह एक स्मार्ट AI है जो आपके निर्देशों को पढ़ सकता है ("कैफेटेरिया जाओ") और एक चतुर योजना बना सकता है। यह संदर्भ समझने और गलतियों को सुधारने में माहिर है। समस्या: यह थोड़ा लापरवाह है। यह ऐसी योजना बना सकता है जो सुनने में तो अच्छी लगती है लेकिन शारीरिक रूप से असंभव है, या यह गलती से रेड लाइट तोड़ सकता है क्योंकि इसने नियमों के बारे में "सोचा" नहीं।
  2. "स्ट्रिक्ट अकाउंटेंट" (क्लासिकल प्लानर्स): यह एक कठोर, नियम-आधारित प्रणाली है। यह तभी काम करती है जब आप इसे दुनिया का एक सटीक, गणितीय विवरण दें। समस्या: यह प्राकृतिक भाषा समझने या अपनी गलतियों को सुधारने में बहुत खराब है। यदि दुनिया थोड़ी भी बदलती है, तो यह फ्रीज हो जाता है।

EvoPlan एक नया फ्रेमवर्क है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यह सुरक्षित और निष्पादन योग्य (executable) योजना बनाने के लिए "क्रिएटिव राइटर" का उपयोग करता है और यह सुनिश्चित करने के लिए कि यह सुरक्षित है, "स्ट्रिक्ट अकाउंटेंट" का उपयोग करता है। यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. "शैडो कोच" (नियमों को सीखना)

रोबोट के हिलने से पहले, सिस्टम को सड़क या फैक्ट्री फ्लोर के "अलिखित नियमों" को सीखने की आवश्यकता होती है।

  • समस्या: शोधकर्ताओं के पास केवल अच्छे व्यवहार (विशेषज्ञों द्वारा सुरक्षित ड्राइविंग या लोगों का शालीनता से चलना) के वीडियो हैं। उनके पास रोबोट को यह दिखाने के लिए वीडियो नहीं हैं कि क्या नहीं करना है।
  • समाधान: सिस्टम एक क्रिएटिव राइटिंग कोच की तरह काम करता है। यह एक अच्छी ड्राइव का वीडियो लेता है और AI से पूछता है: "क्या होगा अगर ड्राइवर तेज हो जाता? क्या होगा अगर वे रेड लाइट पार कर देते?" यह इन "बुरे" परिदृश्यों (counterfactuals) को गढ़ता है ताकि एक विरोधाभास पैदा किया जा सके।
  • परिणाम: "अच्छे" वीडियो की तुलना इन आविष्कृत "बुरे" वीडियो से करके, सिस्टम एक एकल, सार्वभौमिक नियम पुस्तिका (जिसे STL constraint कहा जाता है) सीखता है। इसे एक "शैडो कोच" के रूप में सोचें जो रोबोट के कान में फुसफुसाता है: "X से अधिक तेज कभी न जाएं," या "लोगों से हमेशा Y मीटर दूर रहें।" यह नियम पुस्तिका रोबोट के हर कदम पर लागू होती है।

2. "इवोल्यूशनरी एडिटर" (योजना बनाना)

अब, रोबोट को बिंदु A से बिंदु B तक जाने के लिए एक योजना की आवश्यकता है।

  • प्रक्रिया: "क्रिएटिव राइटर" (AI) एक योजना का प्रस्ताव देता है। लेकिन इसे सीधे स्वीकार करने के बजाय, सिस्टम इसे एक कठोर एडिटिंग प्रक्रिया से गुजारता है।
  • लूप:
    1. AI एक ड्राफ्ट योजना लिखता है।
    2. एक "वैलिडेटर" (अकाउंटेंट) इसकी जांच करता है। यदि योजना टूटी हुई है (जैसे, "आप वह दरवाजा नहीं खोल सकते जो मौजूद ही नहीं है"), तो वैलिडेटर विशिष्ट त्रुटि को चिह्नित करता है।
    3. AI उस त्रुटि को पढ़ता है, उस विशिष्ट हिस्से को ठीक करता है, और फिर से प्रयास करता है।
    4. यह बार-बार होता है, जैसे एक लेखक एक कहानी को तब तक परिष्कृत करता है जब तक वह एकदम सही न हो जाए।
  • जादू: सिस्टम योजना के उन "अच्छे हिस्सों" को बरकरार रखता है जिन्हें पहले ही चेक किया जा चुका है और केवल टूटे हुए हिस्सों को ही दोबारा लिखता है। समय के साथ, योजना लंबी और अधिक विश्वसनीय होती जाती है जब तक कि वह पूरी तरह से वैध न हो जाए।

3. "सेफ्टी गेटकीपर" (रियल-टाइम निष्पादन)

अंत में, रोबोट चलना शुरू करता है। यहीं पर "शैडो कोच" और "सेफ्टी गेटकीपर" नियंत्रण लेते हैं।

  • चेक: रोबोट केवल योजना को अंधे होकर निष्पादित नहीं करता है। एक भी कदम उठाने (या पहिया घुमाने) से पहले, सिस्टम उस विशिष्ट गतिविधि की जांच नियम पुस्तिका के विरुद्ध करता है।
  • सेफ्टी नेट:
    • परिदृश्य A: रोबमा बाएं मुड़ने की योजना बनाता है। गेटकीपर जांचता है: "क्या वहां कोई पैदल यात्री है? क्या गति सुरक्षित है?" हाँ। रोबोट चलता है।
    • परिदृश्य B: रोबोट बाएं मुड़ने की योजना बनाता है। गेटकीपर जांचता है: "रुको, एक पैदल यात्री बहुत करीब है!" नहीं। रोबोट तुरंत रुक जाता है।
  • री-प्लान (पुनः योजना): यदि गेटकीपर "नहीं" कहता है, तो रोबोट क्रैश नहीं होता है। वह अपने द्वारा लिए गए सभी सुरक्षित कदमों को लॉक कर देता है, अपनी वर्तमान स्थिति को अपडेट करता है, और "इवोल्यूशनरी एडिटर" से शेष यात्रा के लिए एक नई योजना लिखने के लिए कहता है।

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि यह सिस्टम केवल AI या केवल नियमों का उपयोग करने की तुलना में बेहतर काम करता है।

  • ड्राइविंग में: ड्राइविंग डेटा पर परीक्षण करते समय, इस सिस्टम ने ड्राइवर AI को फिर से प्रशिक्षित किए बिना टक्करों और रेड-लाइट उल्लंघन को काफी कम कर दिया। इसने बस एक "गार्डरेल" जोड़ दी जिसने गलत चालों को रोक दिया।
  • नेविगेशन में: जटिल, ओपन-वर्ल्ड पहेलियों (जैसे घर में वस्तुओं को खोजना) में परीक्षण के दौरान, इस सिस्टम ने अन्य AI प्लानर्स की तुलना में अधिक कार्यों को हल किया, भले ही निर्देशों में इस्तेमाल किए गए शब्द रोबोट की शब्दावली से पूरी तरह मेल न खाते हों।

संक्षेप में: EvoPlan एक रोबोट प्लानिंग सिस्टम है जो रचनात्मक और लचीला होने के लिए AI का उपयोग करता है, लेकिन यह सुनिश्चित करने के लिए कि यह कभी भी खतरनाक या असंभव कुछ न करे, यह उसे एक "सेफ्टी हेलमेट" (डेटा से सीखा हुआ) और एक "नियम पुस्तिका" (कोड द्वारा जांचा गया) पहनने के लिए मजबूर करता है। यह एक बेहद बुद्धिमान लेकिन आवेगपूर्ण ड्राइवर की तरह है जिसे लगातार एक बहुत ही सख्त और बहुत ही स्मार्ट को-पायलट द्वारा निर्देशित किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →