← नवीनतम पेपर
💻 computer science

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

यह शोध पत्र CogRun को प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त ऑन-डिवाइस फ्रेमवर्क है जो एक नवीन लर्निंग एजेंट को एक समर्पित सुरक्षा-केंद्रित तर्कसंगत एजेंट के साथ एकीकृत करके, सुरक्षा-महत्वपूर्ण ग्राउंड रोबोट्स को बिना किसी पूर्व मानचित्र या कनेक्टिविटी के अज्ञात वातावरण में संज्ञानात्मक रूप से आधारित रनटाइम लर्निंग करने में सक्षम बनाता है।

मूल लेखक: Yihao Cai, Yanbing Mao, Christian Lebiere

प्रकाशित 2026-09-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihao Cai, Yanbing Mao, Christian Lebiere

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट को एक ऐसे जंगल में भेजा गया है जिसे उसने पहले कभी नहीं देखा है, उसे गिरे हुए पेड़ों की टहनियों, छिपे हुए गड्ढों और ऊबड़-खाबड़ जमीन से भरे रास्ते पर नेविगेट करने का काम दिया गया है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, यह परिदृश्य एक मौलिक बाधा का प्रतिनिधित्व करता है। आज के अधिकांश रोबोट आदर्श, सिम्युलेटेड दुनिया या नियंत्रित प्रयोगशालाओं में प्रशिक्षित होते हैं, जो ऐसे वातावरण में चलना सीखते हैं जो अनुमानित और स्थिर होते हैं। जब इन मशीनों को एक जंगली जंगल या आपदा क्षेत्र की अराजक, परिवर्तनशील वास्तविकता में तैनात किया जाता है, तो वे अक्सर संघर्ष करते हैं। उनका पूर्व-निर्धारित ज्ञान एक देन बन जाता है क्योंकि दुनिया जो उनके सामने आती है, वह उस दुनिया से मेल नहीं खाती जो उन्हें सिखाई गई थी। इसके अलावा, ये रोबोट अपने निर्णयों को प्रोसेस करने के लिए क्लाउड में शक्तिशाली कंप्यूटरों के साथ निरंतर कनेक्शन पर निर्भर रहते हैं। दूरदराज के दुर्गम इलाकों में, वह कनेक्शन अक्सर टूट जाता है, जिससे रोबोट या तो फंस जाता है या वास्तविक समय में अनुकूलित होने में असमर्थ हो जाता है। चुनौती फिर यह है कि एक ऐसी मशीन बनाई जाए जो पूरी तरह से अपने आप, चलते समय ही सीख सके, और बिना मानवीय हस्तक्षेप के सुरक्षित रूप से संचालित हो सके।

शोधकर्ताओं की एक टीम ने 'कॉगरन' (CogRun) नामक एक नई प्रणाली के साथ इस चुनौती का समाधान किया है, जिसे ग्राउंड रोबोट्स को अज्ञात भौतिक स्थानों के माध्यम से चलते समय सुरक्षित रूप से सीखने देने के लिए डिज़ाइन किया गया है। मुख्य विचार रोबोट को ऑन-द-स्पॉट लर्निंग का एक रूप देना है जो उसके अपने ऑनबोर्ड कंप्यूटर पर पूरी तरह से होता है, बिना डेटा को सर्वर पर भेजे। यह दृष्टिकोण रोबोट को बाधाओं और बदलती स्थितियों का सामना करते ही उनके प्रति अनुकूलित होने की अनुमति देता है। यह प्रणाली इस समझ पर आधारित है कि वास्तविक दुनिया में सीखना खतरनाक है; एक रोब oleh रोबोट जो केवल यह देखने के लिए नई चीजें आज़माता है कि क्या काम करता है, वह गिर सकता है या टकरा सकता है। इसे हल करने के लिए, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया है जहाँ रोबोट की सीखने की प्रक्रिया की निगरानी और मार्गदर्शन एक अलग, गैर-सीखने वाली सुरक्षा प्रणाली द्वारा लगातार किया जाता है। यह सुनिश्चित करता है कि जबकि रोबोट बेहतर तरीके से चलना सीख रहा है, वह कभी भी ऐसा कदम न उठाए जिससे वह पलट जाए या किसी चीज़ से टकरा जाए।

यह ढांचा रोबोट के मस्तिष्क को तीन अलग-अलग भागों में विभाजित करके काम करता है जो एक साथ मिलकर काम करते हैं। पहला भाग "लर्निंग एजेंट" (Learning Agent) है, जो एक जिज्ञासु खोजकर्ता है। यह विभिन्न गतिविधियों को आज़माता है, उनके परिणामों को देखता है, और जो कुछ भी वह अनुभव करता है उसके आधार पर अपने प्रदर्शन को सुधारने का प्रयास करता है। हालाँकि, क्योंकि यह एजेंट अभी सीख रहा है, यह गलतियाँ कर सकता है। उन गलतियों को आपदा बनने से रोकने के लिए, दूसरा भाग, "रेशनल एजेंट" (Rational Agent), एक सख्त सुरक्षा संरक्षक के रूप में कार्य करता है। यह एजेंट सीखता नहीं है; यह सुनिश्चित करने के लिए स्थापित, सिद्ध नियमों पर भरोसा करता है कि रोबोट सीधा खड़ा रहे और टकरावों से बचे। यदि लर्निंग एजेंट एक ऐसा कदम सुझाता है जो जोखिम भरा दिखता है, तो रेशनल एजेंट तुरंत नियंत्रण संभाल लेता है ताकि एक सुरक्षित पैंतरेबाज़ी को निष्पादित किया जा सके। तीसरा घटक, "कोऑर्डिनेटर" (Coordinator), वास्तविक समय में रोबोट की स्थिति पर नज़र रखता है और यह निर्णय लेता है कि किसी दिए गए क्षण में कौन सा एजेंट प्रभारी है। यदि रोबोट सुरक्षित रूप से चल रहा है, तो कोऑर्डिनेटर लर्निंग एजेंट को चलाने देता है। जैसे ही रोबोट किसी खतरनाक स्थिति में प्रवेश करता है, कोऑर्डिनेटर नियंत्रण रेशनल एजेंट को सौंप देता है जब तक कि खतरा टल न जाए।

इस प्रणाली को जो चीज़ अद्वितीय बनाती है वह यह है कि यह अपने अनुभवों की यादों को कैसे संभालती है। जब एक रोबोट सीखता है, तो वह इस बारे में भारी मात्रा में डेटा उत्पन्न करता है कि उसने क्या किया और उसके बाद क्या हुआ। अधिकांश प्रणालियाँ इस डेटा को एक साधारण सूची के रूप में संग्रहीत करती हैं और सीखने के लिए यादृच्छिक उदाहरण चुनती हैं। शोधकर्ताओं ने पाया कि यह अक्षम है, विशेष रूप से एक बदलते परिवेश में जहाँ पुराना या अप्रासंगिक डेटा सीखने की प्रक्रिया को भ्रमित कर सकता है। इसके बजाय, कॉगरन एक ऐसी विधि का उपयोग करता है जो मानव स्मृति के काम करने के तरीके से प्रेरित है। यह तीन कारकों के आधार पर यादों को प्राथमिकता देता है: वर्तमान स्थिति के साथ पिछला अनुभव कितना समान है, यह कितनी हाल की घटना है, और समान स्थितियाँ कितनी बार हुई हैं। यह रोबोट को सबसे प्रासंगिक क्षणों पर ध्यान केंद्रित करने की अनुमति देता है, जैसे कि ठीक वह समय जब वह एक गीली पत्ती पर फिसलते-फिसलते बचा था, बजाय इसके कि वह घंटों पहले के डेटा पर समय बर्बाद करे जब स्थितियाँ पूरी तरह से अलग थीं।

इस प्रणाली का परीक्षण करने के लिए, शोधकर्ताओं ने इसे एक वास्तविक, अज्ञात जंगल में एक चार पैरों वाले रोबोट पर तैनात किया। वातावरण मृत क्षेत्रों, जमीन में गहरे गड्ढों और पत्तियों से ढके छेदों से भरा था जो गिरने को छिपा सकते थे। रोबोट को एक शुरुआती बिंदु से लक्ष्य तक तीस मीटर की यात्रा करने का कार्य दिया गया था। इन परीक्षणों में, रोबमा को बिना किसी पूर्व मानचित्र के इलाके के माध्यम से नेविगेट करना सीखना था। परिणामों ने दिखाया कि प्रणाली ने पूरी सीखने की प्रक्रिया के दौरान रोबोट को सुरक्षित रखने में सफलता प्राप्त की। जबकि एक मानक सुरक्षा प्रणाली रोबोट को गिरने से बचा सकती थी, वह अक्सर कुशलता से चलने के लिए बहुत अधिक सतर्क थी। हालाँकि, कॉगरन प्रणाली ने रोबोट को कुछ दर्जन प्रयासों में ही एक सुचारू, कुशल रास्ता सीखने में सक्षम बनाया। रोबोट ने ऊबड़-खाबड़ जमीन को संभालने के लिए अपनी चाल और गति को समायोजित करना सीखा, और अंततः एक निश्चित, पूर्व-निर्धारित रणनीति की तुलना में बहुत तेज़ी से अपने लक्ष्य तक पहुँच गया।

टीम ने यह देखने के लिए कि क्या यह दृष्टिकोण विभिन्न प्रकार की मशीनों पर काम करता है, एक सिम्युलेटेड वन वातावरण में एक ऑफ-रोड स्वायत्त वाहन पर भी इस प्रणाली का परीक्षण किया। उन्होंने इसकी तुलना अन्य उन्नत शिक्षण विधियों से की जो सुरक्षा को संभालने का प्रयास करती हैं। इन सिमुलेशन में, अन्य प्रणालियाँ अक्सर अपना संतुलन खो देती थीं या बाधाओं से टकरा जाती थीं, और अक्सर कार्य पूरा करने में विफल रहती थीं। इसके विपरीत, कॉगगरन प्रणाली ने बिना किसी सुरक्षा उल्लंघन के अधिकांश रन पूरे किए। रोबोट ने घने पेड़ों और पथरीले रास्तों के माध्यम से नेविगेट करना सीखा, और अचानक जमीन बदलने पर भी स्थिरता बनाए रखी। शोधकर्ताओं ने नोट किया कि इस प्रणाली की क्षमता, जो सुरक्षित, नियम-आधारित कार्यों को सीखने-आधारित कार्यों के साथ मिलाती है, अत्यंत महत्वपूर्ण थी। सुरक्षा संरक्षक के सतर्क कदमों को लर्निंग एजेंट के अनुकूलन योग्य कदमों के साथ सावधानीपूर्वक मिलाकर, रोबोट खतरे की रेखा को पार किए बिना नए समाधान खोजने में सक्षम हुआ।

यह कार्य यह प्रदर्शित करता है कि यह संभव है कि रोबोट क्लाउड के साथ कनेक्शन या पर्यावरण के पूर्व-मौजूदा मानचित्र पर निर्भर हुए बिना वास्तविक दुनिया में निरंतर सीख सकें। एक लर्निंग एजेंट जो सुधार की तलाश करता है और एक रेशनल एजेंट जो सुरक्षा की गारंटी देता है, को मिलाकर, और एक मेमोरी सिस्टम का उपयोग करके जो सबसे प्रासंगिक अनुभवों को प्राथमिकता देता है, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया है जो मशीनों को भौतिक दुनिया की अप्रत्याशित प्रकृति के अनुकूल होने की अनुमति देता है। प्रयोगों से पता चलता है कि यह दृष्टिकोण जटिल, अज्ञात वातावरणों में काम करने वाले रोबोटों की सुरक्षा और दक्षता दोनों में महत्वपूर्ण सुधार कर सकता है, जिससे आपदा राहत, अन्वेषण और अन्य महत्वपूर्ण कार्यों के लिए अधिक सक्षम मशीनों का मार्ग प्रशस्त होता है जहाँ का इलाका मानव ऑपरेटरों के लिए बहुत खतरनाक या अप्रत्याशित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →