← नवीनतम पेपर
💻 computer science

Safe Learning Predictive Control for Ego-World Robotic Systems

यह शोधपत्र SOWL-MPC प्रस्तुत करता है, जो एक सुरक्षित लर्निंग-आधारित प्रेडिक्टिव कंट्रोल फ्रेमवर्क है जो ऑनलाइन स्पार्स वेरिएशनल गॉसियन प्रोसेस लर्निंग को अनिश्चितता-जागरूक मॉडल प्रेडिक्टिव कंट्रोल के साथ जोड़कर एक ईगो रोबोट को अज्ञात वर्ल्ड रोबॉट्स वाले साझा वातावरण में नेविगेट करने में सक्षम बनाता है।

मूल लेखक: Davide Valenti, Giuseppe Notarstefano

प्रकाशित 2026-07-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Davide Valenti, Giuseppe Notarstefano

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले, अराजक गलियारे में टैग के एक हाई-स्टेक्स खेल में खेल रहे हैं। आप "ईगो" (Ego) खिलाड़ी हैं, और आपका लक्ष्य बिना किसी से टकराए एक विशिष्ट पथ पर दौड़ना है। लेकिन इसमें एक मोड़ है: अन्य खिलाड़ी, "वर्ल्ड" (World) रोबोट, आपके चारों ओर घूम रहे हैं, और आपको उनके गेम प्लान का कोई अंदाजा नहीं है। क्या वे रुकने वाले हैं? बाएं मुड़ने वाले हैं? या गति बढ़ाने वाले हैं? रोबोटिक्स की दुनिया में, यह एक बड़ी चुनौती है: आप एक कार या रोबोट को सुरक्षित रूप से कैसे चलाएं जब अन्य चालक कुछ भी कर सकते हैं, और आप उनके मन को नहीं पढ़ सकते?

इसे हल करने के लिए, वैज्ञानिक आमतौर पर दो चीजों पर भरोसा करते हैं। पहला, वे मॉडल प्रेडिक्टिव कंट्रोल (MPC) का उपयोग करते हैं, जो एक सुपर-स्मार्ट जीपीएस की तरह है जो न केवल यह देखता है कि आप अभी कहाँ हैं, बल्कि आपकी यात्रा के अगले कुछ सेकंडों का अनुकरण (सिमुलेशन) करता है ताकि यह देखा जा सके कि कहीं आप टकरा तो नहीं जाएंगे। दूसरा, वे मशीन लर्निंग का उपयोग करते हैं, विशेष रूप से गौसियन प्रोसेस (Gaussian Processes) नामक एक टूल का, जो एक सांख्यिकीय क्रिस्टल बॉल की तरह कार्य करता है। अनुमान लगाने के बजाय, यह भविष्य की भविष्यवाणी करने के लिए पिछले डेटा को देखता है, लेकिन महत्वपूर्ण रूप से, यह आपको यह भी बताता है कि वह कितना अनिश्चित है। यदि क्रिस्टल बॉल हिल रही है, तो रोबोट जानता है कि उसे अतिरिक्त सावधानी बरतनी चाहिए। बड़ा सवाल यह पेपर उठाता है: क्या हम एक रोबोट को एक अजनबी रोबोट के "व्यक्तित्व" को तुरंत सीखना, अपने क्रिस्टल बॉल को रीयल-टाइम में अपडेट करना, और एक अनजान रोबोट के व्यवहार के बावजूद सुरक्षित रूप से टक्करों से बचना सिखा सकते हैं?

यह पेपर एक नई रणनीति पेश करता है जिसे SOWL-MPC (सेफ ऑनलाइन वर्ल्ड पॉलिसी लर्निंग मॉडल प्रेडिक्टिव कंट्रोल) कहा जाता है। इसे आपके रोबोट को एक अजनबी की आदतों को तुरंत सीखने की "सुपरपावर" देने के रूप में समझें। लेखकों के "ईगो-वर्ल्ड" परिदृश्य में, जिस रोबोट को आप नियंत्रित करते हैं (ईगो), वह नहीं जानता कि दूसरे रोबोट (वर्ल्ड) कौन से नियम मान रहा है। दूसरा रोबोट एक छिपे हुए स्क्रिप्ट का पालन कर रहा हो सकता है, या वह हर सेकंड अपना मन बदल रहा हो सकता है। पारंपरिक तरीके दूसरे रोबोट के पथ का अनुमान लगाने के लिए निश्चित नियमों या पूर्व-प्रशिक्षित स्मृति का उपयोग करते हैं, लेकिन यदि दूसरा रोबोट कुछ नया करता है, तो वे तरीके विफल हो जाते हैं या बहुत अधिक डर जाते हैं।

SOWL-MPC खेल को इस तरह बदल देता है जैसे कि यह चलते समय सीखने वाला एक जासूस हो। केवल दूसरे रोबोट को देखने के बजाय, यह दूसरे रोबोट के "मस्तिष्क" (कंट्रोल पॉलिसी) का मॉडल बनाने के लिए स्पार्स वेरिएशनल गौसियन प्रोसेस (SVGPs) नामक एक विशेष गणितीय ट्रिक का उपयोग करता है, जबकि वह उसे चलते हुए देख रहा होता है। पेपर दिखाता है कि रोबोट दूसरे रोबोट की स्थिति के शोर भरे, धुंधले अवलोकनों (observations) से यह पता लगा सकता है कि दूसरा रोबोट उसके पहियों को क्या कमांड भेज रहा है। यह ऑनलाइन वेरिएशनल कंडीशनिंग (OVC) नामक तकनीक का उपयोग करके करता है, जो हर बार एक नई सड़क देखने पर पूरे नक्शे को फिर से बनाने के बजाय रीयल-टाइम में एक नक्शे को अपडेट करने जैसा है।

लेखकों ने इसे दो तरीकों से परखा। पहले, उन्होंने NVIDIA JetRacer कारों का उपयोग करके एक वर्चुअल दुनिया में हजारों सिमुलेशन चलाए। उन्होंने पाया कि जब "वर्ल्ड" कार ट्रैक के एक नए, अनछुए हिस्से में चलने लगती है, तो SOWL-MPC उसके नए व्यवहार को जल्दी से सीख लेता है। जबकि एक मानक रोबोट जो ऑनलाइन नहीं सीख सकता था, वह टकरा रहा था या लक्ष्य से चूक रहा था, SOWL-MPC ने अनुकूलन किया, जिससे उसके प्रेडिक्शन एरर बड़े गलतियों से घटकर मात्र 0.05 मीटर (लगभग 2 इंच) रह गए। उन्होंने यह भी परीक्षण किया कि उनका रोबोट कितना "सुरक्षित" था, इसके लिए उन्होंने nσn_\sigma नामक एक सुरक्षा नॉब को बदला। जब उन्होंने सुरक्षा को बढ़ाकर 3 कर दिया, तो रोबोट अविश्वसनीय रूप से सतर्क हो गया, दुर्घटना की किसी भी संभावना से बचने के लिए पहले से योजना बनाने लगा, और 50 अलग-अलग रैंडम ट्रायल्स में टकराव से बचने की 100% सफलता दर हासिल की।

अंत में, टीम ने केवल कंप्यूटर सिमुलेशन तक ही सीमित नहीं रही। उन्होंने कोड लिया और उसे एक इनडोर एरिना में वास्तविक, भौतिक रोबोटों पर लगाया। उन्होंने देखा कि "ईगो" रोबोट ने "वर्ल्ड" रोबोट को सफलतापूर्वक चकमा दिया जो उसके रास्ते को काट रहा था या उसे ओवरटेक कर रहा था। वास्तविक दुनिया के परीक्षणों ने वही पुष्टि की जो सिमुलेशन ने सुझाव दिया था: रोबोट ऑन-द-फ्लाई दूसरे रोबोट के व्यवहार को सीख सकता है और सुरक्षित रूप से नेविगेट कर सकता है। पेपर निष्कर्ष निकालता है कि यह दृष्टिकोण काम करता है, यह साबित करते हुए कि एक रोबोट तेज़ सीखने वाला और एक सुरक्षित ड्राइवर दोनों हो सकता है, भले ही दूसरा ड्राइवर एक रहस्य हो। यह ब्रह्मांड की हर समस्या को हल करने वाला जादू का डंडा नहीं है, लेकिन दो रोबोटों के बीच साझा स्थान वाले विशिष्ट चुनौती के लिए, SOWL-MPC एक बहुत ही आशाजनक मार्ग दिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →