← नवीनतम पेपर
⚡ electrical engineering

Safe Exploration for Nonlinear Processes Using Online Gaussian Process Learning

यह शोध पत्र आंशिक रूप से ज्ञात गतिकी वाले गैररेखीय प्रणालियों के लिए एक सुरक्षित डेटा-संचालित नियंत्रण ढांचे को प्रस्तुत करता है जो स्थिरता और बाधा संतुष्टि सुनिश्चित करने के साथ-साथ सूचनात्मक अन्वेषण के माध्यम से सुरक्षित परिचालन क्षेत्र को अनुकूल रूप से विस्तारित करने के लिए ऑनलाइन गॉसियन प्रक्रिया शिक्षण को ल्यपुनोव-आधारित संभाव्य सुरक्षा बाधाओं के साथ जोड़ता है।

मूल लेखक: Stefano Tonini, Soroush Rastegarpour, Hamid Reza Feyzmahdavian, Nicola Bastianello, Karl Henrik Johansson

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stefano Tonini, Soroush Rastegarpour, Hamid Reza Feyzmahdavian, Nicola Bastianello, Karl Henrik Johansson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अंधेरे, अपरिचित कमरे में चलना सिखा रहे हैं जो नाजुक फर्नीचर से भरा हुआ है। आपके पास कमरे का एक रफ मैप (लीनियर मॉडल) है, लेकिन आप जानते हैं कि यह नक्शा अधूरा है; इसमें छिपे हुए अवरोध और अजीब फर्श की बनावटें हैं जिन्हें आपने अभी तक नहीं देखा है (अननोन नॉनलीनियर डायनेमिक्स)।

यदि आप रोबोट को कमरे को सीखने के लिए अंधाधुंध घूमने देते हैं, तो वह किसी फूलदान से टकरा सकता है। यदि आप उसे केवल ज्ञात नक्शे पर ही सीमित रखते हैं, तो वह नए अवरोधों के बारे में कभी नहीं जान पाएगा। यह पेपर एक चतुर "ट्रेनिंग व्हील्स" (सहायक पहियों) वाली प्रणाली प्रस्तावित करता है जो रोबोट को वास्तविक समय में कमरे की सच्चाई सीखने के दौरान सुरक्षित रूप से अन्वेषण करने की अनुमति देती है।

यह सिस्टम कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. दो-भाग वाला मस्तिष्क

रोबोट का मस्तिष्क दो भागों में विभाजित है:

  • अनुभवी (लीनियर मॉडल): यह रोबोट का मौजूदा ज्ञान है। यह जानता है कि कम से कम एक सरल अनुमान के आधार पर कमरे का बुनियादी भौतिक विज्ञान कैसा होना चाहिए। यह एक अनुभवी गाइड की तरह है जो सामान्य लेआउट तो जानता है, लेकिन यह भी स्वीकार करता है कि, "मुझे इस विशिष्ट कोने का विवरण नहीं पता।"
  • चेला (गौसियन प्रोसेस): यह एक स्मार्ट शिक्षार्थी है जो रोबोट की गतिविधियों पर नज़र रखता है। जैसे-जैसे रोबोट चलता है, चेला यह देखता है कि वास्तव में क्या हुआ बनाम अनुभवी ने क्या भविष्यवाणी की थी। अंतर ही "रेसिड्यूअल" (आश्चर्य) है। चेला इन आश्चर्यों को सीखने के लिए एक सांख्यिकीय उपकरण जिसका नाम गौसियन प्रोसेस (GP) है, का उपयोग करता है। महत्वपूर्ण बात यह है कि चेला केवल अनुमान नहीं लगाता; वह यह भी गणना करता है कि वह कितना अनिश्चित है। वह कहता है, "मुझे लगता है कि यहाँ फर्श फिसलन भरा है, लेकिन मैं इसके बारे में केवल 95% निश्चित हूँ।"

2. अदृश्य सुरक्षा बुलबुला (PCIS)

रोबोट को सुरक्षित रखने के लिए, सिस्टम रोबोट की वर्तमान स्थिति के चारों ओर एक अदृश्य सुरक्षा बुलबुला बनाता है। इसे प्रोबेबिलिस्टिक कंट्रोल-इनवेरिएंट सेट (PCIS) कहा जाता है।

  • यह कैसे काम करता है: सिस्टम पूछता है, "यदि रोबोट इस दिशा में आगे बढ़ता है, तो क्या इसकी कोई संभावना है कि वह दीवार से टकरा जाएगा, भले ही हमारा 'चेला' गलत हो?"
  • सुरक्षा मार्जिन: चूंकि चेला यह स्वीकार करता है कि वह गलत हो सकता है, इसलिए सिस्टम ज्ञात नक्शे के चारों ओर एक "सुरक्षा बफर" जोड़ता है। यदि चेला बहुत अनिश्चित है (उच्च अनिश्चितता), तो सुरक्षा बुलबुला सिकुड़ जाता है, और रोबोट को केंद्र में रहने के लिए मजबूर किया जाता है। यदि चेला बहुत आश्वस्त है (कम अनिश्चितता), तो बुलबुला फैल जाता है, जिससे रोबोट को और अधिक अन्वेषण करने की अनुमति मिलती है।
  • गारंटी: यह पेपर गणितीय रूप से सिद्ध करता है कि जब तक रोबोट इस बुलबुले के भीतर रहता है, तब तक वह टकराएगा नहीं, भले ही मॉडल त्रुटिपूर्ण हो।

3. "जिज्ञासु लेकिन सतर्क" चालक

रोबोट केवल स्थिर नहीं बैठता है; उसे सीखने के लिए हिलना-डुलना पड़ता है। सिस्टम हर एक कदम पर अगला कदम तय करने के लिए एक गणितीय समस्या (क्वाड्रेटिक प्रोग्राम) को हल करता है।

  • लक्ष्य: यह ऐसा कदम खोजने की कोशिश करता है जो रोबलेट को कमरे के बारे में सबसे अधिक सिखा सके (सूचना लाभ को अधिकतम करना)।
  • प्रतिबंध: इसे कभी भी सुरक्षा बुलबुले से बाहर नहीं जाना चाहिए।
  • परिणाम: रोबोट स्वाभाविक रूप से उन क्षेत्रों की ओर आकर्षित होता है जहाँ वह सबसे अधिक भ्रमित (उच्च अनिश्चितता) है ताकि वह उन्हें सीख सके, लेकिन वह ऐसा बहुत सावधानी से करता है, यह सुनिश्चित करते हुए कि वह कभी भी सुरक्षा नियमों का उल्लंघन न करे। यह एक जिज्ञासु बच्चे की तरह है जो सब कुछ छूना चाहता है लेकिन एक ऐसी सुरक्षा डोरी से बंधा है जो केवल तभी लंबी होती है जब वह साबित करता है कि वह सावधान है।

4. लर्निंग लूप (सीखने का चक्र)

इस पेपर का परीक्षण दो परिदृश्यों में किया गया:

  1. एक सरल 2D गणितीय समस्या: एक सपाट सतह पर घूमता हुआ रोबोट जिसमें एक जटिल वक्र (curve) है।
  2. एक थ्री-टैंक वॉटर सिस्टम: एक जटिल औद्योगिक सेटअप जिसमें तीन पानी के टैंक पाइपों से जुड़े हुए हैं, जहाँ पानी का स्तर सुरक्षित सीमाओं के भीतर रहना चाहिए।

परिणाम:

  • सुरक्षा: प्रत्येक परीक्षण में, रोबोट ने कभी भी सुरक्षा सीमाओं का उल्लंघन नहीं किया (वह कभी नहीं टकराया या टैंकों में पानी ओवरफ्लो नहीं हुआ)।
  • सीखना: जैसे-जैसे रोबोट ने अधिक डेटा एकत्र किया, उसका "चेला" अधिक आत्मविश्वासी होता गया। अनिश्चितता कम होती गई, और सुरक्षा बुलबुला बड़ा होता गया, जिससे रोबोट को कमरे का अधिक अन्वेषण करने की अनुमति मिली।
  • दक्षता: यह सिस्टम वास्तविक समय में निर्णय लेने के लिए इतना तेज़ था कि यह मिलीसेकंड में निर्णय ले सका।

निचोड़

यह पेपर मशीनों को जटिल, अप्रत्याशित प्रणालियों के बारे में सिखाने के लिए एक ढांचा प्रस्तुत करता है, बिना कुछ भी तोड़े। एक ज्ञात "रफ ड्राफ्ट" को एक स्मार्ट, अनिश्चितता-जागरूक शिक्षार्थी के साथ जोड़कर, और इसे एक गणितीय रूप से गारंटीकृत सुरक्षा बुलबुले में लपेटकर, यह सिस्टम एक आदर्श संतुलन प्राप्त करता है: यह तेजी से सीखता है, लेकिन यह कभी भी असुरक्षित जोखिम नहीं लेता।

लेखकों का निष्कर्ष है कि यह विधि उन उद्योगों में वास्तविक दुनिया के उपयोग के लिए तैयार है जहाँ सुरक्षा महत्वपूर्ण है, जैसे कि रोबोटिक्स और प्रोसेस कंट्रोल, बशर्ते कि सिस्टम का प्रारंभिक "रफ ड्राफ्ट" कम से कम कुछ हद तक सटीक हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →