Reinforcement learning for vertical position control on the EXL-50U spherical tokamak
यह शोध पत्र EXL-50U स्फेरिकल टोकामक पर वर्टिकल पोजीशन कंट्रोल के लिए एक प्रयोगात्मक रूप से मान्य सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क प्रस्तुत करता है, जो पारंपरिक PID कंट्रोलर्स के तुलनीय मिलीमीटर-स्केल ट्रैकिंग सटीकता प्राप्त करता है और साथ ही लगातार एक्चुएटर प्रयास को कम करता है, जिससे भविष्य की फ्यूजन प्रणालियों के लिए लर्निंग-आधारित नियंत्रण की व्यवहार्यता प्रदर्शित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
स्वच्छ, असीमित ऊर्जा की खोज में, वैज्ञानिक यहाँ पृथ्वी पर सूर्य की शक्ति को फिर से बनाने की कोशिश कर रहे हैं। वे ऐसा करने के लिए एक डोनट के आकार के चुंबकीय पिंजरे के भीतर 'प्लाज्मा' नामक अति-गर्म गैस को कैद करते हैं। इस प्रक्रिया को 'मैग्नेटिक कन्फाइनमेंट फ्यूजन' (चुंबकीय बंधन संलयन) कहा जाता है, जिसके लिए प्लाज्मा को पूरी तरह से स्थिर रखना आवश्यक है। यदि गैस केंद्र से थोड़ा भी विचलित होती है, तो वह मशीन की दीवारों से टकरा सकती है, तुरंत ठंडी हो सकती है, और प्रतिक्रिया रुक सकती है। यह विशेष रूप से एक विशिष्ट प्रकार की मशीन में बहुत कठिन है जिसे 'स्फेरिकल टोकामक' (spherical tokamak) कहा जाता है, जिसका आकार चपटे डोनट के बजाय एक कोर वाले सेब जैसा होता है। ये मशीनें कॉम्पैक्ट और कुशल होने के लिए डिज़ाइन की गई हैं, लेकिन उनका अनूठा आकार प्लाज्मा को स्वाभाविक रूप से अस्थिर बना देता है, जिससे यह एक ऐसे गुब्बारे की तरह ऊपर या नीचे जाने के प्रति संवेदनशील हो जाता है जो अपनी जगह पर नहीं टिक पाता। इस तैरते हुए आग के गोले को स्थिर रखना ही एक सफल प्रयोग और अचानक होने वाली हिंसक दुर्घटना के बीच का अंतर है।
वर्षों से, शोधकर्ता प्लाज्मा को केंद्र में रखने के लिए मानक, नियम-आधारित कंप्यूटर प्रोग्रामों पर भरोसा करते रहे हैं। ये प्रोग्राम एक थर्मोस्टेट की तरह कार्य करते हैं, जो लगातार स्थिति की जाँच करते हैं और चुंबकीय क्षेत्रों में छोटे-छोटे समायोजन करते हैं। हालांकि वे कुछ सेटअपों के लिए पर्याप्त रूप से काम करते हैं, लेकिन जब प्लाज्मा खिंच जाता है या जब मशीन को उसकी सीमाओं तक धकेला जाता है, तो वे संघर्ष करते हैं। चीन में EXL-50U नामक मशीन पर हाल के प्रयोगों में, इन मानक नियंत्रणों ने अक्सर प्लाज्मा को काफी अधिक डगमगाते हुए छोड़ दिया, जिससे वह कभी-कभी कई सेंटीमीटर तक विचलित हो गया। ऐसी बड़ी हलचलें खतरनाक होती हैं; वे मशीन को नुकसान पहुँचा सकती हैं और उन्नत हीटिंग सिस्टम के उपयोग को रोक सकती हैं। इस समस्या को हल करने के लिए, वैज्ञानिकों की एक टीम एक अलग प्रकार की बुद्धिमत्ता की ओर मुड़ी: मशीन लर्निंग। मशीन को कठोर नियमों के साथ प्रोग्राम करने के बजाय, उन्होंने इसे एक अत्यधिक विस्तृत वर्चुअल सिमुलेशन में अभ्यास करके प्लाज्मान को नियंत्रित करना सिखाया, ठीक वैसे ही जैसे एक पायलट वास्तविक विमान छूने से पहले फ्लाइट सिम्युलेटर में प्रशिक्षण लेता है।
शोधकर्ताओं ने EXL-50U मशीन का एक 'डिजिटल ट्विन' बनाया, जो एक वर्चुअल वातावरण है जो प्लाज्मा के वास्तविक भौतिक विज्ञान और विद्युत सर्किट की अत्यंत सटीकता के साथ नकल करता है। इस सिमुलेशन के भीतर, उन्होंने 'रीइन्फोर्समेंट लर्निंग' (सुदृढ़ीकरण शिक्षण) पर आधारित एक नए प्रकार के कंट्रोलर का परीक्षण किया। यह एक ऐसी विधि है जहाँ एक कृत्रिम एजेंट 'ट्रायल एंड एरर' (प्रयास और त्रुटि) के माध्यम से सीखता है, जिसमें प्लाज्मा को स्थिर रखने के लिए उसे इनाम और उसे भटकने देने के लिए दंड मिलता है। टीम ने इस डिजिटल एजेंट को एक विशिष्ट प्रायोगिक रन पर प्रशिक्षित किया और फिर इसे एक पूरी तरह से अलग रन पर प्लाज्मा को नियंत्रित करने की चुनौती दी, जहाँ स्थितियाँ थोड़ी भिन्न थीं। उन्होंने इस लर्निंग-आधारित दृष्टिकोण की तुलना मानक नियम-आधारित कंट्रोलर और एक अन्य उन्नत विधि से की जिसे 'लीनियर क्वाड्रेटिक रेगुलेटर' कहा जाता है, जो जटिल गणितीय मॉडल पर निर्भर करती है।
सिमुलेशन के परिणाम उत्साहजनक थे। मानक नियम-आधारित कंट्रोलर प्लाज्मा को लक्ष्य पर रख सकता था, लेकिन इसके लिए मशीन के मैग्नेट को बहुत कड़ी मेहनत करनी पड़ती थी, यानी निरंतर सुधार करने के लिए बहुत अधिक विद्युत शक्ति का उपयोग करना पड़ता था। मॉडल-आधारित दृष्टिकोण स्थितियों के बदलने पर स्थिर रहने के लिए संघर्ष करता था, जिससे प्लाज्मा अक्सर थोड़ी गलत स्थिति में रह जाता था। हालाँकि, रीइन्फोर्समेंट लर्निंग एजेंट ने प्लाज्मा को उल्लेखनीय सहजता के साथ निर्देशित करना सीखा। इसने वांछित पथ का उतना ही सटीक रूप से पीछा किया जितना कि मानक कंट्रोलर ने किया, लेकिन इसने मैग्नेट से बहुत कम प्रयास के साथ ऐसा किया। यह दक्षता महत्वपूर्ण है क्योंकि इसका अर्थ है कि मशीन अपने पावर सिस्टम पर बोझ डाले बिना अधिक समय तक और अधिक स्थिरता के साथ चल सकती है। यह सुनिश्चित करने के लिए कि लर्निंग एजेंट वर्चुअल दुनिया और वास्तविकता के बीच होने वाले अनिवार्य अंतरों को संभाल सके, टीम ने एक सरल सुधार तंत्र जोड़ा जिसने इसे छोटे त्रुटियों के लिए समायोजित करने में मदद की, यह एक ऐसी तकनीक थी जो सटीकता बनाए रखने के लिए महत्वपूर्ण साबित हुई।
इन वर्चुअल सफलताओं से उत्साहित होकर, टीम ने प्रशिक्षित आर्टिफिशियल इंटेलिजेंस को कंप्यूटर से बाहर निकाला और वास्तविक मशीन में डाल दिया। उन्होंने वास्तविक EXL-50U टोकामक पर प्रशिक्षित लर्निंग कंट्रोलर को तैनात किया, और लाइव प्रयोगों के दौरान नियंत्रण संभालने की अनुमति दी। दस से अधिक अलग-अलग शॉट्स में, सिस्टम ने निर्धारित समय सीमा के भीतर प्लाज्मा को ऊर्ध्वाधर रूप से स्थिर रखने में सफलता प्राप्त की। इन सात शॉट्स में से एक प्रत्यक्ष तुलना में, लर्निंग कंट्रोलर ने मानक कंट्रोलर की ट्रैकिंग सटीकता का मिलान किया, जिससे प्लाज्मा लक्ष्य से कुछ मिलीमीटर के भीतर रहा। साथ ही, इसने स्थिरता प्राप्त करने के लिए लगातार कम विद्युत शक्ति का उपयोग किया। इसने प्रदर्शित किया कि एक मशीन लर्निंग सिस्टम न केवल फ्यूजन रिएक्टर के कठोर वातावरण में जीवित रह सकता है, बल्कि दक्षता के मामले में पारंपरिक तरीकों से बेहतर प्रदर्शन भी कर सकता है।
हालाँकि, प्रयोग ने वर्तमान तकनीक की सीमाओं को भी उजागर किया। जब एक प्रयोग के अंत में प्लाज्मा करंट कम होने लगा, तो लर्निंग कंट्रोलर, जिसे स्थिर स्थितियों के लिए प्रशिक्षित किया गया था, अपना नियंत्रण खोने लगा और प्लाज्मा फिर से भटकने लगा। इससे पता चला कि जबकि एजेंट स्थिर चरणों को संभालने में उत्कृष्ट था, उसे तेजी से बदलती स्थितियों के अनुकूल होने के लिए अभी भी अधिक मजबूत उपकरणों की आवश्यकता है। शोधकर्ताओं ने नोट किया कि भविष्य के सुधारों के लिए संभवतः सिस्टम को मशीन के व्यवहार में बदलावों को वास्तविक समय में पहचानने और अपनी रणनीति को तुरंत बदलने की आवश्यकता होगी। इसके बावजूद, यह सफल तैनाती एक महत्वपूर्ण कदम है। यह सिद्ध करता है कि लर्निंग-आधारित नियंत्रण, फ्यूजन के जटिल और अस्थिर भौतिकी को प्रबंधित करने के लिए एक व्यवहार्य मार्ग है, जो ग्रिड तक स्वच्छ ऊर्जा लाने के लिए आवश्यक अधिक स्थिर और कुशल रिएक्टरों की ओर एक व्यावहारिक रास्ता प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।