← नवीनतम पेपर
🔬 physics

Reinforcement learning for vertical position control on the EXL-50U spherical tokamak

यह शोध पत्र EXL-50U स्फेरिकल टोकामक पर वर्टिकल पोजीशन कंट्रोल के लिए एक प्रयोगात्मक रूप से मान्य सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क प्रस्तुत करता है, जो पारंपरिक PID कंट्रोलर्स के तुलनीय मिलीमीटर-स्केल ट्रैकिंग सटीकता प्राप्त करता है और साथ ही लगातार एक्चुएटर प्रयास को कम करता है, जिससे भविष्य की फ्यूजन प्रणालियों के लिए लर्निंग-आधारित नियंत्रण की व्यवहार्यता प्रदर्शित होती है।

मूल लेखक: Lei Xing, Huicong Ma, Changquan Yu, Xuanhe Wang, Jiayi Zhi, Pei Guo, Mengyao Li, Zhengyuan Chen, Yapeng Zhang, Guoyang Shi, Dongkai Qi, Xiang Gu, Siqi Ding, Yong Liu, Jianguo Chen, Tianyuan Liu, the E
प्रकाशित 2026-08-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lei Xing, Huicong Ma, Changquan Yu, Xuanhe Wang, Jiayi Zhi, Pei Guo, Mengyao Li, Zhengyuan Chen, Yapeng Zhang, Guoyang Shi, Dongkai Qi, Xiang Gu, Siqi Ding, Yong Liu, Jianguo Chen, Tianyuan Liu, the EXL-50U Teama

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वच्छ, असीमित ऊर्जा की खोज में, वैज्ञानिक यहाँ पृथ्वी पर सूर्य की शक्ति को फिर से बनाने की कोशिश कर रहे हैं। वे ऐसा करने के लिए एक डोनट के आकार के चुंबकीय पिंजरे के भीतर 'प्लाज्मा' नामक अति-गर्म गैस को कैद करते हैं। इस प्रक्रिया को 'मैग्नेटिक कन्फाइनमेंट फ्यूजन' (चुंबकीय बंधन संलयन) कहा जाता है, जिसके लिए प्लाज्मा को पूरी तरह से स्थिर रखना आवश्यक है। यदि गैस केंद्र से थोड़ा भी विचलित होती है, तो वह मशीन की दीवारों से टकरा सकती है, तुरंत ठंडी हो सकती है, और प्रतिक्रिया रुक सकती है। यह विशेष रूप से एक विशिष्ट प्रकार की मशीन में बहुत कठिन है जिसे 'स्फेरिकल टोकामक' (spherical tokamak) कहा जाता है, जिसका आकार चपटे डोनट के बजाय एक कोर वाले सेब जैसा होता है। ये मशीनें कॉम्पैक्ट और कुशल होने के लिए डिज़ाइन की गई हैं, लेकिन उनका अनूठा आकार प्लाज्मा को स्वाभाविक रूप से अस्थिर बना देता है, जिससे यह एक ऐसे गुब्बारे की तरह ऊपर या नीचे जाने के प्रति संवेदनशील हो जाता है जो अपनी जगह पर नहीं टिक पाता। इस तैरते हुए आग के गोले को स्थिर रखना ही एक सफल प्रयोग और अचानक होने वाली हिंसक दुर्घटना के बीच का अंतर है।

वर्षों से, शोधकर्ता प्लाज्मा को केंद्र में रखने के लिए मानक, नियम-आधारित कंप्यूटर प्रोग्रामों पर भरोसा करते रहे हैं। ये प्रोग्राम एक थर्मोस्टेट की तरह कार्य करते हैं, जो लगातार स्थिति की जाँच करते हैं और चुंबकीय क्षेत्रों में छोटे-छोटे समायोजन करते हैं। हालांकि वे कुछ सेटअपों के लिए पर्याप्त रूप से काम करते हैं, लेकिन जब प्लाज्मा खिंच जाता है या जब मशीन को उसकी सीमाओं तक धकेला जाता है, तो वे संघर्ष करते हैं। चीन में EXL-50U नामक मशीन पर हाल के प्रयोगों में, इन मानक नियंत्रणों ने अक्सर प्लाज्मा को काफी अधिक डगमगाते हुए छोड़ दिया, जिससे वह कभी-कभी कई सेंटीमीटर तक विचलित हो गया। ऐसी बड़ी हलचलें खतरनाक होती हैं; वे मशीन को नुकसान पहुँचा सकती हैं और उन्नत हीटिंग सिस्टम के उपयोग को रोक सकती हैं। इस समस्या को हल करने के लिए, वैज्ञानिकों की एक टीम एक अलग प्रकार की बुद्धिमत्ता की ओर मुड़ी: मशीन लर्निंग। मशीन को कठोर नियमों के साथ प्रोग्राम करने के बजाय, उन्होंने इसे एक अत्यधिक विस्तृत वर्चुअल सिमुलेशन में अभ्यास करके प्लाज्मान को नियंत्रित करना सिखाया, ठीक वैसे ही जैसे एक पायलट वास्तविक विमान छूने से पहले फ्लाइट सिम्युलेटर में प्रशिक्षण लेता है।

शोधकर्ताओं ने EXL-50U मशीन का एक 'डिजिटल ट्विन' बनाया, जो एक वर्चुअल वातावरण है जो प्लाज्मा के वास्तविक भौतिक विज्ञान और विद्युत सर्किट की अत्यंत सटीकता के साथ नकल करता है। इस सिमुलेशन के भीतर, उन्होंने 'रीइन्फोर्समेंट लर्निंग' (सुदृढ़ीकरण शिक्षण) पर आधारित एक नए प्रकार के कंट्रोलर का परीक्षण किया। यह एक ऐसी विधि है जहाँ एक कृत्रिम एजेंट 'ट्रायल एंड एरर' (प्रयास और त्रुटि) के माध्यम से सीखता है, जिसमें प्लाज्मा को स्थिर रखने के लिए उसे इनाम और उसे भटकने देने के लिए दंड मिलता है। टीम ने इस डिजिटल एजेंट को एक विशिष्ट प्रायोगिक रन पर प्रशिक्षित किया और फिर इसे एक पूरी तरह से अलग रन पर प्लाज्मा को नियंत्रित करने की चुनौती दी, जहाँ स्थितियाँ थोड़ी भिन्न थीं। उन्होंने इस लर्निंग-आधारित दृष्टिकोण की तुलना मानक नियम-आधारित कंट्रोलर और एक अन्य उन्नत विधि से की जिसे 'लीनियर क्वाड्रेटिक रेगुलेटर' कहा जाता है, जो जटिल गणितीय मॉडल पर निर्भर करती है।

सिमुलेशन के परिणाम उत्साहजनक थे। मानक नियम-आधारित कंट्रोलर प्लाज्मा को लक्ष्य पर रख सकता था, लेकिन इसके लिए मशीन के मैग्नेट को बहुत कड़ी मेहनत करनी पड़ती थी, यानी निरंतर सुधार करने के लिए बहुत अधिक विद्युत शक्ति का उपयोग करना पड़ता था। मॉडल-आधारित दृष्टिकोण स्थितियों के बदलने पर स्थिर रहने के लिए संघर्ष करता था, जिससे प्लाज्मा अक्सर थोड़ी गलत स्थिति में रह जाता था। हालाँकि, रीइन्फोर्समेंट लर्निंग एजेंट ने प्लाज्मा को उल्लेखनीय सहजता के साथ निर्देशित करना सीखा। इसने वांछित पथ का उतना ही सटीक रूप से पीछा किया जितना कि मानक कंट्रोलर ने किया, लेकिन इसने मैग्नेट से बहुत कम प्रयास के साथ ऐसा किया। यह दक्षता महत्वपूर्ण है क्योंकि इसका अर्थ है कि मशीन अपने पावर सिस्टम पर बोझ डाले बिना अधिक समय तक और अधिक स्थिरता के साथ चल सकती है। यह सुनिश्चित करने के लिए कि लर्निंग एजेंट वर्चुअल दुनिया और वास्तविकता के बीच होने वाले अनिवार्य अंतरों को संभाल सके, टीम ने एक सरल सुधार तंत्र जोड़ा जिसने इसे छोटे त्रुटियों के लिए समायोजित करने में मदद की, यह एक ऐसी तकनीक थी जो सटीकता बनाए रखने के लिए महत्वपूर्ण साबित हुई।

इन वर्चुअल सफलताओं से उत्साहित होकर, टीम ने प्रशिक्षित आर्टिफिशियल इंटेलिजेंस को कंप्यूटर से बाहर निकाला और वास्तविक मशीन में डाल दिया। उन्होंने वास्तविक EXL-50U टोकामक पर प्रशिक्षित लर्निंग कंट्रोलर को तैनात किया, और लाइव प्रयोगों के दौरान नियंत्रण संभालने की अनुमति दी। दस से अधिक अलग-अलग शॉट्स में, सिस्टम ने निर्धारित समय सीमा के भीतर प्लाज्मा को ऊर्ध्वाधर रूप से स्थिर रखने में सफलता प्राप्त की। इन सात शॉट्स में से एक प्रत्यक्ष तुलना में, लर्निंग कंट्रोलर ने मानक कंट्रोलर की ट्रैकिंग सटीकता का मिलान किया, जिससे प्लाज्मा लक्ष्य से कुछ मिलीमीटर के भीतर रहा। साथ ही, इसने स्थिरता प्राप्त करने के लिए लगातार कम विद्युत शक्ति का उपयोग किया। इसने प्रदर्शित किया कि एक मशीन लर्निंग सिस्टम न केवल फ्यूजन रिएक्टर के कठोर वातावरण में जीवित रह सकता है, बल्कि दक्षता के मामले में पारंपरिक तरीकों से बेहतर प्रदर्शन भी कर सकता है।

हालाँकि, प्रयोग ने वर्तमान तकनीक की सीमाओं को भी उजागर किया। जब एक प्रयोग के अंत में प्लाज्मा करंट कम होने लगा, तो लर्निंग कंट्रोलर, जिसे स्थिर स्थितियों के लिए प्रशिक्षित किया गया था, अपना नियंत्रण खोने लगा और प्लाज्मा फिर से भटकने लगा। इससे पता चला कि जबकि एजेंट स्थिर चरणों को संभालने में उत्कृष्ट था, उसे तेजी से बदलती स्थितियों के अनुकूल होने के लिए अभी भी अधिक मजबूत उपकरणों की आवश्यकता है। शोधकर्ताओं ने नोट किया कि भविष्य के सुधारों के लिए संभवतः सिस्टम को मशीन के व्यवहार में बदलावों को वास्तविक समय में पहचानने और अपनी रणनीति को तुरंत बदलने की आवश्यकता होगी। इसके बावजूद, यह सफल तैनाती एक महत्वपूर्ण कदम है। यह सिद्ध करता है कि लर्निंग-आधारित नियंत्रण, फ्यूजन के जटिल और अस्थिर भौतिकी को प्रबंधित करने के लिए एक व्यवहार्य मार्ग है, जो ग्रिड तक स्वच्छ ऊर्जा लाने के लिए आवश्यक अधिक स्थिर और कुशल रिएक्टरों की ओर एक व्यावहारिक रास्ता प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →