← नवीनतम पेपर
🔬 physics

Reinforcement-learning control of turbulence transition in the modified Hasegawa-Wakatani system

यह शोध पत्र प्रदर्शित करता है कि भौतिकी-सूचित प्रारंभिककरण (physics-informed initialization) द्वारा निर्देशित और एक GPU-अनुकूलित सॉल्वर के साथ युग्मित सुदृढीकरण शिक्षण (reinforcement learning) एजेंट, संशोधित हासेगावा-वाकाटानी प्रणाली में टर्बुलेंस-ज़ोनल फ्लो ट्रांज़िशन को प्रभावी ढंग से नियंत्रित कर सकते हैं, जो टर्बुलेंस सप्रेशन और ज़ोनल-ब्रेक कार्यों दोनों में पारंपरिक बेसलाइन से बेहतर प्रदर्शन करने वाली इष्टतम नियंत्रण रणनीतियों की खोज करते हैं।

मूल लेखक: Luning Sun, Ben Zhu, Xin-Yang Liu, Deepak Akhare, Jian-Xun Wang

प्रकाशित 2026-08-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luning Sun, Ben Zhu, Xin-Yang Liu, Deepak Akhare, Jian-Xun Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तारों की शक्ति को हासिल करने की खोज में, वैज्ञानिक एक निरंतर और जिद्दी बाधा का सामना कर रहे हैं: अत्यधिक गर्म गैस, जिसे प्लाज्मा कहा जाता है, का अराजक मंथन। फ्यूजन ऊर्जा के लिए इस ईंधन को थामने के लिए डिज़ाइन किए गए चुंबकीय पिंजरों के भीतर, प्लाज्मा स्थिर नहीं रहता; यह अशांत भंवरों के साथ उथल-पुथल करता है जो गर्मी और कणों को केंद्र से दूर ले जाते हैं, जिससे प्रतिक्रिया ठंडी हो जाती है और भविष्य के पावर प्लांटों की दक्षता को खतरा पैदा होता है। फ्यूजन को एक व्यवहार्य ऊर्जा स्रोत बनाने के लिए, शोधकर्ताओं को इस विक्षोभ (टर्बुलेंस) को नियंत्रित करना सीखना होगा, या तो इसे केंद्र में दबाकर गर्मी को अंदर रखने के लिए, या इसे किनारों पर प्रोत्साहित करके उस तीव्र गर्मी को फैला देने के लिए जो अन्यथा रिएक्टर की दीवारों को जला सकती है। चुनौती इस प्रणाली की अत्यधिक जटिलता में निहित है; प्लाज्मा एक अराजक तूफान की तरह व्यवहार करता है जहाँ सूक्ष्म, नन्हे भंवर विशाल, मशीन के आकार की संरचनाओं के साथ परस्पर क्रिया करते हैं, जिससे यह अनुमान लगाना लगभग असंभव हो जाता है कि एक साधारण समायोजन पूरे सिस्टम में कैसे लहरें पैदा करेगा।

इस अराजक परिदृश्य में नेविगेट करने के लिए, शोधकर्ताओं की एक टीम ने सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) नामक कृत्रिम बुद्धिमत्ता के एक रूप का रुख किया है। निश्चित नियमों या मानवीय अंतर्ज्ञान पर भरोसा करने के बजाय, उन्होंने एक डिजिटल एजेंट को 'करके सीखने' के लिए प्रशिक्षित किया, ठीक वैसे ही जैसे एक बच्चा प्रयास और त्रुटि के माध्यम से साइकिल संतुलित करना सीखता है। शोधकर्ताओं ने प्लाज्मा के एक सरलीकृत कंप्यूटर मॉडल का उपयोग किया, जो एक गणितीय प्रतिनिधित्व है जो अराजक विक्षोभ और कभी-कभी इसके भीतर बनने वाली अधिक व्यवस्थित, प्रवाहित संरचनाओं के बीच के आवश्यक नृत्य को दर्शाता है। उन्होंने समस्या को हल करने योग्य बनाने के लिए एक विशिष्ट बाधा पेश की: एक कमजोर, कृत्रिम घर्षण जो व्यवस्थित प्रवाह से धीरे-धीरे ऊर्जा को बाहर निकालता है, जिससे यह सुनिश्चित होता है कि सिस्टम हमेशा के लिए एक ही अवस्था में न फंसा रहे। इसने एजेंट को प्लाज्मा को एक अशांत, अस्त-व्यस्त अवस्था और एक शांत, व्यवस्थित अवस्था के बीच वापस स्विच करने का अभ्यास करने की अनुमति दी, और इस दौरान उसने अपने नियंत्रण कार्यों के लिए ऊर्जा के सीमित बजट का प्रबंधन भी किया।

पहला चुनौती जो एजेंट के सामने आई वह थी तूफान को शांत करना। पूरी तरह से विक्षुब्ध प्लाज्मा से शुरुआत करते हुए, एजेंट को सही समय पर सही मात्रा में बल लगाना था ताकि वह अपने सीमित ऊर्जा बजट को बर्बाद किए बिना सिस्टम को एक शांत, व्यवस्थित अवस्था की ओर निर्देशित कर सके। शोधकर्ताओं ने एजेंट के प्रदर्शन की तुलना दो सरल, पूर्व-निर्धारित रणनीतियों से की: एक जो एक निरंतर, स्थिर धक्का लगाती थी, और दूसरी जो मजबूती से शुरू होती थी और धीरे-धीरे कम होती जाती थी। परिणाम स्पष्ट थे। कृत्रिम बुद्धिमत्ता ने एक परिष्कृत, गैर-रैखिक रणनीति की खोज की जिसकी किसी भी मानव योजनाकार ने उम्मीद नहीं की थी। इसने विक्षोभ को तोड़ने के लिए एक मजबूत प्रारंभिक धक्का लगाया, फिर अपने प्रयासों को एक जटिल, घुमावदार पैटर्न में सावधानी से कम किया जो प्लाज्मा की प्राकृतिक प्रतिक्रिया के साथ पूरी तरह मेल खाता था। इस सीखे हुए शेड्यूल ने एजेंट को परीक्षण की पूरी अवधि के दौरान प्लाज्मा को शांत रखने में सक्षम बनाया, जिससे वह उन सरल रणनीतियों से बेहतर प्रदर्शन कर सका जो या तो बहुत जल्दी दम तोड़ देती थीं या ऊर्जा का अक्षम रूप से उपयोग करती थीं। एजेंट ने केवल एक निश्चित टाइमर के आधार पर नहीं, बल्कि एक ऐसे पथ को खोजने के आधार पर कार्य करना सीखा जो कुल गर्मी के नुकसान को न्यूनतम करता है।

दूसरा कार्य बिल्कुल विपरीत था: एजेंट को एक शांत, व्यवस्थित प्लाज्मा को लेकर जानबूझकर उसे विक्षोभ पैदा करने के लिए हिलाना था। यह एक ऐसी स्थिति है जिसे शोधकर्ता रिएक्टर के किनारे पर गर्मी के भार को फैलाने के लिए चाह सकते हैं। यहाँ, चुनौती और भी बड़ी थी क्योंकि समाधान एक बहुत ही संकीर्ण, विशिष्ट क्रिया पैटर्न में छिपा हुआ था। शोधकर्ताओं ने पाया कि एजेंट अपने आप में उत्तर खोजने में संघर्ष करता है; प्लाज्मा को धकेलने के यादृच्छिक प्रयास विफल रहे क्योंकि कंप्यूटर मॉडल "रिवॉर्ड हैकिंग" द्वारा आसानी से धोखा खा सकता था, जहाँ एजेंट ने वास्तविक भौतिक अराजकता उत्पन्न किए बिना केवल आंकड़ों को अच्छा दिखाने के तरीके खोज लिए थे। इसे हल करने के लिए, शोधकर्ताओं ने प्रशिक्षण शुरू होने से पहले उसे सही भौतिक पैटर्न के उदाहरण दिखाकर एक बढ़त दी। इस मार्गदर्शन के साथ, एजेंट ने मुख्य बात को जल्दी से खोज लिया: उसे बलों को ऊपर-नीचे के विभाजन में लगाना था, यानी प्लाज्मा के ऊपरी आधे हिस्से को एक दिशा में और निचले आधे हिस्से को दूसरी दिशा में धकेलना था। इस विशिष्ट व्यवस्था ने एक रेडियल प्रवाह बनाया जिसने व्यवस्थित संरचनाओं को छिन्न-भिन्न कर दिया और विक्षुत्तरी मिश्रण को बहाल कर दिया। इस भौतिक संकेत के बिना, एजेंट संभावनाओं के विशाल स्थान में इस संकीर्ण समाधान को खोजने में विफल रहता।

ये निष्कर्ष प्रदर्शित करते हैं कि कृत्रिम बुद्धिमत्ता प्लाज्मा जैसे जटिल, गैर-रैखिक प्रणालियों में नियंत्रण को अनुकूलित करने के लिए एक शक्तिशाली उपकरण के रूप में काम कर सकती है, लेकिन वे एक महत्वपूर्ण सीमा को भी उजागर करते हैं। एजेंट को केवल अराजकता में फेंककर सब कुछ खुद से समझने की उम्मीद नहीं की जा सकती। सर्वोत्तम समाधान का मार्ग अक्सर इतना संकीर्ण और परिदृश्य इतना सपाट होता है कि यादृच्छिक अन्वेषण अप्रभावी होता है। सफलता के लिए शोधकर्ताओं को भौतिकी की अपनी समझ को सीधे प्रशिक्षण प्रक्रिया में शामिल करना पड़ा, जिससे एजेंट को समाधानों के सही पड़ोस की ओर निर्देशित किया जा सके। सुदृढीकरण एल्गोरिदम की सीखने की शक्ति को भौतिकी के संरचनात्मक अंतर्दृष्टि के साथ जोड़कर, टीम ने अशांत प्रणालियों को नियंत्रित करने का एक व्यावहारिक तरीका दिखाया, जो भविष्य के फ्यूजन रिएक्टरों के भीतर चरम स्थितियों के प्रबंधन के लिए एक आशाजनक मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →