Offline Reinforcement Learning for Plasma Control in Nuclear Fusion: Codebase and Benchmark
यह शोध पत्र RL4F को प्रस्तुत करता है, जो वास्तविक DIII-D टोकामक डेटा पर आधारित परमाणु संलयन प्लाज्मा नियंत्रण के लिए एक मानकीकृत ऑफलाइन सुदृढीकरण शिक्षण (RL) बेंचमार्क है, जो चार पूर्ण-प्रोफ़ाइल ट्रैकिंग कार्यों में विभिन्न एल्गोरिदम का मूल्यांकन करता है और यह प्रदर्शित करता है कि ऑफलाइन मॉडल-आधारित विधियाँ इन जटिल, दीर्घ-क्षितिज समस्याओं में आम तौर पर बेहतर प्रदर्शन करती हैं।