Zero-shot Transfer of Reinforcement Learning Control Policies for the Swing-Up and Stabilization of a Cart-Pole System
यह शोध पत्र बैंडविड्थ-जागरूक फ़िल्टरिंग (bandwidth-aware filtering), संवेदनशीलता-निर्देशित डोमेन रैंडमाइजेशन (sensitivity-guided domain randomization) और एक रैखिक पाठ्यक्रम शिक्षण अनुसूची (linear curriculum learning schedule) को संयोजित करके कार्ट-पोल स्विंग-अप और स्थिरीकरण के लिए सुदृढीकरण शिक्षण (reinforcement learning) नीतियों के सिमुलेशन से हार्डवेयर तक सफल ज़ीरो-शॉट ट्रांसफर को प्रदर्शित करता है, ताकि मजबूत ऊर्जा इंजेक्शन और विक्षोभ अस्वीकृति (disturbance rejection) सुनिश्चित की जा सके।