Human-like autonomy emerges from self-play and a pinch of human data
यह शोध पत्र एक हाइब्रिड प्रशिक्षण पद्धति प्रस्तावित करता है जो सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) को मानव प्रदर्शन डेटा की एक न्यूनतम मात्रा (केवल 30 मिनट) के साथ एक नियमितीकरण उद्देश्य (regularization objective) के रूप में जोड़ता है, जिससे व्यापक मानव डेटासेट या नाजुक रिवॉर्ड इंजीनियरिंग की आवश्यकता के बिना, सुरक्षित और स्वाभाविक रूप से मानव व्यवहार के अनुरूप स्वायत्त ड्राइविंग नीतियों का कुशल निर्माण संभव हो पाता है।