RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking
RankQ एक ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो संरचित क्रिया वरीयताओं (structured action preferences) को सीखने के लिए समान निराशावाद (uniform pessimism) को एक स्व-पर्यवेक्षित बहु-पद रैंकिंग हानि (self-supervised multi-term ranking loss) से प्रतिस्थापित करके नमूना दक्षता और नीति प्रदर्शन में सुधार करती है, जो स्पार्स रिवॉर्ड बेंचमार्क पर उत्कृष्ट परिणाम और विजन-आधारित रोबोट लर्निंग में महत्वपूर्ण सिम-टू-रियल ट्रांसफर लाभ प्रदर्शित करती है।