Nonparametric Bayesian Inverse Reinforcement Learning with Data-Parallel Gibbs Sampling
यह शोध पत्र एक नॉनपैरामीट्रिक बायेसियन इन्वर्स रीइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तुत करता है जो डिDirichlet प्रोसेस प्रायर और एक डेटा-पैरेलल कोलैप्स्ड गिब्स सैंपलर का उपयोग करता है ताकि संकलित प्रदर्शनों (pooled demonstrations) से विशिष्ट विशेषज्ञ पुरस्कार प्रकारों की संख्या को स्वचालित रूप से अनुमानित किया जा सके, जो ग्रिड-वर्ल्ड कार्यों पर मानक पैरामीट्रिक बेसलाइनों की तुलना में बेहतर क्लस्टरिंग सटीकता और स्केलेबल प्रदर्शन प्रदर्शित करता है।