Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning
यह शोध पत्र मल्टीटास्क डिस्क्रिमिनेटर प्रॉक्सिमिटी-गाइडेड IRL (MPG) प्रस्तुत करता है, जो एक फ्यू-शॉट इनवर्स रीइन्फोर्समेंट लर्निंग विधि है जो सीमित लक्ष्य प्रदर्शनों और संबंधित मल्टी-टास्क डेटा से पर्याप्त विविधताओं वाले नए कार्यों को प्रभावी ढंग से सीखने के लिए एक सामान्यीकरण योग्य डिस्क्रिमिनेटर और एक प्रॉक्सिमिटी फंक्शन को जोड़ता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी उच्च सफलता दर प्राप्त होती है।