Learning Generalizable Skill Policy with Data-Efficient Unsupervised RL
यह शोध पत्र GenDa को प्रस्तुत करता है, जो एक एकीकृत अनसुपरवाइज्ड सुदृढीकरण लर्निंग (unsupervised reinforcement learning) फ्रेमवर्क है, जो गैर-स्थिर कौशल अर्थों (non-stationary skill semantics) को संबोधित करने के लिए एक स्किल रिलेबलिंग तंत्र और वितरण बदलावों (distribution shifts) के विरुद्ध मजबूती सुनिश्चित करने के लिए एक पूरक सूचना बाधा (Complementary Information Bottleneck) के माध्यम से डेटा दक्षता और सामान्यीकरण क्षमता को बढ़ाता है।