Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning
यह शोध पत्र ऑफलाइन मेटा-रिनफोर्समेंट लर्निंग के लिए एक नवीन ढांचे का प्रस्ताव करता है जो सूचना-सैद्धांतिक, व्यवहार-अपरिवर्तनीय कार्य प्रतिनिधित्व शिक्षण को ट्रांसफार्मर-आधारित स्टोकेस्टिक वर्ल्ड मॉडल और कंजर्वेटिव वैल्यू पेनल्टीज़ के साथ जोड़ता है ताकि वितरण बदलाव (डिस्ट्रीब्यूशन शिफ्ट) को दूर किया जा सके और स्पार्स-रिवॉर्ड, आउट-ऑफ-डिस्ट्रीब्यूशन वातावरण में मजबूत सामान्यीकरण प्राप्त किया जा सके।