Entropy-Regularized Adjoint Matching for Offline RL
यह शोध पत्र मैक्सिमम एंट्रॉपी एडजॉइंट मैचिंग (ME-AM) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो लोकप्रियता पूर्वाग्रह (popularity bias) और सपोर्ट बाइंडिंग (support binding) से निपटने के लिए मिरर डिसेंट एंट्रॉपी मैक्सिमाइजेशन और एक मिश्रण व्यवहार पूर्ववर्ती (mixture behavior prior) को फ्लो-मैचिंग-आधारित ऑफलाइन आरएल (RL) में एकीकृत करता है, जिससे स्पार्स-रिवॉर्ड डेटासेट्स से इष्टतम नीतियों के सुदृढ़ निष्कर्षण को सक्षम बनाया जा सके।