Offline Reinforcement Learning with Generative Trajectory Policies
यह शोधपत्र जेनेरेटिव ट्रैजेक्टरी पॉलिसीज़ (GTPs) को प्रस्तुत करता है, जो एक एकीकृत ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो निरंतर-समय ODE-आधारित ट्रैजेक्टरी समाधान मानचित्रों को सीखकर धीमे डिफ्यूजन मॉडल्स और तेज़ कंसिस्टेंसी मॉडल्स के बीच के अंतर को पाटता है, और चुनौतीपूर्ण AntMaze कार्यों पर परफेक्ट स्कोर सहित D4RL बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।