Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching
यह शोध पत्र एडजॉइंट मैचिंग (adjoint matching) का लाभ उठाकर डिफ्यूजन पॉलिसीज़ को ऑनलाइन सुदृढीकरण लर्निंग (reinforcement learning) में प्रशिक्षित करने के लिए एक कुशल, सिम्युलेशन-मुक्त एल्गोरिदम पेश करता है ताकि मानक स्कोर मैचिंग की सीमाओं को दूर किया जा सके और लागतपूर्ण लाइकलीहुड एस्टीमेशन (likelihood estimation) या डिफ्यूजन प्रक्रिया के माध्यम से बैकप्रोपैगेशन की आवश्यकता को समाप्त किया जा सके।