Symmetric Behavior Regularized Policy Optimization
यह शोध पत्र सिमेट्रिक बिहेवियर रेगुलराइज्ड पॉलिसी ऑप्टिमाइजेशन (SymBRPO) के लिए एक सार्वभौमिक ढांचे को प्रस्तुत करता है जो पियर्सन-वजडा डाइवर्जेंस के परिमित-श्रृंखला सन्निकटन (finite-series approximation) का उपयोग करके सिमेट्रिक डाइवर्जेंस में क्लोज्ड-फॉर्म समाधानों की कमी और संख्यात्मक अस्थिरता पर विजय प्राप्त करता है, जिससे मजबूत प्रदर्शन प्राप्त होता है और ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) में एसिमेट्रिक रेगुलराइजेशन की सीमाओं को संबोधित किया जाता है।