Deep Q-Learning on Hölder Spaces
यह शोध पत्र हॉल्डर-नियमित (Hölder-regular) गुणांकों के तहत निरंतर-समय स्टोकेस्टिक नियंत्रण में बेलमैन लक्ष्यों (Bellable targets) की नियमितता का विश्लेषण करता है, जो यह प्रदर्शित करता है कि वे एनिसोट्रोपिक स्मूथनेस क्लासेज (anisotropic smoothness classes) में मैप होते हैं, जो एक व्युत्पन्न सन्निकटन सीमाओं (derived approximation bounds) और संसाधन व्यापार-बंदों (resource trade-offs) वाले टेंसर-प्रोडक्ट DeepONet आर्किटेक्चर को प्रेरित करता है, जबकि स्पष्ट रूप से यह भी उल्लेख करता है कि व्यावहारिक सैंपल्ड Q-लर्निंग के लिए पूर्ण अभिसरण स्थापित नहीं किया गया है।