Reward Machines for Signal Temporal Logic
यह शोध पत्र एक नवीन ऑटोमेटा-आधारित दृष्टिकोण प्रस्तावित करता है जो सिग्नल टेम्पोरल लॉजिक विशिष्टताओं से एक टाइमड अल्टरनेटिंग ऑटोमेटा का निर्माण करता है ताकि सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) के लिए मार्कोवियन पुरस्कार उत्पन्न किए जा सकें, जो पारंपरिक रोबस्टनेस-आधारित विधियों की स्टेट स्पेस विस्तार संबंधी समस्याओं को प्रभावी ढंग से दूर करता है और उच्च नीति संतुष्टि दर प्राप्त करता है।