Reward Machines for Signal Temporal Logic
تقترح هذه الورقة نهجاً جديداً قائماً على الأوتوماتا يقوم ببناء أوتوماتا متبادلة زمنية من مواصفات المنطق الزمني للإشارات لتوليد مكافآت ماركوفية لتعلم التعزيز، مما يتغلب بفعالية على مشكلات توسع فضاء الحالة التي تعاني منها الطرق التقليدية القائمة على المتانة ويحقق معدلات أعلى في إرضاء السياسة.