Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning
تقدم هذه الورقة البحثية "Daze"، وهو هجوم باب خلفي جديد خالٍ من المكافآت (reward-free) يستهدف اختراق وكلاء التعلم المعزز المدربين في بيئات محاكاة غير موثوقة ببراعة عبر التلاعب بديناميكيات البيئة لتحفيز أفعال خبيثة دون الحاجة إلى الوصول إلى إشارات المكافأة أو تعديلها، وهي قدرة تم التحقق من صحتها تجريبياً على كل من المحاكاة والأجهزة الروبوتية في العالم الحقيقي.