Positive-Only Drifting Policy Optimization
تقدم هذه الورقة البحثية "تحسين سياسة الانجراف الإيجابي فقط" (PODPO)، وهو نهج توليدي يعتمد على التعلم التعزيزي عبر الإنترنت، وهو نهج خالٍ من الاحتمالية وخالٍ من تقليم التدرج، يستفيد من التباين المحلي المرجح بالميزة على عينات الميزة الإيجابية لتوجيه الأفعال نحو مناطق العائد المرتفع مع منع الأخطاء بشكل استباقي.