P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning
تقدم هذه الورقة البحثية إطار عمل "الانتشار الاحتمالي للسياسة" (P³)، وهو إطار تحسين مدرك للتوزيع يعالج التباين والانحياز الناتجين عن التقريبات البدائية أحادية العينة في خوارزمية PPO القائمة على المشفرات التلقائية المتغيرة (VAE)، مما يؤدي إلى تحسين كفاءة البيانات بشكل كبير، وتقليل خطوات التقارب، وتمكين التعلم القوي لمهام الباركور البشرية الصعبة.