OGPO: Sample Efficient Full-Finetuning of Generative Control Policies
تقدم هذه الورقة البحثية خوارزمية OGPO، وهي خوارزمية خارج السياسة (off-policy) ذات كفاءة في العينات تتيح الضبط الدقيق الكامل لسياسات التحكم التوليدية لتحقيق أداء رائد في مهام روبوتية متنوعة، بما في ذلك الضبط الدقيق للسياسات ضعيفة التهيئة دون بيانات خبير، وذلك من خلال الاستفادة من أهداف PPO المعدلة والمثبتات العملية للتخفيف من حدة الاستغلال المفرط للمنتقد (critic over-exploitation).