SAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous Control
تُعد خوارزمية SAVGO خوارزمية تعلم تعزيزي مبتكرة توحد بين تعلم التمثيل، وتقدير القيمة، وتحسين السياسة من خلال تعلم فضاء تضمين مشترك للحالة والعمل، حيث يعكس تشابه جيب التمام تقديرات قيمة العمل، مما يوجه تحديثات السياسة نحو مناطق القيمة العالية في مهام التحكم المستمر.