Hybrid TD3: Overestimation Bias Analysis and Stable Policy Optimization for Hybrid Action Space
تقترح هذه الورقة خوارزمية Hybrid TD3، وهي خوارزمية تعلم تعزيزي جديدة تتعامل أصلياً مع فضاءات الأفعال الهجينة ذات المعلمات من خلال تقديم تحليل نظري دقيق لانحياز المبالغة في التقدير وهدف تعلم Q المقطوع والموزون لتحقيق استقرار أداء وتدريب فائق في مهام المناولة الروبوتية.