Learning to Tune Pure Pursuit in Autonomous Racing: Joint Lookahead and Steering-Gain Control with PPO
تقترح هذه الورقة نهجاً للتعلم التعزيزي يعتمد على تحسين السياسة القريبة (Proximal Policy Optimization) يقوم بضبط مسافة الاستشراف ومعامل التوجيه لمتحكم المطاردة النقية (Pure Pursuit) بشكل مشترك وفي الوقت الفعلي، مما يظهر تفوقاً في زمن اللفة، ودقة التتبع، وسلاسة التوجيه مقارنة بالطرق التقليدية ذات المعلمات الثابتة، والطرق المجدولة حسب السرعة، وطرق التحكم التنبؤي بالنماذج في سباقات القيادة الذاتية.