Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance
تقترح هذه الورقة إطار عمل للتعلم التعزيزي قائم على تحسين السياسة القريبة (PPO) لتجنب الاصطدام الذاتي للأقمار الاصطناعية في المدارات المزدحمة، والذي يحقق معدل نجاح بنسبة 97.5% في سيناريوهات المدارات الأرضية الجغرافية الثابتة الحتمية، متفوقاً بشكل كبير على المخططات التقليدية القائمة على القواعد ومخططات تغيير السرعة المتجهة (delta-v) النبضية.