Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance
यह शोध पत्र भीड़भाड़ वाली कक्षाओं में स्वायत्त उपग्रह टकराव बचाव के लिए एक प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) आधारित सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है, जो नियतात्मक GEO परिदृश्यों में 97.5% सफलता दर प्राप्त करता है, जो पारंपरिक नियम-आधारित और इम्पल्सिव डेल्टा-वी योजनाकारों से काफी बेहतर प्रदर्शन करता है।