Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation
تقترح هذه الورقة إطار عمل للتعلم التعزيزي المقيد بالسلامة يجمع بين تحسين القيمة المشروطة للمخاطر (CVaR) أثناء التدريب والتحقق من إمكانية الوصول للشبكة العصبية بعد التدريب لضمان ملاحة روبوتية قوية، مما يثبت أن السياسات الحساسة للمخاطر تحقق هوامش سلامة رسمية وتنقلاً متفوقاً من المحاكاة إلى الواقع مقارنة بالطرق التي تعتمد فقط على مقاييس التكلفة المتوسطة.