Policy Optimization for Unknown Systems using Differentiable Model Predictive Control
تقدم هذه الورقة إطار عمل جديد لتحسين السياسات للتحكم التنبئي بالنماذج يجمع بين التقدير التفاضلي وتقدير التدرج من الدرجة صفر لتحقيق أداء عابر أسرع وتقارب قوي في ظل عدم اليقين في النموذج، كما هو موضح في مهمة طائرة كوادكوبتر ذات 12 بُعداً.