Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection
تقدم هذه الورقة إطار عمل إسقاط قابل للتفاضل يدمج وحدة تحسين محدب ضمن التعلم التعزيزي العميق لفرض قيود صلبة ومترابطة في اتخاذ القرار المتسلسل، محققاً أداءً يقارب الأمثل وتقليلاً كبيراً في التكاليف في مشكلات تخطيط المخزون المعقدة حيث تعاني الطرق التقليدية.