Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems
यह शोध पत्र लॉन्ग-होरिज़न संचयी-क्षति (cumulative-damage) समस्याओं के लिए पॉलिसी-ग्रेडिएंट विधियों में दो ऑर्थोगोनल विफलता मोड—पूर्णता (completion) और इष्टतमता (optimality)—की पहचान और अपघटन करता है, और ब्रिकलेयर तथा एनबीए करियर सिमुलेशन में अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि जबकि एक्शन-स्पेस प्रतिबंध कार्य पूर्णता को सक्षम करते हैं, वे अक्सर प्रारंभिक लालची प्रतिबद्धताओं (early greedy commitments) के कारण एक महत्वपूर्ण इष्टतमता अंतराल छोड़ देते हैं।