Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity
यह शोध पत्र मार्कोव डिसीजन प्रोसेसिस (Markov Decision Processes) में स्टैटिक कंडीशनल वैल्यू-एट-रिस्क (CVaR) के लिए एक नवीन स्टेट-ऑगमेंटेशन फॉर्मूलेशन प्रस्तावित करता है जो सघन पुरस्कारों (dense rewards) और एक कॉन्ट्रैक्टिंग बेलमैन ऑपरेटर को सक्षम बनाता है, जिससे अभिसरण योग्य जोखिम-अवरोधक वैल्यू इटरेशन और Q-लर्निंग एल्गोरिदम प्राप्त होते हैं जिनके प्रमाणित सन्निकटन सीमाएँ (approximation bounds) और प्रभावी सुरक्षा-प्रदर्शन ट्रेड-ऑफ्स हैं।