Learning Sequential Decisions from Multiple Sources via Group-Robust Markov Decision Processes
यह शोध पत्र विषम बहु-साइट डेटा से सुदृढ़ अनुक्रमिक निर्णय नीतियों (sequential decision policies) को सीखने के लिए फीचर-वाइज अनिश्चितता सेटों (feature-wise uncertainty sets) और एक निराशावादी ऑफलाइन एल्गोरिदम (pessimistic offline algorithm) के साथ एक ग्रुप-रोबस्ट मार्कोव डिसीजन प्रोसेस फ्रेमवर्क प्रस्तावित करता है, जो मजबूत स्टेट-एक्शन रेक्टेंगुलैरिटी धारणाओं पर निर्भर किए बिना उप-इष्टतम गारंटी (suboptimality guarantees) प्राप्त करता है।