Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
यह शोध पत्र युग्मवार प्राथमिकताओं (pairwise preferences) वाले सुदृढीकरण अधिगम (reinforcement learning) के लिए एक नए ढांचे के रूप में मार्कोव निर्णय प्रतियोगिता (Markov decision contest) को प्रस्तुत करता है, जो यह सिद्ध करता है कि स्थिर मार्कोव नीतियां (stationary Markov policies) इष्टतम हैं और यह प्रदर्शित करता है कि एक सरल पुनरावृत्ति एल्गोरिदम पूर्व विधियों की तुलना में दीर्घ-क्षितिज (long-horizon), उच्च-आयामी समस्याओं में बेहतर शिक्षण दक्षता प्राप्त करता है।