Imperfect World Models are Exploitable
यह शोध पत्र सुदृढीकरण aprendizaje (reinforcement learning) में मॉडल शोषण (model exploitation) की एक औपचारिक परिभाषा प्रस्तुत करता है, यह प्रदर्शित करते हुए कि जबकि बड़े नीति सेटों (policy sets) पर शोषण आम तौर पर अपरिहार्य है, शोषण की एक शिथिल धारणा एक सुरक्षित नियोजन क्षितिज (safe planning horizon) के व्युत्पत्ति की अनुमति देती है।