Learning When to Stop: Selective Imitation Learning Under Arbitrary Dynamics Shift
यह शोधपत्र SeqRejectron प्रस्तुत करता है, जो चयनात्मक अनुकरण शिक्षण (selective imitation learning) के लिए एक एल्गोरिदम है जो एक क्षितिज-मुक्त (horizon-free) स्टॉपिंग नियम का निर्माण करके एजेंटों को मनमानी गतिकी परिवर्तनों (arbitrary dynamics shifts) के तहत सुरक्षित रूप से कार्य करने से बचने में सक्षम बनाता है, जिसके पास सिद्ध नमूना जटिलता गारंटी (provable sample complexity guarantees) है।