When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning
यह शोध पत्र सेल्फ-प्ले सुदृढीकरण शिक्षण (self-play reinforcement learning) में एडवरसेरियल एक्शन मास्किंग (adversarial action masking) की जांच करता है, यह प्रदर्शित करते हुए कि वैध क्रियाओं को चुनिंदा रूप से हटाना गड़बड़ी (perturbations) की तुलना में काफी अधिक नुकसान पहुंचाता है, विविध एल्गोरिदम और डोमेन में बना रहता है, और बिना सुधार की अनुमति दिए उच्च-मूल्य वाले निर्णय बिंदुओं का लाभ उठाता है।