Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
यह शोधपत्र पास-एट-के (Pass-at-k) पॉलिसी ऑप्टिमाइजेशन (PKPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पृथक प्रयासों के बजाय नमूना सेटों की सामूहिक सफलता (pass@k) को सीधे अनुकूलित करने के लिए निष्पक्ष अनुमानकों (unbiased estimators) को व्युत्पन्न करता है, जिससे k-एनीलिंग (k-annealing) के माध्यम से pass@1 प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए अन्वेषण को बढ़ावा मिलता है और कठिन समस्याओं को हल करने में मदद मिलती है।