OPD+: Rethinking the Advantage Design for On-Policy Distillation
यह शोध पत्र OPD+ प्रस्तुत करता है, जो एक सुधारात्मक ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो एडवांटेज एस्टीमेशन में मानक स्टॉप-ग्रेडिएंट ऑपरेशन्स के कारण होने वाले बायस को गणितीय रूप से सिद्ध करता है और एक जेनेरिक f-डाइवर्जेंस-आधारित अनुकूलन विधि प्रस्तावित करता है जो रीजनिंग और टूल-यूज़ बेंचमार्क पर प्रदर्शन में सुधार करती है।