Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
यह शोध पत्र यह प्रदर्शित करता है कि कोड सुदृढीकरण शिक्षण (कोड रिइन्फोर्समेंट लर्निंग) में, नेस्टेड यूनिट-टेस्ट कवरेज वाले प्रशिक्षण चेकपॉइंट्स एक शुद्धता-दक्षता सीमा (करेक्टनेस-एफिशिएंसी फ्रंटियर) का निर्माण करते हैं जिसे एक्सट्रैपोलेटिव वेट एवरेजिंग के माध्यम से प्रशिक्षित एंडपॉइंट्स से परे नेविगेट और विस्तारित किया जा सकता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के इन्फरेंस-टाइम प्रदर्शन और समस्या कवरेज में सुधार होता है।