Weak-to-Strong Elicitation via Mismatched Wrong Drafts
यह शोध पत्र प्रदर्शित करता है कि वर्तमान समस्या से मेल न खाने वाले एक छोटे, डोमेन-प्रशिक्षित मॉडल से गणितीय रूप से गलत ड्राफ्ट को एक मजबूत लर्नर के GRPO प्रशिक्षण संदर्भ में इंजेक्ट करना, मानक ऑन-पॉलिक फाइन-ट्यूनिंग और अन्य वेरिएंट्स की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे बिना SFT, रिवॉर्ड मॉडल या सिंथेसाइज्ड डेटा की आवश्यकता के, Mathstral-7B मॉडल के लिए MATH-500 पर 71.98% का एक नया स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त होता है।