Draft-OPD: On-Policy Distillation for Speculative Draft Models
यह शोध पत्र Draft-OPD को प्रस्तुत करता है, जो एक ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो टारगेट-असिस्टेड रोलआउट्स और एरर पोजीशन से ड्राफ्टिंग को रीप्ले करने का उपयोग करके थिंकिंग मॉडल्स के लिए 5 गुना से अधिक लॉसलेस एक्सेलेरेशन प्राप्त करने के लिए स्पेकुलेटिव डिकोडिंग हेतु सुपरवाइज्ड फाइन-ट्यूनिंग की सीमाओं को दूर करता है।