Learning from the Self-future: On-policy Self-distillation for dLLMs
यह शोध पत्र d-OPSD प्रस्तुत करता है, जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (dLLMs) के लिए विशेष रूप से तैयार किया गया पहला ऑन-पॉलिसी सेल्फ-डिस्टिलेशन फ्रेमवर्क है, जो मौजूदा बेसलाइन्स की तुलना में बेहतर प्रदर्शन और सैंपल दक्षता प्राप्त करने के लिए स्व-जनित सफिक्स कंडीशनिंग और स्टेप-लेवल सुपरविजन का लाभ उठाता है।