Not All Denoising Steps Are Equal: Model Scheduling for Faster Masked Diffusion Language Models
यह शोध पत्र मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक मॉडल शेड्यूलिंग रणनीति प्रस्तावित करता है जो कम महत्वपूर्ण मध्य डिनोइजिंग स्टेप्स के दौरान फुल ट्रांसफॉर्मर को एक छोटे मॉडल से बदल देता है, जिससे जनरेटिव क्वालिटी को बनाए रखते हुए FLOPs में 17% तक की कमी आती है।