Diffusion-State Policy Optimization for Masked Diffusion Language Models
यह शोध पत्र डिफ्यूजन-स्टेट पॉलिसी ऑप्टिमाइज़ेशन (DiSPO) का प्रस्ताव करता है, जो एक प्लग-इन विधि है जो ब्रांचिंग और स्कोरिंग तंत्र के माध्यम से मध्यवर्ती टोकन-फिलिंग निर्णयों को सीधे अनुकूलित करके मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स को बेहतर बनाती है, जिससे बिना किसी अतिरिक्त कंप्यूट या ऑप्टिमाइज़र स्टेप की आवश्यकता के गणित और प्लानिंग जैसे जटिल कार्यों पर प्रदर्शन में सुधार होता है।