Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models
यह शोध पत्र सेल्फ-अवेयर शेड्यूलिंग (SAS) प्रस्तुत करता है, जो एक सिद्धांतगत ढांचा है जो डिकोडिंग मिसमैच (decoding mismatch) पर एक सुलभ ऊपरी सीमा (tractable upper bound) प्राप्त करके एक हल्के नीति (lightweight policy) को प्रशिक्षित करता है ताकि मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स में टोकन अनमास्किंग क्रम को अनुकूलित किया जा सके, जिससे सुडोकू और गणितीय तर्क जैसे कार्यों पर ह्यूरिस्टिक शेड्यूल्स की तुलना में जनरेशन की गुणवत्ता में महत्वपूर्ण सुधार होता है।