Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
यह शोध पत्र डिस्ट्रीब्यूशन मैचिंग पॉलिसी ऑप्टिमाइज़ेशन (DMPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो उनके नीति वितरण (policy distribution) को एक इष्टतम रिवॉर्ड-टिल्टेड लक्ष्य के साथ संरेखित करके डिफ्यूजन लार्ज लैंग्वेज मॉडल्स की तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, जिससे सुपरवाइज्ड फाइन-ट्यूनिंग के बिना मौजूदा बेसलाइन की तुलना में पर्याप्त सटीकता सुधार प्राप्त होता है।