Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models
यह शोध पत्र प्रदर्शित करता है कि ऑटोरिग्रेसिव (autoregressive) मॉडलों को मास्क्ड डिफ्यूजन (masked diffusion) मॉडलों में पोस्ट-ट्रेनिंग करना एक कार्य-निर्भर "मैकेनिज्म शिफ्ट" (mechanism shift) उत्पन्न करता है, जहाँ मॉडल अपने आंतरिक सर्किट्स को विशेष रूप से वैश्विक नियोजन (global planning) का समर्थन करने के लिए स्थानीयकृत, कारण-संबंधी प्रसंस्करण (localized, causal processing) से वितरित, द्वि-दिशीय एकीकरण (distributed, bidirectional integration) में पुनर्गठित करते हैं।