💬 NLP
Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models
यह शोधपत्र TABOM को प्रस्तुत करता है, जो एक स्व-निष्पादित (self-distilled) प्रक्षेपवक्र-जागरूक (trajectory-aware) पोस्ट-ट्रेनिंग फ्रेमवर्क है जो इन्फरेंस अनमास्किंग प्राथमिकताओं को बोल्ट्ज़मैन वितरण (Boltzmann distribution) के रूप में मॉडल करके एक युग्म-रैंकिंग उद्देश्य (pairwise ranking objective) प्राप्त करता है, जिससे डिफ्यूजन लैंग्वेज मॉडल्स में ट्रेनिंग-इन्फरेंस विसंगति को पाटा जा सके, और इस प्रकार मानक फाइन-ट्यूनिंग की तुलना में ज्ञान प्राप्ति को बढ़ाकर और कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करके।
Kecheng Chen, Ziru Liu, Xijia Tao, Hui Liu, Yibing Liu, Xinyu Fu, Shi Wu, Suiyun Zhang, Dandan Tu, Lingpeng Kong, Rui Li (…)2026-05-13