Should We Still Pretrain Encoders with Masked Language Modeling?
व्यापक नियंत्रित प्रयोगों के माध्यम से, यह शोध पत्र प्रदर्शित करता है कि जबकि मास्क्ड लैंग्वेज मॉडलिंग (MLM) आम तौर पर बेहतर टेक्स्ट रिप्रजेंटेशन प्रदान करती है, एक द्वि-चरणीय (biphasic) प्रीट्रेनिंग रणनीति जो पहले कॉज़ल लैंग्वेज मॉडलिंग (CLM) और फिर MLM लागू करती है, निश्चित कंप्यूटेशनल बजट के तहत इष्टतम प्रदर्शन प्राप्त करती है, विशेष रूप से मौजूदा प्रीट्रेन्ड CLM मॉडल्स का लाभ उठाते समय।