← नवीनतम पेपर
💬 NLP

Should We Still Pretrain Encoders with Masked Language Modeling?

व्यापक नियंत्रित प्रयोगों के माध्यम से, यह शोध पत्र प्रदर्शित करता है कि जबकि मास्क्ड लैंग्वेज मॉडलिंग (MLM) आम तौर पर बेहतर टेक्स्ट रिप्रजेंटेशन प्रदान करती है, एक द्वि-चरणीय (biphasic) प्रीट्रेनिंग रणनीति जो पहले कॉज़ल लैंग्वेज मॉडलिंग (CLM) और फिर MLM लागू करती है, निश्चित कंप्यूटेशनल बजट के तहत इष्टतम प्रदर्शन प्राप्त करती है, विशेष रूप से मौजूदा प्रीट्रेन्ड CLM मॉडल्स का लाभ उठाते समय।

मूल लेखक: Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव भाषा समझना सिखाने की कोशिश कर रहे हैं। वर्षों से, मानक तरीका "खाली स्थान भरें" का खेल खिलाना रहा है। आप रोबोट को एक वाक्य दिखाते हैं जिसमें कुछ शब्द छिपे (मास्क किए गए) होते हैं और उससे अनुमान लगाने के लिए कहते हैं कि वे क्या हैं, जो कि गायब जगह से पहले और बाद के शब्दों पर आधारित हो। इसे मास्क्ड लैंग्वेज मॉडलिंग (MLM) कहा जाता है। यह एक क्रॉसवर्ड पहेली की तरह है जहाँ आपके पास दोनों दिशाओं से सुराग मिलते हैं।

हाल ही में, एक नया दृष्टिकोण लोकप्रिय हुआ है: रोबोट को एक वाक्य में एक बार में एक शब्द, ठीक वैसे ही जैसे टेक्स्ट मैसेज ऑटो-कंप्लीट होता है, अगले शब्द की भविष्यवाणी करना सिखाना। इसे कॉज़ल लैंग्वेज मॉडलिंग (CLM) कहा जाता है। यह एक कहानी पढ़ने और अनुमान लगाने जैसा है कि आगे क्या होगा, लेकिन आप आगे नहीं देख सकते।

बड़ा सवाल जो यह शोध पत्र पूछता है: "क्या हमें अभी भी रोबte को पुराने 'खाली स्थान भरें' वाले तरीके से सिखाने की आवश्यकता है, या नया 'अगले शब्द की भविष्यवाणी करें' वाला तरीका वास्तव में बेहतर है?"

यहाँ शोधकर्ताओं ने क्या पाया है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. "विशेषज्ञ" बनाम "सामान्यवादी"

शोधकर्ताओं ने दोनों तरीकों का उपयोग करके 38 अलग-अलग रोबोट मस्तिष्क (छोटे से लेकर बहुत बड़े तक) को प्रशिक्षित किया।

  • MLM रोबोट (विशेषज्ञ): जब केवल "खाली स्थान भरें" वाले खेल पर प्रशिक्षित किया गया, तो यह रोबोट एक वाक्य के पूर्ण संदर्भ को समझने में माहिर हो गया। यह जटिल प्रश्नों के उत्तर देने या पाठ के मूड को वर्गीकृत करने जैसे कार्यों के लिए सर्वश्रेष्ठ था। यह एक जासूस की तरह है जो मामले को सुलझाने के लिए सभी कोणों से अपराध स्थल को देख सकता है।
  • CLM रोबोट (सामान्यवादी): जब केवल "अगले शब्द की भविष्यवाणी करें" वाले खेल पर प्रशिक्षित किया गया, तो यह कुछ कार्यों में (जैसे पाठ में विशिष्ट नाम खोजने में) आश्चर्यजनक रूपथा अच्छा था और इसने बहुत तेज़ी से सीखा। हालाँकि, इसे उन कार्यों में अधिक संघर्ष करना पड़ा जिनमें वाक्य की गहरी, दो-तरफा समझ की आवश्यकता होती है।

निर्णय: सर्वश्रेष्ठ समग्र समझ बनाने के लिए "खाली स्थान भरें" (MLM) विधि अभी भी राजा है। "अगले शब्द की भविष्यवाणी करें" (CLM) विधि अकेले एक बेहतरीन "एनकोडर" (एक उपकरण जो पाठ को अर्थ में बदल देता है) बनाने के लिए पर्याप्त नहीं है।

2. "तेज़ शुरुआत" का लाभ

यहाँ मामला दिलचस्प हो जाता है। CLM रोबोट ने शुरुआत में बहुत तेज़ी से सीखा।

  • उपमा: कल्पना कीजिए कि दो छात्र मैराथन के लिए अभ्यास कर रहे हैं।
    • छात्र A (MLM) धीरे-धीरे और स्थिरता से अध्ययन करता है, एक गहरा आधार बनाता है। वे धीरे शुरू करते हैं लेकिन बाद में बहुत मजबूत हो जाते हैं।
    • छात्र B (CLM) तुरंत दौड़ना शुरू कर देता है और बहुत जल्दी फिट हो जाता है। वे छात्र A से आगे हैं शुरुआती कुछ मील के लिए।
  • निष्कर्ष: यदि आप प्रशिक्षण को जल्दी रोक देते हैं (क्योंकि आपके पास समय या पैसा कम है), तो CLM रोबोट वास्तव में काफी प्रतिस्पर्धी है। यह अधिक "डेटा-कुशल" है, जिसका अर्थ है कि यह कम प्रशिक्षण समय के साथ अच्छे परिणाम प्राप्त करता है।

3. "स्थिर नींव"

शोधकर्ताओं ने यह भी पाया कि CLM रोबोट को फाइन-ट्यून करना (विशिष्ट कार्यों के लिए समायोजित करना) आसान था।

  • उपमा: CLM रोबोट को एक बहुत ही ठोस, सपाट कंक्रीट स्लैब पर बने घर के रूप में सोचें। एक विशिष्ट कार्य (जैसे विशिष्ट कार्य के लिए रसोई) के लिए इसके ऊपर एक विशिष्ट कमरा बनाना आसान है बिना घर को हिलाए।
  • MLM रोबोट, हालांकि समग्र रूप से अधिक शक्तिशाली है, लेकिन जब आप इसे विशिष्ट कार्यों के लिए समायोजित करने की कोशिश करते हैं तो यह थोड़ा अधिक "डगमगाता" है। इसे सटीक परिणाम प्राप्त करने के लिए अधिक सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।

4. जीतने वाली रणनीति: "दो-चरणीय" प्रशिक्षण

शोध पत्र का सबसे बड़ा खोज यह है कि केवल एक विधि करने के बजाय एक नया रेसिपी (तरीका) जो दोनों को जोड़ता है।

  • रेसिपी: रोबोट को "अगले शब्द की भविष्यवाणी करें" विधि (CLM) के साथ प्रशिक्षित करके शुरुआत करें ताकि एक तेज़, स्थिर शुरुआत मिल सके। फिर, इसकी समझ को गहरा करने के लिए "खाली स्थान भरें" (MLM) विधि पर स्विच करें।
  • परिणाम: इस "दो-चरणीय" दृष्टिकोण ने सबसे मजबूत रोबोट बनाए। इसने CLM की शुरुआत की गति और स्थिरता को MLM के गहरे अंत के साथ जोड़ दिया।
  • बोनस: आप एक ऐसा रोबोट भी ले सकते हैं जिसे किसी और ने पहले से ही "अगले शब्द की भविष्यवाणी करें" विधि के साथ प्रशिक्षित किया है (जो बहुत सामान्य और सस्ता है), और बस उसे "खाली स्थान भरें" विधि के साथ "टॉप-अप" प्रशिक्षण दे सकते हैं। यह शून्य से रोबोट को प्रशिक्षित करने की तुलना में बहुत सस्ता है।

सारांश

शोध पत्र निष्कर्ष निकालता है कि जबकि पुराना "खाली स्थान भरें" तरीका (MLM) अभी भी सर्वोत्तम परिणामों के लिए आवश्यक है, हमें नए "अगले शब्द की भविष्यवाणी करें" तरीके (CLM) को अनदेखा नहीं करना चाहिए।

आगे का सबसे अच्छा रास्ता एक हाइब्रिड (मिश्रित) है:

  1. शुरुआत करें तेज़, स्थिर "अगले शब्द की भविष्यवाणी करें" प्रशिक्षण के साथ (या पहले से प्रशिक्षित मॉडल का उपयोग करें जिसके पास यह पहले से है)।
  2. समाप्त करें गहरे "खाली स्थान भरें" प्रशिक्षण के साथ।

यह रणनीति कंप्यूटिंग शक्ति और पैसे बचाती है और सबसे स्मार्ट टेक्स्ट-समझने वाले उपकरण भी बनाती है। लेखक अपना सारा कोड और मॉडल जारी कर रहे हैं ताकि अन्य लोग इस "दो-चरणीय" रेसिपी को स्वयं आज़मा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →