T: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning
यह शोध पत्र को प्रस्तुत करता है, जो एक TraceRL-आधारित प्रशिक्षण पाठ्यक्रम है जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स को छोटे से बड़े डिकोडिंग ब्लॉक्स तक प्रगतिशील रूप से स्केल करने में सक्षम बनाता है, जिससे गणितीय तर्क कार्यों पर न्यूनतम प्रदर्शन हानि के साथ उच्च-समानांतरता (high-parallelism) डिकोडिंग प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
🧱 मुख्य विचार: एक बेहतर "अनुमान लगाने वाला खेल" बनाना
कल्पना कीजिए कि आप एक जटिल गणित की समस्या हल करने की कोशिश कर रहे हैं, लेकिन एक साधारण AI की तरह एक-एक शब्द लिखने के बजाय, आपके पास एक जादुई व्हाइटबोर्ड है जहाँ आप उत्तर के बड़े हिस्सों को एक साथ मिटा और फिर से लिख सकते हैं।
मास्क्ड डिफ्यूजन मॉडल्स (MDMs) इसी तरह काम करते हैं। वे केवल बाएं-से-दाएं नहीं लिखते; वे पूरे वाक्य को देखते हैं, अनुमान लगाते हैं कि कौन से हिस्से गलत हैं, उन्हें मिटाते हैं, और उन्हें एक साथ भर देते हैं। यह बहुत तेज़ (पैरेलल) है, लेकिन अगर हिस्से (chunks) बहुत बड़े हों तो यह गड़बड़ भी हो सकता है।
यह पेपर T⋆ पेश करता है, जो एक चतुर प्रशिक्षण विधि है जो इन मॉडल्स को सिखाती है कि बिना भ्रमित हुए बड़े हिस्सों को कैसे संभालना है।
🚗 समस्या: "गति बनाम नियंत्रण" का द्वंद्व
एक AI मॉडल को एक कार ड्राइवर की तरह समझें।
- छोटे ब्लॉक्स (ब्लॉक साइज = 4): ड्राइवर बहुत सावधान है। वह सड़क को देखता है, एक छोटा सा सुधार करता है, फिर से जांचता है, और आगे बढ़ता है। वह धीमा है लेकिन बहुत सटीक है।
- बड़े ब्लॉक्स (ब्लॉक साइज = 32): ड्राइवर मंजिल तक तेजी से पहुँचने के लिए बड़े, व्यापक मोड़ लेने की कोशिश करता है। वह एक बार में अधिक दूरी तय कर सकता है (उच्च पैरेललिज्म), लेकिन यदि वह बहुत तेज़ी से मुड़ता है, तो वह दुर्घटनाग्रस्त हो सकता है या नियंत्रण खो सकता है।
समस्या: जब शोधकर्ताओं ने इन मॉडल्स को सीधे "बड़े ब्लॉक्स" का उपयोग करने के लिए प्रशिक्षित करने की कोशिश की, तो मॉडल्स विफल हो गए। उनके गणित कौशल गिर गए क्योंकि वे एक साथ बहुत सारे शब्दों का अनुमान लगाने की कोशिश कर रहे थे बिना पर्याप्त अभ्यास के। यह एक नौसिखिया ड्राइवर को एक ऐसे ट्रैक पर रेस लगाने के लिए कहने जैसा है जहाँ एक साथ 32 लेन खुली हों—वह घबरा जाता है और असफल हो जाता है।
🪜 समाधान: T⋆ (द "सीढ़ी" प्रशिक्षण)
लेखकों ने T⋆ नामक एक प्रशिक्षण पाठ्यक्रम बनाया। मॉडल को सीधे गहरे पानी में फेंकने के बजाय, उन्होंने एक सीढ़ी बनाई।
- छोटी शुरुआत करें: वे मॉडल को छोटे ब्लॉक्स (जैसे एक बार में 4 शब्द) पर प्रशिक्षित करके शुरुआत करते हैं। मॉडल यहाँ गणित के तर्क को पूरी तरह से सीख लेता है।
- "TraceRL" कोच: वे एक विशेष सुदृढीकरण लर्निंग तकनीक (TraceRL) का उपयोग करते हैं जो एक कोच की तरह काम करती है। कोच केवल अंत में "अच्छा काम किया" नहीं कहता; वह मॉडल द्वारा उठाए गए हर कदम को देखता है और इस पर फीडबैक देता है कि उसने शब्दों को कैसे 'अनमास्क' (unmask) किया।
- सीढ़ियाँ चढ़ें: एक बार जब मॉडल छोटे ब्लॉक्स में माहिर हो जाता है, तो प्रशिक्षण धीरे-धीरे ब्लॉक का आकार बढ़ाता है (4 → 8 → 16 → 32)।
- महत्वपूर्ण चरण: अगले आकार पर जाने से पहले, मॉडल कोच के फीडबैक का उपयोग करके वर्तमान आकार पर अभ्यास करता है। यह सुनिश्चित करता है कि मॉडल तेज़ होने की कोशिश करने से पहले अपनी सटीकता न भूल जाए।
उपमा: कल्पना कीजिए कि आप जग्गलिंग (juggle) सीखना शुरू कर रहे हैं।
- पुराना तरीका: तुरंत 10 गेंदों के साथ जग्गल करने की कोशिश करें। आप उन सभी को गिरा देंगे।
- T⋆ तरीका: 1 गेंद से शुरू करें। उसमें महारत हासिल करें। फिर 2। फिर 3। जब तक आप 10 तक पहुँचते हैं, तब तक आपका मस्तिष्क गति को संभालने के लिए आवश्यक 'मसल मेमोरी' बना चुका होता है।
🧠 असली रहस्य: "ट्रैजेक्टरी अवेयरनेस" (पथ जागरूकता)
यह क्यों काम करता है?
मानक प्रशिक्षण में, AI को गणित की समस्या के बिल्कुल अंत में केवल "हाँ/नहीं" मिलता है।
- AI: "यहाँ उत्तर है।"
- शिक्षक: "गलत।"
- AI: "ठीक है, मैं कुछ और कोशिश करूँगा।" (यह अक्षम है)।
T⋆ (TraceRL का उपयोग करते हुए) अलग है। यह यात्रा (trajectory) को देखता है।
- शिक्षक: "आपने पहला कदम सही किया, लेकिन आपने तीसरे चरण में गलत शब्द मिटाया। चलिए उस विशिष्ट चाल को ठीक करते हैं।"
मॉडल को अच्छे मध्यवर्ती (intermediate) मूव्स के लिए पुरस्कृत करके, मॉडल एक बेहतर "अनमास्किंग शेड्यूल" सीखता है। वह सीखता है कि कब एक शब्द को अंतिम रूप देना है और कब अनुमान लगाना जारी रखना है, भले ही वह टेक्स्ट के विशाल ब्लॉक्स के साथ काम कर रहा हो।
🏆 परिणाम: तेज़ और स्मार्ट
पेपर ने कठिन गणित बेंचमार्क (जैसे MATH500 और GSM8K) पर इसका परीक्षण किया।
- "डायरेक्ट" दृष्टिकोण: यदि आप बस एक मॉडल को बड़े ब्लॉक्स का उपयोग करने के लिए कहते हैं, तो इसकी सटीकता गिर जाती है (जैसे कार का अनियंत्रित होना)।
- T⋆ दृष्टिकोण: मॉडल अपनी उच्च सटीकता बनाए रखता है (यह अभी भी गणित का जीन है) लेकिन इसे बड़े ब्लॉक्स की गति प्राप्त होती है।
"जादुई" खोज:
आमतौर पर, जब आप गति बढ़ाते हैं, तो आप सटीकता खो देते हैं। T⋆ ने एक "स्वीट स्पॉट" (सही संतुलन) खोजा जहाँ मॉडल ने सोचने का एक नया तरीका सीखा। इसने केवल धीरे-धीरे (बाएं-से-दाएं) लिखना शुरू नहीं किया; इसने समस्याओं को हल करने का एक अनूठा, गैर-रैखिक तरीका खोजा जो तेज़ भी है और सटीक भी।
🌟 एक वाक्य में सारांश
T⋆ एक "प्रशिक्षण सीढ़ी" है जो AI मॉडल्स को जटिल गणित की समस्याओं को हल करने के लिए प्रशिक्षित करती है, जिसमें छोटे और सावधानीपूर्ण कदमों से शुरुआत की जाती है और फिर धीरे-धीरे उन्हें एक साथ टेक्स्ट के विशाल हिस्सों को संभालने के लिए सिखाया जाता है, बिना अपनी सटीकता खोए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।