← नवीनतम पेपर
💬 NLP

Diffutron: A Masked Diffusion Language Model for Turkish Language

यह शोध पत्र Diffutron को प्रस्तुत करता है, जो विशेष रूप से रूपात्मक रूप से समृद्ध तुर्की भाषा के लिए डिज़ाइन किया गया एक संसाधन-कुशल मास्क्ड डिफ्यूजन लैंग्वेज मॉडल है, जो LoRA-आधारित निरंतर प्री-ट्रेनिंग और प्रगतिशील निर्देश-ट्यूनिंग के माध्यम से बहुत बड़े ऑटोरेग्रेसिव बेसलाइनों के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

मूल लेखक: Şuayp Talha Kocabay, Talha Rüzgar Akkuş

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Şuayp Talha Kocabay, Talha Rüzgar Akkuş

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को तुर्की बोलना सिखाने की कोशिश कर रहे हैं। आमतौर पर, रोबोट एक वाक्य को एक बार में एक शब्द पढ़ते हुए सीखते हैं, बाएं से दाएं, जैसे कोई व्यक्ति किताब पढ़ता है। इसे ऑटोरिग्रेसिव (Autoregressive) मॉडल कहा जाता है। यह विश्वसनीय तो है, लेकिन धीमा है क्योंकि अगले शब्द का अनुमान लगाने के लिए इसे पिछले शब्द का इंतज़ार करना पड़ता है।

इस शोध पत्र के लेखक, सुयप तल्हा कोकाबे (Suayp Talha Kocabay) और तल्हा रुज़गार अकुश (Talha Rüzgar Akkuş) ने एक अलग दृष्टिकोण आज़माने का फैसला किया। उन्होंने डिफुट्रोन (Diffutron) बनाया, एक ऐसा रोबोट जो एक बार में पूरा कैनवास भरने वाले चित्रकार की तरह, एक साथ पूरी तुर्की भाषा सीखता है, न कि एक समय में एक रेखा खींचने वाले चित्रकार की तरह।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल शब्दों में:

1. समस्या: "एक-समय-में-एक-शब्द" की बाधा

आज के अधिकांश AI मॉडल एक सख्त लाइब्रेरियन की तरह हैं जो आपको केवल एक बार में एक शब्द पढ़ने की अनुमति देते हैं। यदि आप एक लंबी कहानी लिखना चाहते हैं, तो लाइब्रेरियन को अगले शब्द पर जाने से पहले हर एक शब्द के लिए डिक्शनरी चेक करनी पड़ती है। इसमें बहुत समय लगता है और यह रोबोट की याददाश्त (context) को सीमित कर देता है कि वह एक बार में कितनी जानकारी रख सकता है।

साथ ही, इनमें से अधिकांश रोबोट अंग्रेजी पर प्रशिक्षित हैं। तुर्की एक बहुत ही अलग भाषा है; यह एग्लूटिनेटिव (agglutinative) है, जिसका अर्थ है कि शब्द लेगो ब्रिक्स (Lego bricks) की तरह होते हैं जिन्हें आप जटिल अर्थ बनाने के लिए आपस में जोड़ सकते हैं। अंग्रेजी पर प्रशिक्षित रोबोट अक्सर यह समझने में संघर्ष करते हैं कि तुर्की के शब्द आपस में कैसे जुड़ते हैं।

2. समाधान: "मास्क्ड डिफ्यूजन" चित्रकार

एक-एक शब्द लिखने के बजाय, डिफुट्रोन मास्क्ड डिफ्यूजन (Masked Diffusion) नामक तकनीक का उपयोग करता है।

  • सादृश्य (Analogy): एक ऐसे वाक्य की कल्पना करें जहाँ सभी शब्दों को खाली सफेद कार्डों (मास्क) से ढक दिया गया है।
    • चरण 1: रोबोट कुछ दिखाई देने वाले शब्दों को देखता है और अनुमान लगाता है कि छिपे हुए शब्द क्या हो सकते हैं।
    • चरण 2: यह अपने सबसे अच्छे अनुमानों के साथ कुछ खाली जगहों को भर देता है।
    • चरण 3: यह वास्तविक शब्दों और अनुमानों के नए मिश्रण को देखता है और फिर से अधिक खाली जगहों को भरने का अनुमान लगाता है।
    • चरण 4: यह प्रक्रिया को बार-बार दोहराता है, वाक्य को बार-बार परिष्कृत (refine) करता है, जब तक कि सभी कार्ड हट नहीं जाते और एक पूर्ण वाक्य शेष नहीं रह जाता।

चूंकि यह पूरे वाक्य को एक साथ देखता है, इसलिए यह संदर्भ (context) को बहुत बेहतर ढंग से समझ सकता है और "एक-समय-में-एक-शब्द" वाले रोबोटों की तुलना में बहुत तेज़ी से टेक्स्ट जेनरेट कर सकता है।

3. प्रशिक्षण: तीन-चरणीय कुकिंग रेसिपी

डिफुट्रोन को तुर्की बोलना सिखाने के लिए, लेखकों ने केवल डेटा उस पर नहीं फेंका। उन्होंने एक विशिष्ट, कुशल रेसिपी का उपयोग किया:

चरण 1: "भाषा में डूबना" (कंटीन्यूअल प्री-ट्रेनिंग)
उन्होंने एक स्मार्ट, बहुभाषी रोबोट (एक ऐसा मॉडल जो पहले से कई भाषाएँ जानता है) से शुरुआत की, लेकिन वह तुर्की को अच्छी तरह नहीं जानता था।

  • तरीका: पूरे रोबोट को फिर से प्रशिक्षित करने के (जो महंगा है और जिससे वह अन्य भाषाएँ भूल सकता है) के बजाय, उन्होंने LoRA का उपयोग किया।
  • सादृश्य: कल्पना कीजिए कि रोबोट एक मास्टर शेफ है जो फ्रेंच और इटालियन खाना बनाना जानता है। उसे तुर्की सिखाने के लिए, आपको उसका पूरा किचन दोबारा बनाने की ज़रूरत नहीं है। इसके बजाय, आप उसे तुर्की मसालों के रैक (LoRA एडैप्टर) का एक विशिष्ट सेट देते हैं जिसे उसके मौजूदा चाकू और पैन के साथ जोड़ा जा सके। वह पुरानी चीज़ें बनाना भूले बिना नए स्वादों को सीख लेता है। उन्होंने उसे भाषा का "स्वाद" सीखने के लिए लाखों तुर्की समाचार लेख और विकिपीडिया पेज खिलाए।

चरण 2: "बुनियादी आज्ञाकारिता" (पहला इंस्ट्रक्शन ट्यूनिंग)
अब रोबोट तुर्की जानता है, लेकिन वह आदेशों का पालन करना नहीं जानता।

  • उन्होंने इसे सरल तुर्की प्रश्नों और उत्तरों के डेटासेट के साथ सिखाया।
  • सादृश्य: यह एक नए कर्मचारी को बुनियादी बातें सिखाने जैसा है: "जब कोई समय पूछे, तो उन्हें समय बताओ।" इसने केवल अगले शब्द की भविष्यवाणी करने के बजाय वास्तव में सवालों के जवाब देना सीखा।

चरण 3: "एडवांस मास्टरक्लास" (दूसरा इंस्ट्रक्शन ट्यूनिंग)
रोबोट अच्छा था, लेकिन उसे और भी तेज़ होने की ज़रूरत थी।

  • उन्होंने इसे जटिल और सूक्ष्म तुर्की निर्देशों वाले कठिन डेटासेट के साथ प्रशिक्षित किया।
  • सादृश्य: अब कर्मचारी को पदोन्नति मिलती है। वे कठिन स्थितियों को संभालना सीखते हैं, जैसे "बारिश के बारे में एक कविता लिखें जो उदास लेकिन आशावादी लगे।" इस चरण ने रोबोट को शब्दों के पीछे के इरादे (intent) को समझने में बहुत बेहतर बना दिया।

4. परिणाम: "छोटा लेकिन शक्तिशाली" चैंपियन

इस शोध पत्र का सबसे प्रभावशाली हिस्सा रोबोट का आकार है।

  • प्रतिद्वंद्वी: अन्य तुर्की AI मॉडल बहुत बड़े हैं, जैसे 2 बिलियन से 7 बिलियन पैरामीटर्स (AI के "मस्तिष्क कोशिकाएं") वाले गगनचुंबी इमारतें। उन्हें चलाने के लिए विशाल सुपरकंप्यूटर की आवश्यकता होती है।
  • डिफुट्रोन: यह मॉडल बहुत छोटा है, जिसमें केवल 307 मिलियन पैरामीटर्स हैं। यह एक कॉम्पैक्ट, ईंधन-कुशल कार की तरह है।

आश्चर्य: भले ही डिफुट्रोन अपने प्रतिद्वंद्वियों की तुलना में 7 गुना छोटा है, फिर भी इसने कई परीक्षणों में उनके समान या कभी-कभी उनसे भी बेहतर प्रदर्शन किया।

  • इसने साबित कर दिया कि तुर्की जैसी जटिल भाषा बोलने के लिए आपको एक विशाल, महंगे मस्तिष्क की आवश्यकता नहीं है। आपको बस सही आर्किटेक्चर (पेंटर विधि) और सही प्रशिक्षण (मसाले के रैक) की आवश्यकता है।

यह क्यों मायने रखता है?

  1. गति: क्योंकि यह समानांतर (parallel) में टेक्स्ट जेनरेट करता है (एक साथ), यह बहुत तेज़ हो सकता है।
  2. दक्षता: यह बहुत सस्ते हार्डवेयर पर चलता है, जिससे उन्नत AI उन लोगों के लिए भी सुलभ हो जाता है जो सुपरकंप्यूटर खरीदने में सक्षम नहीं हैं।
  3. भविष्य: यह दिखाता है कि जटिल संरचनाओं (जैसे तुर्की, फिनिश या कोरियाई) वाली भाषाओं के लिए, हमें अंग्रेजी के "एक-समय-में-एक-शब्द" वाले तरीके की नकल करने की आवश्यकता नहीं है। हम AI बनाने के नए तरीके आविष्कार कर सकते हैं जो भाषा के अनुकूल हों।

संक्षेप में, लेखकों ने एक छोटा, तेज़ और कुशल तुर्की बोलने वाला AI बनाया है जो "खाली जगहों को भरने" के माध्यम से एक साथ सीखता है, यह साबित करते हुए कि आप छोटे होकर भी भाषा की दुनिया में दिग्गज बन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →