← नवीनतम पेपर
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

यह शोध पत्र ModernBERT-TR को प्रस्तुत करता है, जो ModernBERT आर्किटेक्चर और एक कस्टम टोकेनाइज़र का उपयोग करके 144.4 बिलियन टोकन पर स्क्रैच से प्रीट्रेन किया गया एक 150M-पैरामीटर वाला तुर्की एनकोडर है, जो मौजूदा तुर्की बेसलाइन्स से काफी बेहतर प्रदर्शन करता है और काफी कम संसाधनों पर प्रशिक्षित होने के बावजूद बड़े समवर्ती मॉडलों के बराबर प्रदर्शन करता है।

मूल लेखक: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

प्रकाशित 2026-07-29
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर किताब एक अलग भाषा में लिखी गई है। लंबे समय तक, पुस्तकालयाध्यक्षों (कंप्यूटर वैज्ञानिकों) ने कंप्यूटरों को एक साथ सभी भाषाओं को समझने में मदद करने के लिए एक विशाल, अत्यंत सघन विश्वकोश बनाया। लेकिन जब आप उस विशाल पुस्तक के भीतर एक बहुत ही विशिष्ट भाषा के बारे में किसी खास तथ्य को खोजने की कोशिश करते हैं, तो जानकारी थोड़ी धुंधली हो जाती है। यह एक भीड़ भरे स्टेडियम में फुसफुसाहट सुनने की कोशिश करने जैसा है; संकेत शोर में खो जाता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने एकल भाषाओं के लिए विशेष रूप से छोटी, विशिष्ट डिक्शनरी बनाना शुरू किया। तुर्की (Turkish) के लिए इनमें से सबसे प्रसिद्ध 2020 में बनाई गई थी। यह एक अच्छी शुरुआत थी, लेकिन इसे पुराने औजारों के साथ बनाया गया था, जैसे कि तब जब बाकी सब स्पोर्ट्स कार चला रहे हों, तब एक साइकिल का उपयोग करना। इस बीच, बाकी दुनिया "आधुनिक" इंजनों की ओर बढ़ गई जो तेज़ पढ़ सकते थे, लंबे वाक्यों को याद रख सकते थे, और व्याकरण के उतार-चढ़ाव को कहीं बेहतर तरीके से समझ सकते थे। बड़ा सवाल यह था: क्या हम आधुनिक औजारों का उपयोग करके, अरबों डॉलर के बजट या चंद्रमा के आकार की लाइब्रेरी की आवश्यकता के बिना, विशेष रूप से तुर्की भाषा के लिए एक बिल्कुल नई, सुपर-फास्ट स्पोर्ट्स कार बना सकते थे?

यह शोध पत्र ModernBERT-TR को पेश करता है, जो एक नया आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे कंप्यूटर के लिए परम "तुर्की मस्तिष्क" (Turkish brain) के रूप में डिज़ाइन किया गया है। शोधकर्ताओं ने नवीनतम, सबसे उन्नत वास्तुशिल्प डिजाइनों (ModernBERT इंजन) को लिया और इसे केवल तुर्की टेक्स्ट का उपयोग करके शून्य से प्रशिक्षित किया। उन्होंने केवल भारी मात्रा में डेटा उस पर नहीं फेंका; उन्होंने उच्च-गुणवत्ता वाले तुर्की लेखन के संतुलित मिश्रण और विशेष रूप से तुर्की शब्दों के निर्माण के अनूठे तरीके के लिए तैयार किए गए एक कस्टम-मेड डिक्शनरी (टोकेनाइज़र) का सावधानीपूर्वक चयन किया।

परिणाम आश्चर्यजनक रूप से शक्तिशाली हैं। भले ही यह नया मॉडल अपेक्षाकृत छोटा है—इसमें लगभग 150 मिलियन "न्यूरॉन्स" (पैरामीटर्स) शामिल हैं—इसने बहुत बड़े मॉडलों को भी पीछे छोड़ दिया, जिनमें लगभग चार गुना अधिक न्यूरॉन्स वाले मॉडल भी शामिल थे। 11 अलग-अलग तुर्की कार्यों पर परीक्षण करने पर, जैसे कि नफरत भरे भाषण (hate speech) को पहचानना या मूवी रिव्यूज को समझना, ModernBERT-TR ने औसतन 60.2% स्कोर किया, जो अगले सर्वश्रेष्ठ मॉडल से काफी अधिक है। पूर्ण फाइन-ट्यूनिंग टेस्ट में, इसने एक ऐसे प्रतिस्पर्धी की बराबरी भी की जिसे लगभग 7 गुना अधिक डेटा (1 ट्रिलियन टोकन बनाम मॉडल के 144.4 बिलियन टोकन) पर प्रशिक्षित किया गया था, जो यह साबित करता है कि स्मार्ट ट्रेनिंग और बेहतर आर्किटेक्चर, कच्चे डेटा वॉल्यूम को हरा सकते हैं।

लेखकों का सुझाव है कि "सीक्रेट सॉस" केवल मॉडल का आकार नहीं था, बल्कि डेटा मिक्स की गुणवत्ता थी। उन्होंने पाया कि प्रशिक्षण के दौरान एक विशिष्ट, उच्च-गुणवत्ता वाले तुर्की डेटासेट को पांच बार दोहराना, बैच साइज जैसे अन्य सेटिंग्स को ट्यून करने से कहीं अधिक महत्वपूर्ण था। संक्षेप में, उन्होंने एक चुस्त, सक्षम, तुर्की बोलने वाली मशीन बनाई जो यह साबित करती है कि सबसे अच्छा होने के लिए आपको सबसे बड़ा होने की आवश्यकता नहीं है; आपको बस सबसे आधुनिक और सबसे केंद्रित होने की आवश्यकता है। उन्होंने अपना सारा कोड और मॉडल सार्वजनिक रूप से जारी कर दिया है, इस उम्मीद में कि यह उन सभी को एक बड़ा बढ़ावा दे सके जो ऐसी तकनीक बनाने की कोशिश कर रहे हैं जो तुर्की बोलती हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →