GottBERT: a pure German Language Model
यह शोध पत्र GottBERT को प्रस्तुत करता है, जो OSCAR डेटासेट पर प्री-ट्रेन किया गया पहला जर्मन एकल-भाषा RoBERTa मॉडल है, जो मौजूदा जर्मन और बहुभाषी मॉडलों की तुलना में विभिन्न NLP कार्यों में प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है, साथ ही यह भी नोट करता है कि कॉर्पस फ़िल्टरिंग का परिणामों पर न्यूनतम प्रभाव पड़ा।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जर्मन भाषा समझना सिखाना चाहते हैं। अतीत में, शोधकर्ता अक्सर रोबोट को एक "बहुभाषी" (multilingual) दृष्टिकोण का उपयोग करके सिखाते थे, जिसमें उन्हें एक साथ दर्जनों अलग-अलग भाषाओं के टेक्स्ट का एक विशाल मिश्रण खिलाया जाता था। यह एक साथ फ्रेंच, जर्मन और जापानी सीखने के लिए करतब दिखाने जैसा है। हालांकि यह काम करता है, लेकिन केवल एक भाषा पर ध्यान केंद्रित करने की तुलना में यह अक्सर कम कुशल होता है।
यह शोध पत्र GottBERT पेश करता है, जो एक नया "रोबोट मस्तिष्क" है जिसे विशेष रूप से केवल जर्मन समझने के लिए डिज़ाइन किया गया है। इसे एक ऐसे विशेषज्ञ शेफ के रूप में सोचें जो केवल जर्मन व्यंजन पकाता है, बजाय एक सामान्य शेफ के जो सब कुछ पकाने की कोशिश करता है।
यहाँ इसकी कहानी दी गई है कि उन्होंने इसे कैसे बनाया, जिसे सरल रूप में विभाजित किया गया है:
1. सामग्री: एक विशाल पुस्तकालय
रोबोट को सिखाने के लिए, टीम को जर्मन टेक्स्ट के एक विशाल पुस्तकालय की आवश्यकता थी। उन्होंने OSCAR नामक एक डेटासेट का उपयोग किया, जो इंटरनेट का एक विशाल डिजिटल ढेर है।
- कच्चा ढेर (The Raw Pile): उन्होंने 145 गीगाबाइट कच्चे जर्मन टेक्स्ट के साथ शुरुआत की। कल्पना कीजिए एक ऐसे पुस्तकालय की जिसमें 459 मिलियन पुस्तकें (या दस्तावेज़) हैं, लेकिन उनमें से कई अव्यवस्थित हैं। कुछ में स्पेलिंग की गलतियाँ हैं, कुछ केवल यादृच्छिक शब्दों की सूचियाँ (स्पैम) हैं, और कुछ में अजीब वर्ण त्रुटियाँ (जैसे "ä" के बजाय "ä") हैं।
- सफाई की प्रक्रिया: टीम ने इस पुस्तकालय को साफ करने की कोशिश की। उन्होंने एन्कोडिंग त्रुटियों को ठीक करने, स्पैम को हटाने और उन दस्तावेज़ों को फ़िल्टर करने के लिए एक विशेष प्रोग्राम लिखा जो वास्तविक जर्मन वाक्यों की तरह नहीं दिखते थे। इससे पुस्तकालय घटकर 121 गीगाबाइट रह गया।
- प्रयोग: वे यह देखना चाहते थे कि क्या एक "साफ किया गया" पुस्तकालय एक "कच्चे" पुस्तकालय की तुलना में एक स्मार्ट रोबोट बनाता है। इसलिए, उन्होंने दो सेट रोबोट प्रशिक्षित किए: एक अव्यवस्थित पुस्तकालय पर और दूसरा साफ किए गए पुस्तकालय पर।
2. प्रशिक्षण जिम: सुपरकंप्यूटर
इन रोबोटों को प्रशिक्षित करना कंप्यूटर के लिए एक मैराथन दौड़ने जैसा है। इसके लिए अत्यधिक शक्ति की आवश्यकता होती है।
- अधिकांश पिछले मॉडल ग्राफिक्स प्रोसेसिंग यूनिट्स (GPUs) पर प्रशिक्षित किए गए थे, जो मानक रेस कारों की तरह हैं।
- GottBERT को TPUs (टेन्सर प्रोसेसिंग यूनिट्स) पर प्रशिक्षित किया गया था, जो इस प्रकार की गणित के लिए विशेष रूप से डिज़ाइन किए गए हाई-स्पीड बुलेट ट्रेनों की तरह हैं। इसने उन्हें इस विशिष्ट प्रकार के सुपर-फास्ट हार्डवेयर पर प्रशिक्षित किया गया पहला जर्मन RoBERTA मॉडल बनाया।
3. दौड़: उनका प्रदर्शन कैसा रहा?
प्रशिक्षण के बाद, टीम ने यह देखने के लिए रोबोटों को परीक्षणों की एक श्रृंखला से गुज़ारा कि वे जर्मन को कितनी अच्छी तरह समझते हैं। उन्होंने अपने नए रोबोट (GottBERT) की तुलना अन्य मौजूदा जर्मन रोबोटों और कुछ बहुभाषी रोबोटों से की।
परीक्षणों में शामिल थे:
- नामों को खोजना (NER): क्या रोबोट पहचान सकता है कि "Müller" एक व्यक्ति का नाम है और "Berlin" एक शहर है?
- समझना (NLI): यदि मैं कहूँ "कुत्ते ने बिल्ली का पीछा किया," तो क्या रोबोट समझ सकता है कि "बिल्ली को कुत्ते द्वारा पीछा किया गया" का अर्थ वही है?
- समाचारों को वर्गीकृत करना (Text Classification): क्या रोबोट एक समाचार हेडलाइन पढ़ सकता है और बता सकता है कि यह खेल, राजनीति या मौसम के बारे में है?
परिणाम:
- छोटे मॉडल (Base): मानक आकार के GottBERT रोबोट बहुत मजबूत थे। उन्होंने अन्य मानक आकार के जर्मन मॉडलों की तुलना में 6 में से 4 परीक्षणों में जीत हासिल की या बराबरी की।
- बड़े मॉडल (Large): जब उन्होंने रोबोट को बड़ा (अधिक जटिल) बनाया, तो परिणाम मिले-जुले रहे। एक अलग टीम के सबसे बड़े जर्मन रोबोट (GELECTRA) ने अधिकांश श्रेणियों में GottBERT के सबसे बड़े रोबोटों से थोड़ा बेहतर प्रदर्शन किया।
- सफाई का सरप्राइज: यहाँ एक मोड़ है। टीम को उम्मीद थी कि साफ किए गए पुस्तकालय पर प्रशिक्षित रोबोट अधिक स्मार्ट होगा। ऐसा नहीं हुआ। कच्चे, अव्यवस्थित पुस्तकालय पर प्रशिक्षित रोबोट ने साफ किए गए टेक्स्ट की तुलना में समान रूप से, या थोड़ा बेहतर प्रदर्शन किया। ऐसा लगता है कि रोबोट शोर (noise) को खुद समझने में सक्षम था।
4. निष्कर्ष
लेखक निष्कर्ष निकालते हैं कि:
- विशेषज्ञ जीतते हैं: एक मॉडल जो केवल जर्मन पर प्रशिक्षित है (GottBERT), अत्यधिक प्रतिस्पर्धी है और अक्सर उन मॉडलों को हरा देता है जो कई भाषाएँ बोलने की कोशिश करते हैं।
- सफाई हमेशा आवश्यक नहीं है: प्रशिक्षण डेटा को पूरी तरह से साफ करने में भारी प्रयास खर्च करने से इस मामले में कोई स्पष्ट लाभ नहीं मिला।
- ओपन सोर्स: वे अपने "ब्लूप्रिंट" (मॉडल) सार्वजनिक रूप से मुफ्त में दे रहे हैं, ताकि अन्य शोधकर्ता बेहतर जर्मन भाषा उपकरण बनाने के लिए उनका उपयोग कर सकें।
संक्षेप में: उन्होंने एक विशेष जर्मन भाषा का मस्तिष्क बनाया, उसे एक विशाल (और थोड़ी अव्यवस्थित) इंटरनेट लाइब्रेरी का उपयोग करके सुपर-फास्ट कंप्यूटरों पर प्रशिक्षित किया, और पाया कि यह अविश्वसनीय रूप से अच्छा काम करता है, जिससे यह साबित होता है कि एक शानदार परिणाम प्राप्त करने के लिए आपको हमेशा अपने डेटा को पूरी तरह से साफ करने की आवश्यकता नहीं होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।