← नवीनतम पेपर
💬 NLP

GottBERT: a pure German Language Model

यह शोध पत्र GottBERT को प्रस्तुत करता है, जो OSCAR डेटासेट पर प्री-ट्रेन किया गया पहला जर्मन एकल-भाषा RoBERTa मॉडल है, जो मौजूदा जर्मन और बहुभाषी मॉडलों की तुलना में विभिन्न NLP कार्यों में प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है, साथ ही यह भी नोट करता है कि कॉर्पस फ़िल्टरिंग का परिणामों पर न्यूनतम प्रभाव पड़ा।

मूल लेखक: Raphael Scheible, Johann Frei, Fabian Thomczyk, Henry He, Patric Tippmann, Jochen Knaus, Victor Jaravine, Frank Kramer, Martin Boeker

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Raphael Scheible, Johann Frei, Fabian Thomczyk, Henry He, Patric Tippmann, Jochen Knaus, Victor Jaravine, Frank Kramer, Martin Boeker

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जर्मन भाषा समझना सिखाना चाहते हैं। अतीत में, शोधकर्ता अक्सर रोबोट को एक "बहुभाषी" (multilingual) दृष्टिकोण का उपयोग करके सिखाते थे, जिसमें उन्हें एक साथ दर्जनों अलग-अलग भाषाओं के टेक्स्ट का एक विशाल मिश्रण खिलाया जाता था। यह एक साथ फ्रेंच, जर्मन और जापानी सीखने के लिए करतब दिखाने जैसा है। हालांकि यह काम करता है, लेकिन केवल एक भाषा पर ध्यान केंद्रित करने की तुलना में यह अक्सर कम कुशल होता है।

यह शोध पत्र GottBERT पेश करता है, जो एक नया "रोबोट मस्तिष्क" है जिसे विशेष रूप से केवल जर्मन समझने के लिए डिज़ाइन किया गया है। इसे एक ऐसे विशेषज्ञ शेफ के रूप में सोचें जो केवल जर्मन व्यंजन पकाता है, बजाय एक सामान्य शेफ के जो सब कुछ पकाने की कोशिश करता है।

यहाँ इसकी कहानी दी गई है कि उन्होंने इसे कैसे बनाया, जिसे सरल रूप में विभाजित किया गया है:

1. सामग्री: एक विशाल पुस्तकालय

रोबोट को सिखाने के लिए, टीम को जर्मन टेक्स्ट के एक विशाल पुस्तकालय की आवश्यकता थी। उन्होंने OSCAR नामक एक डेटासेट का उपयोग किया, जो इंटरनेट का एक विशाल डिजिटल ढेर है।

  • कच्चा ढेर (The Raw Pile): उन्होंने 145 गीगाबाइट कच्चे जर्मन टेक्स्ट के साथ शुरुआत की। कल्पना कीजिए एक ऐसे पुस्तकालय की जिसमें 459 मिलियन पुस्तकें (या दस्तावेज़) हैं, लेकिन उनमें से कई अव्यवस्थित हैं। कुछ में स्पेलिंग की गलतियाँ हैं, कुछ केवल यादृच्छिक शब्दों की सूचियाँ (स्पैम) हैं, और कुछ में अजीब वर्ण त्रुटियाँ (जैसे "ä" के बजाय "ä") हैं।
  • सफाई की प्रक्रिया: टीम ने इस पुस्तकालय को साफ करने की कोशिश की। उन्होंने एन्कोडिंग त्रुटियों को ठीक करने, स्पैम को हटाने और उन दस्तावेज़ों को फ़िल्टर करने के लिए एक विशेष प्रोग्राम लिखा जो वास्तविक जर्मन वाक्यों की तरह नहीं दिखते थे। इससे पुस्तकालय घटकर 121 गीगाबाइट रह गया।
  • प्रयोग: वे यह देखना चाहते थे कि क्या एक "साफ किया गया" पुस्तकालय एक "कच्चे" पुस्तकालय की तुलना में एक स्मार्ट रोबोट बनाता है। इसलिए, उन्होंने दो सेट रोबोट प्रशिक्षित किए: एक अव्यवस्थित पुस्तकालय पर और दूसरा साफ किए गए पुस्तकालय पर।

2. प्रशिक्षण जिम: सुपरकंप्यूटर

इन रोबोटों को प्रशिक्षित करना कंप्यूटर के लिए एक मैराथन दौड़ने जैसा है। इसके लिए अत्यधिक शक्ति की आवश्यकता होती है।

  • अधिकांश पिछले मॉडल ग्राफिक्स प्रोसेसिंग यूनिट्स (GPUs) पर प्रशिक्षित किए गए थे, जो मानक रेस कारों की तरह हैं।
  • GottBERT को TPUs (टेन्सर प्रोसेसिंग यूनिट्स) पर प्रशिक्षित किया गया था, जो इस प्रकार की गणित के लिए विशेष रूप से डिज़ाइन किए गए हाई-स्पीड बुलेट ट्रेनों की तरह हैं। इसने उन्हें इस विशिष्ट प्रकार के सुपर-फास्ट हार्डवेयर पर प्रशिक्षित किया गया पहला जर्मन RoBERTA मॉडल बनाया।

3. दौड़: उनका प्रदर्शन कैसा रहा?

प्रशिक्षण के बाद, टीम ने यह देखने के लिए रोबोटों को परीक्षणों की एक श्रृंखला से गुज़ारा कि वे जर्मन को कितनी अच्छी तरह समझते हैं। उन्होंने अपने नए रोबोट (GottBERT) की तुलना अन्य मौजूदा जर्मन रोबोटों और कुछ बहुभाषी रोबोटों से की।

परीक्षणों में शामिल थे:

  • नामों को खोजना (NER): क्या रोबोट पहचान सकता है कि "Müller" एक व्यक्ति का नाम है और "Berlin" एक शहर है?
  • समझना (NLI): यदि मैं कहूँ "कुत्ते ने बिल्ली का पीछा किया," तो क्या रोबोट समझ सकता है कि "बिल्ली को कुत्ते द्वारा पीछा किया गया" का अर्थ वही है?
  • समाचारों को वर्गीकृत करना (Text Classification): क्या रोबोट एक समाचार हेडलाइन पढ़ सकता है और बता सकता है कि यह खेल, राजनीति या मौसम के बारे में है?

परिणाम:

  • छोटे मॉडल (Base): मानक आकार के GottBERT रोबोट बहुत मजबूत थे। उन्होंने अन्य मानक आकार के जर्मन मॉडलों की तुलना में 6 में से 4 परीक्षणों में जीत हासिल की या बराबरी की।
  • बड़े मॉडल (Large): जब उन्होंने रोबोट को बड़ा (अधिक जटिल) बनाया, तो परिणाम मिले-जुले रहे। एक अलग टीम के सबसे बड़े जर्मन रोबोट (GELECTRA) ने अधिकांश श्रेणियों में GottBERT के सबसे बड़े रोबोटों से थोड़ा बेहतर प्रदर्शन किया।
  • सफाई का सरप्राइज: यहाँ एक मोड़ है। टीम को उम्मीद थी कि साफ किए गए पुस्तकालय पर प्रशिक्षित रोबोट अधिक स्मार्ट होगा। ऐसा नहीं हुआ। कच्चे, अव्यवस्थित पुस्तकालय पर प्रशिक्षित रोबोट ने साफ किए गए टेक्स्ट की तुलना में समान रूप से, या थोड़ा बेहतर प्रदर्शन किया। ऐसा लगता है कि रोबोट शोर (noise) को खुद समझने में सक्षम था।

4. निष्कर्ष

लेखक निष्कर्ष निकालते हैं कि:

  1. विशेषज्ञ जीतते हैं: एक मॉडल जो केवल जर्मन पर प्रशिक्षित है (GottBERT), अत्यधिक प्रतिस्पर्धी है और अक्सर उन मॉडलों को हरा देता है जो कई भाषाएँ बोलने की कोशिश करते हैं।
  2. सफाई हमेशा आवश्यक नहीं है: प्रशिक्षण डेटा को पूरी तरह से साफ करने में भारी प्रयास खर्च करने से इस मामले में कोई स्पष्ट लाभ नहीं मिला।
  3. ओपन सोर्स: वे अपने "ब्लूप्रिंट" (मॉडल) सार्वजनिक रूप से मुफ्त में दे रहे हैं, ताकि अन्य शोधकर्ता बेहतर जर्मन भाषा उपकरण बनाने के लिए उनका उपयोग कर सकें।

संक्षेप में: उन्होंने एक विशेष जर्मन भाषा का मस्तिष्क बनाया, उसे एक विशाल (और थोड़ी अव्यवस्थित) इंटरनेट लाइब्रेरी का उपयोग करके सुपर-फास्ट कंप्यूटरों पर प्रशिक्षित किया, और पाया कि यह अविश्वसनीय रूप से अच्छा काम करता है, जिससे यह साबित होता है कि एक शानदार परिणाम प्राप्त करने के लिए आपको हमेशा अपने डेटा को पूरी तरह से साफ करने की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →