HalleluBERT: Let Every Token That Has Meaning Bear Its Weight
यह शोध पत्र HalleluBERT को प्रस्तुत करता है, जो एक RoBERTa-आधारित एनकोडर परिवार है जिसे एक बड़े हिब्रू कॉर्पस पर स्क्रैच से प्रशिक्षित किया गया है और जो प्रमुख हिब्रू एनएलपी बेंचमार्क पर मौजूदा मोनोलिंगुअल और मल्टीलिंगुअल बेसलाइन से बेहतर प्रदर्शन करता है, जिसके इसके वेट्स (weights) और टोकेनाइज़र को पुनरुत्पादक अनुसंधान को आगे बढ़ाने के लिए MIT लाइसेंस के तहत जारी किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: एक बेहतर हिब्रू मस्तिष्क का निर्माण
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया दिमागों का एक विशाल पुस्तकालय है। लंबे समय तक, इनमें से अधिकांश दिमाग अंग्रेजी या कई भाषाएं एक साथ बोलने के लिए डिज़ाइन किए गए थे (जैसे कि एक बहुभाषी व्यक्ति)। हालांकि ये "बहुभाषी" दिमाग मददगार होते हैं, लेकिन वे अक्सर विशिष्ट भाषाओं की अनूठी बारीकियों के साथ संघर्ष करते हैं।
हिब्रू एक जटिल पहेली की तरह है। इसके अक्षर अलग तरह से जुड़ते हैं, शब्द इस आधार पर अपना आकार बदलते हैं कि क्रिया कौन कर रहा है, और इसमें शब्द-निर्माण का एक समृद्ध इतिहास है। अब तक, हिब्रू के पास एक ऐसा "विशेषज्ञ" मस्तिष्क नहीं था जिसे विशेष रूप से केवल हिब्रू के लिए, भारी मात्रा में डेटा का उपयोग करके प्रशिक्षित किया गया हो, और जो विभिन्न कार्यों के लिए अलग-अलग आकारों में उपलब्ध हो।
इस शोध पत्र के लेखकों ने HalleluBERT बनाया है। इसे एक नए, अत्यधिक विशिष्ट हिब्रू मस्तिष्क के रूप में समझें जिसे पिछले किसी भी मॉडल की तुलना में भाषा की बारीकियों को बेहतर ढंग से समझने के लिए शून्य से बनाया गया है।
उन्होंने इसे कैसे बनाया: रेसिपी
इस मस्तिष्क को बनाने के लिए, शोधकर्ताओं ने एक विशिष्ट रेसिपी का पालन किया:
- सामग्री (डेटा): उन्होंने केवल एक छोटी कुकबुक का उपयोग नहीं किया। उन्होंने हिब्रू टेक्स्ट का एक विशाल पुस्तकालय एकत्र किया—लगभग 49.1 GB। इसमें साफ की गई वेबसाइटें और विकिपीडिया लेख शामिल थे। कल्पना कीजिए कि मस्तिष्क को लाखों हिब्रू वाक्यों को खिलाना ताकि वह स्वाभाविक रूप से भाषा की लय, व्याकरण और अर्थ को सीख सके।
- शब्दावली (शब्दकोश): हिब्रू पेचीदा है क्योंकि एक शब्द अंग्रेजी में एक पूरे वाक्य के बराबर हो सकता है। मानक AI उपकरण अक्सर हिब्रू शब्दों को छोटे, अजीब टुकड़ों में काट देते हैं। लेखकों ने विशेष रूप से हिब्रू के लिए एक कस्टम "शब्दकोश" (टोकेनाइज़र) बनाया। यह मस्तिष्क को हिब्रू शब्दों के लिए बिल्कुल फिट होने वाले लेगो (Lego) ब्रिक्स का एक सेट देने जैसा है, बजाय इसके कि उन्हें अंग्रेजी के आकार के सांचों में जबरदस्ती फिट किया जाए।
- प्रशिक्षण (जिम): उन्होंने इस मस्तिष्क को शक्तिशाली सुपरकंप्यूटरों (Google के TPUs) पर एक कठोर वर्कआउट कराया। उन्होंने दो संस्करणों को प्रशिक्षित किया:
- HalleluBERT Base: एक मानक आकार का मस्तिष्क, जो अधिकांश कार्यों के लिए अच्छा है।
- HalleluBERT Large: अधिक "न्यूरॉन्स" वाला एक विशाल मस्तिष्क, जो गहरी सोच में सक्षम है।
टेस्ट ड्राइव: क्या यह काम आया?
शोधकर्ताओं ने HalleluBERT को दो मुख्य परीक्षणों के माध्यम से परखा, जो कार चलाने के अलग-अलग रास्तों की तरह हैं ताकि देखा जा सके कि वह इसे कैसे संभालता है:
- नामों को खोजना (Named Entity Recognition): कल्पना कीजिए कि आप एक समाचार लेख पढ़ रहे हैं और आपको तुरंत लोगों, स्थानों और संगठनों के सभी नामों को घेरना है।
- परिणाम: HalleluBERT इसमें सबसे अच्छा था। इसने किसी भी अन्य हिब्रू मॉडल की तुलना में नामों को अधिक सटीकता से पाया, और एक विशिष्ट परीक्षण में इसने अपने ही "Large" संस्करण को भी पीछे छोड़ दिया (संभवतः इसलिए क्योंकि वह परीक्षण छोटा था और उसे विशाल मस्तिष्क की आवश्यकता नहीं थी)।
- मिजाज को पढ़ना (Sentiment Classification): कल्पना कीजिए कि आप सोशल मीडिया कमेंट्स पढ़ रहे हैं और अनुमान लगा रहे हैं कि लेखक खुश है, दुखी है या तटस्थ है।
- परिणाम: HalleluBERT का "Large" संस्करण यहाँ चैंपियन रहा, जिसने अन्य सभी मॉडलों, जिनमें कई भाषाएं बोलने वाले मॉडल भी शामिल हैं, से अधिक स्कोर किया।
अंतिम स्कोरकार्ड: जब सभी परीक्षणों में स्कोर का औसत निकाला गया, तो HalleluBERT (विशेष रूप से Large संस्करण) शीर्ष पर रहा। इसने साबित कर दिया कि केवल हिब्रू पर प्रशिक्षित एक मस्तिष्क, जिसमें बहुत सारा डेटा है, उस मस्तिष्क से बेहतर है जो एक साथ 100 भाषाएं बोलने की कोशिश करता है।
उन्होंने क्या नहीं किया (सीमाएं)
यह शोध पत्र बहुत सावधानी से बताता है कि उन्होंने क्या नहीं किया:
- उन्होंने मॉडल का परीक्षण चिकित्सा सलाह या कानूनी अनुबंधों पर नहीं किया।
- उन्होंने लंबी कहानियों या उल्लेखित विशिष्ट परीक्षणों से परे जटिल तर्क कार्यों पर इसका परीक्षण नहीं किया।
- उन्होंने इंटरनेट डेटा में पाए जाने वाले संभावित पूर्वाग्रहों (जैसे कि रूढ़िवादिता) को ठीक करने की कोशिश नहीं की।
- उन्होंने हिब्रू के विभिन्न प्रकारों, जैसे प्राचीन बाइबिल हिब्रू या बहुत अनौपचारिक बोलचाल की भाषा पर इसका परीक्षण नहीं किया, हालांकि वे स्वीकार करते हैं कि अतिरिक्त प्रशिक्षण के बिना मॉडल को उनके साथ संघर्ष करना पड़ सकता है।
निष्कर्ष
लेखकों ने अपना काम मुफ्त में (एक ओपन लाइसेंस के तहत) जारी किया है ताकि अन्य शोधकर्ता इसका उपयोग कर सकें। उनका मुख्य संदेश सरल है: यदि आप हिब्रू के लिए सर्वश्रेष्ठ AI चाहते हैं, तो आपको एक ऐसा मॉडल चाहिए जो विशेष रूप से हिब्रू के लिए बनाया गया हो, जिसे भारी मात्रा में साफ डेटा पर प्रशिक्षित किया गया हो, और जिसका शब्दावली डिजाइन केवल उसी भाषा के लिए हो। HalleluBERT वही मॉडल है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।