Tucano 2 Cool: Better Open Source LLMs for Portuguese
यह शोध पत्र टुकानो 2 (Tucano 2) का परिचय देता है, जो पुर्तगाली भाषा के लिए 0.5-3.7 बिलियन पैरामीटर वाले लार्ज लैंग्वेज मॉडल्स का एक पूर्णतः ओपन-सोर्स सुइट है, जिसमें उन्नत डेटासेट और प्रशिक्षण विधियाँ शामिल हैं जो भाषा बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करते हैं और समुदाय के लिए व्यापक, पुनरुत्पादक संसाधन प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र को पुर्तगाली बोलना, लिखना और सोचना सिखाने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेंच है: दुनिया के अधिकांश बेहतरीन शिक्षक और पाठ्यपुस्तकें अंग्रेजी में लिखी गई हैं, और उपलब्ध कुछ पुर्तगाली संसाधन या तो बहुत पुराने हैं, बहुत महंगे हैं, या बंद दरवाजों के पीछे रखे गए हैं।
यह शोध पत्र, "Tucano 2," एक समूह समर्पित शिक्षकों (बॉन विश्वविद्यालय और पॉलीग्लॉट प्रोजेक्ट से) की तरह है जिन्होंने पुर्तगाली के लिए अपना खुद का ओपन-सोर्स स्कूल बनाने का फैसला किया। उन्होंने केवल एक कक्षा नहीं बनाई; उन्होंने पूरा पाठ्यक्रम, पाठ्यपुस्तकें, ग्रेडिंग सिस्टम और शिक्षक प्रशिक्षण नियमावली बनाई, और फिर यह सब मुफ्त में दे दिया।
यहाँ इसकी कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल भागों में विभाजित किया गया है:
1. समस्या: "भाषा अंतराल" (The Language Gap)
इंटरनेट को एक विशाल पुस्तकालय के रूप में सोचें। अंग्रेजी के लिए, पुस्तकालय लाखों उच्च गुणवत्ता वाली किताबों से भरा हुआ है। पुर्तगाली के लिए, पुस्तकालय बहुत छोटा है, और कई किताबें अव्यवस्थित, त्रुटियों से भरी हैं, या इस तरह से लिखी गई हैं जिन्हें कंप्यूटर के लिए समझना कठिन है।
- पुराना तरीका: बड़ी तकनीकी कंपनियाँ विशाल "बहुभाषी" मॉडल (जैसे एक स्विस आर्मी नाइफ) बनाती हैं जो एक साथ 100 भाषाएँ बोलने की कोशिश करती हैं। वे अच्छी हैं, लेकिन वे पुर्तगाली के लिए बेहतरीन नहीं हैं क्योंकि उन्हें अपनी मानसिक शक्ति बहुत अधिक फैलाकर रखनी पड़ती है।
- Tucano का तरीका: वे एक विशेषज्ञ बनाना चाहते थे—एक "केवल-पुर्तगाली" विशेषज्ञ जो भाषा को अंदर और बाहर से जानता हो, बिना किसी सर्व-गुणों वाले (jack-of-all-trades) बने।
2. सामग्री: "GigaVerbo-v2" (पाक विधि/Cookbook)
कंप्यूटर को सिखाने के लिए, आपको डेटा की आवश्यकता होती है। टीम ने GigaVerbo-v2 नामक एक विशाल डेटासेट बनाया।
- कच्चा माल: उन्होंने पुर्तगाली टेक्स्ट के लिए वेब को खंगाला, लेकिन इंटरनेट स्पैम और कचरे से भरा है।
- फ़िल्टर: उन्होंने अच्छे और बुरे को अलग करने के लिए एक "स्मार्ट फ़िल्टर" (AI जज द्वारा संचालित) का उपयोग किया। उन्होंने शैक्षिक गुणवत्ता (क्या यह एक अच्छी पाठ्यपुस्तक है?) और विषाक्तता (क्या यह बुरा या हानिकारक है?) को देखा।
- गुप्त सामग्री (सिंथेटिक डेटा): उन्होंने महसूस किया कि कुछ विषय (जैसे उन्नत गणित या कोडिंग) गायब थे। इसलिए, उन्होंने उन अंतरालों को भरने के लिए विशेष रूप से उच्च-गुणवत्ता वाले नए पुर्तगाली पाठ लिखने के लिए अन्य शक्तिशाली AI का उपयोग किया। यह एक पाठ्यपुस्तक के छूटे हुए अध्यायों को भरने के लिए एक घोस्टराइटर को काम पर रखने जैसा है।
3. मस्तिष्क: "टोकेनाइज़र ट्रांसप्लांटेशन" (Tokenizer Transplantation)
कल्पना कीजिए कि आपके पास 150,000 शब्दों का एक शब्दकोश है, लेकिन आपको पुर्तगाली बोलने के लिए केवल 50,000 की आवश्यकता है। बड़ा शब्दकोश उपयोग करने से कंप्यूटर धीमा और अनाड़ी हो जाता है।
- चाल: उन्होंने एक शक्तिशाली, पूर्व-प्रशिक्षित AI (Qwen परिवार से) लिया और उसका "ब्रेन ट्रांसप्लांट" किया। उन्होंने इसके विशाल, अव्यवस्थित शब्दकोश को अपने कस्टम, कुशल पुर्तगाली शब्दकोश से बदल दिया।
- परिणाम: मॉडल ने अपनी मौजूदा बुद्धिमत्ता को बनाए रखा लेकिन पुर्तगाली बोलने में बहुत तेज़ और अधिक कुशल हो गया, जैसे एक भारी, बोझिल बैकपैक को एक चिकने, कस्टम-फिटेड बैकपैक से बदलना।
4. प्रशिक्षण: "तीन-चरणीय आहार" (The Three-Stage Diet)
उन्होंने मॉडल को केवल रैंडम डेटा नहीं खिलाया। उन्होंने तीन चरणों वाला एक विशिष्ट "आहार" (प्रशिक्षण रेसिपी) डिज़ाइन किया:
- वार्म-अप: एक मजबूत नींव बनाने के लिए इसे उच्च-गुणवत्ता वाली शैक्षिक सामग्री खिलाना।
- स्थिर (Stable): इसमें अधिक विविधता जोड़ना, जिसमें सिंथेटिक डेटा और तर्क संबंधी कार्य शामिल हैं।
- परिष्करण (Refinement): लहजे और व्याकरण को पॉलिश करने के लिए शुद्ध पुर्तगाली डेटा पर ध्यान केंद्रित करना।
- "सोचें" मोड: उन्होंने एक विशेष संस्करण भी बनाया जो "बोलने से पहले सोचने" के बारे में सीखता है। जब कठिन गणितीय समस्या पूछी जाती है, तो यह केवल अनुमान नहीं लगाता; यह अंतिम उत्तर देने से पहले अपने तर्क के चरणों को लिखता है (जैसे गणित की कक्षा में अपना काम दिखाना)।
5. परिणाम: दिग्गजों को हराना
उन्होंने अपने नए मॉडलों (0.5 बिलियन पैरामीटर्स से लेकर 3.7 बिलियन के मजबूत मॉडल तक) का अन्य मॉडलों के विरुद्ध परीक्षण किया।
- आश्चर्य: भले ही उनके मॉडल विशाल "बहुभाषी" दिग्गजों से छोटे थे, फिर भी उन्होंने पुर्तगाली कार्यों पर उन्हें पछाड़ दिया।
- क्यों? क्योंकि वे विशेषज्ञ थे। एक विशेषज्ञ डॉक्टर हृदय के बारे में उस सामान्य चिकित्सक से अधिक जानता है जो सब कुछ थोड़ा-थोड़ा जानता है।
- "Instruct" बनाम "Think" मॉडल:
- Instruct: आदेशों का पालन करने, कोड लिखने और टेक्स्ट का सारांश बनाने में महान है।
- Think: जटिल तर्क पहेलियों और गणित की समस्याओं को हल करने में महान है, जबकि पूरी तरह से पुर्तगाली में तर्क करता है।
6. "ओपन सोर्स" का वादा
इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा केवल मॉडल नहीं है; यह पारदर्शिता है।
- अधिकांश AI कंपनियाँ कहती हैं, "हम पर भरोसा करें, हमारा मॉडल अच्छा है," लेकिन वे डेटा और कोड को छिपा लेती हैं।
- Tucano टीम ने कहा, "यहाँ रेसिपी है, यहाँ सामग्रियाँ हैं, यहाँ कोड है, और यहाँ बिजली का बिल है।" उन्होंने सब कुछ जारी किया ताकि कोई भी, कहीं भी, इससे सीख सके, इसमें सुधार कर सके, या अपना संस्करण बना सके।
बड़ी तस्वीर का रूपक (The Big Picture Analogy)
कल्पना कीजिए कि AI की दुनिया एक दौड़ है।
- बड़ी टेक दिग्गज भारी, महंगी फॉर्मूला 1 कारें चला रहे हैं जो किसी भी ट्रैक (किसी भी भाषा) पर दौड़ने के लिए बनाई गई हैं, लेकिन वे पुर्तगाली की विशिष्ट, घुमावदार सड़कों पर भारी और धीमी हैं।
- Tucano टीम ने एक हल्की, कस्टम-निर्मित मोटरसाइकिल बनाई। उनके पास सबसे बड़ा इंजन नहीं था, लेकिन उन्होंने टायर, सस्पेंशन और ईंधन को विशेष रूप से पुर्तगाली सड़क के लिए ट्यून किया।
- परिणाम: पुर्तगाली ट्रैक पर, मोटरसाइकिल F1 कार को पीछे छोड़ देती है। और क्योंकि उन्होंने ब्लूप्रिंट साझा किए हैं, अब हर कोई अपनी खुद की मोटरसाइकिल बना सकता है।
संक्षेप में: यह शोध पत्र सिद्ध करता है कि एक विशिष्ट भाषा के लिए महान AI बनाने के लिए आपको अरबों डॉलर की आवश्यकता नहीं है। आपको बस उच्च-गुणवत्ता वाले डेटा, स्मार्ट इंजीनियरिंग और अपने काम को दुनिया के साथ साझा करने की प्रतिबद्धता की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।