← नवीनतम पेपर
🤖 AI

Tucano 2 Cool: Better Open Source LLMs for Portuguese

यह शोध पत्र टुकानो 2 (Tucano 2) का परिचय देता है, जो पुर्तगाली भाषा के लिए 0.5-3.7 बिलियन पैरामीटर वाले लार्ज लैंग्वेज मॉडल्स का एक पूर्णतः ओपन-सोर्स सुइट है, जिसमें उन्नत डेटासेट और प्रशिक्षण विधियाँ शामिल हैं जो भाषा बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करते हैं और समुदाय के लिए व्यापक, पुनरुत्पादक संसाधन प्रदान करते हैं।

मूल लेखक: Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र को पुर्तगाली बोलना, लिखना और सोचना सिखाने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेंच है: दुनिया के अधिकांश बेहतरीन शिक्षक और पाठ्यपुस्तकें अंग्रेजी में लिखी गई हैं, और उपलब्ध कुछ पुर्तगाली संसाधन या तो बहुत पुराने हैं, बहुत महंगे हैं, या बंद दरवाजों के पीछे रखे गए हैं।

यह शोध पत्र, "Tucano 2," एक समूह समर्पित शिक्षकों (बॉन विश्वविद्यालय और पॉलीग्लॉट प्रोजेक्ट से) की तरह है जिन्होंने पुर्तगाली के लिए अपना खुद का ओपन-सोर्स स्कूल बनाने का फैसला किया। उन्होंने केवल एक कक्षा नहीं बनाई; उन्होंने पूरा पाठ्यक्रम, पाठ्यपुस्तकें, ग्रेडिंग सिस्टम और शिक्षक प्रशिक्षण नियमावली बनाई, और फिर यह सब मुफ्त में दे दिया।

यहाँ इसकी कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल भागों में विभाजित किया गया है:

1. समस्या: "भाषा अंतराल" (The Language Gap)

इंटरनेट को एक विशाल पुस्तकालय के रूप में सोचें। अंग्रेजी के लिए, पुस्तकालय लाखों उच्च गुणवत्ता वाली किताबों से भरा हुआ है। पुर्तगाली के लिए, पुस्तकालय बहुत छोटा है, और कई किताबें अव्यवस्थित, त्रुटियों से भरी हैं, या इस तरह से लिखी गई हैं जिन्हें कंप्यूटर के लिए समझना कठिन है।

  • पुराना तरीका: बड़ी तकनीकी कंपनियाँ विशाल "बहुभाषी" मॉडल (जैसे एक स्विस आर्मी नाइफ) बनाती हैं जो एक साथ 100 भाषाएँ बोलने की कोशिश करती हैं। वे अच्छी हैं, लेकिन वे पुर्तगाली के लिए बेहतरीन नहीं हैं क्योंकि उन्हें अपनी मानसिक शक्ति बहुत अधिक फैलाकर रखनी पड़ती है।
  • Tucano का तरीका: वे एक विशेषज्ञ बनाना चाहते थे—एक "केवल-पुर्तगाली" विशेषज्ञ जो भाषा को अंदर और बाहर से जानता हो, बिना किसी सर्व-गुणों वाले (jack-of-all-trades) बने।

2. सामग्री: "GigaVerbo-v2" (पाक विधि/Cookbook)

कंप्यूटर को सिखाने के लिए, आपको डेटा की आवश्यकता होती है। टीम ने GigaVerbo-v2 नामक एक विशाल डेटासेट बनाया।

  • कच्चा माल: उन्होंने पुर्तगाली टेक्स्ट के लिए वेब को खंगाला, लेकिन इंटरनेट स्पैम और कचरे से भरा है।
  • फ़िल्टर: उन्होंने अच्छे और बुरे को अलग करने के लिए एक "स्मार्ट फ़िल्टर" (AI जज द्वारा संचालित) का उपयोग किया। उन्होंने शैक्षिक गुणवत्ता (क्या यह एक अच्छी पाठ्यपुस्तक है?) और विषाक्तता (क्या यह बुरा या हानिकारक है?) को देखा।
  • गुप्त सामग्री (सिंथेटिक डेटा): उन्होंने महसूस किया कि कुछ विषय (जैसे उन्नत गणित या कोडिंग) गायब थे। इसलिए, उन्होंने उन अंतरालों को भरने के लिए विशेष रूप से उच्च-गुणवत्ता वाले नए पुर्तगाली पाठ लिखने के लिए अन्य शक्तिशाली AI का उपयोग किया। यह एक पाठ्यपुस्तक के छूटे हुए अध्यायों को भरने के लिए एक घोस्टराइटर को काम पर रखने जैसा है।

3. मस्तिष्क: "टोकेनाइज़र ट्रांसप्लांटेशन" (Tokenizer Transplantation)

कल्पना कीजिए कि आपके पास 150,000 शब्दों का एक शब्दकोश है, लेकिन आपको पुर्तगाली बोलने के लिए केवल 50,000 की आवश्यकता है। बड़ा शब्दकोश उपयोग करने से कंप्यूटर धीमा और अनाड़ी हो जाता है।

  • चाल: उन्होंने एक शक्तिशाली, पूर्व-प्रशिक्षित AI (Qwen परिवार से) लिया और उसका "ब्रेन ट्रांसप्लांट" किया। उन्होंने इसके विशाल, अव्यवस्थित शब्दकोश को अपने कस्टम, कुशल पुर्तगाली शब्दकोश से बदल दिया।
  • परिणाम: मॉडल ने अपनी मौजूदा बुद्धिमत्ता को बनाए रखा लेकिन पुर्तगाली बोलने में बहुत तेज़ और अधिक कुशल हो गया, जैसे एक भारी, बोझिल बैकपैक को एक चिकने, कस्टम-फिटेड बैकपैक से बदलना।

4. प्रशिक्षण: "तीन-चरणीय आहार" (The Three-Stage Diet)

उन्होंने मॉडल को केवल रैंडम डेटा नहीं खिलाया। उन्होंने तीन चरणों वाला एक विशिष्ट "आहार" (प्रशिक्षण रेसिपी) डिज़ाइन किया:

  1. वार्म-अप: एक मजबूत नींव बनाने के लिए इसे उच्च-गुणवत्ता वाली शैक्षिक सामग्री खिलाना।
  2. स्थिर (Stable): इसमें अधिक विविधता जोड़ना, जिसमें सिंथेटिक डेटा और तर्क संबंधी कार्य शामिल हैं।
  3. परिष्करण (Refinement): लहजे और व्याकरण को पॉलिश करने के लिए शुद्ध पुर्तगाली डेटा पर ध्यान केंद्रित करना।
  • "सोचें" मोड: उन्होंने एक विशेष संस्करण भी बनाया जो "बोलने से पहले सोचने" के बारे में सीखता है। जब कठिन गणितीय समस्या पूछी जाती है, तो यह केवल अनुमान नहीं लगाता; यह अंतिम उत्तर देने से पहले अपने तर्क के चरणों को लिखता है (जैसे गणित की कक्षा में अपना काम दिखाना)।

5. परिणाम: दिग्गजों को हराना

उन्होंने अपने नए मॉडलों (0.5 बिलियन पैरामीटर्स से लेकर 3.7 बिलियन के मजबूत मॉडल तक) का अन्य मॉडलों के विरुद्ध परीक्षण किया।

  • आश्चर्य: भले ही उनके मॉडल विशाल "बहुभाषी" दिग्गजों से छोटे थे, फिर भी उन्होंने पुर्तगाली कार्यों पर उन्हें पछाड़ दिया
  • क्यों? क्योंकि वे विशेषज्ञ थे। एक विशेषज्ञ डॉक्टर हृदय के बारे में उस सामान्य चिकित्सक से अधिक जानता है जो सब कुछ थोड़ा-थोड़ा जानता है।
  • "Instruct" बनाम "Think" मॉडल:
    • Instruct: आदेशों का पालन करने, कोड लिखने और टेक्स्ट का सारांश बनाने में महान है।
    • Think: जटिल तर्क पहेलियों और गणित की समस्याओं को हल करने में महान है, जबकि पूरी तरह से पुर्तगाली में तर्क करता है।

6. "ओपन सोर्स" का वादा

इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा केवल मॉडल नहीं है; यह पारदर्शिता है।

  • अधिकांश AI कंपनियाँ कहती हैं, "हम पर भरोसा करें, हमारा मॉडल अच्छा है," लेकिन वे डेटा और कोड को छिपा लेती हैं।
  • Tucano टीम ने कहा, "यहाँ रेसिपी है, यहाँ सामग्रियाँ हैं, यहाँ कोड है, और यहाँ बिजली का बिल है।" उन्होंने सब कुछ जारी किया ताकि कोई भी, कहीं भी, इससे सीख सके, इसमें सुधार कर सके, या अपना संस्करण बना सके।

बड़ी तस्वीर का रूपक (The Big Picture Analogy)

कल्पना कीजिए कि AI की दुनिया एक दौड़ है।

  • बड़ी टेक दिग्गज भारी, महंगी फॉर्मूला 1 कारें चला रहे हैं जो किसी भी ट्रैक (किसी भी भाषा) पर दौड़ने के लिए बनाई गई हैं, लेकिन वे पुर्तगाली की विशिष्ट, घुमावदार सड़कों पर भारी और धीमी हैं।
  • Tucano टीम ने एक हल्की, कस्टम-निर्मित मोटरसाइकिल बनाई। उनके पास सबसे बड़ा इंजन नहीं था, लेकिन उन्होंने टायर, सस्पेंशन और ईंधन को विशेष रूप से पुर्तगाली सड़क के लिए ट्यून किया।
  • परिणाम: पुर्तगाली ट्रैक पर, मोटरसाइकिल F1 कार को पीछे छोड़ देती है। और क्योंकि उन्होंने ब्लूप्रिंट साझा किए हैं, अब हर कोई अपनी खुद की मोटरसाइकिल बना सकता है।

संक्षेप में: यह शोध पत्र सिद्ध करता है कि एक विशिष्ट भाषा के लिए महान AI बनाने के लिए आपको अरबों डॉलर की आवश्यकता नहीं है। आपको बस उच्च-गुणवत्ता वाले डेटा, स्मार्ट इंजीनियरिंग और अपने काम को दुनिया के साथ साझा करने की प्रतिबद्धता की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →