daVinci-LLM:Towards the Science of Pretraining
daVinci-LLM पेपर औद्योगिक-स्तर के संसाधनों और पूर्ण अनुसंधान स्वतंत्रता के एक अनूठे संयोजन का लाभ उठाकर प्रीट्रेनिंग के एक पूर्णतः-खुले, व्यवस्थित विज्ञान को स्थापित करता है, जिसमें "डेटा डार्विनिज्म" ढांचे को पेश किया गया है और व्यापक एब्लेशन अध्ययनों के माध्यम से यह प्रदर्शित किया गया है कि डेटा की मात्रा के साथ-साथ प्रोसेसिंग डेप्थ, एडेप्टिव डोमेन रणनीतियाँ और कंपोजिशनल बैलेंस मॉडल क्षमता के महत्वपूर्ण निर्धारक हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ daVinci-LLM पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।
बड़ी समस्या: AI का "ब्लैक बॉक्स" (Black Box)
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस की दुनिया एक विशाल कुकिंग कॉम्पिटिशन (खाना बनाने की प्रतियोगिता) की तरह है।
- बड़े शेफ (व्यावसायिक कंपनियाँ): उनके पास विशाल रसोई, असीमित सामग्री और सबसे अच्छे ओवन हैं। लेकिन वे अपनी गुप्त रेसिपी को एक तिजोरी में बंद रखते हैं। वे आपको केवल तैयार डिश (AI मॉडल) परोसते हैं और यह नहीं बताते कि उन्होंने इसे कैसे बनाया, उन्होंने किन सामग्रियों का उपयोग किया, या इसका स्वाद ऐसा क्यों है।
- होम कुक्स (अकादमिक शोधकर्ता): वे प्रयोग करने और अपने हर कदम को लिखने के लिए स्वतंत्र हैं। लेकिन उनके पास केवल एक छोटा चूल्हा और कुछ अंडे हैं। वे बड़े शेफों की तरह बड़ा भोज (feast) नहीं बना सकते।
परिणाम: हमारे पास बेहतरीन स्वाद वाला AI तो है, लेकिन हमें यह समझ नहीं आता कि इसे बेहतर कैसे बनाया जाए। हम केवल अनुमान लगाने में फंसे हुए हैं।
समाधान: "ओपन किचन" प्रयोग
daVinci-LLM की टीम (SII, SJTU और GAIR का एक सहयोग) ने एक ऐसी रसोई बनाने का निर्णय लिया जिसमें बड़े शेफों के पास मौजूद विशाल औद्योगिक उपकरण और होम कुक्स की पूर्ण स्वतंत्रता, दोनों हों।
उन्होंने केवल एक बना हुआ केक ही नहीं जारी किया; उन्होंने पूरी रेसिपी बुक, खरीदारी की सूची, गंदे बर्तन, और यहाँ तक कि वे विफल प्रयोग भी जारी किए जहाँ केक जल गया था। उनका लक्ष्य AI ट्रेनिंग को एक "रहस्यमयी कला" से बदलकर एक वास्तविक विज्ञान बनाना था।
असली मसाला: "डेटा डार्विनिज्म" (Data Darwinism)
ज्यादातर लोग सोचते हैं कि एक स्मार्ट AI बनाने के लिए बस उसे अधिक किताबें खिलाना जरूरी है। daVinci टीम कहती है: "नहीं, यह भोजन की मात्रा के बारे में नहीं, बल्कि उसकी गुणवत्ता के बारे में है।"
उन्होंने Data Darwinism नामक एक प्रणाली बनाई, जो उनकी सामग्रियों (डेटा) के लिए एक 10-स्तरीय फ़िल्टर की तरह है। इसे भोजन तैयार करने के रूप में सोचें:
- L0-L2 (किराने का सामान और छंटनी): वे इंटरनेट से कच्चा डेटा इकट्ठा करते हैं (जैसे कच्ची सब्जियाँ खरीदना)। वे गंदगी को धो देते हैं और सड़ी-गली चीजों को फेंक देते हैं (कचरा टेक्स्ट हटा देते हैं)।
- L3 (स्वाद परीक्षण): वे यह तय करने के लिए कि क्या भोजन वास्तव में खाने लायक है या सिर्फ लेबल पर आधारित है, एक स्मार्ट रोबोट का उपयोग करते हैं।
- L4 (शेफ का परिष्करण/Refinement): यह जादुई कदम है। केवल कच्ची सब्जी परोसने के बजाय, शेफ (एक शक्तिशाली AI) उसे काटता है, उसका सख्त छिलका हटाता है, और उसे प्लेट पर खूबसूरती से सजाता है। वे बिखरे हुए, कठिन वैज्ञानिक शोध पत्रों को फिर से लिखते हैं ताकि वे स्पष्ट और तार्किक हों, बिना तथ्यों को बदले।
- L5 (मास्टर शेफ का सबक): यह उच्चतम स्तर है। AI केवल भोजन को साफ नहीं करता; वह नए सबक बनाता है। वह एक जटिल गणितीय समस्या को लेता है और उसे हल करने के लिए चरण-दर-चरण ट्यूटोरियल लिखता है, उन कमियों को भरता है जिन्हें शायद एक इंसान छोड़ देता।
खोज: उन्होंने पाया कि इन "मास्टर शेफ" चरणों (L4 और L5) का उपयोग करने से उनका छोटा 3-बिलियन-पैरामीटर वाला मॉडल, बहुत बड़े 7-बिलियन-पैरामीटर वाले मॉडलों के समान प्रदर्शन करने लगा। गुणवत्ता ने मात्रा को हरा दिया।
ट्रेनिंग प्लान: दो चरणों की यात्रा
AI को प्रशिक्षित करना एक बच्चे को पालने जैसा है। आप उन्हें गिनती सीखने से पहले उन्नत कैलकुलस नहीं सिखा सकते। टीम ने एक दो-चरणीय पाठ्यक्रम (Two-Stage Curriculum) का उपयोग किया:
चरण 1: "किंडरगार्टन" (सामान्य आधार)
- लक्ष्य: मॉडल को बोलना, पढ़ना और दुनिया को समझना सिखाना।
- विधि: उन्होंने इसे सामान्य इंटरनेट टेक्स्ट, कोड और विज्ञान का एक विशाल मिश्रण खिलाया।
- ट्विस्ट: उन्होंने देखा कि मॉडल "सामान्य तथ्य" बहुत जल्दी सीख जाता है (जैसे एक बच्चा वर्णमाला सीखता है), लेकिन वह "तर्क करने" (जैसे पहेलियाँ सुलझाना) में लंबे समय तक बेहतर होता रहता है। इसलिए, उन्होंने बीच में ही आहार बदल दिया, और इसमें अधिक लॉजिक-हैवी कंटेंट (कोड और विज्ञान) और कम रैंडम इंटरनेट चैट शामिल की।
चरण 2: "यूनिवर्सिटी" (तर्क क्षमता में वृद्धि)
- लक्ष्य: उस स्मार्ट बच्चे को एक जीनियस प्रॉब्लम-सॉल्वर बनाना।
- विधि: उन्होंने उसे रैंडम कहानियाँ खिलाना बंद कर दिया और उसे प्रश्न और उत्तर (QA) जोड़े खिलाना शुरू किया।
- उपमा: कल्पना कीजिए कि आप एक परीक्षा के लिए पढ़ाई कर रहे हैं।
- चरण 1 पूरी पाठ्यपुस्तक को पढ़ना था।
- चरण 2 अभ्यास परीक्षा (practice exams) देना है।
- उन्होंने अभ्यास परीक्षाओं और पढ़ने के मिश्रण (30% QA) से शुरुआत की, फिर इसे बढ़ाकर 70% अभ्यास परीक्षा तक ले गए।
- परिणाम: मॉडल ने चरण-दर-चरण सोचना सीखा। वह गणित में ठीक होने से लेकर गणित के जादूगर बनने तक पहुँच गया, और इस दौरान उसने अपना सामान्य ज्ञान भी बरकरार रखा।
बड़ी खोजें (उन्होंने क्या सीखा)
200 से अधिक प्रयोगों (अलग-अलग रेसिपी आजमाकर और यह देखकर कि क्या विफल हुआ) के माध्यम से, उन्होंने तीन सुनहरे नियम खोजे:
- गहन प्रसंस्करण (Deep Processing) > बड़ा डेटा (Big Data): अपने डेटा को साफ करना और परिष्कृत करना (L4/L5), मॉडल पर अधिक कच्चा डेटा डालने से अधिक शक्तिशाली है। यह पोषक तत्वों से भरपूर 'सुपरफूड' बनाम ढेर सारा 'जंक फूड' खाने जैसा है।
- अनुकूलन या समाप्ति (Adapt or Die): अलग-अलग कौशल अलग-अलग गति से बढ़ते हैं। यदि आप एक ही तरह का डेटा मिश्रण खिलाते रहते हैं, तो मॉडल सीखना बंद कर देता है। आपको रेसिपी बदलनी होगी जैसे-जैसे मॉडल स्मार्ट होता जाता है।
- संतुलन ही कुंजी है: यदि आप मॉडल को केवल गणित के सवाल खिलाते हैं, तो वह कविता लिखना भूल जाता है। यदि आप उसे केवल कहानियाँ खिलाते हैं, तो वह गणित हल नहीं कर पाता। आपको "विनाशकारी विस्मृति" (catastrophic forgetting - जहाँ AI एक चीज़ में स्मार्ट हो जाता है लेकिन बाकी सब में मूर्ख) से बचने के लिए "विशेषज्ञ" प्रशिक्षण को "सामान्य" प्रशिक्षण के साथ संतुलित करना होगा।
अंतिम स्कोर
परिणाम है daVinci-LLM-3B।
- यह एक छोटा मॉडल है (3 बिलियन पैरामीटर्स)।
- यह ओपन है (हर कोई देख सकता है कि इसे कैसे बनाया गया है)।
- यह गणित, कोडिंग और विज्ञान में बहुत बड़े मॉडलों (जैसे 7-बिलियन-पैरामीटर वाला OLMo-3) के बराबर प्रदर्शन करता है।
यह क्यों मायने रखता है
यह पेपर पूरी दुनिया के लिए एक उपहार है। यह दिखाकर कि उन्होंने वास्तव में यह कैसे किया, उन्होंने साबित कर दिया कि विश्व-स्तरीय AI बनाने के लिए आपको अरबों डॉलर की कंपनी होने की आवश्यकता नहीं है। आपको बस अच्छा विज्ञान, साफ डेटा और प्रयोग करने की स्वतंत्रता चाहिए।
उन्होंने AI ट्रेनिंग के "ब्लैक बॉक्स" को एक स्पष्ट, पारदर्शी खिड़की में बदल दिया है, जिससे कोई भी सीख सकता है, सुधार कर सकता है और अपने काम को आगे बढ़ा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।