← नवीनतम पेपर
🤖 AI

daVinci-LLM:Towards the Science of Pretraining

daVinci-LLM पेपर औद्योगिक-स्तर के संसाधनों और पूर्ण अनुसंधान स्वतंत्रता के एक अनूठे संयोजन का लाभ उठाकर प्रीट्रेनिंग के एक पूर्णतः-खुले, व्यवस्थित विज्ञान को स्थापित करता है, जिसमें "डेटा डार्विनिज्म" ढांचे को पेश किया गया है और व्यापक एब्लेशन अध्ययनों के माध्यम से यह प्रदर्शित किया गया है कि डेटा की मात्रा के साथ-साथ प्रोसेसिंग डेप्थ, एडेप्टिव डोमेन रणनीतियाँ और कंपोजिशनल बैलेंस मॉडल क्षमता के महत्वपूर्ण निर्धारक हैं।

मूल लेखक: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ daVinci-LLM पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: AI का "ब्लैक बॉक्स" (Black Box)

कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस की दुनिया एक विशाल कुकिंग कॉम्पिटिशन (खाना बनाने की प्रतियोगिता) की तरह है।

  • बड़े शेफ (व्यावसायिक कंपनियाँ): उनके पास विशाल रसोई, असीमित सामग्री और सबसे अच्छे ओवन हैं। लेकिन वे अपनी गुप्त रेसिपी को एक तिजोरी में बंद रखते हैं। वे आपको केवल तैयार डिश (AI मॉडल) परोसते हैं और यह नहीं बताते कि उन्होंने इसे कैसे बनाया, उन्होंने किन सामग्रियों का उपयोग किया, या इसका स्वाद ऐसा क्यों है।
  • होम कुक्स (अकादमिक शोधकर्ता): वे प्रयोग करने और अपने हर कदम को लिखने के लिए स्वतंत्र हैं। लेकिन उनके पास केवल एक छोटा चूल्हा और कुछ अंडे हैं। वे बड़े शेफों की तरह बड़ा भोज (feast) नहीं बना सकते।

परिणाम: हमारे पास बेहतरीन स्वाद वाला AI तो है, लेकिन हमें यह समझ नहीं आता कि इसे बेहतर कैसे बनाया जाए। हम केवल अनुमान लगाने में फंसे हुए हैं।

समाधान: "ओपन किचन" प्रयोग

daVinci-LLM की टीम (SII, SJTU और GAIR का एक सहयोग) ने एक ऐसी रसोई बनाने का निर्णय लिया जिसमें बड़े शेफों के पास मौजूद विशाल औद्योगिक उपकरण और होम कुक्स की पूर्ण स्वतंत्रता, दोनों हों।

उन्होंने केवल एक बना हुआ केक ही नहीं जारी किया; उन्होंने पूरी रेसिपी बुक, खरीदारी की सूची, गंदे बर्तन, और यहाँ तक कि वे विफल प्रयोग भी जारी किए जहाँ केक जल गया था। उनका लक्ष्य AI ट्रेनिंग को एक "रहस्यमयी कला" से बदलकर एक वास्तविक विज्ञान बनाना था।


असली मसाला: "डेटा डार्विनिज्म" (Data Darwinism)

ज्यादातर लोग सोचते हैं कि एक स्मार्ट AI बनाने के लिए बस उसे अधिक किताबें खिलाना जरूरी है। daVinci टीम कहती है: "नहीं, यह भोजन की मात्रा के बारे में नहीं, बल्कि उसकी गुणवत्ता के बारे में है।"

उन्होंने Data Darwinism नामक एक प्रणाली बनाई, जो उनकी सामग्रियों (डेटा) के लिए एक 10-स्तरीय फ़िल्टर की तरह है। इसे भोजन तैयार करने के रूप में सोचें:

  1. L0-L2 (किराने का सामान और छंटनी): वे इंटरनेट से कच्चा डेटा इकट्ठा करते हैं (जैसे कच्ची सब्जियाँ खरीदना)। वे गंदगी को धो देते हैं और सड़ी-गली चीजों को फेंक देते हैं (कचरा टेक्स्ट हटा देते हैं)।
  2. L3 (स्वाद परीक्षण): वे यह तय करने के लिए कि क्या भोजन वास्तव में खाने लायक है या सिर्फ लेबल पर आधारित है, एक स्मार्ट रोबोट का उपयोग करते हैं।
  3. L4 (शेफ का परिष्करण/Refinement): यह जादुई कदम है। केवल कच्ची सब्जी परोसने के बजाय, शेफ (एक शक्तिशाली AI) उसे काटता है, उसका सख्त छिलका हटाता है, और उसे प्लेट पर खूबसूरती से सजाता है। वे बिखरे हुए, कठिन वैज्ञानिक शोध पत्रों को फिर से लिखते हैं ताकि वे स्पष्ट और तार्किक हों, बिना तथ्यों को बदले।
  4. L5 (मास्टर शेफ का सबक): यह उच्चतम स्तर है। AI केवल भोजन को साफ नहीं करता; वह नए सबक बनाता है। वह एक जटिल गणितीय समस्या को लेता है और उसे हल करने के लिए चरण-दर-चरण ट्यूटोरियल लिखता है, उन कमियों को भरता है जिन्हें शायद एक इंसान छोड़ देता।

खोज: उन्होंने पाया कि इन "मास्टर शेफ" चरणों (L4 और L5) का उपयोग करने से उनका छोटा 3-बिलियन-पैरामीटर वाला मॉडल, बहुत बड़े 7-बिलियन-पैरामीटर वाले मॉडलों के समान प्रदर्शन करने लगा। गुणवत्ता ने मात्रा को हरा दिया।


ट्रेनिंग प्लान: दो चरणों की यात्रा

AI को प्रशिक्षित करना एक बच्चे को पालने जैसा है। आप उन्हें गिनती सीखने से पहले उन्नत कैलकुलस नहीं सिखा सकते। टीम ने एक दो-चरणीय पाठ्यक्रम (Two-Stage Curriculum) का उपयोग किया:

चरण 1: "किंडरगार्टन" (सामान्य आधार)

  • लक्ष्य: मॉडल को बोलना, पढ़ना और दुनिया को समझना सिखाना।
  • विधि: उन्होंने इसे सामान्य इंटरनेट टेक्स्ट, कोड और विज्ञान का एक विशाल मिश्रण खिलाया।
  • ट्विस्ट: उन्होंने देखा कि मॉडल "सामान्य तथ्य" बहुत जल्दी सीख जाता है (जैसे एक बच्चा वर्णमाला सीखता है), लेकिन वह "तर्क करने" (जैसे पहेलियाँ सुलझाना) में लंबे समय तक बेहतर होता रहता है। इसलिए, उन्होंने बीच में ही आहार बदल दिया, और इसमें अधिक लॉजिक-हैवी कंटेंट (कोड और विज्ञान) और कम रैंडम इंटरनेट चैट शामिल की।

चरण 2: "यूनिवर्सिटी" (तर्क क्षमता में वृद्धि)

  • लक्ष्य: उस स्मार्ट बच्चे को एक जीनियस प्रॉब्लम-सॉल्वर बनाना।
  • विधि: उन्होंने उसे रैंडम कहानियाँ खिलाना बंद कर दिया और उसे प्रश्न और उत्तर (QA) जोड़े खिलाना शुरू किया।
  • उपमा: कल्पना कीजिए कि आप एक परीक्षा के लिए पढ़ाई कर रहे हैं।
    • चरण 1 पूरी पाठ्यपुस्तक को पढ़ना था।
    • चरण 2 अभ्यास परीक्षा (practice exams) देना है।
    • उन्होंने अभ्यास परीक्षाओं और पढ़ने के मिश्रण (30% QA) से शुरुआत की, फिर इसे बढ़ाकर 70% अभ्यास परीक्षा तक ले गए।
  • परिणाम: मॉडल ने चरण-दर-चरण सोचना सीखा। वह गणित में ठीक होने से लेकर गणित के जादूगर बनने तक पहुँच गया, और इस दौरान उसने अपना सामान्य ज्ञान भी बरकरार रखा।

बड़ी खोजें (उन्होंने क्या सीखा)

200 से अधिक प्रयोगों (अलग-अलग रेसिपी आजमाकर और यह देखकर कि क्या विफल हुआ) के माध्यम से, उन्होंने तीन सुनहरे नियम खोजे:

  1. गहन प्रसंस्करण (Deep Processing) > बड़ा डेटा (Big Data): अपने डेटा को साफ करना और परिष्कृत करना (L4/L5), मॉडल पर अधिक कच्चा डेटा डालने से अधिक शक्तिशाली है। यह पोषक तत्वों से भरपूर 'सुपरफूड' बनाम ढेर सारा 'जंक फूड' खाने जैसा है।
  2. अनुकूलन या समाप्ति (Adapt or Die): अलग-अलग कौशल अलग-अलग गति से बढ़ते हैं। यदि आप एक ही तरह का डेटा मिश्रण खिलाते रहते हैं, तो मॉडल सीखना बंद कर देता है। आपको रेसिपी बदलनी होगी जैसे-जैसे मॉडल स्मार्ट होता जाता है।
  3. संतुलन ही कुंजी है: यदि आप मॉडल को केवल गणित के सवाल खिलाते हैं, तो वह कविता लिखना भूल जाता है। यदि आप उसे केवल कहानियाँ खिलाते हैं, तो वह गणित हल नहीं कर पाता। आपको "विनाशकारी विस्मृति" (catastrophic forgetting - जहाँ AI एक चीज़ में स्मार्ट हो जाता है लेकिन बाकी सब में मूर्ख) से बचने के लिए "विशेषज्ञ" प्रशिक्षण को "सामान्य" प्रशिक्षण के साथ संतुलित करना होगा।

अंतिम स्कोर

परिणाम है daVinci-LLM-3B

  • यह एक छोटा मॉडल है (3 बिलियन पैरामीटर्स)।
  • यह ओपन है (हर कोई देख सकता है कि इसे कैसे बनाया गया है)।
  • यह गणित, कोडिंग और विज्ञान में बहुत बड़े मॉडलों (जैसे 7-बिलियन-पैरामीटर वाला OLMo-3) के बराबर प्रदर्शन करता है।

यह क्यों मायने रखता है

यह पेपर पूरी दुनिया के लिए एक उपहार है। यह दिखाकर कि उन्होंने वास्तव में यह कैसे किया, उन्होंने साबित कर दिया कि विश्व-स्तरीय AI बनाने के लिए आपको अरबों डॉलर की कंपनी होने की आवश्यकता नहीं है। आपको बस अच्छा विज्ञान, साफ डेटा और प्रयोग करने की स्वतंत्रता चाहिए।

उन्होंने AI ट्रेनिंग के "ब्लैक बॉक्स" को एक स्पष्ट, पारदर्शी खिड़की में बदल दिया है, जिससे कोई भी सीख सकता है, सुधार कर सकता है और अपने काम को आगे बढ़ा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →