← नवीनतम पेपर
💬 NLP

Efficient Construction of Model Family through Progressive Training Using Model Expansion

यह शोध पत्र एक कुशल प्रगतिशील प्रशिक्षण पद्धति का प्रस्ताव करता है जो एक मॉडल परिवार बनाने के लिए छोटे मॉडलों को बड़े आकार में क्रमिक रूप से विस्तारित करता है, जिससे पारंपरिक स्वतंत्र प्रशिक्षण की तुलना में प्रदर्शन और व्यवहार संबंधी निरंतरता बनाए रखते हुए कुल कम्प्यूटेशनल लागत में लगभग 25% की कमी आती है।

मूल लेखक: Kazuki Yano, Sho Takase, Sosuke Kobayashi, Shun Kiyono, Jun Suzuki

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kazuki Yano, Sho Takase, Sosuke Kobayashi, Shun Kiyono, Jun Suzuki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक रेस्टोरेंट चेन बनाने की कोशिश कर रहे हैं। आपको तीन अलग-अलग रसोई की आवश्यकता है: एक छोटा फूड ट्रक (1B पैरामीटर्स), एक मध्यम बिस्ट्रो (4B पैरामीटर्स), और एक विशाल फाइव-स्टार होटल की रसोई (8B पैरामीटर्स)।

पुराना तरीका: शून्य से शुरुआत करना

परंपरागत रूप से, यदि आप इन तीनों को खोलना चाहते, तो आप तीन पूरी तरह से अलग टीमें काम पर रखते।

  1. आप टीम A को काम पर रखते, उन्हें ताजी सामग्री खरीदते, और उन्हें फूड ट्रक चलाने के लिए सब कुछ शुरू से सिखाते।
  2. आप उन्हें निकाल देते (या वेतन पर रखते), टीम B को काम पर रखते, नई सामग्री खरीदते, और उन्हें बिस्ट्रो चलाने के लिए सब कुछ शुरू से सिखाते।
  3. आप टीम C और फाइव-स्टार होटल के लिए भी यही करते।

समस्या: यह अविश्वसनीय रूप से महंगा है। आप एक ही "सीखने" के लिए तीन बार भुगतान कर रहे हैं। इसके अलावा, फूड ट्रक शेफ का स्टाइल थोड़ा अलग हो सकता है और होटल शेफ का स्टाइल अलग, इसलिए उनके रेसिपी आपस में मेल नहीं खाएंगे।

नया तरीका: "प्रोग्रेसिव ट्रेनिंग" (पेपर का विचार)

इस पेपर के लेखक आपके रेस्टोरेंट चेन को बनाने का एक स्मार्ट और अधिक कुशल तरीका प्रस्तावित करते हैं। तीन अलग-अलग टीमें रखने के बजाय, आप एक शेफ से शुरुआत करते हैं और उसे विकसित करते हैं।

  1. छोटा शुरू करें: आप एक शेफ को काम पर रखते हैं और उसे फूड ट्रक चलाने के लिए प्रशिक्षित करते हैं। वह बुनियादी बातें सीखता है।
  2. रसोई का विस्तार करें: उसे निकालने के बजाय, आप उसे पदोन्नति देते हैं। आप भौतिक रूप से उसकी रसोई को ट्रक से बिस्ट्रो में विस्तारित करते हैं। आप उसके पहले से सीखे हुए कौशल (यानी "वेट्स" या "पैरामीटर्स") का उपयोग करते हैं। आप फिर से शुरुआत नहीं करते; आप बस जो वह पहले से जानता है उसमें और अधिक काउंटर और ओवन जोड़ देते हैं।
  3. फिर से बढ़ें: एक बार जब वह बिस्ट्रो में महारत हासिल कर लेता है, तो आप अपनी रसोई को फिर से बढ़ाकर फाइव-स्टार होटल में विस्तारित करते हैं। फिर से, आप उसके मौजूदा अनुभव की नींव पर निर्माण करते हैं।

जादुई ट्रिक: ऐसा करने से, आप केवल अंतिम विस्तार की लागत का भुगतान करते हैं। आप हर बार बड़ी रसोई मिलने पर शेफ को प्याज काटना या अंडे तलना फिर से नहीं सिखाने के लिए भुगतान नहीं करते हैं।

उन्होंने क्या पाया?

1. यह बहुत पैसा (और समय) बचाता है
पेपर दिखाता है कि यह "बढ़ाने" वाला तरीका तीन अलग मॉडल को प्रशिक्षित करने की तुलना में लगभग 25% कंप्यूटिंग पावर (या पैसा) बचाता है।

  • उपमा: यह एक ही उच्च गुणवत्ता वाले सूट खरीदने और उसे आपके बढ़ते शरीर के अनुसार फिट कराने जैसा है, बजाय इसके कि हर बार वजन बढ़ने पर आप एक नया सूट खरीदें।

2. खाना बेहतर स्वाद करता है (प्रदर्शन)
आश्चर्यजनक रूप से, इस तरह से बनाए गए मॉडल न केवल पैसे बचाते हैं; वे स्वतंत्र रूप से प्रशिक्षित मॉडलों की तुलना में बेहतर या उनके बराबर प्रदर्शन करते हैं।

  • सीक्रेट सॉस: शोधकर्ताओं ने पाया कि यदि आप रसोई के आकार के आधार पर ओवन की "गर्मी" (लर्निंग रेट) को एडजस्ट करते हैं, तो यह और भी बेहतर काम करता है। छोटी रसोई को तेजी से सीखने के लिए उच्च गर्मी की आवश्यकता होती है; विशाल होटलों को स्थिर रहने के लिए कम गर्मी की आवश्यकता होती है। इसे ट्यून करके, "प्रोग्रेसिव" मॉडल कई परीक्षणों में "इंडिपेंडेंट" मॉडल्स को पीछे छोड़ देते हैं।

3. वे एक ही भाषा बोलते हैं (निरंतरता)
सबसे दिलचस्प हिस्सा यह है। क्योंकि बड़े मॉडल का जन्म छोटे मॉडल से हुआ है, इसलिए वे बहुत समान रूप से सोचते हैं।

  • उपमा: यदि आप फूड ट्रक शेफ और होटल शेफ से एक ही सवाल पूछते हैं, तो वे बहुत समान उत्तर देंगे क्योंकि उनका इतिहास एक ही है।
  • यह क्यों मायने रखता है: यह स्पेक्टिव डिकोडिंग (Speculative Decoding) का उपयोग करना आसान बनाता है। कल्पना कीजिए कि फूड ट्रक शेफ जल्दी से अनुमान लगा रहा है कि होटल शेफ क्या कहने वाला है। चूंकि वे एक जैसा सोचते हैं, इसलिए होटल शेफ लगभग हर बार उस अनुमान को स्वीकार कर लेता है। यह पूरे सिस्टम को बहुत तेज़ बना देता है।

निचोड़ (The Bottom Line)

यह पेपर एक AI मॉडल परिवार (छोटे से विशाल तक) बनाने का एक तरीका पेश करता है, जो किसी छोटे मॉडल को विस्तारित (expand) करके बनाया गया है, न कि उन्हें अलग-अलग प्रशिक्षित करके।

  • पुराना तरीका: 1B को ट्रेन करें, 4B को ट्रेन करें, 8B को अलग-अलग ट्रेन करें। (महंगा, असंगत)।
  • नया तरीका: 1B \rightarrow 4B तक विस्तार \rightarrow 8B तक विस्तार। (सस्ता, तेज़, और मॉडल आपस में पूरी तरह तालमेल रखते हैं)।

यह AI परिवारों को बनाने का एक स्मार्ट तरीका है, जो संसाधनों को बचाते हुए मॉडलों को अधिक सुसंगत और कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →