← नवीनतम पेपर
💬 NLP

Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

यह शोध पत्र OP-Mix को पेश करता है, जो एक एकीकृत, कुशल डेटा मिक्सिंग एल्गोरिदम है जो पूरे लैंग्वेज मॉडल प्रशिक्षण जीवनचक्र में संभावित मिश्रणों का अनुकरण करने के लिए लो-रैंक एडैप्टर इंटरपोलेशन का उपयोग करता है, और मौजूदा चरण-विशिष्ट विधियों की तुलना में काफी कम कंप्यूट के साथ लगभग इष्टतम प्रदर्शन प्राप्त करता है।

मूल लेखक: Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक बेहतरीन सूप बनाने की कोशिश कर रहे हैं। आपके पास विभिन्न सामग्रियों से भरी एक पेंट्री है: कुछ तीखी हैं, कुछ मीठी हैं, कुछ मिट्टी जैसी (earthy) हैं और कुछ खट्टी हैं। लक्ष्य यह पता लगाना है कि सबसे स्वादिष्ट सूप बनाने के लिए आपको प्रत्येक सामग्री को कितनी मात्रा में मिलाना चाहिए।

आर्टिफिशियल इंटेलिजेंस (विशेष रूप से लार्ज लैंग्वेज मॉडल्स) की दुनिया में, ये "सामग्रियां" डेटा के विभिन्न प्रकार हैं (जैसे गणित की समस्याएं, रेडिट पोस्ट, या मेडिकल लेख)। "सूप" वह AI मॉडल है। किस प्रकार के डेटा का कितना मिश्रण उपयोग करना है, इसका निर्णय लेने की प्रक्रिया को डेटा मिक्सिंग (Data Mixing) कहा जाता है।

समस्या: पुराना तरीका धीमा और कठोर है

पारंपरिक रूप से, सही मिश्रण का पता लगाना एक छोटे टेस्ट किचन में बड़े बर्तन में सूप डालने से पहले लाखों अलग-अलग संस्करणों को बनाने जैसा था।

  • द प्रॉक्सी प्रॉब्लम (The Proxy Problem): शोधकर्ता अलग-अलग मिश्रणों पर बहुत छोटे, सस्ते "टेस्ट मॉडल" (प्रॉक्सी) प्रशिक्षित करते थे ताकि यह अनुमान लगाया जा सके कि बड़े, महंगे मॉडल के लिए क्या काम करेगा। लेकिन ये छोटे मॉडल बड़े मॉडल की तुलना में अलग तरह से व्यवहार करते थे, जिससे गलत अनुमान लग जाते थे।
  • "वन-टाइम" की समस्या (The "One-Time" Problem): अधिकांश तरीके केवल प्रशिक्षण के पहले चरण (प्रीट्रेनिंग) के लिए काम करते थे। एक बार जब मॉडल बुनियादी चीजें सीख लेता था और उसे नए कौशल सीखने की आवश्यकता होती थी (जैसे प्रश्न पूछना), तो पुराने मिक्सिंग रेसिपी काम नहीं करते थे। यदि नया डेटा आता (जैसे मेडिकल रिकॉर्ड का एक नया डेटासेट), तो आप पुराने को भूले बिना या उसे फिर से शुरू किए बिना उस मिश्रण में आसानी से शामिल नहीं हो सकते थे।

समाधान: OP-MIX (ऑन-पॉलिसी मिक्स)

लेखक OP-MIX पेश करते हैं, जो एक नया तरीका है जो एक "स्मार्ट टेस्ट-टेस्टर" की तरह काम करता है और AI के पूरे जीवनकाल में, उसके सीखने के पहले दिन से लेकर उसके अंतिम पॉलिश तक, काम करता है।

यहाँ बताया गया है कि OP-MIX कैसे काम करता है, एक रचनात्मक उपमा (analogy) का उपयोग करते हुए:

1. "LoRA" टेस्ट-टेस्टर (छोटे शेफ)

हर नए घटक (ingredient) के लिए एक नया टेस्ट किचन (एक अलग प्रॉक्सी मॉडल) बनाने के बजाय, OP-MIX LoRA (लो-रैंक अडैप्टेशन) का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक मास्टर शेफ (मुख्य AI मॉडल) है। जब आप एक नई सामग्री (एक नया डेटासेट) का परीक्षण करना चाहते हैं, तो आप एक नया रेस्टोरेंट नहीं खोलते। इसके बजाय, आप मास्टर शेफ को एक छोटा, हल्का एप्रन (LoRA एडॉप्टर) देते हैं जो उन्हें उस विशिष्ट नई सामग्री को संभालने का तरीका सिखाता है।
  • लाभ: ये एप्रन बनाने में अविश्वसनीय रूप से सस्ते और तेज़ हैं। वे "ऑन-पॉलिसी" रहते हैं, जिसका अर्थ है कि वे सीधे मास्टर शेफ की वर्तमान शैली से जुड़े होते हैं, इसलिए वे अधिक सटीक भविष्यवाणी करते हैं कि अंतिम सूप का स्वाद कैसा होगा।

2. "ब्लेंडिंग" का तरीका (इंटरपोलेशन)

एक बार जब शेफ के पास विभिन्न सामग्रियों के लिए ये छोटे एप्रन होते हैं, तो OP-MIX को यह देखने के लिए वास्तव में सूप बनाने की आवश्यकता नहीं होती कि क्या होता है।

  • उपमा: कल्पना कीजिए कि आपके पास एक जादुई ब्लेंडर है। आप "मैथ" के एप्रन का "फ्लेवर प्रोफाइल" और "हिस्ट्री" के एप्रन का "फ्लेवर प्रोफाइल" ले सकते हैं और उन्हें विभिन्न अनुपातों में गणितीय रूप से मिला सकते हैं (जैसे 30% मैथ, 70% हिस्ट्री)।
  • जादू: क्योंकि लीनियर मोड कनेक्टिविटी (एक फैंसी तरीका कहने का कि ये मॉडल बिना टूटे सुचारू रूप से मिलते हैं) नामक एक घटना मौजूद है, AI दो एप्रन के गणितीय औसत के माध्यम से 50/50 मिश्रण के प्रदर्शन की भविष्यवाणी कर सकता है। यह दो स्पिरिट्स के स्वाद प्रोफाइल को गणितीय रूप से मिलाकर एक नए कॉकटेल के स्वाद का अनुमान लगाने जैसा है, बिना वास्तव में ड्रिंक बनाए।

3. "कॉन्टिनुअल" किचन (हमेशा सीखने वाला)

सबसे बड़ी सफलता यह है कि OP-MIX हर समय काम करता है।

  • पुराना तरीका: यदि कोई नई सामग्री आती (जैसे कोडिंग डेटा का एक नया प्रकार), तो पुराने तरीके कहते, "हम इसे इसमें नहीं मिला सकते, हमारी रेसिपी सेट है," या "हमें एक नया टेस्ट किचन शुरू करने की आवश्यकता है।"
  • OP-MIX का तरीका: जब नया डेटा आता है, तो आप बस एक नया एप्रन बनाते हैं। फिर, आप इस नए एप्रन को अपने पास मौजूद सभी पुराने एप्रन के साथ मिलाने के लिए जादुई ब्लेंडर का उपयोग करते हैं। आप पुराने ज्ञान को कभी नहीं फेंकते; आप बस अनुपातों को समायोजित करते हैं।

यह क्यों मायने रखता है (परिणाम)

पेपर का दावा है कि OP-MIX तीन कारणों से गेम-चेंजर है:

  1. यह सार्वभौमिक है: यह प्रारंभिक प्रशिक्षण (प्रीट्रेनिंग), मध्य चरण (मिडट्रेनिंग), और अंतिम फाइन-ट्यूनिंग (इंस्ट्रक्शन ट्यूनिंग) के लिए काम करता है। आपको विभिन्न चरणों के लिए अलग-अलग उपकरणों की आवश्यकता नहीं है; एक ही उपकरण सब कुछ करता है।
  2. यह कुशल है: यह निरंतर सीखने (continual learning) के मौजूदा तरीकों की तुलना में 95% कम कंप्यूटिंग पावर का उपयोग करता है। पूरे मॉडल को फिर से प्रशिक्षित करने या महंगे टेस्ट किचन चलाने के बजाय, यह केवल हल्के एप्रन को मिलाता है।
  3. यह "भूलने" को रोकता है: AI की दुनिया में, नई चीजें सीखने से अक्सर मॉडल पुरानी चीजें भूल जाता है (कैटास्ट्रोफिक फॉरगेटिंग)। OP-MIX पुराने स्वादों को सूप में बनाए रखते हुए नए स्वाद जोड़ने में उत्कृष्ट है, और यह बहुत कम लागत पर लगभग उतना ही प्रदर्शन करता है जितना कि यदि आपने इसे शुरू से फिर से प्रशिक्षित किया होता।

निचोड़ (The Bottom Line)

OP-MIX AI प्रशिक्षण के दृष्टिकोण को अलग-अलग चरणों (शुरू, रुकना, फिर से शुरू करना) से बदलकर एक एकल, निरंतर प्रक्रिया में बदल देता है। यह डेटा मिक्सिंग को एक बार के निर्णय के रूप में नहीं, बल्कि मॉडल और डेटा के बीच एक निरंतर बातचीत के रूप में देखता है, जो हर बार जब पेंट्री में एक नई सामग्री जोड़ी जाती है, तो एक परफेक्ट रेसिपी खोजने के लिए हल्के, स्मार्ट शॉर्टकट का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →