Multi-task Code LLMs: Data Mix or Model Merge?
यह शोध पत्र कुशल मल्टी-टास्क कोड एलएलएम (LLMs) बनाने के लिए डेटा मिक्सिंग और मॉडल मर्जिंग रणनीतियों की तुलना करता है, जिसमें यह पाया गया है कि बड़े पैमाने (7B) पर मॉडल मर्जिंग, विशिष्ट प्रदर्शन को बनाए रखते हुए या उसे बढ़ाते हुए डेटा मिक्सिंग से बेहतर प्रदर्शन करती है, जबकि छोटे पैमाने (2B) पर डेटा मिक्सिंग को प्राथमिकता दी जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन छोटा रोबोट सहायक है जिसे उसे दो बहुत अलग कौशल सीखने की आवश्यकता है: कोड लिखना (एक प्रोग्रामर की तरह) और कोड समझाना (एक शिक्षक की तरह)। आप चाहते हैं कि यह रोबोट दोनों में अच्छा हो, लेकिन आपके पास दो अलग-अलग रोबोटों को प्रशिक्षित करने का बजट या समय नहीं है। आपके पास इसे सिखाने के दो मुख्य तरीके हैं:
- "मिक्स-एंड-मैच" क्लास (डेटा मिश्रण): आप सभी प्रोग्रामिंग समस्याओं और सभी व्याख्या पाठों को एक बड़े बाल्टी में डाल देते हैं और रोबोट को एक साथ सब कुछ सिखाते हैं।
- "स्पेशलिस्ट स्वैप" (मॉडल मर्जिंग): पहले आप एक रोबोट को मास्टर प्रोग्रामर बनने के लिए प्रशिक्षित करते हैं और दूसरे को मास्टर टीचर बनने के लिए, फिर आप उनके दिमाग (उनके "वेट्स") को लेते हैं और उन्हें सावधानीपूर्वक एक सुपर-रोबोट में मिला देते हैं।
यह शोध पत्र एक सरल प्रश्न पूछता है: कौन सा तरीका बेहतर काम करता है? और इसका उत्तर पूरी तरह से इस बात पर निर्भर करता है कि रोबोट कितना बड़ा है।
बड़ी खोज: आकार मायने रखता है
शोधकर्ताओं ने इसे विभिन्न आकारों के रोबोटों पर परखा—छोटे रोबोट (लगभग 2 बिलियन "ब्रेन सेल्स" वाले) और बड़े रोबोट (7 बिलियन वाले)। यहाँ उन्हें जो मिला वह है:
1. छोटे रोबोट (2 बिलियन पैरामीटर्स): "मिक्स-एंड-मैच" जीतता है
छोटे रोबोटों के लिए, दो विशेषज्ञ दिमागों को एक साथ मिलाना एक आपदा जैसा था। यह तेल और पानी को मिलाने जैसा था; दोनों कौशल आपस में लड़ रहे थे, और रोबकट भ्रमित हो गया, जिससे वह दोनों में से कोई भी काम अच्छी तरह से करना भूल गया।
- उपमा: कल्पना कीजिए कि एक छोटा छात्र एक ही कक्षा में कैलकुलस और कविता दोनों एक साथ सीखने की कोशिश कर रहा है। यदि आप उन्हें केवल दो अलग-अलग पाठों को मिलाकर एक "मैथ-पोएट" बनने के लिए मजबूर करते हैं, तो वे अभिभूत हो सकते हैं और दोनों में से कुछ भी ठीक से नहीं सीख पाएंगे।
- समाधान: छोटे रोबोटों के लिए, यह बेहतर है कि आप गणित और कविता की सभी किताबें एक ढेर में रखें और उन्हें एक साथ पढ़ें। "मिक्स-एंड-मैच" दृष्टिकोण (डेटा मिश्रण) ने छोटे रोबोट को बिना भ्रमित हुए दोनों कार्यों में सक्षम बनाए रखा।
2. बड़े रोबोट (7 बिलियन पैरामीटर्स): "स्पेशलिस्ट स्वैप" जीतता है
बड़े रोबोटों के लिए, कहानी पूरी तरह बदल गई। दो विशेषज्ञों के दिमागों को मिलाना बहुत शानदार रहा। वास्तव में, मर्ज किया गया रोबोट कभी-कभी व्यक्तिगत विशेषज्ञों से भी बेहतर था।
- उपमा: एक जीनियस प्रोफेसर की कल्पना करें जो पहले से ही गणित का मास्टर और साहित्य का मास्टर है। यदि आप उनके "गणित वाले दिमाग" और "साहित्य वाले दिमाग" को लेते हैं और उन्हें मिला देते हैं, तो वे भ्रमित नहीं होते हैं। इसके बजाय, वे अपनी विशाल जानकारी का उपयोग उन समस्याओं को हल करने के लिए करने का तरीका ढूंढ लेते हैं जिन्हें अकेले कोई विशेषज्ञ नहीं कर सकता था।
- परिणाम: बड़े मर्ज किए गए रोबोट ने विशेषज्ञ विशेषज्ञों के प्रदर्शन का 96% बरकरार रखा। कुछ मामलों में, मर्ज किया गया रोबोट कोडिंग टेस्ट पर उस रोबोट से भी अधिक अंक प्राप्त करता है जिसे विशेष रूप से कोडिंग के लिए प्रशिक्षित किया गया था!
ऐसा क्यों होता है? ("ब्रेन स्कैन")
शोधकर्ताओं ने केवल टेस्ट स्कोर ही नहीं देखे; उन्होंने रोबोट के दिमाग के अंदर देखा कि प्रशिक्षण के दौरान वे कैसे बदलते हैं।
- छोटे रोबोट: जब छोटे रोबोटों ने एक साथ दो चीजें सीखने की कोशिश की, तो उनके दिमाग दोनों कार्यों के लिए बहुत समान तरीकों से बदले। यह ऐसा था जैसे वे गणित और कविता दोनों के लिए बिल्कुल एक ही न्यूरॉन्स का उपयोग कर रहे थे। जब आपने दो छोटे रोबोटों को मर्ज करने की कोशिश की, तो वे न्यूरॉन्स इस बात पर लड़ रहे थे कि कौन क्या करेगा, जिससे मस्तिष्क में "ट्रैफिक जाम" हो गया।
- बड़े रोबोट: बड़े रोबोटों के पास गणित के लिए अपने दिमाग के अलग हिस्से और कविता के लिए अलग हिस्से का उपयोग करने के लिए पर्याप्त "ब्रेन स्पेस" होता है। वे एक घर में दो अलग-अलग कमरों की तरह हैं। जब आप उन्हें मर्ज करते हैं, तो कमरे आपस में नहीं टकराते; वे बस अगल-बगल में बैठ जाते हैं, जिससे रोबोट बिना किसी हस्तक्षेप के दोनों का मास्टर बन जाता है।
मुख्य निष्कर्ष
यदि आप एक छोटा, कुशल AI सिस्टम बना रहे हैं (शायद सीमित बैटरी या मेमोरी वाले डिवाइस के लिए), विशेषज्ञों को मर्ज करने की कोशिश न करें। बस एक मॉडल को उस सभी डेटा पर प्रशिक्षित करें जिसकी आपको आवश्यकता है।
हालाँकि, यदि आपके पास एक बड़ा, अधिक शक्तिशाली मॉडल है, तो विशेषज्ञों को मर्ज करें। आप एक कोडिंग विशेषज्ञ और एक समराइजिंग विशेषज्ञ को अलग-अलग प्रशिक्षित कर सकते हैं, फिर उन्हें मिलाकर एक बहुमुखी, उच्च-प्रदर्शन वाला मॉडल प्राप्त कर सकते हैं जो शून्य से एक विशाल मल्टी-टास्क मॉडल को प्रशिक्षित करने की लागत बचाएगा।
संक्षेप में:
- छोटा मॉडल? डेटा को मिक्स करें।
- बड़ा मॉडल? विशेषज्ञों को मर्ज करें।
यह शोध पत्र डेवलपर्स को उनके मॉडल के आकार के आधार पर सही रणनीति चुनने के लिए एक स्पष्ट नियम पुस्तिका प्रदान करता है, जिससे वे संसाधनों को बर्बाद किए बिना सर्वोत्तम प्रदर्शन प्राप्त कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।