Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs
यह शोध पत्र Hard-Routed MoR-LoRA का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो एक हल्के राउटर का उपयोग करके स्वतंत्र रूप से प्रशिक्षित फ्रोजन रीजनिंग LoRA विशेषज्ञों को कंपोज़ करता है, जो हार्ड टॉप-1 रूटिंग के माध्यम से प्रति टोकन ठीक एक विशेषज्ञ का चयन करता है, जिससे विशेषज्ञों के मूल यूनिट-स्केल एडिटिव अपडेट को सुरक्षित रखते हुए सॉफ्ट-रूटिंग बेसलाइन की तुलना में काफी कम प्रशिक्षण योग्य पैरामीटरों की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास पाँच प्रतिभाशाली, विशेषज्ञ शेफों की एक टीम है। एक इतालवी पास्ता का उस्ताद है, दूसरा जापानी सुशी का जीनियस है, तीसरा मैक्सिकन टैकोस में माहिर है, और इसी तरह। प्रत्येक शेफ को उनके अपने रसोईघर में अपनी खुद की गुप्त रेसिपी के साथ अलग से प्रशिक्षित किया गया था।
अब, कल्पना कीजिए कि आप एक एकल रेस्तरां खोलना चाहते हैं जो इन सभी व्यंजनों को पूरी तरह से पका सके, लेकिन आप इन सभी शेफों को एक टीम के रूप में फिर से प्रशिक्षित करने के लिए एक साथ नहीं ला सकते। आप उनकी रेसिपीज़ को एक विशाल "सुपर-रेसिपी" में भी नहीं मिला सकते क्योंकि इससे उनके व्यक्तिगत कौशल का नाजुक संतुलन बिगड़ जाएगा।
यह समस्या AI (आर्टिफिशियल इंटेलिजेंस) के लिए "Learning to Select, Not Relearn" नामक शोध पत्र द्वारा हल की गई है।
यहाँ उनके समाधान का सरल विवरण दिया गया है:
समस्या: "सॉफ्ट मिक्स" की गलती
अतीत में, जब AI शोधकर्ता इन विशिष्ट "शेफों" (जिन्हें LoRA एक्सपर्ट्स कहा जाता है) को मिलाने की कोशिश करते थे, तो वे सॉफ्ट रूटिंग (Soft Routing) नामक विधि का उपयोग करते थे।
सॉफ्ट रूटिंग को एक ब्लेंडर (मिक्सी) की तरह समझें। यदि आप कोई व्यंजन बनाना चाहते हैं, तो ब्लेंडर इतालवी शेफ का थोड़ा सा हिस्सा, सुशी शेफ का थोड़ा सा हिस्सा और टैको शेफ का थोड़ा सा हिस्सा लेगा, और उन्हें आपस में मिला देगा।
- समस्या: इतालवी शेफ को अकेले अपना पूरा पास्ता बनाने के लिए प्रशिक्षित किया गया था। यदि आप उन्हें केवल 10% सामग्री देते हैं (क्योंकि ब्लेंडर ने उन्हें पतला कर दिया है), तो उनका व्यंजन बेस्वाद होगा। गणित मेल नहीं खाता। इसे ठीक करने के लिए, पिछले तरीकों को शेफ को "पतली हुई" सामग्रियों के साथ खाना सीखने के लिए वापस स्कूल भेजना पड़ता था, जो महंगा और धीमा था।
समाधान: "हार्ड-रूटेड" वेटर
लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे Hard-Routed MoR-LoRA कहा जाता है। ब्लेंडर के बजाय, वे एक अत्यधिक कुशल वेटर का उपयोग करते हैं।
- शेफ स्थिर (Frozen) रहते हैं: विशिष्ट शेफ (AI एक्सपर्ट्स) को उनके विशिष्ट कार्य (जैसे गणित या चिकित्सा संबंधी प्रश्न) के लिए व्यक्तिगत रूप से प्रशिक्षित किया जाता है। एक बार जब वे समाप्त हो जाते हैं, तो वे "फ्रीज" हो जाते हैं। वे बदलते नहीं हैं। वे अपनी मूल, सटीक रेसिपी रखते हैं।
- स्मार्ट वेटर: सिस्टम एक छोटा, हल्का "वेटर" (रौटर) प्रशिक्षित करता है। इस वेटर का एकमात्र काम ग्राहक के ऑर्डर (इनपुट प्रश्न) को देखना और निर्णय लेना है: "ठीक है, यह एक गणित का सवाल है। इसे मैथ शेफ के पास भेजें। यह एक मेडिकल सवाल है। इसे डॉक्टर शेफ के पास भेजें।"
- एक शेफ, एक व्यंजन: वेटर पूरे ऑर्डर को ठीक एक शेफ के पास भेजता है। शेफ अपने पूर्ण, मूल रेसिपी (100% स्केल) का उपयोग करके व्यंजन बनाता है। कोई मिश्रण नहीं, कोई पतलापन नहीं।
- जादुई ट्रिक: चूंकि वेटर को अचानक, असतत (discrete) चुनाव करना होता है (शेफ A या शेफ B), इसलिए मानक गणित का उपयोग करके वेटर को बेहतर बनाना कठिन होता है। शोध पत्र एक चतुर ट्रिक का उपयोग करता है जिसे स्ट्रेट-थ्रू एस्टिमेटर (STE) कहा जाता है। कल्पना कीजिए कि वेटर ऑर्डर को विभाजित करने का "दिखावा" करके अभ्यास कर रहा है (गणित सीखने के लिए) लेकिन वास्तव में पूरा व्यंजन एक ही शेफ को परोस रहा है (गुणवत्ता बनाए रखने के लिए)। यह वेटर को शेफ को बिना नुकसान पहुँचाए सीखने की अनुमति देता है।
यह एक बड़ी बात क्यों है
शोधकर्ताओं ने पांच अलग-अलग प्रकार के कार्यों (गणित, सामान्य ज्ञान, चिकित्सा, पठन और व्याकरण) पर विभिन्न आकार के AI मॉडल का परीक्षण किया।
- कम काम में बेहतर परिणाम: उनका "हार्ड-रूटेड" सिस्टम पुराने "ब्लेंडर" तरीकों के समान (या उनसे बेहतर) प्रदर्शन करता है, लेकिन इसके लिए बहुत कम प्रशिक्षण योग्य पैरामीटर्स (trainable parameters) की आवश्यकता थी। यह एक स्मार्ट वेटर को काम पर रखने जैसा है बजाय पाँच शेफों को फिर से प्रशिक्षित करने के।
- तर्क क्षमता को सुरक्षित रखना: शोध पत्र ने पाया कि जब आप शेफ को प्रशिक्षित करने के लिए RLVF (वेरिफिएबल फीडबैक से सुदृढीकरण सीखना) नामक एक विशेष प्रशिक्षण विधि का उपयोग करते हैं, तो वे "सोचने" (चरण-दर-चरण तर्क करने) में बहुत बेहतर हो जाते हैं। हार्ड-रूटेड सिस्टम इस सोचने की क्षमता को पूरी तरह से सुरक्षित रखता है क्योंकि यह शेफ के काम को पतला नहीं करता है।
- "ब्लेंडर" झूठ बोल रहा था: लेखकों ने पुराने "ब्लेंडर" तरीकों का विश्लेषण किया और पाया कि भले ही वे दो शेफों को मिलाने की कोशिश करते थे, ब्लेंडर आमतौर पर फिर भी केवल एक ही शेफ पर निर्भर रहता था (लगभग 70% समय)। इसलिए, "ब्लेंडर" बिना किसी कारण के अतिरिक्त काम कर रहा था। "हार्ड-रूटेड" वेटर बस बीच के आदमी को हटा देता है और सीधे सही शेफ को चुन लेता है।
निचोड़
यह शोध पत्र हमें सिखाता है कि विशिष्ट AI विशेषज्ञों को संयोजित करते समय, आपको उन्हें फिर से प्रशिक्षित करने या उनके दिमागों को आपस में मिलाने की आवश्यकता नहीं है। आपको बस एक स्मार्ट, हल्का सिस्टम चाहिए जो काम के लिए सही विशेषज्ञ को चुन सके और उन्हें ठीक वैसे ही अपना काम करने दे जैसा उन्हें प्रशिक्षित किया गया था।
यह एक टीम को एक औसत दर्जे के ग्रुप प्रोजेक्ट के लिए समझौता करने के लिए मजबूर करने के बजाय, एक-एक करके सही विशेषज्ञ को कार्य संभालने देने के बीच का अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।