Consolidating Rewarded Perturbations for LLM Post-Training
यह शोधपत्र CoRP को प्रस्तुत करता है, जो एक ग्रेडिएंट-मुक्त पोस्ट-ट्रेनिंग विधि है जो लो-रैंक संरचना का लाभ उठाकर रिवॉर्ड-वेटेड गॉसियन परम्यूटेशन्स (reward-weighted Gaussian perturbations) को एक एकल मॉडल अपडेट में समेकित करती है, जिससे RandOpt जैसे एन्सेम्बल-आधारित दृष्टिकोणों के मल्टी-पास इन्फरेंस ओवरहेड को समाप्त करते हुए बेस मॉडल की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Consolidating Rewarded Perturbations for LLM Post-Training" (CoRP) का सरल भाषा में अनुवाद दिया गया है:
बड़ी समस्या: "बहुत अधिक रसोइयों" की दुविधा
कल्पना कीजिए कि आपके पास एक शानदार, अच्छी तरह से प्रशिक्षित शेफ (बेस मॉडल) है जो लगभग कुछ भी पका सकता है। आप उन्हें एक विशिष्ट, उत्तम व्यंजन बनाना सिखाना चाहते हैं (जैसे कि कोई जटिल गणित की समस्या या कोड का एक टुकड़ा)।
आमतौर पर, किसी शेफ को सिखाने के लिए, आप रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करते हैं। आप उन्हें खाना बनाने के लिए कहते हैं, स्वाद चखते हैं, और यदि वह अच्छा है, तो आप उनकी रेसिपी में थोड़ा बदलाव करते हैं। यह ग्रेडिएंट्स का उपयोग करके चरण-दर-चरण रेसिपी को ठीक करने जैसा है। यह काम करता है, लेकिन यह धीमा और गणनात्मक रूप से महंगा है।
हाल ही में, RandOpt नामक एक नई विधि आई। यह कहती है कि: "चलो शेफ की मूल रेसिपी में बस ढेर सारे रैंडम मसाले डाल देते हैं और देखते हैं कि क्या होता है।"
- यह शेफ के 5,000 थोड़े अलग संस्करण बनाता है (शेफ के वेट्स में रैंडम "परटर्बेशन" या शोर जोड़कर)।
- यह सभी 5,000 संस्करणों का कुछ अभ्यास व्यंजनों पर परीक्षण करता है।
- यह उन शीर्ष 50 संस्करणों को चुनता है जिन्होंने सबसे अच्छा खाना बनाया।
- चुनौती: ग्राहक को परोसने के लिए, आपको इन सभी 50 "विशेषज्ञ" शेफ को व्यंजन पकाने के लिए कहना पड़ता है, और फिर आप अंतिम उत्तर पर वोट लेते हैं।
- लाभ: यह बहुत स्मार्ट है।
- हानि: यह अविश्वसनीय रूप से धीमा है। आपको हर एक भोजन के लिए 50 रसोइयों को चलाना पड़ता है। साथ ही, आप उन्हें एक एकल मास्टर शेफ में आसानी से नहीं मिला सकते क्योंकि उनके "व्यक्तित्व" (वेट्स) आपस में टकरा सकते हैं।
शोध पत्र का प्रश्न: क्या हम टीम को मिला सकते हैं?
लेखकों ने पूछा: "क्या हम उन 50 विशेषज्ञ शेफ को लेकर उन्हें एक एकल शेफ में मिला सकते हैं, ताकि हमें 50 रसोइयों के बजाय केवल एक ही रसोइया चलाना पड़े?"
यदि हम केवल उनकी रेसिपी का औसत निकालते हैं, तो यह आमतौर पर विफल हो जाता है। क्यों? क्योंकि हालांकि वे सभी अच्छा खाना बना सकते हैं, लेकिन उन्होंने अलग-अलग समस्याओं को हल करने के लिए अलग-अलग तरीके सीखे होंगे। यदि आप उन्हें बिना सोचे-समझे मिला देते हैं, तो उनके सुधार एक-दूसरे को काट देते हैं, और अंत में आपके पास शुरूआती शेफ से भी बदतर शेफ रह जाता है।
खोज: "छिपा हुआ लो-रैंक रहस्य"
अपना समाधान बनाने से पहले, लेखकों ने एक "स्प्लिट-हाफ" प्रयोग किया। उन्होंने 5,000 रैंडम शेफ लिए, उन्हें दो हिस्सों में बांटा, और शीर्ष प्रदर्शन करने वालों को देखा।
उन्होंने एक आश्चर्यजनक ज्यामितीय पैटर्न पाया: भले ही शेफ रैंडम तरीके से बनाए गए थे, लेकिन उनकी "अच्छाई" हर जगह बिखरी हुई नहीं थी। इसके बजाय, सभी उपयोगी सुधार एक विशाल रसोई के भीतर एक बहुत ही विशिष्ट "सबस्पेस" (संभावनाओं का एक संकीक गलियारा) में केंद्रित थे।
इसे ऐसे सोचिए: यदि आप एक बड़ी दीवार पर 1,000 डार्ट फेंकते हैं, तो वे रैंडम लग सकते हैं। लेकिन यदि आप करीब से देखें, तो आप पाएंगे कि हर एक "अच्छा" डार्ट एक छोटे, अदृश्य घेरे के भीतर ही गिरा है। शोध पत्र ने पाया कि यह "घेरा" (एक लो-रैंक संरचना) हर उस मामले में मौजूद था जिसका उन्होंने परीक्षण किया था, भले ही डार्ट की औसत दिशा हमेशा एक जैसी न रही हो।
समाधान: CoRP (Consolidating Rewarded Perturbations)
लेखकों ने इन विशेषज्ञों को एक तैनात करने योग्य मॉडल में मिलाने के लिए CoRP नामक एक टूल बनाया। यह तीन-चरणीय भर्ती प्रक्रिया की तरह काम करता है:
हेडहंटर (रिवॉर्ड-वेटेड एग्रीगेशन):
सबसे पहले, CoRP शीर्ष प्रदर्शन करने वाले शेफ को देखता है और पूछता है, "सामान्य सूत्र क्या है?" यह उच्चतम स्कोर पाने वालों के आधार पर एक "प्रस्तावित दिशा" बनाता है। यह ऐसा कहने जैसा है, "ठीक है, सबसे अच्छे शेफ सभी अधिक लहसुन का उपयोग कर रहे हैं।"अनुकूलता की जाँच (रीवेटिंग):
यह जादुई कदम है। CoRP केवल "लहसुन" वाले शेफ की बात नहीं सुनता। यह प्रत्येक विशेषज्ञ की जाँच करता है कि क्या उनकी शैली प्रस्तावित दिशा के साथ फिट बैठती है।
- यदि कोई शेफ लहसुन में माहिर है लेकिन साथ ही चॉकलेट डालने पर भी अड़ा हुआ है (जो लहसुन के विषय से टकराता है), तो CoRP कहता है, "नहीं, तुम बहुत असंगत हो।" यह उनका वेट कम कर देता है।
- यदि कोई शेफ लहसुन में माहिर है और कुछ भी अजीब नहीं जोड़ता है, तो CoRP कहता है, "हाँ, तुम एकदम सही फिट हो।" यह उनका वेट बढ़ा देता है।
- उपमा: कल्पना कीजिए कि आप एक घर बनाने की कोशिश कर रहे हैं। आपके पास 50 बेहतरीन आर्किटेक्ट हैं। आप केवल उनके ब्लूप्रिंट का औसत नहीं निकालते (जिससे सब गड़बड़ हो जाएगा)। आप सबसे अच्छी डिज़ाइन दिशा चुनते हैं, और फिर आप केवल उन आर्किटेक्ट्स को काम पर रखते हैं जिनके विशिष्ट विचार उस दिशा का समर्थन करते हैं बिना टकराव के।
- सुरक्षा निरीक्षक (हेल्ड-आउट वैलिडेशन गेट):
नया एकल शेफ फाइनल करने से पहले, CoRP नए रेसिपी का परीक्षण उन व्यंजनों पर करता है जिन्हें शेफ ने कभी नहीं देखा था।
- यदि नया शेफ इन ताज़ा व्यंजनों पर वास्तव में बेहतर है, तो CoRP अपडेट को मंजूरी देता है।
- यदि नया शेफ बदतर (या समान) है, तो CoRP कहता है, "नहीं, चलिए मूल शेफ पर ही टिके रहते हैं।" यह ऐसे बदलाव को करने से मना कर देता है जो मदद नहीं करता।
परिणाम: एक शेफ, एक पास, बड़े लाभ
उन्होंने इसे 5 अलग-अलग मॉडलों (छोटे से बड़े तक) और 5 अलग-अलग कार्यों (गणित, कोडिंग, रचनात्मक लेखन) पर परखा।
- गति: RandOpt (50-शेफ टीम) को एक प्रश्न का उत्तर देने के लिए 50 फॉरवर्ड पास की आवश्यकता होती है। CoRP को केवल 1 फॉरवर्ड पास की आवश्यकता होती है। यह इन्फरेंस (inference) में 50 गुना तेज़ है।
- दक्षता: CoRP को प्रशिक्षण के दौरान RandOpt द्वारा उपयोग किए गए कंप्यूटिंग पावर (परटर्बेशन बजट) के केवल 1/10वें हिस्से की आवश्यकता थी।
- प्रदर्शन:
- CoRP ने बेस मॉडल में औसतन 8.1 अंक का सुधार किया।
- इसने उस प्रदर्शन लाभ के आधे से अधिक को वापस पा लिया जो विशाल 50-शेफ टीम ने हासिल किया था, लेकिन एक एकल मॉडल के साथ।
- कुछ मामलों में (जैसे रचनात्मक लेखन), CoRP ने सिंगल-बेस्ट-शेफ अप्रोच (RandOpt K=1) को भी पीछे छोड़ दिया और 50-शेफ टीम के बहुत करीब पहुँच गया।
संक्षेप में
यह शोध पत्र दिखाता है कि शानदार परिणाम प्राप्त करने के लिए आपको 50 AI मॉडलों की एक समिति की आवश्यकता नहीं है। यह जानकर कि मॉडल कैसे सुधरते हैं उनमें कौन सी "साझा ज्यामिति" छिपी है, और उन्हें बाहर करने के लिए जो आपस में टकराते हैं, उन्हें सावधानी से फ़िल्टर करके, आप उन्हें एक एकल, अत्यंत कुशल मॉडल में मिला सकते हैं।
यह महसूस करने जैसा है कि किसी समस्या को हल करने के लिए 50 अलग-अलग सलाहकारों को काम पर रखने के बजाय, आप एक ऐसे विशेषज्ञ को काम पर रख सकते हैं जिसने उन सभी 50 के सर्वोत्तम विचारों को आत्मसात कर लिया है, बिना इस उलझन के कि वे आपस में बहस करेंगे। आपको भीड़ का ज्ञान मिलता है, लेकिन एक व्यक्ति की गति के साथ।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।