PreFT: Prefill-only finetuning for efficient inference
यह शोधपत्र PreFT को प्रस्तुत करता है, जो एक प्रीफिल-ओनली (prefill-only) फाइनट्यूनिंग दृष्टिकोण है जो इनपुट टोकन को प्रोसेस करने के बाद एडेप्टर्स को हटा देता है ताकि मॉडल के प्रदर्शन पर न्यूनतम प्रभाव के साथ मल्टी-यूज़र सर्विंग थ्रूपुट में उल्लेखनीय सुधार किया जा सके, जो पारंपरिक पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग विधियों की तुलना में एक बेहतर सटीकता-थ्रूपुट ट्रेड-ऑफ प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हाई-टेक बेकरी (एक लार्ज लैंग्वेज मॉडल) चलाते हैं जो लाखों अलग-अलग प्रकार की ब्रेड बना सकती है। आमतौर पर, बेकरी हर चीज़ के लिए एक विशाल, मानक रेसिपी का उपयोग करती है। लेकिन अब, ग्राहकों को व्यक्तिगत ब्रेड चाहिए: किसी को एक्स्ट्रा सॉरडो (sourdough) चाहिए, किसी को एक गुप्त मसाला मिश्रण, और तीसरे को एक विशिष्ट आकार।
इस काम को संभालने के लिए, बेकरी "विशेषज्ञ शेफ" (जिन्हें एडेप्टर्स (adapters) या PEFTs कहा जाता है) को काम पर रखती है। ये शेफ बेकरी की पूरी रेसिपी बुक को दोबारा नहीं लिखते; वे बस अपनी विशिष्ट बारीकियों के लिए एक छोटा, हल्का नोटपैड साथ रखते हैं।
समस्या: रश ऑवर (Rush Hour) का बॉटलनेक
अतीत में, जब कोई ग्राहक ऑर्डर देता था, तो विशेषज्ञ शेफ बेकिंग की हर एक प्रक्रिया के लिए विशिष्ट निर्देश फुसफुसाते थे:
- आटा गूंथना (Mixing the dough)।
- आटे को फूलने देना (Letting it rise)।
- पहला स्लाइस बेक करना।
- दूसरा स्लाइस बेक करना... और इसी तरह, जब तक लोफ (loaf) तैयार न हो जाए।
यह अक्षम है जब आपके पास हजारों ग्राहक (एडेप्टर्स) लाइन में खड़े हों।
- "मिक्सिंग" चरण (प्रीफिल/Prefill): यह एक साथ आटे का एक बड़ा बैच मिलाने जैसा है। यह तेज़ है और ओवन की पूरी शक्ति (कंप्यूट-बाउंड) का उपयोग करता है।
- "बेकिंग" चरण (डिकोड/Decode): यह ब्रेड का एक-एक स्लाइस एक बार में बाहर निकालने जैसा है। यह धीमा है और इसके लिए शेफ को एक ही स्लाइस के लिए मसाले का जार लेने के लिए बार-बार फ्रिज की ओर दौड़ना पड़ता है (मेमोरी-बाउंड)।
जब 500 अलग-अलग शेफ हर एक ब्रेड स्लाइस के लिए निर्देश फुसफुसाने की कोशिश करते हैं, तो किचन जाम हो जाता है। शेफ वास्तव में बेकिंग करने के बजाय उनके छोटे नोटपैड (मसाले के जार) लोड करने में अधिक समय बिताते हैं। पेपर इसे "मेमोरी बॉटलनेक" कहता है।
समाधान: PreFT (प्रीफिल-ओनली फाइनट्यूनिंग)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे PreFT कहा जाता है।
यहाँ उपमा (analogy) दी गई है:
एक विशेषज्ञ शेफ द्वारा पूरी बेकिंग प्रक्रिया के दौरान निर्देश फुसफुसाने के बजाय, वे केवल शुरुआती मिक्सिंग चरण के दौरान निर्देश फुसफुसाते हैं।
- मिक्सिंग (प्रीफिल): शेफ अपना नोटपैड पढ़ता है और आटे को बताता है कि उसे अभी कैसा व्यवहार करना है। वे इसमें सॉरडो या मसाला मिला देते हैं।
- बेकिंग (डिकोड): एक बार जब आटा मिक्स हो जाता है और ओवन में चला जाता है, तो शेफ किचन से बाहर चला जाता है। वह निर्देश देना बंद कर देता है। ओवन बेकरी के मानक, स्थिर नियमों का उपयोग करके बाकी की ब्रेड बेक करता है।
यह बेहतर क्यों है?
- फ्रिज की ओर दौड़ना बंद: धीमी, स्लाइस-दर-स्लाइस बेकिंग चरण के दौरान, किचन को 500 अलग-अलग मसालों के जार लोड करने की आवश्यकता नहीं होती है। यह बस बेकिंग करता है।
- गति: क्योंकि किचन को 500 अलग-अलग शेफ के नोटपैड्स के बीच स्विच करने के लिए संघर्ष नहीं करना पड़ता, इसलिए वे एक ग्राहक के लिए ब्रेड बेक करने जितनी ही तेज़ी से 500 ग्राहकों के लिए ब्रेड बेक कर सकते हैं।
इस पेपर ने क्या पाया
शोधकर्ताओं ने इस सिस्टम को बनाया और वास्तविक मॉडल्स (जैसे Llama और Qwen) पर इसका परीक्षण किया। उनके मुख्य निष्कर्ष यहाँ दिए गए हैं:
यह बहुत तेज़ है:
जब एक साथ 512 अलग-अलग "व्यक्तित्वों" (एडेप्टर्स) को सर्व किया जा रहा था, तो उनकी नई विधि (PreFT) पुराने तरीके की तुलना में 1.9 गुना तेज़ थी। कल्पना कीजिए कि एक बेकरी जिसे भीड़ को सर्व करने में 10 मिनट लगते थे, अब बिना ओवन या इमारत बदले, 5 मिनट में यह काम कर देती है।क्या ब्रेड का स्वाद वही रहता है? (परफॉरमेंस):
- गणित और कोडिंग के लिए: ब्रेड का स्वाद लगभग एक जैसा ही रहता है। "मिक्सिंग" निर्देश मॉडल को गणित की समस्याओं को हल करने या कोड लिखने के लिए सिखाने के लिए पर्याप्त थे। मॉडल को सही उत्तर पाने के लिए बेकिंग चरण के दौरान शेफ के फुसफुसाने की आवश्यकता नहीं थी।
- लंबी कहानियों के लिए: यहाँ मामला थोड़ा पेचीदा है। यदि आप मॉडल को एक बहुत लंबी कहानी लिखने के लिए कहते हैं, तो "मिक्सिंग" निर्देश कभी-कभी धुंधले पड़ जाते हैं।
- एक प्रकार के शेफ (जिसे LoRA कहा जाता है) ने लंबे समय तक निर्देशों को पूरी तरह से काम करने में सक्षम रखा।
- दूसरा प्रकार (ReFT) कभी-कभी निर्देशों को भूल जाता था और केवल "बहुत अधिक" लिख देता था या पटरी से उतर जाता था।
- कुल मिलाकर: अधिकांश कार्यों के लिए, "केवल मिक्सिंग" वाला दृष्टिकोण "हर स्टेप पर फुसफुसाने" वाले दृष्टिकोण के समान ही अच्छा काम करता है, लेकिन यह बहुत तेज़ है।
मुख्य निष्कर्ष (The Big Takeaway)
पेपर निष्कर्ष निकालता है कि व्यक्तिगत AI (जहाँ हर उपयोगकर्ता का अपना छोटा "शेफ" होता है) के लिए, हमें AI द्वारा प्रत्येक शब्द जेनरेट करने के लिए उन शेफों को लोड करने की भारी लागत चुकाने की आवश्यकता नहीं है।
केवल यह अनुमति देकर कि शेफ अपना काम बिल्कुल शुरुआत में (प्रीफिल स्टेज में) करें, हम हजारों व्यक्तिगत उपयोगकर्ताओं को एक साथ सर्व कर सकते हैं बिना सिस्टम को रुकने दिए। यह किचन को व्यवस्थित करने का एक स्मार्ट तरीका है जो गुणवत्ता बनाए रखते हुए समय और ऊर्जा बचाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।