MARS: Enabling Autoregressive Models Multi-Token Generation
MARS एक हल्का फाइन-ट्यूनिंग तरीका है जो बिना किसी आर्किटेक्चरल बदलाव या अतिरिक्त पैरामीटर्स के ऑटोरिग्रेसिव लैंग्वेज मॉडल्स को एक फॉरवर्ड पास में कई टोकन जेनरेट करने में सक्षम बनाता है, जो बेसलाइन सटीकता बनाए रखते हुए 1.5–1.7x थ्रूपुट प्राप्त करता है और कॉन्फिडेंस थ्रेशोल्डिंग के माध्यम से रीयल-टाइम स्पीड एडजस्टमेंट की सुविधा देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक पेशेवर शेफ (AI मॉडल) हैं जिन्हें एक रेसिपी लिखने का काम सौंपा गया है।
पुराना तरीका (स्टैंडर्ड ऑटोरेग्रेसिव मॉडल्स):
पारंपरिक रूप से, यह शेफ एक बार में एक शब्द लिखता है। भले ही अगला शब्द कितना भी स्पष्ट क्यों न हो—जैसे कि "एक चुटकी" के बाद "नमक" लिखना—शेफ रुक जाता है, सोचता है, "नमक" लिखता है, फिर रुकता है, सोचता है, और "काली मिर्च" लिखता है। यह एक बहुत ही सावधानीपूर्ण, चरण-दर-चरण प्रक्रिया है। यह सटीक है, लेकिन यह धीमा है क्योंकि शेफ कभी शॉर्टकट नहीं लेता, भले ही रास्ता बिल्कुल साफ हो।
वर्तमान "फास्ट" तरीकों के साथ समस्या:
अन्य टीमों ने इसे तेज करने की कोशिश की, जैसे कि एक सहायक शेफ (Speculative Decoding) को काम पर रखना या शेफ को अतिरिक्त हाथ (Medusa/EAGE) देना।
- सहायक शेफ अगले कुछ शब्दों का अनुमान लगाने की कोशिश करता है, लेकिन आपको रसोई में दो शेफ रखने पड़ते हैं, जिससे जगह और उपकरणों की जरूरत दोगुनी हो जाती है।
- अतिरिक्त हाथ के लिए शेफ के शरीर पर नए अंग बनाने की आवश्यकता होती है, जो महंगा और जटिल है।
MARS समाधान:
इस पेपर के लेखकों ने, MARS, एक चतुर तरकीब निकाली। उन्होंने नया शेफ नहीं रखा और न ही शेफ को नए हाथ दिए। इसके बजाय, उन्होंने उसी शेफ को एक नया प्रशिक्षण अभ्यास दिया।
उन्होंने शेफ को आगे देखना सिखाया और कहना सिखाया, "मुझे 95% यकीन है कि अगले तीन शब्द 'नमक', 'काली मिर्च' और 'चीनी' होंगे।" यदि शेफ आश्वस्त है, तो वह तीनों शब्द एक साथ लिख देता है। यदि वह अनिश्चित है (जैसे कि कोई जटिल, रचनात्मक कहानी लिखते समय), तो वह धीमा हो जाता है और पहले की तरह एक बार में केवल एक ही शब्द लिखता है।
यह कैसे काम करता है (एक उपमा)
शेफ के कार्यक्षेत्र को एक स्लाइडिंग विंडो के रूप में सोचें।
- प्रशिक्षण (द "मास्क्ड" अभ्यास):
प्रशिक्षण के दौरान, लेखक रेसिपी कार्ड पर अगले कुछ शब्दों पर एक "आंखों की पट्टी" ([MASK]टोकन) लगा देते हैं। वे शेफ से पूछते हैं: "जो आपने अब तक लिखा है, उसके आधार पर इन खाली जगहों में क्या जाएगा?"
- महत्वपूर्ण मोड़: उन्होंने यह भी सुनिश्चित किया कि शेफ मूल रेसिपी को भी साथ-साथ लिखे। यह सुनिश्चित करता है कि शेफ सामान्य रूप से लिखना न भूल जाए। यह एक नया डांस स्टेप सीखते समय अपने एक पैर पर संतुलन बनाए रखने जैसा है।
- चार नियम (अंतरालों को भरना):
पिछले प्रयास विफल रहे क्योंकि उन्होंने शेफ के काम करने के नियमों को तोड़ दिया था। MARS ने तीन टूटे हुए नियमों को ठीक किया:
- नियम 1 (कारणता/Causality): शेफ को केवल आगे देखना चाहिए, कभी पीछे नहीं। (सामग्री का अनुमान लगाने के लिए तैयार डिश को न देखें)।
- नियम 2 (क्रम/Order): शेफ को बाएं-से-दाएं लिखना चाहिए। (पहले शब्द से पहले आखिरी शब्द न लिखें)।
- नियम 3 (तर्क/Logic): शेफ को हर चीज़ के लिए एक ही "दिमाग" (पैरामीटर्स) का उपयोग करना चाहिए।
- नियम 4 (आंखों की पट्टी/The Blindfold): केवल यही बदलता है कि शेफ को शब्दों के एक ब्लॉक का अनुमान लगाने की अनुमति मिलती है, लेकिन तभी जब वह आश्वस्त हो।
- परिणाम ("कॉन्फिडेंस नॉब"):
जब शेफ एक उबाऊ, अनुमानित वाक्य लिख रहा होता है ("आसमान नीला है"), तो वह एक ही सांस में 3 या 4 शब्द लिख सकता है।
जब वह एक जटिल गणित की समस्या या एक कठिन चुटकुला लिख रहा होता है, तो वह वापस एक बार में एक शब्द लिखने की प्रक्रिया पर आ जाता है।
- सबसे अच्छी बात: आप वास्तविक समय में एक "कॉन्फिडेंस नॉब" (थ्रेशोल्ड) को एडजस्ट कर सकते हैं। यदि रसोई बहुत व्यस्त है, तो आप शेफ से कहते हैं, "थोड़ा अधिक आत्मविश्वासी बनो, एक बार में 2 शब्द लिखो!" यदि ग्राहक बहुत नखरेबाज है, तो आप कहते हैं, "धीमे हो जाओ, एक बार में एक ही शब्द लिखो।" आपको शेफ बदलने या रसोई को फिर से शुरू करने की आवश्यकता नहीं है।
यह एक बड़ी बात क्यों है
- कोई नया हार्डवेयर नहीं: आपको बड़ी रसोई या दूसरे शेफ की आवश्यकता नहीं है। यह बिल्कुल वही मॉडल है, बस यह अधिक स्मार्ट है कि उसे कब तेज होना है।
- गुणवत्ता में कोई कमी नहीं: जब शेफ एक बार में एक शब्द लिखता है, तो वह पहले जितना ही अच्छा होता है। वास्तव में, शब्दों के ब्लॉक्स का अनुमान लगाने के अभ्यास ने उन्हें मानक कार्यों में थोड़ा बेहतर भी बना दिया है।
- वास्तविक गति: परीक्षणों में, इस पद्धति ने बिना सटीकता खोए AI को 1.5 से 1.7 गुना तेज़ बना दिया। यह ऐसा है जैसे शेफ ने अचानक तैयारी के उबाऊ हिस्सों के दौरान सब्जियां काटने का एक तेज़ तरीका ढूंढ लिया हो, लेकिन फिर भी फैंसी डिश को सावधानी से सजाने में सक्षम हो।
संक्षेप में: MARS AI को "बैच" में सोचना सिखाता है। यह सीखता है कि जब रास्ता साफ हो तो दौड़ना है और जब रास्ता कठिन हो तो चलना है, और यह सब बिना अपने दिमाग को बदले या अतिरिक्त मदद के बिना किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।