← नवीनतम पेपर
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

MARS एक हल्का फाइन-ट्यूनिंग तरीका है जो बिना किसी आर्किटेक्चरल बदलाव या अतिरिक्त पैरामीटर्स के ऑटोरिग्रेसिव लैंग्वेज मॉडल्स को एक फॉरवर्ड पास में कई टोकन जेनरेट करने में सक्षम बनाता है, जो बेसलाइन सटीकता बनाए रखते हुए 1.5–1.7x थ्रूपुट प्राप्त करता है और कॉन्फिडेंस थ्रेशोल्डिंग के माध्यम से रीयल-टाइम स्पीड एडजस्टमेंट की सुविधा देता है।

मूल लेखक: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेशेवर शेफ (AI मॉडल) हैं जिन्हें एक रेसिपी लिखने का काम सौंपा गया है।

पुराना तरीका (स्टैंडर्ड ऑटोरेग्रेसिव मॉडल्स):
पारंपरिक रूप से, यह शेफ एक बार में एक शब्द लिखता है। भले ही अगला शब्द कितना भी स्पष्ट क्यों न हो—जैसे कि "एक चुटकी" के बाद "नमक" लिखना—शेफ रुक जाता है, सोचता है, "नमक" लिखता है, फिर रुकता है, सोचता है, और "काली मिर्च" लिखता है। यह एक बहुत ही सावधानीपूर्ण, चरण-दर-चरण प्रक्रिया है। यह सटीक है, लेकिन यह धीमा है क्योंकि शेफ कभी शॉर्टकट नहीं लेता, भले ही रास्ता बिल्कुल साफ हो।

वर्तमान "फास्ट" तरीकों के साथ समस्या:
अन्य टीमों ने इसे तेज करने की कोशिश की, जैसे कि एक सहायक शेफ (Speculative Decoding) को काम पर रखना या शेफ को अतिरिक्त हाथ (Medusa/EAGE) देना।

  • सहायक शेफ अगले कुछ शब्दों का अनुमान लगाने की कोशिश करता है, लेकिन आपको रसोई में दो शेफ रखने पड़ते हैं, जिससे जगह और उपकरणों की जरूरत दोगुनी हो जाती है।
  • अतिरिक्त हाथ के लिए शेफ के शरीर पर नए अंग बनाने की आवश्यकता होती है, जो महंगा और जटिल है।

MARS समाधान:
इस पेपर के लेखकों ने, MARS, एक चतुर तरकीब निकाली। उन्होंने नया शेफ नहीं रखा और न ही शेफ को नए हाथ दिए। इसके बजाय, उन्होंने उसी शेफ को एक नया प्रशिक्षण अभ्यास दिया।

उन्होंने शेफ को आगे देखना सिखाया और कहना सिखाया, "मुझे 95% यकीन है कि अगले तीन शब्द 'नमक', 'काली मिर्च' और 'चीनी' होंगे।" यदि शेफ आश्वस्त है, तो वह तीनों शब्द एक साथ लिख देता है। यदि वह अनिश्चित है (जैसे कि कोई जटिल, रचनात्मक कहानी लिखते समय), तो वह धीमा हो जाता है और पहले की तरह एक बार में केवल एक ही शब्द लिखता है।

यह कैसे काम करता है (एक उपमा)

शेफ के कार्यक्षेत्र को एक स्लाइडिंग विंडो के रूप में सोचें।

  1. प्रशिक्षण (द "मास्क्ड" अभ्यास):
    प्रशिक्षण के दौरान, लेखक रेसिपी कार्ड पर अगले कुछ शब्दों पर एक "आंखों की पट्टी" ([MASK] टोकन) लगा देते हैं। वे शेफ से पूछते हैं: "जो आपने अब तक लिखा है, उसके आधार पर इन खाली जगहों में क्या जाएगा?"
  • महत्वपूर्ण मोड़: उन्होंने यह भी सुनिश्चित किया कि शेफ मूल रेसिपी को भी साथ-साथ लिखे। यह सुनिश्चित करता है कि शेफ सामान्य रूप से लिखना न भूल जाए। यह एक नया डांस स्टेप सीखते समय अपने एक पैर पर संतुलन बनाए रखने जैसा है।
  1. चार नियम (अंतरालों को भरना):
    पिछले प्रयास विफल रहे क्योंकि उन्होंने शेफ के काम करने के नियमों को तोड़ दिया था। MARS ने तीन टूटे हुए नियमों को ठीक किया:
  • नियम 1 (कारणता/Causality): शेफ को केवल आगे देखना चाहिए, कभी पीछे नहीं। (सामग्री का अनुमान लगाने के लिए तैयार डिश को न देखें)।
  • नियम 2 (क्रम/Order): शेफ को बाएं-से-दाएं लिखना चाहिए। (पहले शब्द से पहले आखिरी शब्द न लिखें)।
  • नियम 3 (तर्क/Logic): शेफ को हर चीज़ के लिए एक ही "दिमाग" (पैरामीटर्स) का उपयोग करना चाहिए।
  • नियम 4 (आंखों की पट्टी/The Blindfold): केवल यही बदलता है कि शेफ को शब्दों के एक ब्लॉक का अनुमान लगाने की अनुमति मिलती है, लेकिन तभी जब वह आश्वस्त हो।
  1. परिणाम ("कॉन्फिडेंस नॉब"):
    जब शेफ एक उबाऊ, अनुमानित वाक्य लिख रहा होता है ("आसमान नीला है"), तो वह एक ही सांस में 3 या 4 शब्द लिख सकता है।
    जब वह एक जटिल गणित की समस्या या एक कठिन चुटकुला लिख रहा होता है, तो वह वापस एक बार में एक शब्द लिखने की प्रक्रिया पर आ जाता है।
  • सबसे अच्छी बात: आप वास्तविक समय में एक "कॉन्फिडेंस नॉब" (थ्रेशोल्ड) को एडजस्ट कर सकते हैं। यदि रसोई बहुत व्यस्त है, तो आप शेफ से कहते हैं, "थोड़ा अधिक आत्मविश्वासी बनो, एक बार में 2 शब्द लिखो!" यदि ग्राहक बहुत नखरेबाज है, तो आप कहते हैं, "धीमे हो जाओ, एक बार में एक ही शब्द लिखो।" आपको शेफ बदलने या रसोई को फिर से शुरू करने की आवश्यकता नहीं है।

यह एक बड़ी बात क्यों है

  • कोई नया हार्डवेयर नहीं: आपको बड़ी रसोई या दूसरे शेफ की आवश्यकता नहीं है। यह बिल्कुल वही मॉडल है, बस यह अधिक स्मार्ट है कि उसे कब तेज होना है।
  • गुणवत्ता में कोई कमी नहीं: जब शेफ एक बार में एक शब्द लिखता है, तो वह पहले जितना ही अच्छा होता है। वास्तव में, शब्दों के ब्लॉक्स का अनुमान लगाने के अभ्यास ने उन्हें मानक कार्यों में थोड़ा बेहतर भी बना दिया है।
  • वास्तविक गति: परीक्षणों में, इस पद्धति ने बिना सटीकता खोए AI को 1.5 से 1.7 गुना तेज़ बना दिया। यह ऐसा है जैसे शेफ ने अचानक तैयारी के उबाऊ हिस्सों के दौरान सब्जियां काटने का एक तेज़ तरीका ढूंढ लिया हो, लेकिन फिर भी फैंसी डिश को सावधानी से सजाने में सक्षम हो।

संक्षेप में: MARS AI को "बैच" में सोचना सिखाता है। यह सीखता है कि जब रास्ता साफ हो तो दौड़ना है और जब रास्ता कठिन हो तो चलना है, और यह सब बिना अपने दिमाग को बदले या अतिरिक्त मदद के बिना किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →