← नवीनतम पेपर
🤖 machine learning

Controllably Efficient Language Models

यह शोध पत्र कंप्रेस एंड अटेंड ट्रांसफॉर्मर (CAT) को पेश करता है, जो एक मेटा-सीक्वेंस मिक्सर है जो संकुचित टोकन चंक्स (compressed token chunks) से डिकोड करके गुणवत्ता-लागत के बीच संतुलन पर टेस्ट-टाइम नियंत्रण सक्षम बनाता है, जिससे एक एकल मॉडल विविध कुशल आर्किटेक्चर के प्रदर्शन से मेल खाने के साथ-साथ डेंस ट्रांसफॉर्मर्स की तुलना में उच्च थ्रूपुट प्रदान करता है।

मूल लेखक: Jatin Prakash, Aahlad Puli, Rajesh Ranganath

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jatin Prakash, Aahlad Puli, Rajesh Ranganath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो आपके सवालों के जवाब देने के लिए किताबें पढ़ता है। समस्या यह है कि वह जितना अधिक पढ़ता है, उसे उतना ही अधिक याद रखना पड़ता है, और उसे जितना अधिक याद रखना पड़ता है, उसे चलाना उतना ही धीमा और महंगा हो जाता है। यह एक लाइब्रेरी को अपने बैकपैक में ले जाने जैसा है; अंततः, आप हिल भी नहीं पाएंगे।

लंबे समय तक, वैज्ञानिकों ने इसे हल करने की कोशिश की कि कैसे "कुशल" (efficient) रोबोट बनाए जाएं जो केवल पिछले कुछ पन्नों को याद रखते हैं (स्लाइडिंग विंडोज) या जो सब कुछ एक छोटे, निश्चित आकार के नोट में सारांशित कर देते हैं (लीनियर अटेंशन)। लेकिन यहाँ एक पेंच है: यह पेपर इस विचार के विरुद्ध तर्क देता है कि आपको इनमें से किसी एक "कुशल" रोबोट को चुनना होगा और उसी के साथ चिपके रहना होगा। यदि आप ऐसा रोबोट चुनते हैं जो केवल पिछले कुछ पन्नों को याद रखता है, तो वह तेज़ तो है लेकिन कहानी का सार भूल जाता है। यदि आप वह रोबोट चुनते हैं जो सब कुछ याद रखता है, तो वह स्मार्ट है लेकिन टेक्स्ट मैसेज लिखने जैसे त्वरित कार्यों के लिए बहुत धीमा है।

इस पेपर के लेखक कहते हैं: "क्यों चुनें?" उन्होंने एक नया प्रकार का रोबोट बनाया है जिसे CAT (कंप्रेस एंड अटेंड ट्रांसफॉर्मर) कहा जाता है।

जादुई ट्रिक: "चंकी" (टुकड़ों वाला) बैकपैक

CAT को ऐसे न समझें कि वह एक बार में एक शब्द पढ़ता है, बल्कि ऐसे समझें जो चंक्स (chunks) में पढ़ता है—जैसे एक बार में शब्दों की एक मुट्ठी पकड़ लेना।

  1. द कंप्रेशन स्टेप (संपीड़न चरण): कल्पना कीजिए कि आपके पास एक लंबी कहानी है। हर एक शब्द को अपनी याददाश्त में रखने के बजाय, CAT शब्दों का एक चंक (मान लीजिए, एक बार में 8 शब्द) लेता है और तुरंत उन्हें एक एकल, छोटे "समरी टोकन" (सारांश टोकन) में सिकोड़ देता है। यह एक पूरे पैराग्राफ को एक छोटे से स्टिकी नोट में बदलने जैसा है जो मुख्य विचार को पकड़ लेता है।
  2. द अटेंडिंग स्टेप (ध्यान देने का चरण): अब, पूरी लाइब्रेरी को याद रखने की कोशिश करने के बजाय, रोबोट को केवल इन छोटे स्टिकी नोट्स को देखना होता है। जब उसे किसी सवाल का जवाब देना होता है, तो वह अतीत के स्टिकी नोट्स और वर्तमान में पढ़े जा रहे शब्दों के चंक को देखता है।

सबसे अच्छा हिस्सा: "वॉल्यूम नॉब"

यहाँ असली जादू है। आमतौर पर, यदि आप चाहते हैं कि कोई रोबोट तेज़ हो, तो आपको एक अलग "कम बुद्धिमान" (कम मेमोरी वाला) रोबोट बनाना पड़ता है। यदि आप चाहते हैं कि वह स्मार्ट हो, तो आपको एक "धीमा" वाला ट्रेन करना पड़ता है।

CAT अलग है। पेपर दिखाता है कि आप एक ही मॉडल बना सकते हैं जिसमें एक "वॉल्यूम नॉब" (जिसे चंक साइज कहा जाता है) होता है जिसे आप बिल्कुल आखिरी सेकंड में, उपयोग करते समय घुमा सकते हैं।

  • नॉब को "छोटे चंक्स" (जैसे, 4 शब्द) पर घुमाएं: रोबोट अधिक विवरण रखता है। यह हाई-डेफिनिशन मेमोरी जैसा है। यह धीमा है और अधिक शक्ति का उपयोग करता है, लेकिन यह कोडिंग या रहस्य सुलझाने जैसे जटिल कार्यों के लिए बेहतरीन है जहाँ आपको 100 पन्नों पहले आए किसी फंक्शन के नाम को याद रखने की आवश्यकता होती है।
  • नॉब को "बड़े चंक्स" (जैसे, 32 शब्द) पर घुमाएं: रोबोट अतीत को बहुत कम सारांश नोट्स में सिकोड़ देता है। यह सुपर फास्ट हो जाता है और बहुत कम मेमोरी का उपयोग करता है। यह ईमेल लिखने जैसे छोटे कार्यों के लिए एकदम सही है जहाँ आपको गहरी याददाश्त की आवश्यकता नहीं है।

पेपर में यह बताया गया है और पाया गया कि केवल एक प्रशिक्षित CAT मॉडल के साथ, आप इसे बिना दोबारा ट्रेन किए, इन मोड के बीच स्विच कर सकते हैं। यह एक स्विस आर्मी नाइफ की तरह है जो केवल हैंडल घुमाने से एक छोटा पेचकस या एक बड़ा रिंच बन सकता है, और वह भी उसी टूल के रूप में।

क्या यह वास्तव में काम करता है?

लेखकों ने अन्य 10 लोकप्रिय "कुशल" रोबोटों (कुछ जो स्लाइडिंग विंडो का उपयोग करते हैं, कुछ जो लीनियर मैथ ट्रिक्स का उपयोग करते हैं) के खिलाफ इसका परीक्षण किया।

  • परिणाम: CAT रोबोट, अपने सबसे बुनियादी "डेंस" अटेंशन (मानक, गैर-विशेष प्रकार का) का उपयोग करके, लंबी मेमोरी वाले कार्यों पर उन सभी विशेष रोबोटों के बराबर या उनसे बेहतर प्रदर्शन करने में सफल रहा।
  • गति: जब लेखकों ने इसे तेज़ बनाने के लिए नॉब घुमाया, तो CAT मानक रोबोट की तुलना में 1.4 से 3.7 गुना तेज़ था, जबकि इसने 2.2 से 9.5 गुना कम मेमोरी का उपयोग किया।
  • मेमोरी: अन्य रोबोटों के विपरीत जो या तो सब कुछ भूल जाते हैं या मेमोरी खत्म होने से जूझते हैं, CAT की मेमोरी "गरिमापूर्ण" (gracefully) तरीके से बढ़ती है। जैसे-जैसे कहानी लंबी होती है, यह थोड़ी सी मेमोरी जोड़ता जाता है, लेकिन मानक रोबोट जितना अधिक नहीं। यह इसे "फिक्स्ड मेमोरी" वाले रोबots की तुलना में लंबी कहानियों को बहुत बेहतर तरीके से याद रखने की अनुमति देता है।

यह पेपर किसे खारिज करता है

यह पेपर बहुत स्पष्ट है कि क्या उनके समाधान जितना अच्छा काम नहीं करता:

  • फिक्स्ड मेमोरी (निश्चित मेमोरी): वे रोबोट जो एक निश्चित आकार की मेमोरी रखने की कोशिश करते हैं (चाहे कहानी कितनी भी लंबी हो), वे बहुत पीछे की चीजों को याद रखने में संघर्ष करते हैं। पेपर दिखाता है कि ये लॉन्ग-कॉन्टेक्स्ट कार्यों में विफल रहते हैं।
  • अलग-अलग मॉडल को प्री-ट्रेन करना: पुराना तरीका यह था कि ईमेल के लिए एक मॉडल और कोडिंग के लिए दूसरा मॉडल ट्रेन किया जाए। पेपर सुझाव देता है कि यह बर्बादी और अनावश्यक है क्योंकि CAT एक ही मॉडल के साथ दोनों काम कर सकता है।
  • ट्रेनिंग-फ्री ट्रिक्स: कुछ लोग मॉडल को ट्रेन करने के बाद मेमोरी के कुछ हिस्सों को अनदेखा करके उसे तेज़ बनाने की कोशिश करते हैं (जैसे "ट्रेनिंग-फ्री" स्पार्स अटेंशन)। पेपर का तर्क है कि यह एक बुरा विचार है क्योंकि रोबोट को सब कुछ याद रखने के लिए प्रशिक्षित किया गया था, इसलिए अचानक कुछ हिस्सों को अनदेखा करने से वह भ्रमित हो जाता है। CAT प्रशिक्षण के दौरान ही संपीड़न (compression) करना सीखता है, इसलिए उसे पता होता है कि क्या रखना है।

वे कितने आश्वस्त हैं?

लेखक काफी आश्वस्त हैं क्योंकि उन्होंने केवल अनुमान नहीं लगाया; उन्होंने इसे मापा है।

  • उन्होंने मॉडल को 15 बिलियन टोकन के टेक्स्ट पर प्रशिक्षित किया।
  • उन्होंने वास्तविक दुनिया के कार्यों पर इसका परीक्षण किया जैसे कि घास के ढेर में सुई ढूंढना (एक लंबे टेक्स्ट में एक विशिष्ट संख्या ढूंढना) और लंबे दस्तावेज़ों को समझना।
  • उन्होंने सीधे तौर पर 10 अन्य मॉडलों के साथ इसकी तुलना की जिनमें अलग-अलग आकार और कॉन्फ़िगरेशन थे।
  • उन्होंने यह भी दिखाया कि यदि आप CAT मॉडल को बड़ा (अधिक पैरामीटर्स वाला) बनाते हैं, तो यह और भी बेहतर हो जाता है बिना धीमा हुए, जो AI की दुनिया में एक दुर्लभ जीत है।

संक्षेप में, पेपर सुझाव देता है कि अलग-अलग कामों के लिए हजारों अलग-अलग रोबोट बनाने के बजाय, हम एक "स्मार्ट" रोबोट बना सकते हैं जो चलते समय अपनी मेमोरी को खुद एडजस्ट करना जानता है। यह एक सरल विचार है—टेक्स्ट के चंक्स को कंप्रेस करना—जो आश्चर्यजनक रूप से शक्तिशाली साबित होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →