← नवीनतम पेपर
📊 statistics

Express Language Modeling

यह शोध पत्र एक्सप्रेस (Express) को प्रस्तुत करता है, जो एक ऐसा टूल है जो नॉन-कॉज़ल अटेंशन एप्रोक्सिमेशन को बेहतर सैद्धांतिक गारंटियों के साथ कॉज़ल में परिवर्तित करता है और इसका एक कुशल ट्राइटन (Triton) कार्यान्वयन है, जो फ्लैश-अटेंशन 2 (FlashAttention 2) की तुलना में महत्वपूर्ण गति प्रदान करता है और लॉन्ग-कॉन्टेक्स्ट लैंग्वेज मॉडलिंग में प्रमुख संसाधन बाधाओं को दूर करता है।

मूल लेखक: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रश्न का उत्तर देने के लिए एक बहुत लंबी किताब पढ़ने की कोशिश कर रहे हैं। जैसे-जैसे आप पढ़ते हैं, आपको अब तक मिले हर महत्वपूर्ण विवरण को याद रखने की आवश्यकता होती है ताकि आप वर्तमान वाक्य का अर्थ समझ सकें। AI भाषा मॉडलों की दुनिया में, इस "याद रखने" की प्रक्रिया को अटेंशन (Attention) कहा जाता है।

समस्या यह है कि जैसे-जैसे किताब लंबी होती जाती है, सब कुछ याद रखने में लगने वाला प्रयास विस्फोटक रूप से बढ़ता जाता है। यह एक कमरे में मौजूद लोगों के समूह के साथ बातचीत करने जैसा है जहाँ, आपके द्वारा बोले गए हर नए शब्द के लिए, आपको हर व्यक्ति से अपना परिचय फिर से देना पड़ता है और अपनी पूरी बातचीत का इतिहास फिर से पढ़ना पड़ता है। यह इतना धीमा और मेमोरी-भारी हो जाता है कि बहुत लंबी कहानियों या जटिल तर्क कार्यों को संभालना असंभव हो जाता है।

यह पेपर एक नया टूल पेश करता है जिसे एक्सप्रेस (Express) (और एक विशिष्ट संस्करण जिसे थिनफॉर्मर एक्सप्रेस (Thinnerformer Express) कहा जाता है) कहा जाता है, जो इन AI मॉडलों के लिए एक अत्यंत कुशल लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह कार्य करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "क्वाड्रेटिक" बाधा (The Quadratic Bottleneck)

सामान्यतः, एक नए वाक्य को समझने के लिए, एक AI पिछले प्रत्येक शब्द को देखता है। यदि आपके पास 1,000 शब्द हैं, तो यह 1,000 बार जाँच करता है। यदि आपके पास 10 लाख शब्द हैं, तो इसे 1 ट्रिलियन बार जाँच करनी होगी। यह वह "क्वाड्रेटिक" लागत है जिसका उल्लेख पेपर में किया गया है। यह घास के ढेर में एक विशिष्ट सुई को खोजने की कोशिश करने जैसा है जहाँ आप बार-बार घास के हर एक टुकड़े की एक-एक करके जाँच करते हैं।

2. समाधान: "स्मार्ट सारांशकर्ता" (The Smart Summarizer - Thinning)

लेखकों ने महसूस किया कि वास्तव में आपको हर शब्द को पूरी तरह से याद रखने की आवश्यकता नहीं है। आपको बस पूरी कहानी का प्रतिनिधित्व करने वाले सबसे महत्वपूर्ण शब्दों का एक छोटा, उच्च-गुणवत्ता वाला "सारांश" या "मुख्य सेट" चाहिए।

उन्होंने एक्सप्रेस (Express) नामक एक टूल बनाया है जो एक "नॉन-कॉज़ल" (non-causal) सारांशकर्ता (एक ऐसा टूल जो पूरी किताब देख सकता है और सबसे अच्छे 100 पन्ने चुन सकता है) को "कॉज़ल" (causal) सारांशकर्ता में बदल देता है।

  • नॉन-कॉज़ल (Non-causal) का अर्थ है पहले पूरी किताब पढ़ना, और फिर मुख्य अंशों को चुनना।
  • कॉज़ल (Causal) का अर्थ है किताब को वास्तविक समय में पेज-दर-पेज पढ़ना, और बिना आगे देखे, तुरंत यह निर्णय लेना कि किन मुख्य अंशों को अपनी जेब में रखना है।

एक्सप्रेस (Express) वह जादुवी तकनीक है जो AI को बिना सटीकता खोए इस वास्तविक समय के सारांश को करने की अनुमति देती है। यह सुनिश्चित करता है कि भले ही AI अतीत के एक बहुत छोटे हिस्से (एक "थिन्ड" या छितरे हुए संस्करण) को देख रहा हो, फिर भी उसे सही उत्तर प्राप्त होता है।

3. "इन्फ्लेशन" (फूलने) की तकनीक (The Inflation Trick)

पेपर में एक चतुर तंत्र का वर्णन किया गया है जहाँ AI की मेमोरी एक गुब्बारे की तरह "फूलती" (inflate) और "पिचकती" (deflate) है।

  • एक्सैक्ट फेज (The Exact Phase): बिल्कुल शुरुआत में, AI हर चीज़ को पूरी तरह से याद रखता है।
  • थिन फेज (The Thin Phase): जैसे-जैसे अधिक शब्द आते हैं, AI उन्हें बैचों में समूहित करता है। उन सभी को रखने के बजाय, यह पूरे समूह को एक छोटे, भारित (weighted) सारांश में "कंप्रेस" करने के लिए एक विशेष एल्गोरिदम का उपयोग करता है।
  • हाल्वे फेज (The HALVE Phase): जब सारांश बहुत बड़ा हो जाता है, तो AI "हाल्वे" (आधा करने वाला) ऑपरेशन करता है, जो सबसे महत्वपूर्ण जानकारी को सावधानीपूर्वक सुरक्षित रखते हुए आकार को आधा कर देता है।

यह प्रक्रिया सुनिश्चित करती है कि कहानी चाहे कितनी भी लंबी क्यों न हो जाए, मेमोरी का आकार छोटा और स्थिर बना रहे। यह एक ऐसे बैकपैक की तरह है जो अपने सामान को अपने आप सिकोड़ लेता है ताकि वह फिट हो सके, केवल आवश्यक वस्तुओं को ही रखता है, ताकि आपके पास कभी जगह की कमी न हो।

4. वास्तविक दुनिया के परिणाम: AI की गति बढ़ाना (Real-World Results)

लेखकों ने केवल गणित नहीं किया; उन्होंने ट्राइटन (Triton) (जो कंप्यूटर चिप्स के लिए एक हाई-स्पीड इंजन की तरह है) नामक एक प्रोग्रामिंग भाषा का उपयोग करके इस टूल का एक तेज़ संस्करण बनाया। उन्होंने चार विशिष्ट परिदृश्यों में इसका परीक्षण किया:

  • लॉन्ग-कॉन्टेक्स्ट प्रीफिल (किताब पढ़ना): जब AI को उत्तर देने से पहले एक विशाल दस्तावेज़ पढ़ने के लिए दिया जाता है, तो एक्सप्रेस ने बहुत लंबे टेक्स्ट (512,000 शब्द) के लिए वर्तमान सर्वोत्तम विधि (फ्लैशअटेंशन 2 - FlashAttention 2) की तुलना में इसे 82 गुना तेज़ बना दिया।
  • मेमोरी को कंप्रेस करना (KV कैश): AI पिछले शब्दों को एक "कैश" में संग्रहीत करता है। एक्सप्रेस ने अन्य लोकप्रिय विधियों का उपयोग करके इस कैश को कंप्रेस करने में मदद की, जिससे सटीकता खोए बिना पूरी प्रक्रिया तेज़ हो गई।
  • मेमोरी-कुशल डिकोडिंग (चरण-दर-चरण सोचना): कठिन गणितीय समस्याओं को हल करने के लिए जिनमें तर्क की लंबी श्रृंखलाओं की आवश्यकता होती है, एक्सप्रेस ने AI को मानक विधि की तुलना में केवल 61% मेमोरी का उपयोग करने की अनुमति दी और फिर भी सही उत्तर प्राप्त किए।
  • कंप्यूट-कुशल डिकोडिंग (सोचने की गति बढ़ाना): उन्हीं गणितीय समस्याओं के लिए, एक्सप्रेस ने AI को सामान्य से केवल 56% समय में समाप्त करने की अनुमति दी, जबकि वह सही उत्तर प्राप्त कर रहा था।

सारांश

संक्षेप में, एक्सप्रेस (Express) AI के लिए लंबी बातचीत और जटिल कार्यों को संभालने का एक नया तरीका है। यह एक स्मार्ट फिल्टर की तरह कार्य करता है जो लगातार अतीत का सारांश निकालता रहता है, जिससे AI की मेमोरी छोटी और उसकी सोचने की गति तेज़ बनी रहती है, बिना AI को महत्वपूर्ण विवरण "भुलने" दिए। यह उस समस्या को हल करता है जहाँ लंबे टेक्स्ट या जटिल तर्क के मामले में AI बहुत धीमा हो जाता है या उसकी मेमोरी खत्म हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →