← नवीनतम पेपर
💻 computer science

Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference

फ्लक्स अटेंशन (Flux Attention) एक पैरामीटर-कुशल, संदर्भ-जागरूक फ्रेमवर्क है जो सिंक्रोनाइज़ेशन बाधाओं को समाप्त करने और लॉन्ग-कॉन्टेक्स्ट एलएलएम (long-context LLM) परिदृश्यों में उच्च प्रदर्शन बनाए रखते हुए 2.8 गुना तक इन्फरेंस स्पीडअप प्राप्त करने के लिए ट्रांसफार्मर परतों को फुल और स्पार्स अटेंशन मैकेनिज्म के बीच गतिशील रूप से रूट करता है।

मूल लेखक: Quantong Qiu, Zhiyi Hong, Yi Yang, Haitian Wang, Kebin Liu, Qingqing Dang, Juntao Li, Min Zhang

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quantong Qiu, Zhiyi Hong, Yi Yang, Haitian Wang, Kebin Liu, Qingqing Dang, Juntao Li, Min Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, तेज़ गति वाली लाइब्रेरी चला रहे हैं जहाँ एक लाइब्रेरियन (AI) को लाखों किताबों (डेटा) के आधार पर सवालों के जवाब देने होते हैं।

समस्या: "ब्रूट फोर्स" लाइब्रेरियन

मानक लार्ज लैंग्वेज मॉडल्स (LLMs) में, लाइब्रेरियन एक "फुल अटेंशन" (Full Attention) रणनीति का उपयोग करता है। इसका मतलब है कि हर बार जब उसे कोई सवाल मिलता है, तो वह केवल प्रासंगिक किताब नहीं देखता; बल्कि वह शेल्फ से हर एक किताब निकाल लेता है, हर पन्ना पढ़ता है, और फिर तय करता है कि क्या कहना है।

  • अच्छा: वे कोई भी विवरण मिस नहीं करते।
  • बुरा: यदि लाइब्रेरी में 1,00,000 किताबें हैं, तो इसमें बहुत समय लगता है। लाइब्रेरियन थक जाता है (कंप्यूटेशनल बॉटलनेक), अलमारियाँ बहुत भर जाती हैं (मेमोरी की समस्या), और जवाबों के लिए लोगों की लाइन अनंत रूप से लंबी होती जाती है।

पुराना समाधान: "रिजिड" (कठोर) लाइब्रेरियन

इसे ठीक करने के लिए, शोधकर्ताओं ने "स्पार्स अटेंशन" (Sparse Attention) का प्रयास किया। यह कुछ ऐसा है जैसे लाइब्रेरियन को कहना: "ठीक है, केवल हर 10वीं किताब पढ़ो।"

  • समस्या: यह बहुत कठोर है। कभी-कभी उत्तर तीसरी किताब में होता है, और उसे छोड़ देने पर लाइब्रेरियन गलत उत्तर दे देता है। अन्य समय में, जब लाइब्रेरियन को पूरी कहानी का सारांश देना होता है, तो हर एक किताब पढ़ना समय की बर्बादी है।
  • हाइब्रिड प्रयास: कुछ लोगों ने मिश्रण आज़माया: "पहले 10 किताबें पूरी तरह से पढ़ो, फिर बाकी को छोड़ दो।" लेकिन यह एक ऐसी टीम की तरह है जहाँ कुछ लोग पूरी गति से दौड़ते हैं और अन्य चलते हैं। दौड़ने वालों को चलने वालों का इंतज़ार करना पड़ता है, जिससे ट्रैफिक जाम (सिंक्रोनाइज़ेशन देरी) होता है जो सबको धीमा कर देता है।

नया समाधान: "फ्लक्स अटेंशन" (द स्मार्ट, एडेप्टिव लाइब्रेरियन)

लेखकों ने "फ्लक्स अटेंशन" (Flux Attention) का प्रस्ताव दिया है। इसे एक स्मार्ट मैनेजर के रूप में सोचें जो लाइब्रेरियन को देखता रहता है और पूछे जा रहे विशिष्ट प्रश्न के आधार पर तुरंत निर्णय लेता है कि कैसे काम करना है।

यह यहाँ कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "लेयर राउटर" (द स्मार्ट मैनेजर)

लाइब्रेरियन को किताब-दर-किताब निर्णय लेने के बजाय (जो अराजक और धीमा है), स्मार्ट मैनेजर पहले पूरे प्रश्न को देखता है।

  • परिदृश्य अ (एक जासूसी प्रश्न): यदि प्रश्न है "संधि पर हस्ताक्षर होने की सटीक तारीख क्या थी," तो मैनेजर चिल्लाकर कहता है: "फुल स्पीड! हर एक पन्ना पढ़ो!" (यह फुल अटेंशन है)। लाइब्रेरियन जानता है कि उसे सटीक होने की आवश्यकता है, इसलिए वह कुछ भी नहीं छोड़ता है।
  • परिदृश्य ब (एक सारांश प्रश्न): यदि प्रश्न है "इस 500 पन्नों के उपन्यास के मुख्य विषय का सारांश दें," तो मैनेजर चिल्लाता है: "स्किप मोड! बस चैप्टर टाइटल और शुरुआत/अंत के वाक्यों को पढ़ो!" (यह स्पार्स अटेंशन है)। लाइब्रेरियन जानता है कि बड़े चित्र के लिए बारीक विवरण उतने महत्वपूर्ण नहीं हैं, इसलिए वह टेक्स्ट के माध्यम से तेज़ी से आगे बढ़ता है।

2. "हेड" के बजाय "लेयर" क्यों?

पिछले तरीकों ने लाइब्रेरियन के मस्तिष्क के व्यक्तिगत हिस्सों को एक ही समय में अलग-अलग तरह से काम करने की कोशिश की। एक रिले रेस की कल्पना करें जहाँ कुछ धावक स्प्रिंट करते हैं और अन्य जॉग करते हैं। स्प्रिंटर अपना हिस्सा पूरा कर लेते हैं और जॉगर्स का इंतज़ार करने के लिए खड़े हो जाते हैं। इससे ट्रैफिक जाम पैदा होता है।

फ्लक्स अटेंशन पूरी टीम को एक साथ बदल देता है।

  • "जासूसी" कार्य के लिए, पूरी टीम पूरी गति से दौड़ती है।
  • "सारांश" कार्य के लिए, पूरी टीम टेक्स्ट के माध्यम से तेज़ी से निकल जाती है।
  • परिणाम: कोई किसी का इंतज़ार नहीं करता। पूरी प्रणाली एकदम तालमेल (sync) में चलती है, जिससे कंप्यूटर चिप्स (GPUs) पर यह अविश्वसनीय रूप से तेज़ हो जाती है।

3. "फ्रीज़" ट्रिक (ट्रेनिंग)

सबसे अच्छी बात? लेखकों को पूरी लाइब्रेरी को फिर से बनाने या लाइब्रेरियन को शून्य से प्रशिक्षित करने की आवश्यकता नहीं पड़ी।

  • उन्होंने एक मौजूदा, अत्यधिक कुशल लाइब्रेरियन (Qwen या Llama जैसा प्री-ट्रेन किया गया AI) लिया।
  • उन्होंने उनके मस्तिष्क को फ्रीज कर दिया (उनका सारा ज्ञान बरकरार रखा)।
  • उन्होंने बस एक छोटा, हल्का स्मार्ट मैनेजर (लेयर राउटर) जोड़ा जो सही निर्देश चिल्लाना सीखता है।
  • शक्तिशाली कंप्यूटरों पर इसे प्रशिक्षित करने में केवल 12 घंटे लगे, जबकि एक नया AI प्रशिक्षित करने में आमतौर पर महीनों लग जाते हैं।

परिणाम: बुद्धिमत्ता खोए बिना गति

क्योंकि स्मार्ट मैनेजर जानता है कि कब गहनता से काम करना है और कब तेज़ होना है:

  • गति: प्रश्नों के उत्तर देने में यह AI 2 से 3 गुना तेज़ है, विशेष रूप से बहुत लंबे दस्तावेज़ों के लिए।
  • सटीकता: यह अपनी याददाश्त नहीं खोता। जब इसे किसी विशिष्ट तथ्य को खोजने की आवश्यकता होती है, तो यह धीमा हो जाता है और सब कुछ पढ़ता है। जब इसे केवल एक 'वाइब चेक' की आवश्यकता होती है, तो यह तेज़ हो जाता है।
  • दक्षता: यह कंप्यूटर मेमोरी की भारी मात्रा बचाता है, जिससे हमें सैकड़ों हज़ार शब्दों लंबे दस्तावेज़ों को प्रोसेस करने की अनुमति मिलती है बिना कंप्यूटर क्रैश हुए।

संक्षेप में

फ्लक्स अटेंशन एक लाइब्रेरी को अपग्रेड करने जैसा है, जहाँ अब किसी भी प्रश्न का उत्तर देने के लिए आपको हर किताब पढ़ने की आवश्यकता नहीं है, बल्कि एक स्मार्ट मैनेजर तुरंत जानता है: "इस प्रश्न के लिए, हमें सूक्ष्मदर्शी (microscope) की आवश्यकता है; उस प्रश्न के लिए, हमें दूरबीन (telescope) की आवश्यकता है।" यह AI को तेज़, सस्ता और पहले की तरह ही स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →